Deze week: OpenAI stemt GPT-5.6 Sol af op dagelijks gebruik en geeft gratis gebruikers onbeperkt tekstchats, Meta brengt een terminal-codeeragent uit, DeepSeek zet met V4-Flash een nieuw prijsrecord neer, Cloudflare bouwt een portemonnee voor betalende AI-agents, Alibaba lanceert het 2,4 biljoen parameters tellende Qwen3.8-Max, en Microsoft introduceert een eigen cyberbeveiligingsmodel met agentisch systeem eromheen.
- OpenAI verfijnt GPT-5.6 Sol en opent ChatGPT verder voor gratis gebruikers
- Meta lanceert coding-agent Muse Code en model Muse Spark 1.2
- DeepSeek V4-Flash tot 105 keer goedkoper dan Claude Fable 5
- Cloudflare introduceert programmeerbare portemonnee voor AI-agents
- Alibaba lanceert Qwen3.8-Max met 2,4 biljoen parameters
- Microsoft brengt eigen cybersecurity-model en agentisch verdedigingssysteem uit
OpenAI verfijnt GPT-5.6 Sol en opent ChatGPT verder voor gratis gebruikers
OpenAI heeft een update van GPT-5.6 Sol uitgerold die gerichter en feitelijk betrouwbaarder moet antwoorden binnen ChatGPT. Tegelijkertijd wordt de toegang voor gratis gebruikers verruimd, met een nieuw model en onbeperkte tekstchats als opvallendste wijzigingen.
- Plus- en Pro-gebruikers krijgen een schuifregelaar waarmee ze zelf bepalen hoeveel denktijd ChatGPT aan een antwoord besteedt, van snelle reacties tot uitgebreide analyses.
- Bij interne tests op financiële, medische en juridische prompts kwamen feitelijke fouten circa 68 procent minder vaak voor bij GPT-5.6 Sol dan bij het voorgaande GPT-5.5 Instant.
- Gratis gebruikers krijgen deze week GPT-5.6 Luna als standaardmodel, gevolgd door onbeperkte tekstchats en een nieuwe Think-knop voor lastigere vragen; limieten voor bestanden en afbeeldingen blijven gelden.
- Voor gebruikers die mogelijk minderjarig zijn traint OpenAI het model om romantische rollenspellen en risicovolle content te vermijden en actief door te verwijzen naar vertrouwde personen.
Bron: OpenAI
Meta lanceert coding-agent Muse Code en model Muse Spark 1.2
Meta Superintelligence Labs heeft Muse Code uitgebracht, een terminal-gebaseerde coding-agent die draait op het nieuwe model Muse Spark 1.2. De combinatie moet complexe softwaretaken over grote codebases zelfstandig kunnen plannen, uitvoeren en controleren.
- Muse Code werkt met persistente achtergrondagents die tijdens een sessie actief blijven en zelf bepalen wanneer ze terugkoppelen naar de hoofdagent, wat herhaald opzoekwerk moet voorkomen.
- Een lokaal event-log legt elke modelaanroep, tool-uitvoering en bewerking vast, waardoor de agent na een crash exact kan hervatten waar hij gebleven was.
- Muse Spark 1.2 is samen met Muse Code getraind en presteert volgens Meta beter op langlopende coderingstaken zoals het genereren van hele repositories.
- In een testcase optimaliseerde het model GPU-kernels zelfstandig over meer dan duizend tool-aanroepen, tot 24 uur aan een stuk.
Bron: Meta AI Research
DeepSeek V4-Flash tot 105 keer goedkoper dan Claude Fable 5
Onderzoeksbureau Artificial Analysis heeft berekend dat DeepSeek V4-Flash gemiddeld slechts 3 dollarcent kost om een volledige benchmarktest uit te voeren, meldt Reuters. Ter vergelijking: Claude Fable 5 van Anthropic komt voor dezelfde test uit op 3,15 dollar.
- Ook andere modellen worden ruim voorbijgestreefd: Kimi K3 van Moonshot AI kost 86 dollarcent per test en GPT-5.6 Sol van OpenAI 1,86 dollar.
- DeepSeek rekent officieel 0,14 dollar per miljoen inputtokens en 0,28 dollar per miljoen outputtokens; de kosten per test liggen lager doordat het model relatief zuinig omgaat met tokens.
- Op de Intelligence Index van Artificial Analysis scoort V4-Flash 50 van de 100 punten, ongeveer gelijk aan Google Gemini 3.6 Flash en achter de nieuwste modellen van OpenAI en Anthropic.
- DeepSeek haalde recent voor het eerst extern kapitaal op, meer dan 7 miljard dollar, wat volgens waarnemers ruimte geeft om de agressieve prijsstrategie voort te zetten.
Bron: Reuters
Cloudflare introduceert programmeerbare portemonnee voor AI-agents
Cloudflare heeft Cloudflare Wallets aangekondigd, een systeem waarmee AI-agents zelfstandig kunnen betalen voor API’s, tools en content. De portemonnee bouwt voort op het x402-protocol en moet agents een stabiele identiteit en native betaalmogelijkheid geven, iets wat nu vaak ontbreekt.
- Er komen twee varianten: Account Wallets voor mensen die geld toevoegen en beheren, en Virtual Wallets waarmee agents binnen een vastgesteld budget zelfstandig kunnen uitgeven.
- Eigenaren van een Account Wallet stellen limieten in zoals een maximaal bedrag, een toegestane lijst van aanbieders en een bestedingsplafond per transactie.
- Agents kunnen optioneel een herkenbare identiteit aannemen via cloudflare.pay, zodat aanbieders weten namens welke organisatie een agent handelt.
- Cloudflare koppelt de lancering aan de eerder aangekondigde Monetization Gateway, die bedrijven moet helpen inkomsten te genereren uit micropayments van agents.
Bron: Cloudflare
Alibaba lanceert Qwen3.8-Max met 2,4 biljoen parameters
Alibaba heeft zijn nieuwe vlaggenschipmodel Qwen3.8-Max officieel gelanceerd, na een preview die op 19 juli werd aangekondigd tijdens de World AI Conference in Shanghai. Het model telt 2,4 biljoen parameters en moet volgens Alibaba qua vermogen alleen onderdoen voor Claude Fable 5.
- De API is beschikbaar tegen 2 dollar per miljoen inputtokens en 6 dollar per miljoen outputtokens, goedkoper dan concurrent Kimi K3 van Moonshot AI.
- Het model ondersteunt een contextvenster tot bijna 1 miljoen tokens en een maximale output van 131.072 tokens, met verwerking van tekst, beeld, video en documenten.
- Open weights zijn toegezegd maar nog niet vrijgegeven; een licentie en releasedatum daarvoor ontbreken vooralsnog.
- Naast het Max-model kondigde Alibaba ook Qwen3.8-27B aan, een kleinere variant die wel direct als open-weightmodel verschijnt.
Bron: Latent Space (AINews)
Microsoft brengt eigen cybersecurity-model en agentisch verdedigingssysteem uit
Microsoft heeft Project Perception aangekondigd, een agentisch beveiligingssysteem dat organisaties moet helpen zich te verdedigen tegen AI-gestuurde aanvallen. Onderdeel van de lancering is MAI-Cyber-1-Flash, het eerste volledig zelfontwikkelde AI-model van Microsoft dat specifiek is gericht op cybersecurity.
- MAI-Cyber-1-Flash draait binnen MDASH, Microsoft’s systeem voor het opsporen en verhelpen van kwetsbaarheden, en behaalt daar 96 procent op de CyberGym-benchmark, 12 procentpunt hoger dan Anthropic’s Mythos.
- Het model handelt naar eigen zeggen tot 90 procent van de beveiligingstaken zelfstandig af en stuurt alleen de moeilijkste 10 procent door naar GPT-5.4 van OpenAI.
- Deze combinatie levert volgens Microsoft ongeveer 50 procent lagere operationele kosten op dan de huidige MDASH-configuratie.
- Project Perception coördineert drie soorten agents: Red Team-agents die aanvallen simuleren, Blue Team-agents die incidenten analyseren en Green Team-agents die herstelacties uitvoeren; het systeem gaat op 3 augustus in publieke preview.
Bron: The Official Microsoft Blog
De AI Update is samengesteld door Marcel Debets. Tips? Mail de redactie op mspb@dutchit.com.