Google brengt twee nieuwe spraakmodellen uit: Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking. Beide modellen richten zich op spraakgestuurde interactie, met verschillen in schaalbaarheid en redeneervermogen. De modellen zijn per direct beschikbaar voor ontwikkelaars en zakelijke gebruikers.
Google heeft twee spraakmodellen aangekondigd: Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking. Volgens Google combineren de modellen spraakherkenning met redeneervermogen, waarmee spraakgestuurde toepassingen ingezet kunnen worden voor zakelijke taken.
Live gericht op schaalbaarheid
Gemini 3.8 Live is volgens Google ontworpen voor schaalbaarheid en kostenefficiëntie. Het model combineert dialoogvoering met visuele waarneming en kan schakelen tussen 97 talen. Google geeft aan dat het systeem op de achtergrond API-calls en acties kan uitvoeren terwijl een gesprek met de gebruiker doorloopt.
Extended Thinking voor complexe taken
Voor taken die meer analyse vereisen, introduceert Google Gemini 3.8 Live Extended Thinking. Dit model is volgens het bedrijf bedoeld voor complexe workflows en kan redeneren en spreken tegelijkertijd. Google meldt dat het model gebruikers via verbale signalen op de hoogte houdt van wat het op de achtergrond uitzoekt of bouwt, bijvoorbeeld bij het omzetten van een schets naar code of het beheren van meerdere boekingen tegelijk. Het bedrijf verwijst naar de Speech to Speech Quality Index van Artificial Analysis, waarin dit model volgens Google de hoogste positie behaalde.
Beschikbaarheid en watermerk
Google rolt de spraakmodellen per direct uit voor ontwikkelaars en de zakelijke markt. Via de Gemini API en Google AI Studio kunnen ontwikkelaars ermee werken. De modellen worden ook opgenomen in het Gemini Enterprise-platform en geïntegreerd binnen Google Workspace en Google Search Live. Google geeft aan dat alle gegenereerde audio automatisch wordt voorzien van het SynthID-watermerk, waarmee AI-gegenereerde audio herkenbaar moet blijven.