Stemmestyrede AI-agenter er endelig klar: GPT-Realtime-2 tænker og taler på samme tid

Uge 20 markerer et vendepunkt for AI-stemmeagenter. OpenAI lancerede tre nye stemmemodeller — GPT-Realtime-2, GPT-Realtime-Translate og GPT-Realtime-Whisper — der samlet set lukker det hul, som har holdt stemme-AI tilbage siden introduktionen: enten talte modellerne hurtigt men tænkte dårligt, eller de tænkte dybt men svarede for langsomt til at føles naturlige.

GPT-Realtime-2 hoppede fra 81,4% til 96,6% på Big Bench Audio-benchmark og fra 34,7% til 48,5% på Audio MultiChallenge — begge sammenlignet med forgængeren GPT-Realtime-1.5. Kontekstvinduet voksede fra 32.000 til 128.000 tokens, hvilket i praksis betyder, at modellen kan huske hele en kundes historik under ét opkald. Det smarte trick er såkaldte 'preambles' — korte sætninger som 'lad mig tjekke det' — der afspilles, mens modellen tænker i baggrunden, så tavsheden ikke afslører, at det er en maskine.

Samtidig lancerede Google en hel serie af nye produkter under Android Show-eventet: Googlebooks er en ny generation af bærbare computere bygget med Dell, HP, Lenovo, Acer og Asus, der sætter Gemini Intelligence i centrum. Systemet fungerer som et tværgående AI-lag på tværs af enheder og kan udføre agentive opgaver direkte i apps. Dertil kom GPT-5.5 Instant som ny standardmodel i ChatGPT med forbedret faktuel nøjagtighed og personalisering, og Subquadratic præsenterede en model med et 12-millioners-token kontekstvindue — en teknisk bedrift der hævder at have løst det kvadratiske skalerbarhedsproblem ved lange kontekster.

På open-source-fronten imponerede DeepSeek V4 Pro med 1,6 billioner parametre i alt og 49 milliarder aktive — nu den største open weights-model overhovedet. Prismæssigt er Codex stadig stærkt subsidieret sammenlignet med konkurrenterne, mens Claude Pro koster ca. 10 gange mere per token.

Kontekst: Uge 20's modellandskab viser, at AI-kapløbet nu i stigende grad foregår på specialiserede fronter — stemme, kode, matematik og kontekstlængde — frem for blot generel benchmark-dominans.