Dokumenteret · primær kilde

GPT-6 Astra satser på længere arbejdsforløb

OpenAI lancerede GPT-6 Astra som en model til computerbrug, softwareudvikling og længere arbejdsforløb. OpenAI oplyser, at Astra på OSWorld 2.0 løste 72,6 procent af opgaverne på cirka 40 minutter mod 65,7 procent på cirka 75 minutter for GPT-5.6 Sol. Det er leverandørens egen måling, men den illustrerer den praktiske ambition: modellen skal ikke blot svare bedre, men kunne gennemføre mere arbejde i browser, dokumenter og specialsoftware.

Lanceringen har en usædvanlig sikkerhedsside. OpenAI klassificerer Astra på niveauet Critical for cyberkapacitet under virksomhedens Preparedness Framework. Modellen opnåede 100 procent på ExploitBench uden produktionssikringer og fandt under evalueringen to hidtil ukendte sårbarheder, som OpenAI siger er blevet rapporteret til de relevante vedligeholdere. Den almindelige version afviser avancerede offensive opgaver, mens mindre begrænset adgang efter planen gives gennem programmet Daybreak. Astra rulles ud til betalende ChatGPT-kunder og API-brugere; standardprisen er 10 dollar pr. million inputtokens og 50 dollar pr. million outputtokens.

Dokumenteret · primær kilde

Claude Fable 5.1 gør genbrugt kontekst billigere

Dagen før præsenterede Anthropic Claude Fable 5.1 og Claude Mythos 5.1. De to produkter bygger ifølge Anthropic på samme model, men med forskellige sikkerhedsgrænser. Fable er bredt tilgængelig, mens Mythos kun udbydes gennem kontrollerede adgangsprogrammer til blandt andet cybersikkerhed og biovidenskab. Anthropic har samtidig reduceret prisen på cachelæsninger med 75 procent til 0,25 dollar pr. million tokens. Det er især relevant i agentforløb, hvor det samme store kontekstgrundlag bruges igen og igen.

Fable-lanceringen viser, at modelpris ikke kun handler om den synlige input- og outputtakst. Hvis en agent gentagne gange læser de samme dokumenter, regler eller kodebaser, kan cacheprisen påvirke den samlede regning mere end en mindre forskel i almindelig tokenpris. Den rigtige sammenligning er derfor prisen for et afsluttet og godkendt resultat, inklusive genkørsler, værktøjskald og menneskelig kontrol.

Dokumenteret · primær kilde

Muse Spark fokuserer på færre unødvendige trin

Meta fulgte efter med Muse Spark 1.3, som er tilgængelig i Muse Code og Meta Model API. Meta fremhæver længere agentforløb, bedre fastholdelse af instruktioner og mere præcis håndtering af afbrydelser. I interne sammenligninger med Muse Spark 1.2 brugte modellen cirka 20 procent færre værktøjskald og 25 procent færre tokens. De tal er ikke en uafhængig produktionstest, men de peger på en relevant optimering: et godt agentresultat afhænger også af, om modellen ved, hvornår den skal spørge, stoppe eller undlade endnu en runde.

Dokumenteret · primær kilde

Gemini Flash kombinerer lav pris med mere beregning

Google lancerede Gemini 3.8 Flash til 0,75 dollar pr. million inputtokens og 3,75 dollar pr. million outputtokens som introduktionspris. Google beskriver modellen som mere grundig end forgængeren på komplekse opgaver; det kan forbedre kvaliteten, men også øge forbruget pr. opgave. Selskabet lancerede samtidig Gemini 3.8 Flash Cyber, som har friere cyberfunktioner og kun udbydes til godkendte myndigheder, operatører af kritisk infrastruktur og softwarevedligeholdere gennem Fairwind-programmet.

Praksis · redaktionel anbefaling

Hvad betyder det for virksomhedens modelvalg?

Ugens modelbølge giver ikke én enkel vinder. Astra kombinerer høj kapacitet med en høj pris og markante kontrolkrav. Fable 5.1 sænker omkostningen ved genbrugt kontekst. Muse Spark fokuserer på færre unødvendige trin, mens Gemini Flash kombinerer en lav listepris med mulighed for mere beregning på svære opgaver. For virksomheder bør en modeltest derfor måle hele arbejdsforløbet: korrekt slutresultat, tidsforbrug, antal værktøjskald, nødvendige godkendelser og omkostning pr. accepteret levering.

Kontekst: Når modeller udfører handlinger i stedet for kun at levere tekst, bliver sikkerhedsgrænser, cacheøkonomi og afslutningsadfærd en del af selve produktet. En benchmarkscore kan åbne en samtale, men den kan ikke erstatte en test på virksomhedens egne opgaver og risici.