Fire modeludgivelser i samme uge gjorde det tydeligt, at AI-konkurrencen har skiftet karakter. Topplaceringer på benchmarks fylder stadig i leverandørernes præsentationer, men pris, svartid og driftsform er blevet lige så afgørende for, hvilken model der faktisk bliver sat i arbejde.
SpaceXAI lancerede Grok 4.6 med fokus på længere agentopgaver, kodearbejde og research. Modellen blev gjort tilgængelig i blandt andet Cursor, Grok Build og via API. SpaceXAI fremhæver egne resultater på professionelle opgaver og kodetest, mens nyhedsbrevene især bemærkede prisen på 2 dollar pr. million inputtokens og 6 dollar pr. million outputtokens. De tal gør Grok relevant som konkurrent, også for teams der ikke bruger selskabets forbrugerprodukter. Benchmarkresultaterne er leverandørens og bør vurderes mod egne arbejdsopgaver, før de bruges som købsargument.
Google valgte en anden position. Gemini 3.7 Flash blev præsenteret som en arbejdshest til kode og agenter, med en introduktionspris på 0,75 dollar pr. million inputtokens og 3,75 dollar pr. million outputtokens frem til årets udgang. Det var halvdelen af den normale pris. Den korte afstand til Gemini 3.6 Flash viser, hvor hurtigt leverandørerne nu justerer modeller efter brugernes feedback. Den midlertidige rabat betyder samtidig, at et attraktivt pilotregnestykke ikke nødvendigvis er det samme som den langsigtede driftspris.
OpenAI gik efter svartid frem for en ny grundmodel. Ultrafast kører GPT-5.6 Sol på Cerebras-infrastruktur og leverer ifølge OpenAI op til 750 outputtokens i sekundet, op til 14 gange hurtigere end standardbehandling. Den begrænsede API-preview retter sig mod situationer, hvor ventetid ændrer værdien af resultatet: incident response, svindelkontrol, kundeservice under en samtale og interaktiv research. OpenAI oplyser endnu ingen offentlig pris. Derfor kan man foreløbig vurdere kapaciteten, men ikke det samlede forhold mellem fart og omkostning.
DeepSeek V4-Pro-0813 føjede en tredje økonomisk mekanisme til billedet. Udviklere kan justere modellens reasoning-niveau efter opgaven, og den annoncerede pris var 0,435 dollar pr. million inputtokens og 0,87 dollar pr. million outputtokens, med lavere priser uden for spidsbelastning. DeepSeek offentliggjorde også benchmarkresultater, men de blev ikke uafhængigt reproduceret i ugens kilder. Den mere holdbare pointe er derfor ikke, at én model har slået alle andre, men at udviklere får flere knapper til at styre udgiften pr. opgave.
Priskortet alene kan dog ikke afgøre et modelvalg. En billig model bliver dyr, hvis den kræver mange genkørsler, og en hurtig model skaber ikke værdi, hvis flaskehalsen er menneskelig godkendelse. Teams bør måle succesrate, samlet tokenforbrug, svartid og omarbejde på deres egne opgaver. Det giver et bedre billede end en rangliste, hvor alle modeller testes under samme kunstige betingelser.
Ugens fjerde konkurrenceparameter var dokumentation. Anthropic beskrev et usynligt tekstvandmærke i Claude for nye modeller lanceret i EU fra 2. august. Signalet lægges ind i modellens ordvalg, mens understøttede filer får signeret proveniensmetadata. Anthropic understreger, at et fund viser Claude-behandling, ikke nødvendigvis at Claude alene har forfattet teksten eller hvem der har ansvaret for den. Det er en vigtig begrænsning for skoler, redaktioner og virksomheder, som ellers kan fristes til at behandle en detektor som et bevisværktøj.
Kontekst: Modelvalg er ved at ligne kapacitetsstyring mere end et abonnement på én chatbot. Den relevante enhed er ikke prisen pr. token, men prisen og risikoen ved et godkendt resultat i den konkrete arbejdsgang.