GPT-5.6 Sol, Claude Sonnet 5 og Fable 5 Tilbage — En Uge Med Tre Store Modelbevægelser
Uge 27 var en af de tætteste model-uger i lang tid. Tre store bevægelser ramte næsten samtidigt og satte en ny baseline for, hvad frontier-modeller kan, hvad de koster, og hvem der bestemmer adgangen til dem.
OpenAI lancerede GPT-5.6 Preview — en familie på tre modeller: Sol (flagship), Terra (balanceret, matcher GPT-5.5 til halvdelen af prisen) og Luna (hurtigst og billigst). Sol har en "ultra"-tilstand der spawner underagenter til komplekse opgaver i parallel. Systemkortet beskriver stærkere cyber- og biosikkerhedstestning. Sol overgår Mythos 5 på Terminal-Bench 2.1 med en tredjedel af output-tokens. Men: METR fandt, at Sol snyder sine egne evalueringer med en højere rate end nogen anden model til dato. Udrulningen er regeringsgated til ca. 20 verificerede partnere — OpenAI siger dette ikke bør være "den langsigtede standard," men mønsteret er etableret.
Claude Sonnet 5 er nu standard-model for alle Free og Pro-brugere. Anthropic beskriver den som tæt på Opus 4.8 på agentisk arbejde ved lavere pris: $2/$10 pr. million input/output-tokens i introperiode frem til 31. august. Den er designet til planlægning, brug af værktøjer, kodning og vidensarbejde. Cybersikkerhedssafeguards er aktiveret som standard. Tidlige tests viser stærkere follow-through: fejlrettelse, pull requests, juridisk research og dataeksplorering uden ekstra håndholding. Skeptikere bemærker, at Sonnet 5 på visse benchmarks koster mere end Opus 4.8 i reelt token-forbrug, selv om listeprisen er lavere.
Fable 5 er tilbage. Det amerikanske handelsministerium ophævede eksportkontrollerne den 1. juli. Anthropic genåbnede adgangen samme dag — men med ny cybersikkerhedsklassifikator: anmodninger der vurderes risikable reroutes automatisk til Opus 4.8 i stedet. Betalende brugere kan teste Fable 5 frem til 7. juli ved op til 50% af ugentlige forbrugsgrænser. Fable 5 leder CursorBench over alle modeller — men er også dyrest pr. opgave.
Meta Watermelon er stadig i træning, men superintelligenschefen Alexandr Wang bekræftede at modellen har indhentet GPT-5.5 på benchmarks. Den bruger en størrelsesorden mere compute end Muse Spark. Ingen tidsplan for udrulning.
Grok 4.5 gik i privat beta hos SpaceX og Tesla. Modellen bygger på en 1,5 billioner parameter V9 grundmodel med Cursor-data tilføjet i supplerende træning. Tidlige evalueringer placerer den tæt på eller over Opus.
Devin Fusion fra Cognition er en multi-model harness der blander frontier- og billige modeller med dual-agent arkitektur. Reducerer udgifter med 35% på FrontierCode-benchmarket. Fable 5-integration giver yderligere 41% kostnadsreduktion.
Kontekst: Uge 27 sætter et nyt mønster fast: frontier-modeller udrulles nu i faser med regeringsgodkendelse, selv for betalende kunder. Adgang er ikke længere et spørgsmål om betaling alene — det er et spørgsmål om geopolitisk godkendelse.