Kimi K3 åbner frontier-kapløbet – og Codex får fysiske knapper
Moonshot AI gjorde ugens største modelnyhed konkret med Kimi K3: en multimodal mixture-of-experts-model med 2,8 billioner parametre, én million tokens i kontekstvinduet og værktøjer til både kode og vidensarbejde. Modellen kunne bruges via Kimi-produkterne og API'et ved lanceringen, mens de fulde vægte ifølge Moonshot først ville blive frigivet 27. juli. Det sidste forbehold er vigtigt. I uge 29 var Kimi K3 altså en annonceret open-weight-model, men endnu ikke en model, som en virksomhed selv kunne hente og efterprøve i fuld skala.
Moonshot placerer selv K3 tæt på de førende lukkede modeller og fremhæver især lange kodeopgaver, visuel ræsonnering og agentbaseret vidensarbejde. Virksomheden skriver samtidig, at den samlede ydelse fortsat ligger under Claude Fable 5 og GPT-5.6 Sol. Benchmarkene bør læses som leverandørresultater, ikke som en neutral facitliste: modellerne er flere steder testet med forskellige agent-harnesses, hardwareopsætninger og reasoning-indstillinger. Moonshot beskriver disse forskelle i fodnoterne, men det gør ikke sammenligningen direkte.
For indkøbere er den mest interessante nyhed derfor ikke en enkelt placering på en kodebenchmark. Det er, at en kinesisk open-weight-udbyder tilbyder en model med frontier-ambitioner, native vision og en officiel API-pris på 0,30 dollar pr. million cachede inputtokens, 3 dollar for øvrige inputtokens og 15 dollar for outputtokens. De priser kan lægge pres på de lukkede udbydere, men en tokenpris fortæller ikke, hvad en færdig opgave koster. Fejlrate, svartid, værktøjsbrug, sikkerhedskrav og antallet af nødvendige forsøg kan ændre regnestykket markant.
Muligheden for egne vægte er heller ikke det samme som nem lokal drift. Moonshot anbefaler supernode-konfigurationer med mindst 64 acceleratorer til implementering af den fulde model. Det gør K3 relevant for specialiserede hostingpartnere og store organisationer, men mindre oplagt som et ukompliceret self-hosting-projekt. En realistisk evaluering bør derfor sammenligne tre spor: Moonshots API, en europæisk hostingpartner og egen drift. De skal testes på de samme opgaver og med samme krav til dataplacering, logning og adgangskontrol.
Mens Kimi udvider valget i modellaget, forsøger OpenAI at gøre sit eget økosystem fysisk. Codex Micro er et tastatur til 230 dollar, udviklet med Work Louder. Det har 13 mekaniske taster, en touch-sensor, en drejeknap og et joystick. RGB-lys viser, om Codex-agenter tænker, kører, venter eller er færdige, og kontrollerne kan blandt andet starte workflows, acceptere eller afvise handlinger og justere reasoning-niveauet.
Codex Micro er et nicheprodukt, men det peger på en større produktstrategi. Når agentarbejde flytter fra enkeltstående chats til flere samtidige forløb, bliver status, godkendelser og afbrydelser en grænsefladeopgave. OpenAI prøver her at reservere plads på skrivebordet til netop de handlinger. Det kan gøre agentarbejdet mere overskueligt, men binder også brugerens vaner tættere til Codex.
De to lanceringer trækker således i hver sin retning. Kimi K3 lover større valgfrihed i model- og hostinglaget; Codex Micro gør én bestemt agentplatform mere nærværende i det daglige arbejde. Virksomheder bør evaluere begge dele på arbejdsprocesser frem for specifikationer: Kan modellen løse opgaven stabilt, kan data behandles på acceptable vilkår, og kan man skifte leverandør uden at bygge hele arbejdsgangen om?
Kontekst: Ugens lanceringer viser, at konkurrencen ikke længere kun foregår om den stærkeste model. Den handler også om driftsformen, brugergrænsefladen og hvem der ejer de vaner og integrationer, som opstår omkring AI-agenter.