AI slår to ER-læger i Harvard-studie — og USA og Kina indgår den første AI-sikkerhedsprotokol
Et Harvard-studie offentliggjort i Science dokumenterede denne uge, at OpenAI's o1-preview — en model fra 2024 — diagnosticerede patienter mere præcist end to erfarne læger på tværs af 76 rigtige ER-forløb og tre beslutningsfaser i patientbehandlingen. Ved den indledende triage gav modellen den korrekte diagnose 67,1% af gangene, mod 55,3% og 50,0% for de to læger. De uafhængige bedømmere, der vurderede diagnoserne, kunne ikke skelne mellem dem fra modellen og fra menneskene. I ét tilfælde identificerede AI'en en sjælden nekrotiserende infektion hos en transplantationspatient 12-24 timer før den behandlende læge.
Parallelt mødtes præsidenterne Trump og Xi i Beijing til et topmøde, der dækkede handel, Taiwan, sjældne jordarter og — afgørende for AI-verdenen — en ny sikkerhedsprotokol. Finansminister Scott Bessent fortalte CNBC, at USA og Kina opsætter en AI-sikkerhedsprotokol fokuseret på 'best practices' for frontier-modeller, særligt med henblik på at forhindre, at kraftfuld AI når statsløse aktører som kriminelle hackingnetværk eller ekstremistgrupper. Anthropics Mythos-model blev specifikt nævnt som én årsag til Washingtons bekymring over AI's cybersikkerhedspotentiale. Nvidia-direktør Jensen Huang var med i Trumps delegation.
Malta satte denne uge rekord som det første land i verden, der tilbyder alle borgere gratis ChatGPT Plus — betinget af gennemførelse af et AI-litteracitetsforløb. Bloomberg rapporterede om et andet år med jobtab på 0,2% på tværs af 18 AI-eksponerede roller — men den samlede beskæftigelse er steget 0,8%, svarende til et vækst-til-tab-forhold på 4:1. Gallup fandt, at 7 ud af 10 amerikanere er imod AI-datacentre i deres lokalområde, hvilket gør dem endnu mere upopulære end atomkraftværker.
Forskningsresultater fra denne uge tilføjer nuancer: Brandon Stewart dokumenterede, at statslige medier allerede former LLM-output via træningsdata, og Lujain Ibrahim fandt, at sykofantisk AI langsomt ændrer, hvad folk forventer af menneskelig interaktion — fordi validering fra chatbots gør rigtig menneskelig kontakt føles som mere anstrengelse.
Kontekst: AI's samfundsmæssige rolle ekspanderer hurtigere end reguleringsrammerne — fra skadestuer og diplomatiske borde til jobmarkedet og lokalpolitik — og uge 20 demonstrerer bredden af de beslutninger, demokratier nu må tage stilling til.