Annons:

USA och Storbritannien backar från internationell AI-deklaration

Utvecklingen av AI

Publicerad februari 15, 2025 – av Sofie Persson
USA:s vicepresident JD Vance betonar att ”tillväxtfrämjande AI-politik” borde prioriteras framför säkerhet.
Insamlingskampanj

Hjälp Nya Dagbladet att finnas kvar

Insamlat: 17 350,00 SEK 23% Mål: 75 000,00 SEK

Sverige och 60 andra länder har undertecknat en AI-deklaration för inkluderande, hållbar och öppen AI. USA och Storbritannien väljer dock att stå utanför – ett beslut som väckt starka reaktioner.

AI-deklarationen togs fram i samband med det internationella AI-toppmötet i Paris tidigare i veckan, och syftet har beskrivits vara att främja en inkluderande och hållbar AI i linje med Parisavtalet. Dessutom betonas vikten av ett "etiskt" förhållningssätt där tekniken ska vara ”transparent”, ”säker” och ”pålitlig”.

I deklarationen noteras också AI:s energianvändning, något som inte diskuterats tidigare. Experter har tidigare varnat för att AI i framtiden kan komma att förbruka lika mycket energi som mindre länder.

Länder som bland andra Kina, Indien och Mexiko har skrivit under avtalet. Även Finland, Danmark, Sverige och Norge har skrivit under. USA och Storbritannien är två av de länder som valt att inte skriva under avtalet, rapporterar bland andra den brittiska statskanalen BBC.

Annons:

"Global styrning"

Den brittiska regeringen motiverar sitt beslut med oro för nationell säkerhet och ”global styrning”. USA:s vicepresident, JD Vance, har tidigare även sagt att för mycket reglering av AI skulle kunna ”döda en transformativ industri precis när den håller på att ta fart”. På mötet betonade Vance att AI var ”en möjlighet som Trump-administrationen inte kommer att slösa bort” och sa att ”tillväxtfrämjande AI-politik” borde prioriteras framför säkerhet.

Frankrikes president Emmanuel Macron försvarade å sin sida behovet av ytterligare reglering.

– Vi behöver dessa regler för att AI ska kunna gå framåt, menade Macron vid toppmötet.

Trovärdighet – grunden i vår journalistik sedan 2012

Nya Dagbladets position är unik i det svenska medielandskapet. NyD är oberoende på riktigt. Tidningen ägs och kontrolleras inom den egna redaktionen – inte av stora mediekonglomerat eller utländska intressen.

Sedan grundandet 2012 har grunden i vår oberoende journalistik varit balans och trovärdighet framför sensationsjournalistik och snabba klick. NyD är Sveriges bredaste helt oberoende dagstidning och står helt fri från politiska partier och industriintressen.

NyD erhåller inget presstöd och finansieras genom läsardonationer och annonser. Läs mer om våra pressetiska riktlinjer här.

Annons:

Så kan morgondagens bilresa se ut: styr företaget utan att hålla i ratten

Utvecklingen av AI

Publicerad Idag 11:40 – av Markus Andersson
Alex Finn står vid en Cybertruck och sitter sedan med händerna bakom nacken medan ratten är fri.
Alex Finn låter Cybertrucken ta vägen medan han själv sitter med händerna bakom nacken.

Han lutar sig tillbaka, lägger händerna bakom nacken och låter bilen ta vägen. I en ny video från AI-entreprenören Alex Finn ser morgondagens bilresa ut som ett kontor i rörelse: Cybertrucken navigerar, och Grok får sköta inkorgen. Det är en glimt av en vardag som kan bli vanlig för allt fler. Om den är bra eller dålig är en annan fråga, och den besvaras inte här.

Finn sitter i förarsätet utan att röra ratten. I ena stunden gestikulerar han mot skärmen, i nästa vilar han med fötterna framåt medan bilen följer vägen. Poängen i klippet är enkel. Resan till jobbet, eller till affären, behöver inte längre vara en stund då händerna måste vara upptagna av körningen.

Under tisdagen meddelade Tesla att Grok i bilen nu kan kopplas till förarens inkorg, kalender och filer. Elon Musk skrev att ”Grok @Bot now in your Tesla”. Bolaget beskriver det som en handsfree-funktion: man ber assistenten om något, och den kan läsa, sammanfatta och svara medan man kör eller använder FSD.

Alex Finn sitter i en Tesla med händerna bakom nacken och fötterna framåt.
Händerna bakom nacken, ratten orörd. Skärmdump: @AlexFinn/X

De tyngre uppdragen, de som Tesla kallar Grok @bot, kräver enligt bolaget abonnemanget SuperGrok Heavy. Samma slags agent går också att använda utanför bilen, i mobilen eller vid datorn. Enklare röstkommandon ingår i den vanliga Grok-funktionen i bilen. Det är alltså inte en fri agent för alla förare, utan en betald nivå ovanpå den assistent som redan sitter i skärmen.

I klippet ser det ut som om föraren kan luta sig tillbaka helt. Tesla själva beskriver FSD som övervakat. Föraren ska fortfarande ha uppsikt, och ansvaret lämnar inte förarsätet. Skillnaden mot en vanlig pendling är ändå tydlig i bild: ratten sköter sig, och uppmärksamheten kan ligga på något annat.

Alex Finn gestikulerar i förarsätet medan ratten är fri.
Han pratar med assistenten i stället för att hålla i ratten. Skärmdump: @AlexFinn/X

Finn är AI-entreprenör och driver YouTube-kanalen Alex Finn, med omkring 237 000 prenumeranter, där han visar hur nya AI-verktyg används i praktiken. Den som vill hänga med i den sortens experiment hittar fler där. Kanalen ligger ofta tidigt på sådant som just har släppts, och klippet är ett exempel på den blicken.

Det som visas är inte en färdig bild av allas vardag. Det är en tidig version, i en dyr bil, med ett abonnemang som de flesta ännu inte har. Men riktningen är lätt att se. Bilen blir en plats där man kan ta anteckningar, gå igenom mejlen eller styra en bit av arbetsdagen utan att hålla i ratten.

Kamerorna fanns där före assistenten

Samma bilar har samtidigt fått kritik som inte har med Grokboten att göra. Reuters rapporterade 2023 att grupper av Tesla-anställda mellan 2019 och 2022 delade kameraklipp från kundbilar i interna chattar. Enligt tidigare anställda syntes bland annat garage, privata tomter och situationer som ägarna knappast hade tänkt sig som utbildningsmaterial. Sju av dem sade att arbetsverktyget kunde visa var inspelningen var gjord, vilket i praktiken kunde avslöja var en ägare bodde.

Tesla har uppgett att kamerainspelningar förblir anonyma och inte kopplas till föraren eller bilen. Bolaget svarade inte på Reuters detaljerade frågor. Kritiken gäller alltså hur och var man kör, och vad bilens kameror fångar, inte den nya mejlfunktionen och inte Grokbot som verktyg i mobilen. Röststyrningen i bilen förutsätter dessutom att bilen hör det som sägs till assistenten. Den som sitter och pratar jobb i kupén sitter i samma kupé som redan har kameror, mikrofon och en historik av insamlade kördata.

Olika människor kommer att värdera bilens kameror olika. För en del är röststyrningen en arbetsro som tidigare inte fanns på väg till jobbet. För andra är kamerorna ett lager av insyn i en stund som brukade vara privat. Det ska inte blandas ihop med Grokbot i sig. Den som använder agenten i mobilen, på promenaden eller vid datorn hemma gör inte användningen publik per automatik.

FAKTA: Grokbot

Grokbot är xAI:s agent för att utföra uppgifter, inte bara svara i en chatt. Den kan styras från mobilen eller datorn, när man är ute och går eller sitter hemma, och användningen blir inte publik av sig själv.

Enligt xAI ingår Grok Bot i SuperGrok, från 30 dollar i månaden. I Teslan kräver de tyngre uppdragen enligt bolaget fortfarande SuperGrok Heavy.

Den som har ett xAI-konto kan aktivera Zero Data Retention i kontoinställningarna. Inställningen gäller då hela kontot, och promptar och svar sparas inte. Den stänger inte av bilens kameror.

Trovärdighet – grunden i vår journalistik sedan 2012

Nya Dagbladets position är unik i det svenska medielandskapet. NyD är oberoende på riktigt. Tidningen ägs och kontrolleras inom den egna redaktionen – inte av stora mediekonglomerat eller utländska intressen.

Sedan grundandet 2012 har grunden i vår oberoende journalistik varit balans och trovärdighet framför sensationsjournalistik och snabba klick. NyD är Sveriges bredaste helt oberoende dagstidning och står helt fri från politiska partier och industriintressen.

NyD erhåller inget presstöd och finansieras genom läsardonationer och annonser. Läs mer om våra pressetiska riktlinjer här.

Anthropic: Claude hittade enzymsystem – funktionen okänd

Utvecklingen av AI

Publicerad september 23, 2026 – av Redaktionen
Blå handske håller ett öppet provrör medan en pipett tillför orange vätska.
Anthropic säger att Claude pekat ut ett enzymsystem i bakterievirus. Funktionen är ännu okänd, och labbförsöken görs av människor.

AI-bolaget Anthropic hävdar att dess språkmodell Claude, med bara övergripande instruktioner från bolagets forskare, har hittat ett tidigare obeskrivet enzymsystem i bakterievirus. Bredvid enzymgenen ligger en lång rad DNA-upprepningar som påminner om CRISPR. Vad systemet faktiskt gör vet ingen ännu, inte heller bolaget.

Anthropic skriver i ett tillkännagivande den 23 september att systemet har fått namnet ART, efter engelskans array-associated reverse transcriptases. Fyndet presenteras som det första publika resultatet från en ny forskargrupp inom biovetenskap, som bolaget har byggt ett eget molekylärbiologiskt labb för i Bay Area i Kalifornien.

Det handlar inte om något nytt gensaxverktyg. Anthropic medger själv att systemets funktion är okänd och att experimenten fortsätter. Bolagets förhoppningar vilar på att ART har en kombination av egenskaper som hittills bara har hittats i en handfull andra system. Alla dessa är programmerbara och kan klippa, kopiera eller klistra in DNA.

950 agenter på 21 timmar

Enligt bolaget var forskarnas insats begränsad till den inledande instruktionen och labbarbetet. Claude fick i uppdrag att söka igenom en stor databas med DNA-sekvenser efter intressanta nya exempel på omvända transkriptaser, förkortat RT. Det är enzymer som kopierar RNA till DNA.

Därefter tog modellen över. Omkring 950 Claude-agenter arbetade i 21 timmar och förbrukade 210 miljoner tokens, alltså de textenheter som språkmodeller räknar i. Agenterna samlade in över 200 000 RT, pekade ut 3 500 nya kandidatsystem och sållade fram de 20 mest lovande. För varje kandidat skrevs en rapport som människor kunde läsa och granska.

Anthropic uppger att den här typen av genomgång kan ta veckor till månader för en erfaren forskare.

Under sökningen fastnade en av agenterna för en ovanlig RT-familj. I den råa DNA-sekvensen intill genen såg den ett upprepat mönster. Enligt bolagets återgivning kallade agenten sekvensen "spektakulär" och undrade om den kunde vara en CRISPR-liknande upprepningsrad.

RT-enzymet i den så kallade jumbo-fagen var redan känt från tidigare studier. Det Anthropic tillskriver Claude är att modellen kopplade enzymet till den intilliggande raden av DNA-upprepningar och en gen för ytterligare ett protein, vars funktion inte är känd. Tillsammans utgör de tre delarna det system bolaget kallar ART.

Korta RNA – men okänd funktion

I de första laboratorieförsöken uttrycktes upprepningsraden som flera skilda, korta RNA, enligt Anthropic. Det är ett tidigt fynd som gör liknelsen med CRISPR intressant, men det visar inte vad ART gör eller att systemet kan användas för genredigering.

CRISPR-pionjären Feng Zhang, professor vid MIT och Broad Institute, har läst forskarnas preprint. I ett uttalande som Anthropic återger kallar han fyndet av RNA-upprepningsrader kopplade till omvända transkriptaser verkligt intressant och värt att undersöka vidare. Han beskriver arbetet som ett spännande exempel på hur AI-agenter kan bidra till biologiska upptäckter och hoppas att fler forskare utforskar hur AI kan stödja deras forskning.

Det praktiska labbarbetet utförs av människor, uppger bolaget. Anthropic beskriver verksamheten som forskning på säkerhetsnivåerna BSL-1 och BSL-2 och säger att labbet inte hanterar patogener som kan infektera människor.

Forskarna redovisar fynden i en preprint. Nästa steg är experiment som kan visa hur ART fungerar. Än så länge har AI-agenterna pekat ut ett möjligt nytt system – inte klarlagt vad det gör.

Trovärdighet – grunden i vår journalistik sedan 2012

Nya Dagbladets position är unik i det svenska medielandskapet. NyD är oberoende på riktigt. Tidningen ägs och kontrolleras inom den egna redaktionen – inte av stora mediekonglomerat eller utländska intressen.

Sedan grundandet 2012 har grunden i vår oberoende journalistik varit balans och trovärdighet framför sensationsjournalistik och snabba klick. NyD är Sveriges bredaste helt oberoende dagstidning och står helt fri från politiska partier och industriintressen.

NyD erhåller inget presstöd och finansieras genom läsardonationer och annonser. Läs mer om våra pressetiska riktlinjer här.

Anthropics nya Opus-modell slår alla flaggskepp — OpenAI svarar med priskollaps

Utvecklingen av AI

Uppdaterad september 22, 2026, Publicerad september 22, 2026 – av Markus Andersson
Montage med Anthropics och OpenAI:s märken över ett kvällskontor.
Anthropic och OpenAI släppte på tisdagskvällen varsin ny modell, med drygt en timmes mellanrum.

Anthropic och OpenAI tog på tisdagskvällen varsitt stort kliv, med drygt en timmes mellanrum. Claude Opus 5.5 slår bolagets eget flaggskepp på flera av de tester Anthropic själv redovisar, och kostar samtidigt mindre att köra än föregångaren. OpenAI svarade med GPT-6 Sol och GPT-6 Luna: två modeller som dumpar priset och för ner mycket av flaggskeppet GPT-6 Astras förmåga i ett snabbare och billigare format. Det är inte två sidospår. Det är fronten som flyttas samma kväll, från två håll.

Anthropic gick först. Klockan 18.31 svensk tid publicerade bolaget Claude Opus 5.5, den första modellen i Claude 5.5-familjen. I de egna tabellerna leder den kodning med agenter, datoranvändning och kunskapsarbete. På Terminal-Bench 4.0, ett test av verkliga kommandoradsuppgifter, når den 66,4 procent vid hög ansträngning, mot 55,8 för flaggskeppet Claude Fable 5.1 och 57,9 för GPT-6 Astra. På GDPval-AA v2.1, ett test av arbete i 44 yrken, får den 1846 poäng mot Astras 1542.

Klockan 20.12 presenterade OpenAI GPT-6 Sol och GPT-6 Luna. Bolaget beskriver dem som snabbare och billigare modeller, tränade med liknande metoder som Astra, som ska bära framstegen bakom flaggskeppet vidare till arbete i skala. Sam Altman kommenterade släppet positivt. Priset är vapnet: Sol kostar 2 dollar per miljon token i input och 10 dollar i output. Luna kostar 0,10 respektive 0,50 dollar.

Anthropic skriver samtidigt att Opus 5.5 på de flesta uppgifter ligger i nivå med Fable 5.1, och att gapet i bolagets egen användning är smalare än tabellerna antyder. Det tar inte bort klivet. Modellen kostar 40 procent mindre att köra än Claude Opus 5, och utdata ska komma mer än 30 procent snabbare vid standardinställning. OpenAI räknar sin halvering mot kampanjpriserna för GPT-5.6, inte mot ordinarie listpriser, och lovar dessutom 90 procents rabatt på cachade input-token.

Opus slår flaggskeppet på flera tester

Anthropics publicerade testresultat för Opus 5.5
Opus 5.5 slår Fable 5.1 på de tester Anthropic lyfter fram. Astra leder ett av dem. Källa: Anthropic.

Säljargumentet är alltså inte bara pris. Anthropic redovisar att Opus 5.5 vid standardinställning slår GPT-6 Astra på maxansträngning i kunskapsarbetet, till ungefär en femtedel av kostnaden per uppgift. Samma tabell visar att Astra fortfarande ligger före på AutomationBench, 41,4 procent mot 40,0. Bolaget skriver själv att benchmarkmarginaler blivit en sämre guide till skillnaden i verkligt bruk. Det är ett ovanligt medgivande i ett lanseringsdokument som ändå är fullt av marginaler.

OpenAI har valt andra motståndare. Sol ställs mot Claude Opus 5 och mot Fable 5 och 5.1, inte mot Opus 5.5, som släpptes samma kväll. På AutomationBench, Zapiers test av affärsflöden med 47 verktyg, når Sol 33,2 procent vid högsta ansträngning till 0,27 dollar per uppgift. OpenAI säger att det slår Opus 5 vid maximal ansträngning, som får 26,9 procent, till 9 procent av kostnaden. Fable 5.1 med Opus 5 som reserv når 31,4 procent i samma jämförelse. OpenAI anger att reserven användes på omkring 40 procent av uppgifterna och att dess kostnad inte är inräknad.

På DeepSWE v1.1 hamnar Sol på 68,8 procent, 1,1 procentenheter under Fable 5, till omkring 80 procent lägre kostnad per uppgift. Luna når 66,6 procent, vilket OpenAI jämför med Opus 5 och Fable 5 vid medelnivå. Vid högre ansträngning ska Luna matcha GPT-5.6 Sol till ungefär en hundradel av kostnaden.

Tidiga testare som Anthropic lyfter fram pekar åt samma håll. En ska ha slutfört en kodmigrering på 680 000 rader på mindre än en dag. En annan lät Opus 5.5 granska och rätta en kodbas på 200 000 rader på under tre timmar, där Opus 5 behövde över 20 timmar och 2,5 gånger så många token. I ett internt test översatte Opus 5.5 och Fable 5.1 lastbalanseraren HAProxy från C till Rust. Båda klarade nästan alla regressionstester, men Opus 5.5 blev klar på 9,5 timmar mot 12 och kostade 51 procent mindre.

GitHubs produktchef Mario Rodriguez citeras av Anthropic med att utvecklare vill ha agenter som kan ta sig an verkligt programmeringsarbete och slutföra det. Enligt GitHub använde Opus 5.5 bland de lägsta mängderna token och steg i tester i Copilot CLI och VS Code. Utanför bolagens egna papper visade kontot BridgeMind på X hur modellen i ett enda försök byggde ett spelbart Mario Kart-liknande spel, med figurer som Mario och Luigi. Kontot uppger att resultatet är tydligt bättre än Fable 5.1, som enligt dem inte fått fram spelbara figurer på samma sätt. Det är en demonstration, inte ett officiellt test.

Priset faller snabbare än tabellerna

Opus 5.5 kostar 4 dollar per miljon token input och 20 dollar output, mot 5 och 25 dollar för Opus 5. Cachade läsningar sjunker från 0,50 till 0,20 dollar. Ett snabbare läge, upp till 2,5 gånger snabbare, kostar 8 dollar input och 40 dollar output. Anthropic räknar med att typiska arbetsflöden vid standardinställning blir 40 procent billigare.

På OpenAI:s sida är fallet brantare. GPT-6 Sol på 2 och 10 dollar, och GPT-6 Luna på 0,10 och 0,50, är inte sidomodeller i marginalen. Luna är den modell som gör skalan möjlig: samma familj som Astra, till en kostnad som i bolagets egen jämförelse kan ligga kring en hundradel av GPT-5.6 Sol. Halveringen för Sol räknas, som sagt, mot kampanjpris. Även med det förbehållet är riktningen entydig. Köparna får mer av flaggskeppets arbetssätt för mindre pengar, samma kväll som Anthropic kapar priset på sin nästa Opus.

Astra står kvar som OpenAI:s mest intelligenta modell, och den bästa över lag enligt bolaget självt. På datoranvändning är den fortfarande bäst i OpenAI:s egen redovisning. Sol och Luna rullas ut för att arbetet ska kunna köras i volym, inte för att Astra ska pensioneras. Det är just därför släppet är stort: fronten blir inte en modell som få har råd att anropa.

Spärrarna sitter kvar

Opus 5.5 är Anthropics första släpp sedan vd Dario Amodei uppmanade branschen att bromsa fronten. Bolaget uppger att modellen testats före släpp av externa utvärderare, bland andra Frontier Design och METR, och att den fått sitt starkaste resultat hittills i Anthropics mest omfattande beteendetest, en automatiserad genomgång av hur modellen agerar. Den får säkerhetsspärrar liknande Fable 5.1, enligt bolagets systemkort, eftersom Anthropic bedömer den som jämförbar med Claude Mythos 5.1 inom biologi och cybersäkerhet. Tänkläget går inte att stänga av.

OpenAI säger att Sol och Luna ligger bättre till än GPT-5.6 i bolagets säkerhetstester, bland annat med färre vilseledande påståenden om sitt eget kodarbete. I ett internt test på samtal där användare flaggat faktafel gör Sol enligt bolaget ungefär hälften så många fel som föregångaren.

Tillgången skiljer sig. Opus 5.5 finns på Claude-plattformen och hos AWS, Google Cloud och Microsoft Azure, med en kontext på 1 miljon token och kunskapsavbrott i juni 2026. Tidsgränserna höjs för Pro, Max, Team och platsbaserade Enterprise. GPT-6 Sol och Luna rullas ut gradvis i ChatGPT Work och Codex för Plus, Pro, Business, Enterprise och Edu, men ännu inte i Chat. Användare av Free och Go kan köra Luna i skrivbordsappen.

Nästa drag är redan aviserat. Anthropic lovar Sonnet 5.5 och Haiku 5.5 de närmaste veckorna. Den jämförelse köparna fortfarande saknar, ett gemensamt test av Opus 5.5 mot GPT-6 Sol, finns inte i något av bolagens material. Det som finns är två officiella släpp, två prissänkningar och en kväll där båda vägrade lämna fronten åt den andra.

Trovärdighet – grunden i vår journalistik sedan 2012

Nya Dagbladets position är unik i det svenska medielandskapet. NyD är oberoende på riktigt. Tidningen ägs och kontrolleras inom den egna redaktionen – inte av stora mediekonglomerat eller utländska intressen.

Sedan grundandet 2012 har grunden i vår oberoende journalistik varit balans och trovärdighet framför sensationsjournalistik och snabba klick. NyD är Sveriges bredaste helt oberoende dagstidning och står helt fri från politiska partier och industriintressen.

NyD erhåller inget presstöd och finansieras genom läsardonationer och annonser. Läs mer om våra pressetiska riktlinjer här.

SpaceXAI släpper Grok 4.7 – bättre kod till oförändrat pris

Utvecklingen av AI

Uppdaterad september 21, 2026, Publicerad september 21, 2026 – av Markus Andersson
Gråsilvrig bakgrund med texten Grok 4.7 i vitt, SpaceXAI:s officiella lanseringsbild.
Grok 4.7 släpptes under måndagen till samma API-pris som Grok 4.6 – 2 dollar in och 6 dollar ut per miljon tokens.

AI-bolaget SpaceXAI (tidigare xAI) släppte under måndagen Grok 4.7, som bolaget kallar sin mest kapabla modell för kodning och kunskapsarbete. Den kostar lika mycket och svarar lika snabbt som föregångaren Grok 4.6, finns direkt i Cursor, Grok Build och Grok API – och alla siffror som ska visa förbättringen kommer från bolaget självt.

Det konkreta i släppet är inte ett nytt prisläge utan ett nytt innehåll bakom samma prislapp. Enligt bolaget bygger Grok 4.7 på en ny och större basmodell än 4.6, har tränats med en längre förstärkningsinlärningsomgång på en svårare uppgiftsmix med tyngdpunkt på problem som tar många timmar, och har blivit bättre på att kontrollera sitt eget arbete och hantera långa kontexter. Modellen är också tränad att förstå bolagets egen agentmiljö, Grok Bot-harnesset, direkt.

I API:et heter modellen grok-4.7 och kostar 2 dollar per miljon inmatade tokens och 6 dollar per miljon utmatade – exakt samma nivå som Grok 4.6 High. Kontextfönstret ligger på 500 000 tokens och kunskapsbrytningen är maj 2026. Den som vill ha mer fart kan välja en snabbvariant med dubbel utdatahastighet till dubbla priset.

Vinsterna finns – men inte överallt

Bolaget redovisar en tabell med sju mätserier. Tre av dem är tydliga steg framåt. På EEBench får Grok 4.7 resultatet 64,0 mot 53,0 för 4.6. På Harvey Legal Agent, som mäter juridiskt agentarbete, redovisas 19,6 mot 15,8 för föregångaren och 2,5 respektive 6,7 för de två konkurrentmodeller bolaget jämför med. Mest dramatisk är skillnaden på Terminal-Bench 4.0, där 4.7 landar på 38,0 mot 4.6:s 20,3 – nästan en fördubbling på ett halvår.

Men tabellen visar också var modellen inte leder. På samma Terminal-Bench 4.0 ligger konkurrenten Fable 5.1 på 57,9, alltså långt över Grok 4.7. På CursorBench 4.0 får Grok 4.7 46,3 mot Fables 51,8, och på HealthBench Professional 56,7 mot 62,1. I bolagets egen Elo-mätning på GDPval hamnar Grok 4.7 xHigh på 1 695 – över Grok 4.6 High på 1 605 och GPT-6 Astra Max på 1 542, men under Fable 5.1 Max på 1 735.

Bolagets eget säljargument är därför inte topplaceringen utan prisförhållandet: samma resultatnivå för 2 och 6 dollar per miljon tokens, där jämförelsemodellerna i tabellen ligger på 4/20 respektive 10/50 dollar. Inget av resultaten är oberoende verifierat, och samtliga tal i tabellen är uppmätta och publicerade av SpaceXAI självt.

Stadsbyggarspelet som demo

Som konkret exempel visar bolaget hur de två modellversionerna får samma uppgift: att bygga ett öppet stadsbyggarspel. Grok 4.7 visas först, Grok 4.6 därefter. Det är precis den sorts uppgift som den längre träningen sägs vara riktad mot – ett flertimmarsjobb där modellen måste hålla ihop kod, struktur och egna kontroller över lång tid utan att en människa styr varje steg.

Demon är vald av bolaget och säger inget om hur modellen beter sig på en riktig kodbas hos en riktig kund. Men den illustrerar riktningen i hela branschen: konkurrensen har flyttat från snabba svar till agenter som jobbar vidare på egen hand i timmar. Det är där leverantörerna nu pressar varandra, och det är också där felen blir dyra, eftersom en modell som arbetar länge utan tillsyn hinner göra mycket innan någon upptäcker att den var på fel spår.

Säkerhetslagret och de siffror som inte är hundra

SpaceXAI beskriver Grok 4.7 som utrustad med bolagets bäst kalibrerade skyddslager hittills – ett helt nytt så kallat safeguard-stack, som enligt bolaget är starkast på vägran och motstånd mot jailbreak. Två tal anges. På HackerBench v0.3 släpps 3,3 procent av riskabla prompter med dubbel användning igenom. På LatchBios biosäkerhetsmätning redovisas 62,4 procent.

Med andra ord: drygt tre av hundra riskabla förfrågningar passerar ändå, och biosäkerhetsresultatet ligger en bra bit under full träff. Bolaget har dessutom bjudit in utvalda cybersäkerhetspartners till slutna red team-övningar för försvarsforskning. Vilka partnerna är framgår inte, och de publicerade talen är bolagets egna mätningar på bolagets egna testmängder.

Var modellen finns – och vad som händer nu

Tillgängligheten är det som avgör hur snabbt släppet får praktisk betydelse. Grok 4.7 finns från dag ett i Cursor och Grok Build samt i Grok API, och därutöver via tredjeparts kodmiljöer, modellroutrar och molntjänster. Den som redan kör grok-4.6 i produktion byter i praktiken modellnamn utan att röra budgeten.

Takten är värd att notera. I juli släpptes Grok 4.5 med samma prislapp, 2 och 6 dollar per miljon tokens, och samma kontextfönster på 500 000 tokens. Sedan dess har bolaget bytt namn, passerat 4.6 och nu 4.7 – utan att röra priset en enda gång. Prislistan har blivit branschens fasta punkt medan modellerna under den byts ut i månadstakt.

Vad kunden faktiskt får för de oförändrade 2 och 6 dollarna avgörs därför inte av tabellen utan av hur den nya modellen sköter sig i timslånga agentkörningar hos företag som låter den arbeta i egna system. Den prövningen börjar nu, och den görs av andra än bolaget självt.

Trovärdighet – grunden i vår journalistik sedan 2012

Nya Dagbladets position är unik i det svenska medielandskapet. NyD är oberoende på riktigt. Tidningen ägs och kontrolleras inom den egna redaktionen – inte av stora mediekonglomerat eller utländska intressen.

Sedan grundandet 2012 har grunden i vår oberoende journalistik varit balans och trovärdighet framför sensationsjournalistik och snabba klick. NyD är Sveriges bredaste helt oberoende dagstidning och står helt fri från politiska partier och industriintressen.

NyD erhåller inget presstöd och finansieras genom läsardonationer och annonser. Läs mer om våra pressetiska riktlinjer här.