Google har utvecklat en ny algoritm som kan minska AI-systemens minnesanvändning dramatiskt – utan att sänka prestandan. Tekniken öppnas nu för alla att använda, och marknaden reagerade med fallande minnesaktier.
För att förstå TurboQuant måste man först förstå vad AI-modeller egentligen gör när de genererar text. När en stor språkmodell skriver en mening behöver den hålla reda på allt som sagts tidigare i konversationen. Det handlar inte om att komma ihåg ord som ett barn memorerar läxor – det handlar om tusentals matematiska beräkningar som bygger på varandra.
Moderna AI-system använder något som kallas KV-cache för att slippa göra om dessa beräkningar från början för varje nytt ord. Men här ligger problemet: för varje ord som modellen bearbetar sparas nya mellanliggande resultat. Ju längre kontexten blir, desto mer minne går åt. Och i takt med att modellerna blir kraftfullare och kontexterna längre, har minnesanvändningen blivit en allvarlig flaskhals.
Så komprimerar TurboQuant minnet
Google Researchs nya algoritm TurboQuant angriper problemet i två steg. Det första steget bygger på en metod som kallas PolarQuant, som byter ut traditionella kartesiska koordinater mot polära koordinater. Skillnaden påminner om att beskriva en position på jorden med latitud och longitud i stället för med koordinater i ett rätvinkligt system. Det polära systemet effektiviserar beräkningarna genom att eliminera behovet av de konstanter som normalt krävs för att normalisera resultaten.
Det andra steget använder QJL, Quantized Johnson-Lindenstrauss, som tar hand om den lilla felmarginal som uppstår. QJL komprimerar denna felmarginal till bara 1 bit, utan extra minnesbelastning.
Tillsammans ger detta en komprimering från 16-bitars till 3-bitars representation av KV-cacheminnen. Det betyder att samma mängd minne nu kan lagra ungefär fem gånger mer data. Den kanske viktigaste fördelen är att algoritmen inte kräver nyträning av befintliga modeller – den fungerar direkt med redan tränade system som Llama, Mistral och Qwen.
Stora prestandavinster
Med Nvidias H100-grafikkort uppnår TurboQuant åtta gånger högre beräkningshastighet för attention-beräkningar. Kostnaden för att köra en AI-modell minskar med över 50 procent. I Googles egna tester klarade systemet 100 procents träffsäkerhet i extremt långa kontexter med över 100 000 tokens, så kallade "nålen i höstacken"-tester.
Marknaden reagerade snabbt. Minnestillverkare som Samsung och SK Hynix såg sina aktiekurser falla rejält. Bedömare har liknat tekniken vid Pied Piper-algoritmen – komprimeringsalgoritmen i HBO-serien Silicon Valley.
Samtidigt som AI-systemen växer exponentiellt kan tekniksprång som TurboQuant paradoxalt nog leda till en ökad total minnesanvändning, i takt med att modellerna blir större och mer krävande.
Google öppnar nu källkoden för alla. Forskningsrapporten presenteras vid ICLR 2026, och tillämpningar för Llama.cpp och Hugging Face utvecklas just nu.
