Jan Sverre foran komprimert DeepSeek-arkitektur for millionkontekst i effektiv AI-drift

DeepSeek V4.1 Flash gjør millionkontekst lettere å servere

DeepSeek V4.1 Flash har 1 million tokens og kutter global KV-cache til 890 byte per token. Slik kan lange AI-agentløp bli lettere og billigere å drifte.
Person omgitt av store dokumentbunker mens AI-modellen parser og strukturerer innholdet på skjermen

Baidu Unlimited OCR: 3B-modellen som parser hele dokumentbunker uten at minnet eksploderer

Baidu slapp Unlimited OCR – en 3B MoE-modell som parser 40+ siders dokumenter i én operasjon. R-SWA-mekanismen holder KV-cachen flat slik at minne og latens ikke vokser med dokumentlengden. MIT-lisens og tilgjengelig på Hugging Face.
Jan Sverre i et serverrom med lysende GPU-racker - TurboQuant komprimerer KV-cache til 3 bits

TurboQuant – Googles nye KV-cache-algoritme gir 6x lavere minnebruk

Googles TurboQuant komprimerer KV-cachen i store språkmodeller til kun 3 bits – uten nøyakhetstap. 6 ganger lavere minnebruk og opptil 8 ganger raskere ytelse på NVIDIA H100. Presentert på ICLR 2026.