Jan Sverre utforsker Lance, ByteDances 3B multimodale AI-modell for bilde og video

Lance – ByteDances 3B-modell for bilde og video i ett system

Lance er ByteDances nye 3B open source-modell som håndterer bildegenerering, videogenerering og bilderedigering i ett system. Apache 2.0-lisens, 40GB VRAM.
Jan Sverre i serverrom med blågrønt lys fra racks, tablet viser AI-genererte videorammer fra Alice v1

Alice v1 – open source videomodell som utfordrer Sora og Veo

Alice v1 er en 14-milliarder parameter open source videomodell fra Mirage med Apache 2.0-lisens. Bruker rCM-destillasjon og MoE-arkitektur for å generere 720p video på 4 inferenstrinn – og hevder å slå lukkede modeller som Sora og Veo.
Jan Sverre ser på en AI-generert cinematic film laget av en open source pipeline med FLUX.2 og Wan2.2

Open source video pipeline – én prompt til ferdig film med FLUX.2 og Wan2.2

En open source pipeline tar én setning og leverer ferdig cinematic MP4 med karakterer, musikk og voice-over på 9 språk – alt på én AMD Instinct MI300X GPU på 45 minutter. FLUX.2 klein for keyframes, Wan2.2-I2V for animering, Vision Critic med auto-retry for kvalitetskontroll. Alle modeller Apache 2.0 eller MIT.
Jan Sverre studerer et Mixture of Experts-nettverksdiagram som viser ZAYA1-8B sin selektive parameteraktivering med AMD-hardware i bakgrunnen

ZAYA1-8B – Zyphra sin MoE-modell slår modeller 15 ganger større

ZAYA1-8B fra Zyphra aktiverer bare 760 millioner parametere per inferens, men slår modeller med 119 milliarder parametere på matematikk-benchmarks. Trent ende-til-ende på AMD Instinct MI300x og tilgjengelig under Apache 2.0-lisens.
Jan Sverre utforsker Gemma-4-31B-it-DFlash og spekulativ dekoding med DFlash-teknikken

Gemma-4-31B-it-DFlash – spekulativ dekoding for Googles åpne modell

Gemma-4-31B-it-DFlash er en ny variant av Googles Gemma 4 31B utgitt av Z Lab, med DFlash spekulativ dekoding som kan gi opptil 8x raskere inferens. Llama.cpp-støtte er under utvikling via PR #22105.
Jan Sverre utforsker IBM Granite 4.1 sine tre open source AI-modeller på 3B, 8B og 30B parametere

IBM Granite 4.1 – open source AI-modeller i 3B, 8B og 30B

IBM Granite 4.1 er tre nye open source AI-modeller (3B, 8B og 30B) med Apache 2.0-lisens, 512K tokens kontekstvindu og FP8-kvantisering. 8B-modellen matcher tidligere 32B MoE-modell – og kjører på vanlig gaming-GPU.
Mann som dykker ned i en digital pool av kode og AI-agenter - Poolside AI Laguna lansering

Poolside AI lanserer Laguna XS.2 og M.1 – spesialiserte agentic coding-modeller

Poolside AI lanserte 28. april 2026 sine to første offentlige modeller: Laguna M.1 (225B/23B aktive parametere) og Laguna XS.2 (33B/3B aktive, Apache 2.0). Begge er bygget for agentic coding og lange autonome kodingssessjoner – og begge er gratis via API og OpenRouter nå.
Jan Sverre lager AI-musikk med ACE-Step 1.5 XL ved mixing board med lydbølger og spektrogrammer

ACE-Step 1.5 XL – 4B Language Model og Chain-of-Thought musikk-AI

ACE-Step 1.5 XL doblet modellstørrelsen til 4 milliarder parametere og la til en 4B Language Model basert på Qwen3. Jeg testet XL-oppdateringen på RTX 4090 – her er hva som fungerer og hva som ikke fungerer.
Jan Sverre tester FLUX.2 small decoder med Python-kode på skjermen sent på kvelden

FLUX.2 small decoder – raskere VAE og lavere VRAM-bruk

Black Forest Labs lanserte FLUX.2-small-decoder – en destillert VAE-dekoder som er ~1,4x raskere og bruker mindre VRAM. Drop-in erstatning for standard dekoder, kompatibel med alle åpne FLUX.2-modeller, Apache 2.0-lisens.
Jan Sverre utforsker Gemma Gem Chrome-utvidelsen med AI-chat overlay i nettleseren

Gemma Gem – AI-agent i nettleseren uten API-nøkler eller sky

Gemma Gem er en Chrome-utvidelse som kjører Googles Gemma 4 direkte i nettleseren via WebGPU – ingen API-nøkler, ingen sky. En liten AI-agent med agent-kapabiliteter som leser sider, klikker knapper og fyller ut skjemaer, alt lokalt på maskinen din.
Jan Sverre utforsker Gemma 4 fra Google med Apache 2.0-lisens og fire nye åpne AI-modeller

Gemma 4 – Google lanserer åpne AI-modeller med Apache 2.0-lisens

Google lanserte Gemma 4 den 2. april 2026 med Apache 2.0-lisens – den første Gemma-modellen som er fullt åpen for kommersiell bruk. Fire varianter fra 2,3 til 31 milliarder parametere, multimodal støtte og 128-256K kontekstvindu.
Jan Sverre dirigerer et nettverk av open source AI-modeller som Llama, Qwen og Mistral lokalt på egen maskin

Open source AI – komplett guide (2026)

Alt du trenger å vite om open source AI i 2026: hva open weights faktisk betyr, de beste modellene (Llama, Qwen, Mistral, DeepSeek), verktøy for lokal kjøring, og når open source slår lukkede alternativ.
Jan Sverre dirigerer fire datastrømmer for lyd, video, tekst og bilder som smelter sammen - illustrasjon av Qwen3.5 Omni omnimodal AI

Qwen3.5 Omni – Alibabas omnimodale AI hører, ser og snakker samtidig

Qwen3.5 Omni er Alibabas nye omnimodale AI-modell som håndterer lyd, video, bilder og tekst i én og samme modell – uten separate verktøy. Plus-varianten overpresterer Gemini 3.1 Pro på audioforståelse og nådde SOTA på 22 av 36 benchmarks.
Jan Sverre holder hodetelefoner mens lydbølger og tale-til-tekst-transkripsjon spruter ut i rommet rundt ham

Cohere Transcribe – open source transkripsjon som slår Whisper

Cohere lanserer Transcribe – en open source ASR-modell med 2 milliarder parametere som topper Open ASR Leaderboard med 5,42% WER. Slår Whisper Large v3 og ElevenLabs Scribe v2. Apache 2.0-lisens, kjører på forbrukerhardware, støtter 14 språk.