Hvis du har ventet på å kjøre DeepSeek V4 Flash Vision uten å sende bildene dine til DeepSeeks API, er modellvektene endelig publisert på Hugging Face. Det gjør modellen langt mer interessant for utviklere som vil undersøke, tilpasse eller drifte den selv.

Men vi må ta «lokal AI» med en liten neve salt her. Modellkortet oppgir 305 milliarder parametere, og selve checkpointet er på nesten 168 GB fordelt på 48 filer. Dette er ikke en vision-modell du laster ned på en vanlig PC og fyrer opp ved siden av nettleseren.

DeepSeek lanserte API-versjonen 21. august 2026. Nyheten nå er at selskapet også har lagt ut vektene, promptkodingen og en minimal PyTorch-implementasjon under MIT-lisens. Det er et viktig skritt fra «du kan leie tilgang» til «du kan faktisk undersøke hele kjøreoppsettet selv».

Hva er publisert på Hugging Face?

DeepSeek har publisert en eksperimentell multimodal V4-modell med 305 milliarder parametere, MIT-lisens og nedlastbare vekter. Det offisielle modellkortet på Hugging Face beskriver dette som den første eksperimentelle multimodale modellen i DeepSeek V4-familien.

DeepSeek-V4-Flash-Vision-Exp bygger videre på V4 Flash-arkitekturen med egne visuelle moduler og videre trening for bildeforståelse. Den tar imot både tekst og bilder, og er først og fremst laget for agenter som må tolke skjermbilder, diagrammer, dokumenter og andre visuelle deler av en arbeidsflyt.

Hugging Face-repositoriet inneholder mer enn en bunke modellfiler. DeepSeek har også lagt ved referansekode for vision-encoder og aligner, DFlash attention, mixture-of-experts, Hyper-Connections og DSpark. I tillegg følger det med en separat implementasjon av promptkodingen, slik at OpenAI-kompatible meldinger med tekst og bilder kan gjøres om til formatet modellen forventer.

Det er bra. Du slipper å gjette deg fram til hvordan bildene skal plasseres i prompten eller hvordan flere bilder skal holdes i riktig rekkefølge. Repositoriet har både JSON- og teksteksempler som skal gi identiske tokeniserte prompter.

MIT-lisensen gir også rom for kommersiell bruk, endring og distribusjon så lenge lisensvilkårene beholdes. Det er vesentlig friere enn en tjeneste der leverandøren alene bestemmer pris, tilgang og hvilke endringer som kommer neste uke. Samtidig er åpne vekter ikke det samme som full åpenhet om treningsdata og hele treningsløpet. Du får modellen og kjøregrunnlaget, ikke nødvendigvis oppskriften på alt som skapte den.

DeepSeek V4 Flash Vision med 48 vektfiler, referansekode og MIT-lisens
Hugging Face-pakken inneholder 48 vektfiler, MIT-lisens og referansekode for de sentrale vision- og modellkomponentene.

Hvor lokalt er 168 GB?

Checkpointet er på 167 811 372 792 byte, altså omtrent 167,8 GB, fordelt på 48 vektfiler. Det er den praktiske opplysningen som betyr mest før du trykker på nedlastingsknappen. Selv en kraftig RTX 4090 med 24 GB VRAM er ikke i nærheten av å romme hele modellen alene.

Konfigurasjonen bruker FP8-kvantisering med dynamiske aktiveringer og blokker på 128 ganger 128. Det gjør lagringen langt mindre enn en ren BF16-modell med 305 milliarder parametere ville vært, men 168 GB er fortsatt 168 GB. Du må tenke flere GPU-er, rikelig systemminne, rask lagring og et oppsett som kan håndtere modellparallell kjøring.

DeepSeeks egen referanseoppskrift konverterer Hugging Face-vektene til én checkpoint-fil per tensor-parallell rang. Eksemplet deres bruker fire prosesser, MP=4, 256 eksperter og --expert-dtype fp4. Det er nyttig dokumentasjon, men DeepSeek sier selv at dette er en lesbar referanseimplementasjon – ikke en ferdig produksjonsserver.

Det skillet er viktig. At vektene kan lastes ned betyr at modellen kan kjøres uten DeepSeeks API. Det betyr ikke at installasjonen er enkel, billig eller ferdig optimalisert for maskinvaren du tilfeldigvis har under skrivebordet.

Hva kan vision-modellen brukes til?

Modellen er laget for arbeidsflyter der en agent må forstå bilder samtidig som den bruker verktøy og resonnerer over tekst. DeepSeek nevner blant annet skjermbilder, diagrammer og visuell informasjon i agentoppgaver. Den offisielle vision-dokumentasjonen støtter JPEG, PNG, GIF og WebP.

Gjennom API-et kan du sende et bilde som base64, gi modellen en offentlig bilde-URL eller laste opp filen én gang og vise til en file_id. Eksterne bilder kan være opptil 32 MiB, mens bilder via Files API kan være opptil 64 MiB. En forespørsel kan inneholde opptil 600 bilder, men den samlede størrelsen og konteksten setter selvsagt en mer praktisk grense lenge før noen bør finne på å fylle alle plassene.

Hvert bilde blir skalert og gjort om til maksimalt 384 tokens for fakturering. Det gir en forutsigbar øvre grense per bilde og gjør modellen interessant for agenter som må lese mange skjermbilder. Samtidig betyr nedskaleringen at et svært stort bilde ikke automatisk gir modellen tilsvarende mer detalj.

API-et støtter Chat Completions, Responses API og et Anthropic-kompatibelt Messages-endepunkt. Det senker terskelen for å prøve modellen i eksisterende agentkode. Du må likevel velge modell-ID-en deepseek-v4-flash-vision-exp; de vanlige tekstmodellene avviser bildeinnhold med en 400-feil.

Er DeepSeek V4 Flash Vision god nok?

DeepSeek hevder at vision-utgaven beholder omtrent samme tekstegenskaper som V4 Flash-0731, samtidig som den gjør et tydelig hopp på multimodale agentoppgaver. I selskapets egne målinger fikk modellen blant annet 36,5 på ApexBench Pass@1.

Det er lovende tall, men de er fortsatt leverandørmålinger. DeepSeek oppgir at egne modeller ble testet med DeepSeek Harness i minimalmodus, maksimal reasoning effort, temperatur 1,0 og top_p=0.95. Slike detaljer betyr mye når agentresultater skal sammenlignes, og jeg ville ikke valgt produksjonsmodell ut fra tabellen alene.

Det mer interessante er hva publiseringen gjør mulig. Nå kan uavhengige utviklere kjøre de samme vektene, undersøke promptformatet, teste bildeforståelsen på egne datasett og måle hvor modellen faktisk feiler. Det er først når slike tester kommer at vi får vite om DeepSeeks vision-modell er solid i virkelige arbeidsflyter eller bare ser pen ut i en lanseringstabell.

Jeg er generelt skeptisk til å ta leverandørens egne sammenligninger som fasit, og kinesiske modeller får ikke frikort fordi vektene ligger på Hugging Face. Men åpne vekter og referansekode gjør i det minste påstandene mulig å etterprøve. Det er langt bedre enn en lukket modell der hele diskusjonen ender med «stol på oss».

Uavhengig testing av DeepSeek V4 Flash Vision mot leverandørens egne benchmarktall
Åpne vekter gjør det mulig å kontrollere leverandørtallene mot realistiske skjermbilder, diagrammer og agentoppgaver.

Hva koster det å prøve modellen?

For de fleste er API-et den fornuftige startplassen. DeepSeeks pristabell oppgir samme pris for vision-modellen som for V4 Flash: I rushtiden koster én million input-tokens uten cache 0,44 dollar, cirka 4,10 kroner med en dollarkurs rundt 9,33 kroner. Én million output-tokens koster 1,32 dollar, cirka 12,30 kroner.

Utenfor rushtiden halveres prisene til 0,22 dollar for én million input-tokens uten cache og 0,66 dollar for én million output-tokens, omtrent 2,10 og 6,20 kroner. Cache-treff er enda billigere. Bildene faktureres som input-tokens, med opptil 384 tokens per bilde.

Prisen er lav nok til at jeg heller ville brukt noen kroner på realistiske API-tester før jeg planla et tungt lokalt oppsett. Test egne skjermbilder, diagrammer og dokumenter. Mål feilrate, responstid, tool calls og hvor ofte agenten trenger menneskelig korrigering. Hvis resultatene faktisk forsvarer egen drift, kan du begynne å regne på maskinvare etterpå.

Den lokale varianten gir kontroll over data, kjøremiljø og videre tilpasning, men maskinvarekostnaden forsvinner ikke fordi lisensen er MIT. For forskning, modelltilpasning og miljøer med eksisterende GPU-kapasitet er vektene en stor nyhet. For en utvikler som bare vil gi en agent syn, er API-et mye enklere.

Datakontroll kan likevel vippe regnestykket. Skjermbilder kan inneholde kundenavn, interne systemer, kildekode og informasjon du slett ikke ønsker å sende til en ekstern tjeneste. Da kan lokal drift være verdt både maskinvare og arbeid. Alternativet er å maskere følsomme felt før API-kallet, bruke syntetiske testbilder og lese gjeldende vilkår før du sender produksjonsdata. Billig API betyr ikke at alle bilder bør forlate maskinen.

Hva bør du gjøre nå?

Vil du bare finne ut om modellen løser oppgaven din, start med API-et og modell-ID-en deepseek-v4-flash-vision-exp. Bruk ufølsomme testdata først, og sammenlign resultatene med en annen vision-modell på de samme oppgavene. Ikke la tre fine skjermbilder bli til en produksjonsbeslutning.

Har du maskinvaren og vil undersøke lokal kjøring, begynn med modellkortet og referanseimplementasjonen. Regn med omtrent 168 GB bare til vektene, og les konverteringsoppskriften før du laster ned alt. Referansekoden er laget for forståelighet, så du må forvente mer arbeid før dette er et robust serveroppsett.

DeepSeek har altså levert noe reelt: en nedlastbar multimodal V4-modell med en tillatende lisens og nok kode til at andre kan etterprøve den. Samtidig er modellen eksperimentell og voldsomt stor. Last ned hvis du faktisk skal forske, optimalisere eller drifte den. Skal du bare se om den kan lese et diagram, bruk API-et først. Det er mindre romantisk, men langt mer fornuftig.

Ofte stilte spørsmål

Kan DeepSeek V4 Flash Vision kjøres på én RTX 4090?

Nei, ikke hele det offisielle checkpointet direkte i GPU-minnet. Vektene er på omtrent 167,8 GB, mens en vanlig RTX 4090 har 24 GB VRAM. Kraftig kvantisering eller CPU-offloading kan endre regnestykket, men det offisielle oppsettet peker mot modellparallell kjøring over flere enheter.

Er DeepSeek V4 Flash Vision open source?

Modellrepositoriet, vektene og referansekoden er publisert på Hugging Face under MIT-lisens. Det gir svært vide rettigheter til bruk og endring. Det betyr likevel ikke automatisk at treningsdata, hele treningsprosessen og alle utviklingsdetaljer er offentliggjort.

Hvilke bildeformater støtter DeepSeek Vision API?

API-et støtter JPEG, PNG, GIF og WebP. Bilder kan sendes som base64, en offentlig URL eller en filreferanse fra Files API. Vanlige bildeopplastinger kan være opptil 32 MiB, mens en filreferanse kan peke til et bilde på opptil 64 MiB.

Er modellen klar for produksjon?

DeepSeek kaller den uttrykkelig eksperimentell. Bruk egne tester før produksjon, særlig for visuelle agentoppgaver der en feil kan utløse en handling. Mål nøyaktighet og stabilitet på dine egne data, og krev menneskelig godkjenning før agenten får gjøre noe som er vanskelig å angre.

Legg igjen en kommentar

Din e-postadresse vil ikke bli publisert. Obligatoriske felt er merket med *

Meld deg på nyhetsbrevet

Få oppdateringer om AI nyhetene rett i inboxen!

Du liker kanskje denne også
Jan Sverre ser på en skjerm med Claude Code og er overrasket over påstanden om $5 000 kostnad per bruker

Claude Code Pris 2026 – Hva Koster Det Egentlig?

Forbes hevdet at Anthropic taper $5 000 per Claude Code Max-bruker. Men beregningen forveksler API-priser med faktiske produksjonskostnader. Gjennomsnittlig bruker koster Anthropic rundt $18 per måned — ikke $5 000.
Jan Sverre surfer på en bølge av ChatGPT-meldinger - komplett norsk guide til ChatGPT i 2026

ChatGPT Norsk Guide – Slik Kommer Du i Gang (2026)

Komplett norsk guide til ChatGPT i 2026. Slik kommer du i gang, hva det koster i norske kroner, beste tips, og ærlig sammenligning med Claude og Gemini.
Gpt53 codex

OpenAI svarer med GPT-5.3 Codex — selvforbedrende AI som bygget seg selv

Innhold Vis Hva er GPT-5.3 Codex?Fra kodeskriver til digital arbeiderKappløpet intensiveresMer drama…
Jan Sverre i et mørkt videoredigeringsstudio med flere skjermer som viser LTX Video 2.3 frames fra en kafé-POV-scene

LTX Video 2.3 – 481 frames og 20 sekunder video på 2,5 minutt lokalt

LTX Video 2.3 (versjon 0.9.8) genererer 20 sekunder vertikal POV-video med 481 frames på 2 minutter og 26 sekunder på RTX 4090. Her er hva som er nytt, hva modellen krever, og hvorfor dette er den sterkeste lokale video-AI-modellen akkurat nå.