Apertus 1.5 gjør den sveitsiske, fullt åpne AI-modellen langt mer anvendelig: 8B- og 70B-utgavene kan nå forstå bilder og lyd, bruke opptil 262 144 tokens med kontekst og settes i en egen tenkemodus.

Hvis du er opptatt av lokal AI, er det fristende å hoppe rett til spørsmålet om den slår Qwen, Gemma eller de lukkede toppmodellene. Det er ikke der denne lanseringen har størst tyngde. Apertus er laget som en gjennomsiktig grunnmur som forskere, bedrifter og offentlige virksomheter kan undersøke, tilpasse og kjøre på egne premisser.

Versjon 1.5 ble lansert 24. juli 2026 av Swiss AI Initiative, ETH Zürich, EPFL og Swiss National Supercomputing Centre. Arkitekturen er videreført fra Apertus 1.0, men modellen har fått flere billioner nye treningstokens og et langt bredere bruksområde. Det er en betydelig oppgradering, selv om noen viktige deler av dokumentasjonen fortsatt står på «kommer snart».

Hva er nytt i Apertus 1.5?

Apertus 1.5 er fortsatt en familie med en 8B- og en 70B-modell, men begge har fått multimodal forståelse, valgfri tenkemodus, bedre instruksjonsfølging og bedre støtte for verktøy. Kontekstvinduet er samtidig firedoblet til 262 144 tokens, ifølge den offisielle lanseringen.

Dette er ikke en helt ny arkitektur. Swiss AI har fortsatt treningen av Apertus 1.0 og lagt til en blanding av tekst og multimodale data. 8B-modellen fikk 4 billioner nye tokens, mens 70B-modellen fikk 2 billioner. Totalt oppgir modellkortet henholdsvis 19 og 17 billioner treningstokens.

Det er en viktig forskjell. En helt ny modell kan være et brudd med alt som kom før, mens Apertus 1.5 er en videreutvikling av den samme åpne grunnmuren. Prosjektet beholder decoder-only-arkitekturen, xIELU-aktiveringen og AdEMAMix-optimaliseringen, men gjør modellen mer relevant for apper, agenter og dokumentarbeid.

Hva betyr multimodal støtte i praksis?

Apertus 1.5 tar imot tekst, bilder og lyd i samme samtale og svarer med tekst. Det betyr at modellen kan beskrive et bilde, tolke et diagram, arbeide med dokumenter eller oppsummere tale. Lyd behandles med 40 tokens per sekund, mens video ikke støttes direkte, ifølge modellkortet på Hugging Face.

Modellkortet dokumenterer støtte for både bilder og lyd, men de detaljerte evalueringene kommer først i den tekniske rapporten. Derfor er det for tidlig å si hvor robust lydforståelsen er i praksis. Modellen lager verken bilder eller lyd – den forstår flere typer input og svarer med tekst.

For utviklere er kombinasjonen mer interessant enn en løs liste med funksjoner. En agent kan få et skjermbilde og en instruksjon, et dokument kan analyseres sammen med et spørsmål, og tale kan inngå i en lokal arbeidsflyt uten at selve språkmodellen må byttes ut. Det åpner for langt flere praktiske systemer enn Apertus 1.0 kunne håndtere.

Apertus 1.5 analyserer tekst, bilder og lyd i samme åpne modell
Apertus 1.5 kan ta imot tekst, bilder og lyd, men svarer fortsatt med tekst.

Hvor mye er 262 144 tokens?

Et kontekstvindu på 262 144 tokens er fire ganger større enn i Apertus 1.0. Det gir plass til lange dokumenter, store kodeutdrag eller en omfattende samtale i én forespørsel. Men maksimal kontekst er kapasitet, ikke et løfte om at alt alltid kan kjøres raskt eller billig.

Jo mer kontekst du bruker, desto mer minne og beregning krever inferensen. Swiss AI skriver selv at du kan måtte senke --max-model-len dersom maskinen går tom for minne. Det gjelder særlig 70B-utgaven, men også 8B kan bli tung når du faktisk fyller hele vinduet.

Lang kontekst er heller ikke det samme som perfekt hukommelse. En modell kan ha plass til et dokument uten å finne eller vekte alle detaljene riktig. Det blir derfor viktig å se de kommende langkontekst-testene før 262 144-tallet behandles som dokumentert kvalitet gjennom hele vinduet.

Kan den tenke og bruke verktøy samtidig?

Apertus 1.5 har en valgfri tenkemodus som lar modellen bruke flere tokens på intern resonnering før svaret. Verktøystøtten er også forbedret, men de to funksjonene kan foreløpig ikke kombineres i den anbefalte kjøringen. Modellkortet sier uttrykkelig at tool calling ikke støttes når tenkemodus er aktiv.

Det er en reell begrensning for agentarbeid. Mange moderne agenter må både planlegge i flere steg og kalle API-er underveis. Med Apertus 1.5 må utvikleren i praksis velge modus eller bygge arbeidsflyten slik at resonnering og verktøykall skjer i separate steg.

Samtidig er dette et tydelig sprang fra den opprinnelige Apertus-utgaven. Egen tenkemodus og et dokumentert samtaleformat med støtte for verktøy gjør modellen til mer enn en flerspråklig tekstgenerator. Det interessante blir om den åpne infrastrukturen gjør det enklere å forbedre nettopp koblingen mellom resonnering og handling i senere versjoner.

Er 8B eller 70B mest aktuell lokalt?

8B-utgaven er det naturlige utgangspunktet for de fleste som vil eksperimentere lokalt. 70B-modellen gir større kapasitet, men den offisielle vLLM-oppskriften bruker fireveis tensorparallellisering. Det er et tydelig signal om at fullversjonen er laget for servere og flere kraftige GPU-er, ikke en vanlig laptop.

Modellkortet oppgir bfloat16 som treningspresisjon. Bare modellvektene til en tett 70B-modell er derfor svært tunge før hurtigbuffer, kontekst og multimodale komponenter regnes med. Kvantiserte utgaver kan etter hvert senke terskelen, men de offisielle 1.5-modellene på lanseringsdagen er ikke presentert som små modeller for enkel én-GPU-kjøring.

8B betyr heller ikke at hele kontekstvinduet er gratis. Vil du kombinere 262 144 tokens med bilder eller lange lydklipp, øker minnebruken raskt. Det fornuftige valget er å starte med 8B og en kortere kontekst, måle kvalitet og ressursbruk, og bare gå opp til 70B dersom oppgaven faktisk forsvarer maskinvaren.

Apertus 1.5 8B på arbeidsstasjon sammenlignet med 70B på GPU-server
8B er det naturlige lokale startpunktet, mens 70B krever langt kraftigere GPU-maskinvare.

Hvor åpen er Apertus egentlig?

Apertus skiller seg fra mange modeller som kalles open source fordi prosjektet ikke bare publiserer vektene. Ambisjonen omfatter åpne treningsdata, kode, metoder, verdier og treningsoppskrifter. Modellen er utgitt under Apache 2.0, som åpner for både forskning og kommersiell bruk, ifølge ETH Zürichs presentasjon av Apertus 1.5.

Det er selve hovedsaken. En virksomhet som må vite hva systemet bygger på, får et annet utgangspunkt enn med en lukket API-modell eller en «åpen» modell der bare vektene er tilgjengelige. Apertus kan inspiseres, tilpasses og brukes som grunnlag for egne modeller uten at hele kunnskapskjeden ligger bak døren til ett selskap.

Men åpen betyr ikke helt friksjonsfri på lanseringsdagen. Hugging Face krever at du godtar både Apache-lisensen og en egen brukspolicy, og at kontaktinformasjonen deles med utviklerne før modellfilene kan lastes ned. Det gjør ikke treningsarbeidet lukket, men det er verdt å vite hvis du forventer en anonym nedlasting uten vilkår.

Det finnes også en mer praktisk hake. Støtten er ennå ikke med i vanlige utgaver av Transformers og vLLM. Swiss AI viser foreløpig til egne grener og ferdige Docker-bilder mens endringene arbeides inn oppstrøms. Full åpenhet hjelper mye, men moden distribusjon betyr også at modellen fungerer i verktøyene folk allerede bruker.

Hvor god er Apertus 1.5?

Det ærlige svaret 24. juli er at dokumentasjonen ikke er komplett nok til en sikker sluttdom. Swiss AI sier at ytelsen er sammenlignbar med andre modeller i samme størrelse, og modellkortet viser grafer for tekst og bilde. Den fulle tekniske rapporten med detaljerte tester, treningspipeline og mellomliggende sjekkpunkter skal imidlertid først publiseres i løpet av de kommende ukene.

Diskusjonen i LocalLLaMA-tråden om lanseringen viser akkurat hvorfor det forbeholdet trengs. Noen lesere mener 8B ser interessant ut på bildetester, mens andre stiller spørsmål ved tekstytelsen til den tette 70B-modellen sammenlignet med nyere alternativer. Dette er forumtolkninger av leverandørens resultater, ikke uavhengige tester.

ETH Zürich sier dessuten rett ut at målet ikke er å konkurrere med de fremste private modellene. Målet er en pålitelig og gjennomsiktig plattform som andre kan bygge på. Dermed blir det feil å dømme hele prosjektet etter om 70B topper en kort benchmarkliste, men like feil å bruke åpenheten som unnskyldning dersom den praktiske kvaliteten ikke holder.

Hvem bør følge med på Apertus 1.5?

Apertus 1.5 er mest interessant for forskere, utviklere og virksomheter som verdsetter kontroll over hele modellkjeden. Den passer også for miljøer som vil arbeide med språk, dokumenter og multimodale data lokalt, og som tåler litt mer teknisk arbeid enn en ferdig skytjeneste krever.

Det finnes også en API-vei, men den er foreløpig avgrenset. ETH Zürich opplyser at CSCS åpner et eget endepunkt for CSCS-brukere og dermed sveitsiske akademiske miljøer. For norske brukere er nedlasting og lokal kjøring den konkrete tilgangen ved lansering.

Den forrige Apertus-utgaven viste hvorfor en AI-modell Europa faktisk kontrollerer selv har verdi. Versjon 1.5 gjør den ideen mer praktisk: Samme åpne fundament kan nå lese bilder, behandle lyd, håndtere lengre materiale og inngå i verktøybaserte arbeidsflyter.

For vanlige brukere som bare vil ha best mulig chatbot i dag, er Apertus neppe det opplagte førstevalget. For dem som vil bygge, undersøke eller tilpasse AI uten å ta en leverandørs påstander på tro, er dette en langt viktigere lansering enn benchmarkplasseringen alene antyder.

Jeg ville likevel ventet på den tekniske rapporten før jeg kalte ytelsen konkurransedyktig. Åpenhet gjør det mulig å kontrollere påstanden. Da bør jeg også gjøre nettopp det.

Ofte stilte spørsmål

Kan Apertus 1.5 kjøres lokalt?

Ja. Både 8B- og 70B-modellen kan lastes ned og kjøres lokalt med prosjektets vLLM- eller Transformers-oppsett. 8B er det mest realistiske startpunktet for enkeltmaskiner. 70B krever betydelig mer minne, og Swiss AI viser selv en konfigurasjon med fireveis tensorparallellisering.

Kan Apertus 1.5 analysere bilder og lyd?

Ja. Modellen tar imot tekst, bilder og lyd og svarer med tekst. Modellen genererer ikke nye bilder eller lyd, og den støtter ikke video direkte. Detaljerte evalueringer av bilde- og lydforståelsen skal komme i den tekniske rapporten.

Er Apertus 1.5 gratis å bruke kommersielt?

Modellen er utgitt under Apache 2.0 og kan brukes både til forskning og kommersielle formål. Før nedlasting fra Hugging Face må du likevel godta en egen brukspolicy og dele brukernavn og e-postadresse med utviklerne.

Er Apertus 1.5 bedre enn Qwen og Gemma?

Det er for tidlig å slå fast. Swiss AI hevder ytelse på nivå med modeller av lignende størrelse, men den detaljerte tekniske rapporten og fullstendige testdokumentasjonen er ikke publisert ennå. Åpenheten er Apertus’ tydeligste fortrinn, ikke en dokumentert seier over alle konkurrenter.

Legg igjen en kommentar

Din e-postadresse vil ikke bli publisert. Obligatoriske felt er merket med *

Meld deg på nyhetsbrevet

Få oppdateringer om AI nyhetene rett i inboxen!

Du liker kanskje denne også
Jan Sverre styrer et digitalt kontrollpanel omgitt av Claude AI-symboler og glødende lysstriper i et mørkt rom

Claude AI – pris, funksjoner og norsk guide (2026)

Alt om Claude AI i 2026 – priser i norske kroner, Claude Pro vs Max, Claude Code, og ærlig sammenligning med ChatGPT. Komplett norsk guide fra en som bruker Claude daglig.
Jan Sverre ser på en skjerm med Claude Code og er overrasket over påstanden om $5 000 kostnad per bruker

Claude Code Pris 2026 – Hva Koster Det Egentlig?

Forbes hevdet at Anthropic taper $5 000 per Claude Code Max-bruker. Men beregningen forveksler API-priser med faktiske produksjonskostnader. Gjennomsnittlig bruker koster Anthropic rundt $18 per måned — ikke $5 000.
Gpt53 codex

OpenAI svarer med GPT-5.3 Codex — selvforbedrende AI som bygget seg selv

Innhold Vis Hva er GPT-5.3 Codex?Fra kodeskriver til digital arbeiderKappløpet intensiveresMer drama…
Jan Sverre surfer på en bølge av ChatGPT-meldinger - komplett norsk guide til ChatGPT i 2026

ChatGPT Norsk Guide – Slik Kommer Du i Gang (2026)

Komplett norsk guide til ChatGPT i 2026. Slik kommer du i gang, hva det koster i norske kroner, beste tips, og ærlig sammenligning med Claude og Gemini.