Innhold Vis
Raskere AI-svar er lite verdt hvis serverne mister kapasitet når køen vokser. OpenAI Jalapeño ser ut til å løse begge deler samtidig: lavere forsinkelse og mer AI-arbeid per watt.
Det er akkurat den kombinasjonen som betyr noe når millioner av mennesker og en voksende hær av AI-agenter skal bruke modellene samtidig. Lav forsinkelse er lite verdt hvis serveren bare klarer noen få brukere. Høy kapasitet hjelper heller ikke den som sitter og venter på at agenten skal fullføre steg nummer 14.
I de første målingene leverte chipen 1,7 til 3,6 ganger lavere ende-til-ende-forsinkelse og 1,5 til 1,9 ganger mer AI-arbeid per watt enn systemene den ble sammenlignet med. Tallene er skikkelig lovende. Men OpenAI kjørte og publiserte testen selv, chipen er ennå ikke rullet ut i stor skala, og «opptil» gjør fremdeles mye arbeid. Dette er målte resultater fra fungerende maskinvare – ikke et løfte om at alle ChatGPT-svar blir 3,6 ganger raskere i morgen.
Hva viste den første testen av OpenAI Jalapeño?
OpenAI testet Jalapeño med tre åpne modeller: GPT-OSS 120B, DeepSeek R1 670B og Kimi K2.5 1T. Ifølge resultatene OpenAI publiserte 25. august 2026 slo chipen sammenligningssystemene på kombinasjonen av forsinkelse, kapasitet og ytelse per watt over hele det testede driftsområdet.
På GPT-OSS 120B leverte Jalapeño 1,9 ganger høyere maksimal ytelse per kilowatt enn Nvidia GB200, mens ende-til-ende-forsinkelsen var 1,7 ganger lavere. På DeepSeek R1 var maksimal ytelse per kilowatt 1,7 ganger høyere enn på GB300, og forsinkelsen falt fra 5,99 til 1,65 sekunder. Det tilsvarer 3,6 ganger lavere forsinkelse.
Kimi K2.5 ga et lignende bilde. Jalapeño leverte omtrent 1,5 ganger høyere maksimal ytelse per watt enn GB300 og reduserte ende-til-ende-forsinkelsen fra 5,31 til 1,56 sekunder. Minimumstiden mellom ferdige tokens falt fra 5,48 til 1,44 millisekunder, som tilsvarer 694 mot 182 tokens i sekundet per bruker.
Det mest oppsiktsvekkende tallet er egentlig ikke toppresultatet. Ved samme tid mellom tokens som de tidligere beste systemene leverte Jalapeño 53,7 ganger mer gjennomstrømning på GPT-OSS og 104,3 ganger mer på DeepSeek R1. Det betyr ikke at chipen generelt er hundre ganger raskere enn Nvidia. Det beskriver ett bestemt punkt på kurven der brukeropplevelsen holdes lik og kapasiteten sammenlignes. Likevel viser det hvor dyrt det kan være å presse eksisterende systemer ned mot svært lav forsinkelse.
Hvorfor er både fart og kapasitet viktig?
En inferenschip skal kjøre ferdigtrente modeller og levere svar til brukeren. Da konkurrerer to behov hele tiden: Hver bruker vil ha raske tokens, mens leverandøren vil betjene flest mulig forespørsler med samme maskinvare og strømforbruk. Skrur du opp batching for å få mer total kapasitet, øker ofte ventetiden for den enkelte.
Jalapeño er laget for å flytte denne grensen. OpenAI beskriver chipen som en arkitektur som kan levere lavere forsinkelse og høyere gjennomstrømning samtidig, i stedet for bare å velge den ene. Det er dette Richard Ho, OpenAIs maskinvaredirektør, kalte «det beste fra begge verdener» i The Verges omtale av målingene.
Forskjellen blir ekstra viktig for agenter. Et vanlig chatsvar merker kanskje ett sekund ekstra forsinkelse én gang. En agent som planlegger, søker, bruker et verktøy, leser resultatet og prøver på nytt, kan møte forsinkelsen i hvert eneste steg. Små ventetider blir fort til minutter når de legges oppå hverandre.
Mer arbeid per watt betyr samtidig at OpenAI kan betjene flere slike arbeidsløp innenfor samme strømramme. Jalapeño er oppgitt til 700 watt, men OpenAI sier at målt vedvarende effekt holdt seg på eller under 550 watt i de publiserte testene. Selskapet normaliserte likevel sammenligningen med den oppgitte chip-effekten: 700 watt for Jalapeño, 1 200 watt for GB200 og 1 400 watt for GB300.
Hvor mye kan vi stole på sammenligningen?
Målingene er mer nyttige enn en løs påstand om at en ny chip er «rask». OpenAI brukte InferenceX, en offentlig testplattform fra SemiAnalysis, og kjørte tre forskjellige store modeller. InferenceX-metoden måler hele forholdet mellom gjennomstrømning og forsinkelse over flere belastningsnivåer, ikke bare ett pent toppresultat.
Det gjør også resultatet lettere å tolke. En chip kan vinne på total tokenproduksjon når den får samle mange forespørsler i store batcher, men føles treg for hver bruker. En annen kan svare lynraskt til én bruker og falle sammen når køen vokser. Pareto-kurven viser hvilke systemer som leverer den beste kombinasjonen uten at én egenskap må bli dårligere for å forbedre den andre.
Men OpenAI har fremdeles valgt testoppsettet, kjørt Jalapeño-systemet og publisert analysen. Sammenligningsgrunnlaget er de beste kommersielt tilgjengelige resultatene i InferenceX, ikke en uavhengig test der en tredjepart fikk identiske rack og fri tilgang til alle systemene. OpenAI oppgir dessuten at egne, lukkede frontmodeller ga enda større gevinst, men uten tall som andre kan kontrollere.
Derfor er den riktige dommen ganske enkel: Resultatene ser sterke ut og er konkrete nok til å tas alvorlig, men stor utrulling blir den virkelige prøven. Stabilitet, programvare, produksjonsvariasjon, nettverk og minne betyr også noe når en chip forlater laboratoriet. Et søylediagram har aldri måttet håndtere mandagsrushet i ChatGPT.
Hva betyr Jalapeño for ChatGPT, Codex og API-et?
For brukere kan Jalapeño etter hvert gi raskere svar, mer responsive agenter og bedre kapasitet når etterspørselen er høy. For utviklere kan bedre inferenseffektivitet gi rom for flere agentsteg og høyere trafikk uten at infrastrukturen vokser like raskt. Men OpenAI har ikke lovet bestemte prisreduksjoner eller oppgitt hvilke produkter og modeller som får chipen først.
Selskapet planlegger å ta Jalapeño i bruk i små volumer innen utgangen av 2026 og øke volumet i 2027. Produksjonskvalifisering, programvaremodning og testing på flere modeller pågår fortsatt. Det betyr at den første praktiske effekten sannsynligvis kommer gradvis, ikke som en bryter som gjør hele OpenAI-plattformen raskere på én bestemt dato.
Det er også verdt å huske hva chipen ikke gjør. Jalapeño er laget for inferens, altså kjøring av ferdigtrente modeller. Den erstatter ikke hele infrastrukturen OpenAI bruker til trening, og selskapet sier uttrykkelig at det vil fortsette å kjøpe og bruke Nvidia-akseleratorer og maskinvare fra andre partnere.
Leserrådet mitt er derfor å følge den målbare tjenesteeffekten: faktisk svartid, tilgjengelighet og API-priser etter hvert som Jalapeño rulles ut. Ikke regn hjem et prosjekt på grunnlag av en chipbenchmark alene. Hvis lavere kostnad per token aldri når kundene, er energieffektiviteten først og fremst svært gode nyheter for OpenAIs eget regnskap.
Hvorfor bygger OpenAI egne AI-chiper?
OpenAI får kontroll over flere lag i samme system når selskapet designer chip, serverprogramvare, modeller og produkter sammen. Jalapeño er utviklet med Broadcom og Celestica, men arkitekturen er OpenAIs egen. Den er laget rundt inferensbehovene selskapet ser i ekte språkmodeller og agentarbeidsløp.
Da OpenAI og Broadcom presenterte Jalapeño i juni, var løftet bedre ytelse per watt og utrulling mot slutten av 2026. De nye tallene er neste kapittel: Nå finnes det fungerende førstegenerasjonsmaskinvare med målte resultater, ikke bare en arkitektur og en plan.
Strategien handler også om forhandlingsmakt og kapasitet. OpenAI trenger enorme mengder regnekraft, og et eget alternativ gjør selskapet mindre fullstendig avhengig av én leverandør. Det betyr ikke at Nvidia er på vei ut døren. Det betyr at OpenAI får en chip som kan finjusteres for de inferensoppgavene selskapet selv betaler for hver dag.
Egen maskinvare gir dessuten OpenAI mulighet til å planlegge modeller og datasentre sammen flere år fram i tid. Hvis neste modell trenger en annen balanse mellom minnebåndbredde, regnekraft og nettverk, kan den kunnskapen påvirke neste chip. Ulempen er at spesialtilpasning også kan bli en felle dersom modellarkitekturen endrer seg raskere enn maskinvaren. En modell kan oppdateres på uker. En fysisk chip skal designes, produseres, monteres og driftes før den tjener inn én krone.
Andre generasjon Jalapeño er allerede langt inne i utviklingen, mens tredje generasjon er under planlegging. Første generasjon trenger derfor ikke slå alt på alle oppgaver for å være viktig. Hvis OpenAI faktisk kan forbedre chip, modeller og programvare sammen for hver runde, kan forspranget bli mer interessant enn én enkelt benchmark.
Jalapeño har bestått den første troverdighetsprøven. Tallene viser en sjelden god kombinasjon av lav forsinkelse, høy kapasitet og lavere effektbruk på tre store modeller. Nå må OpenAI vise at gevinsten overlever produksjon og drift – og at brukerne merker den. Det er først da chilien virkelig begynner å svi for konkurrentene.
Ofte stilte spørsmål
Er Jalapeño raskere enn Nvidia GB200 og GB300?
I OpenAIs egne InferenceX-målinger leverte Jalapeño en bedre kombinasjon av forsinkelse og ytelse per watt enn sammenligningssystemer med Nvidia GB200 og GB300. Resultatet gjelder de testede modellene og oppsettene. Det er ennå ikke en uavhengig fasit for alle AI-arbeidslaster.
Når blir OpenAIs Jalapeño-chip tatt i bruk?
OpenAI planlegger å ta Jalapeño i bruk i små volumer innen utgangen av 2026 og øke utrullingen i 2027. Selskapet arbeider fortsatt med produksjonskvalifisering, programvare og validering på flere modeller, så vanlig brukereffekt vil trolig komme gradvis.
Vil Jalapeño gjøre ChatGPT 3,6 ganger raskere?
Ikke nødvendigvis. Tallet på 3,6 ganger gjelder lavere ende-til-ende-forsinkelse for DeepSeek R1 i et bestemt testoppsett. Opplevd ChatGPT-fart avhenger også av modell, kø, nettverk, programvare og hvor mye av tjenesten som faktisk kjører på Jalapeño.
Skal OpenAI slutte å bruke Nvidia-chiper?
Nei. OpenAI sier at selskapet fortsatt vil bruke Nvidia og andre maskinvarepartnere til både trening og inferens. Jalapeño blir et eget, spesialisert alternativ i en større maskinvareportefølje, ikke en full erstatning for alle akseleratorene OpenAI allerede bruker.