OpenAI må dokumentere at forskernes upubliserte arbeid ikke havnet i OpenAIs treningsdata. Et kategorisk nei er ikke godt nok når selskapet selv innrømmer at avidentifiserte bruksdata kan ha forbedret modellene.

Matematikeren Andreas Thom stilte et enkelt og presist spørsmål etter at OpenAI presenterte et resultat innen hans eget fagfelt: Hadde samtalene han og en kollega førte med ChatGPT, blitt brukt til trening eller vært tilgjengelige da modellen fant løsningen? Svaret han fikk fra OpenAI-forskeren Mark Sellke var kort: Det hadde ikke skjedd.

Problemet er at svaret ikke forklarte hva som faktisk var kontrollert. Direkte tilgang til en bestemt samtale er ikke det samme som at innholdet aldri har påvirket en senere modell gjennom trening. Når OpenAI ikke viser forskjellen, blir det forskerne som må stole på selskapets ord. Det holder ikke. Særlig ikke når hele verdien som står på spill, er ideer ingen andre har sett ennå.

Hva anklager Andreas Thom OpenAI for?

Andreas Thom anklager ikke OpenAI for dokumentert tyveri. Han anklager selskapet for å gi et bredt og misvisende svar uten bevis. I en serie på tre innlegg publisert 9. september 2026 kaller han håndteringen uærlig og krever innsyn i hvilke datasett, modellversjoner og kontoinnstillinger svaret bygger på.

Bakgrunnen er OpenAIs kunngjøring av ti matematiske resultater 1. august. Ett av dem gjaldt såkalte ikke-sofiske grupper og bygde tungt på tidligere arbeid fra Thom og Gábor Kun. OpenAI oppga at en intern versjon av Astra fant resultatene, og at modellene samlet brukte et antall tokens som ville kostet rundt 2 000 dollar med Sol-priser.

Thom reagerte på hvor godt modellen behersket teknikkene han og Kun hadde utviklet. Ifølge ham var dette verken den mest opplagte eller den mest lovende veien mot en løsning. Samtidig hadde han og en kollega i Dresden diskutert problemet og mulige utvidelser med ChatGPT i månedene før kunngjøringen. Det beviser ikke at samtalene ble brukt. Men det gjør spørsmålet både konkret og fullstendig rimelig.

Upublisert matematikk går gjennom en ugjennomsiktig pipeline for OpenAI treningsdata
Avidentifisering kan fjerne forskerens navn uten å fjerne ideen, metoden eller bevisføringen.

Hvorfor holder ikke svaret om OpenAIs treningsdata?

OpenAI ser ut til å skille mellom at ansatte eller agenter åpner en bestemt brukers samtale, og at avidentifiserte data fra samtalen inngår i arbeidet med å forbedre en modell. Det første kan selskapet avvise. Det andre har selskapet ikke klart å utelukke. For en forsker som prøver å beskytte en ny idé, er dette ingen liten språklig detalj.

Det samme skillet dukket opp etter striden om OpenAIs foreslåtte løsning på Navier-Stokes-problemet. Selskapet sa at forskerne og agentene ikke hadde sett arbeidet til Tristan Buckmaster og Levent Alpöge før det ble offentliggjort. Samtidig skrev OpenAI at det ikke kunne utelukke at avidentifiserte data fra deres bruk av selskapets produkter hadde bidratt til å forbedre modellene. OpenAI svarte ikke på The Verges nye henvendelse om Thoms kritikk før saken ble publisert 10. september.

Og her ryker tilliten. Avidentifisering kan fjerne navnet på forskeren, men den fjerner ikke ideen, metoden eller det faglige forspranget i teksten. Hvis en upublisert metode går inn uten navn og senere hjelper en modell med å finne samme spor, er ikke problemet borte. Da er bare opphavspersonen blitt vanskeligere å se.

Er det bevist at OpenAI brukte forskernes arbeid?

Nei. Det finnes foreløpig ikke offentlig dokumentasjon som viser at Thoms, Buckmasters eller Alpöges upubliserte arbeid ble brukt til å trene modellen eller styre agentene. OpenAI avviser direkte tilgang til det konkrete materialet. Mistanke er ikke bevis, og dommen har ikke falt.

Men bevisbyrden kan heller ikke skyves over på forskerne. De har ikke tilgang til OpenAIs treningspipeline, datasett, utvalgsregler eller modellversjoner. De kan derfor ikke undersøke om en bestemt samtale ble valgt ut, bearbeidet, avidentifisert og brukt i en senere trening eller finjustering. Bare OpenAI sitter med de opplysningene.

Det er nettopp derfor et kontant «det skjedde ikke» krever en kontant forklaring. Hvilken konto ble kontrollert? Hvilke innstillinger gjaldt da samtalene fant sted? Hvilke datasett og modellkontrollpunkter ble undersøkt? Hva betyr «data derived from usage» i praksis? Uten slike svar ber OpenAI forskerne om tillit samtidig som selskapet holder tilbake det eneste materialet som kan begrunne den.

Hvor alvorlig er dette for matematisk forskning?

Dette kan gjøre forskningen mer lukket. Dersom en matematiker tror at en uferdig idé kan bli råstoff for en modell som senere konkurrerer om samme publisering, er den rasjonelle reaksjonen å holde ideen unna tjenesten. Da mister forskerne et nyttig verktøy, fagmiljøet deler mindre, og OpenAI ødelegger markedet for sitt eget produkt. Imponerende matematikk hjelper lite hvis de flinkeste brukerne ikke tør å skrive inn det de faktisk arbeider med.

OpenAI har samtidig levert resultater som fortjener seriøs vurdering. De ti arbeidene fra august omfatter blant annet gruppeteori, geometri, kodeteori og kvantekompleksitet. Det gjør åpenheten viktigere, ikke mindre viktig. Jo mer modellen kan bidra med, desto større blir skadepotensialet når ingen utenfor selskapet kan kontrollere hvor ideene kom fra.

Det handler også om æren for arbeidet. Forskning er ikke bare det siste beviset som kan formaliseres i Lean. Å finne riktig retning, utvikle en metode og forstå hvilket spørsmål som faktisk lar seg løse, kan være flere års arbeid. Et selskap kan ikke vaske bort den innsatsen ved å fjerne navnet fra dataene og deretter late som bare sluttresultatet teller.

Hva sier OpenAI om data fra ChatGPT og Codex?

OpenAIs egne regler for tjenester som ChatGPT og Codex sier at innhold kan brukes til å trene modeller dersom brukeren ikke reserverer seg. For ChatGPT kan brukeren slå av «Improve the model for everyone». OpenAI sier at nye samtaler da ikke skal brukes til trening.

Det avgjørende ordet er «nye». En innstilling du slår av i dag, dokumenterer ikke hva som skjedde med tidligere samtaler eller bearbeidede data som allerede kan ha blitt valgt ut. Thom opplyser at han slo av modelltrening 29. juni, men mener kontrollen fortsatt bare er et løfte brukerne ikke kan kontrollere.

Codex krever dessuten ekstra oppmerksomhet. OpenAI opplyser at Codex har egne innstillinger for deling av hele utviklingsmiljøer, og at endringer i ChatGPT eller personvernportalen ikke nødvendigvis påvirker disse. Et generelt personvernvalg er altså ikke automatisk et fullstendig vern på tvers av produktene.

Personvernvalg sammenlignes med lokal AI for beskyttelse av fortrolig forskning
Sensitive forskningsdata krever tydelige innstillinger, avtalebeskyttelse eller lokal behandling.

Hva bør forskere og bedrifter gjøre nå?

Ikke legg upublisert forskning, forretningshemmeligheter, kundedata eller annen informasjon med reell verdi inn i en personlig AI-tjeneste og håp at standardinnstillingene beskytter deg. Slå av modelltrening i ChatGPT, kontroller de separate innstillingene i Codex, og vær forsiktig med å sende positiv eller negativ tilbakemelding på sensitive samtaler. OpenAI opplyser at hele samtalen kan brukes til trening når brukeren aktivt gir slik tilbakemelding.

For arbeid som må ut i skyen, bør bedrifter og forskningsmiljøer bruke en tjeneste med en tydelig databehandleravtale og vilkår som sier at inn- og utdata ikke brukes til modelltrening som standard. OpenAI sier dette gjelder Business, Enterprise og API-plattformen. Vil du ha kontroll som ikke avhenger av løfter fra en ekstern leverandør, er lokal AI fortsatt det tryggeste valget for materiale som aldri burde forlate maskinen.

Og ta vare på dokumentasjonen. Registrer hvilke tjenester, kontoer og innstillinger som ble brukt, når innstillingene ble endret, og hvilket materiale som ble sendt inn. Det reparerer ikke et mulig misbruk, men det gjør det langt vanskeligere for en leverandør å gjemme seg bak et vagt standardsvar dersom en konflikt oppstår senere.

OpenAI skylder forskerne mer enn et løfte

OpenAI kan rydde opp i dette. Selskapet kan forklare nøyaktig hva som ble undersøkt, la uavhengige fagfolk kontrollere prosessen og dokumentere hvordan avidentifiserte samtaler behandles. Dersom dataene viser at forskernes arbeid ikke ble brukt, bør OpenAI være den parten som aller mest ønsker å legge fram bevisene.

Inntil det skjer, er skepsisen fortjent. Ingen har bevist at OpenAI stjal en matematisk idé. Men OpenAI har selv skapt et svarhull der den mistanken får vokse, og selskapet har alle opplysningene som trengs for å lukke det. Da er ikke «stol på oss» et svar. Vis arbeidet.

Ofte stilte spørsmål

Har OpenAI innrømmet å ha brukt upublisert matematikk?

Nei. I Navier-Stokes-saken avviser OpenAI at egne forskere eller agenter fikk se det konkrete, upubliserte arbeidet før det ble offentliggjort. Selskapet har samtidig sagt at det ikke kan utelukke at avidentifiserte data fra bruk av produktene bidro til å forbedre modellene. Det er denne forskjellen matematikerne krever dokumentasjon på.

Kan samtaler i ChatGPT brukes til modelltrening?

Ja, innhold fra personlige ChatGPT- og Codex-kontoer kan brukes til trening dersom brukeren ikke har reservert seg. OpenAI lar deg slå av «Improve the model for everyone», men opplyser at valget gjelder nye samtaler. Codex kan i tillegg ha separate innstillinger.

Er Temporary Chat trygt for hemmelig forskning?

Temporary Chat skal ikke brukes til modelltrening og lagres ikke i historikken, men det er fortsatt en skytjeneste. For virkelig fortrolig eller upublisert materiale bør du bruke en løsning med avtalt databeskyttelse eller kjøre modellen lokalt, slik at materialet ikke forlater maskinen.

Hvorfor er avidentifiserte data fortsatt et problem?

Avidentifisering kan fjerne navn og andre personopplysninger uten å fjerne selve ideen, metoden eller bevisføringen. For en forsker er det intellektuelle innholdet nettopp det verdifulle. Derfor svarer ikke «avidentifisert» alene på om upublisert arbeid kan ha påvirket en modell.

Legg igjen en kommentar

Din e-postadresse vil ikke bli publisert. Obligatoriske felt er merket med *

Meld deg på nyhetsbrevet

Få oppdateringer om AI nyhetene rett i inboxen!

Du liker kanskje denne også
Jan Sverre med headphones og lydmikser i boardroom-møte med forvirrede executives

Suno AI Copyright 2026 – Opphavsrett og Rettigheter for AI-Musikk

Kan du tjene penger på Suno-musikk? Her er en praktisk gjennomgang av rettigheter, risiko og hva du bør avklare før publisering.
Jan Sverre blar gjennom en tilpasset YouTube AI-videofeed på telefonen

YouTube lar deg lage din egen AI-videofeed – slik fungerer det

YouTube lar deg nå beskrive hva du vil se med vanlig tekst, og AI setter opp en personlig feed for deg. Her er hva du trenger å vite – og hva det egentlig betyr for deg som bruker.
Jan Sverre profesjonelt fotograf-kvalitet portrett AI-generert bildegenerering

NotebookLM er nå Gemini Notebook – norsk guide 2026

Google NotebookLM er en AI-assistent som gjør dokumenter om til interaktive samtaler, studieguidere og podcasts på norsk. Nå drevet av Gemini 3 Pro med nye funksjoner som infographics, slide decks og Deep Research. Komplett guide til gratis vs. Plus-versjon.
Mann i trebåt på norsk fjord med laptop som viser norsk talegjenkjenning og transkribert dialekttekst

NB-Whisper – AI som faktisk forstår norske dialekter

NB-Whisper fra Nasjonalbiblioteket er den beste AI-modellen for norsk talegjenkjenning – og forstår alle norske dialekter. Den er gratis. Her er tre måter å komme i gang på i dag.