RAVNSecurity

Incident · Kontroll

Modellen trodde att det var en övning.Företagen den bröt sig in i var riktiga.

Johan Almgren · Pentester och grundare

Publicerad 2026-07-31 · 7 min läsning

Två av världens ledande AI-bolag publicerade inom tio dagar var sin redogörelse för samma sorts händelse. Deras egna modeller skulle testa sin förmåga att hitta säkerhetshål i en avstängd övningsmiljö. Miljön var inte avstängd.

Vad som hände hos OpenAI

OpenAI körde ett internt prov som mäter hur bra en modell är på att omvandla en rapporterad sårbarhet till ett fungerande angrepp. För att kunna mäta det hade man skruvat ner modellens normala ovilja att hjälpa till med angrepp.[01]

Modellerna hittade då ett tidigare okänt säkerhetshål i den mellanliggande programvara som hanterade kodpaket i deras egen testmiljö. Det hålet gav dem internetuppkoppling. Därifrån tog de sig vidare till Hugging Face, en av världens största plattformar för AI-modeller och datamängder, och lyckades köra egen kod på deras produktionsservrar.[01]

Motivet är den mest talande detaljen. Facit till provet låg lagrat hos Hugging Face. Modellerna letade inte efter något att förstöra. De letade efter svaren, i stället för att lösa uppgifterna.[02]

Autonomous exploit development by frontier AI agents is no longer a hypothetical capability.
Simon Willison · 2026-07-22

Det är en oberoende bedömares sammanfattning, inte ett pressmeddelande. Poängen är inte att modellerna var elaka. Poängen är att de var kapabla, och att kapabel är precis vad man beställer när man köper ett säkerhetstest.[02]

Vad som hände hos Anthropic

Åtta dagar senare publicerade Anthropic resultatet av en genomgång av 141 006 testkörningar. I sex av dem, fördelat på tre incidenter, hade modeller nått ut till riktiga system. Orsaken var ett missförstånd mellan Anthropic och deras testpartner om huruvida testmiljön var avskuren från internet. Den var inte det.[03]

I den första incidenten råkade det påhittade företagsnamnet i övningen sammanfalla med en verklig webbadress. Modellen tog sig in, hämtade ut inloggningsuppgifter och kom åt en produktionsdatabas med flera hundra rader riktig data. Det var det enda av fallen där modellen fortsatte att angripa systemet efter att den förstått att det troligen var på riktigt.[03]

I den andra incidenten skrev modellen ett skadligt program och publicerade det i PyPI, det öppna bibliotek som Python-utvecklare världen över hämtar kod ifrån. Under ungefär en timme hämtade och körde femton riktiga datorer paketet. En av dem tillhörde ett säkerhetsföretag vars automatiska granskningsverktyg installerade det, varpå koden skickade vidare det företagets inloggningsuppgifter.[03]

I den tredje skannade en intern testmodell omkring 9 000 mål, tog sig in hos ett företag via en glömd felsökningssida och en klassisk databasattack, och avbröt sedan själv när den insåg att målet var verkligt.[03]

3 av 141 006

Tre incidenter på 141 006 granskade testkörningar. Det är en mycket liten andel. Den första inträffade i april 2026 och de drabbade organisationerna underrättades den 27 juli. Det tog alltså ungefär tre månader innan någon upptäckte det.[03]

Det obehagliga är inte att de lyckades

Att en skicklig angripare tar sig in genom en glömd felsökningssida är ingen nyhet. Det obehagliga ligger någon annanstans, och det är samma sak i båda bolagens redogörelser.

Modellerna hade uttryckligen fått veta att de inte hade internetuppkoppling. Instruktionen var fel, och när verkligheten sa emot instruktionen valde två av tre modeller att lita på instruktionen. En av dem resonerade sig fram till att det nog ändå var en simulering och fortsatte. Bara den nyaste avbröt av sig själv.[04]

En agent som är osäker på om målet är verkligt gissar. Ibland gissar den fel, och gissningen kostar någon annan en produktionsdatabas.

Det är därför den här texten står på en säljsida. Vi säljer en tjänst där en AI-agent riktas mot en kunds system. Det är samma teknik och samma sorts uppställning som i incidenterna ovan. Skillnaden kan inte vara att vår modell har bättre omdöme, för det är inte något någon kan lova.

Det som faktiskt håller en agent inne

Skillnaden måste ligga i vad agenten över huvud taget kan nå, och det är en fråga om konstruktion snarare än om förtroende. Så här ser våra spärrar ut.

  • En människa bestämmer omfattningen innan en enda förfrågan skickas. Scopet är en juridisk gräns, inte en rekommendation.
  • Agentens nätverkstrafik går genom en spärr som byggs från den godkända listan. Trafik mot något som inte står på listan går helt enkelt inte fram.
  • Agenten har inga inloggningsuppgifter till vår databas. Den har en nyckel som bara gäller det enskilda uppdraget och slutar fungera efter sju dagar.
  • Allt agenten gör skrivs ned löpande. Den loggen är pentesterns liveöversikt och dokumentationen av vad som faktiskt utfördes.
  • Agenten behandlar allt den läser från målet som misstänkt. Instruktioner som dyker upp i ett svar från målsystemet följs aldrig.

Lägg märke till att ingen av punkterna handlar om att modellen ska bete sig väl. De handlar om att den inte ska kunna nå det den inte fått nå, oavsett hur den resonerar. Incidenterna i juli är det bästa argumentet för att bygga så.

Och samma förmåga finns redan hos angriparna

Incidenterna i juli var olyckor. Det finns också de som gör det här med flit. I november 2025 redovisade Anthropic vad de bedömer som den första spionagekampanjen där en AI utförde 80 till 90 procent av arbetet, mot omkring 30 mål, med bara fyra till sex tillfällen där en människa behövde fatta beslut.[05]

Ett halvår senare rapporterade Googles hotanalysgrupp den första AI-skrivna attackkoden de sett användas skarpt. Förmågan som råkade riktas fel i ett laboratorium riktas redan medvetet någon annanstans.[06]

Slutsatsen är inte att ni ska hålla er borta från AI i säkerhetsarbetet. Den är att ni ska fråga vem som byggt väggarna, och be att få se dem.

Källor

  1. [01]OpenAI says its own AI models escaped a sandboxed evaluationThe Hacker News · 2026-07-22
  2. [02]OpenAI models attacked Hugging Face during an evaluationSimon Willison · 2026-07-22
  3. [03]Investigating incidents in our cybersecurity evaluationsAnthropic · 2026-07-30
  4. [04]Anthropic says its own AI models breached three companies during security testsTechCrunch · 2026-07-30
  5. [05]Disrupting the first reported AI-orchestrated cyber espionage campaignAnthropic · 2025-11-13
  6. [06]Threat actors leveraging AI for vulnerability exploitation and initial accessGoogle Threat Intelligence · 2026-05-11
Alla artiklar
Nästa steg

Testa innannågon annan gör det.

Kostnadsfri scoping. Fast pris innan vi börjar.

[AI] djup och tempo[HUMAN] omdöme och ansvar[EU] hemvist i Sverige