Metod · [ AI ] [ HUMAN ]
Ensam klarar AI:n 21 procent.Med en människa bredvid: 64.
Johan Almgren · Pentester och grundare
Publicerad 2026-07-28 · 6 min läsning
Det finns en bekväm berättelse där maskinen tar över säkerhetstestningen och människan blir en kostnad man kan stryka. Den berättelsen mötte verkligheten under 2026. Verkligheten vann.
Marknaden bytte åsikt på ett år
29 % → 9 %
Andelen organisationer som helt förlitar sig på AI för sin säkerhetstestning föll från 29 till 9 procent mellan två jämförbara enkäter med omkring 450 säkerhetsproffs. Andelen som vill kombinera AI med människor steg med 22 procentenheter, till 47 procent.[01]
Skälet är erfarenhet, inte princip. 78 procent av organisationerna uppger att helautomatiska verktyg missat allvarliga sårbarheter och rapporterat allt klart när det inte var det.[01]
Ett falskt larm kostar en timme. Ett missat problem kostar ett intrång.
Vad mätningarna visar
Forskare byggde ett testbatteri som kallas AutoPenBench. De körde samma AI mot samma uppgifter i två lägen. Först ensam, sedan med en människa som stöd.[02]
21 % → 64 %
Ensam löste AI:n 21 procent av uppgifterna. Med en människa som styrde löste den 64 procent. Samma modell och samma verktyg i båda fallen. Det är inte en liten förbättring, det är skillnaden mellan ett verktyg och ett uppdrag.[02]
En annan studie från december 2025 byggde 346 uppgifter i tolv realistiska miljöer och lät experter bestämma vad rätt svar var. Systemen som fick jobba hela vägen själva klarade 31 procent, och forskarna konstaterar att de mest självgående av dem misslyckas nästan helt.[03]
Det betyder inte att AI är svag. I den amerikanska forskningsmyndigheten DARPA:s tävling hittade deltagande system 54 av 63 inplanterade sårbarheter, plus 18 tidigare okända i verklig kod, till en snittkostnad på 152 dollar per uppgift. Maskinen är snabb och billig på bredden. Den är opålitlig på slutsatsen.[04]
Varför AI är säker på vissa fel och osäker på andra
Förklaringen är enklare än debatten. Vissa fel går att bevisa mekaniskt. Om en AI skickar in något som får programmet att krascha, då kraschade det. Det syns. AI:n kan prova om och om igen tills verkligheten svarar ja eller nej.
Andra fel har inget sådant facit. Ingenting kraschar när en användare kan öppna en annan användares faktura. Systemet gör precis vad koden säger åt det att göra. Det som är trasigt är avsikten, alltså vad ni hade tänkt att systemet skulle tillåta. Och avsikten står inte skriven någonstans i koden.
we too lose the ability to (near-)perfectly validate the correctness of any bugs Mythos Preview reports to have found
Det är ingen konkurrent som skriver det. Det är AI-leverantören som samma dag kunde visa att deras modell på egen hand hittade och utnyttjade en sjutton år gammal sårbarhet i operativsystemet FreeBSD. De kan bygga en AI som tar sig in. De kan inte bygga bort behovet av någon som avgör om ett fynd är verkligt.[05]
Rekordet som inte var vad det såg ut som
I juni 2025 gick nyheten att ett AI-system tagit förstaplatsen på en av de stora plattformarna där säkerhetsforskare rapporterar in sårbarheter mot betalning. Rubriken gjorde jobbet. Detaljerna gjorde inte det.
Placeringen gällde den amerikanska listan, under tre månader, mätt i en poängtyp som inte säger något om hur allvarliga fynden var. Bakom systemet stod ett team på minst 25 personer. Varje rapport lästes av en människa innan den skickades in, och hur många fynd som slängdes internt har aldrig redovisats.[06]
Det intressanta är vad genombrottet faktiskt byggde på. Inte en större AI-modell, utan ett separat kontrollsteg som bevisade att sårbarheten gick att utnyttja innan rapporten skickades, plus mänsklig granskning ovanpå. Branschens mest omtalade AI-framgång byggde alltså på att inte lita på AI:ns ord.[07]
Lagstiftarna har landat i samma slutsats
EU:s AI-förordning kräver att viktiga AI-system ska kunna övervakas av människor. Den nämner uttryckligen risken att människor litar för mycket på vad en AI säger, och kräver att det ska gå att åsidosätta systemets svar.[08]
En AI-assisterad pentesttjänst omfattas med all sannolikhet inte av de reglerna, och vi påstår inte det. Men de är skrivna av folk som satt sig in i problemet, och de beskriver samma sak som mätningarna: det en AI säger behöver någon som kan säga nej.[08]
Så gör vi
Vår AI arbetar i fem steg: den kartlägger vad som finns, undersöker hur det hänger ihop, försöker ta sig in, kontrollerar vad den lyckades med, och skriver ihop resultatet. Den skriver löpande ned allt den gör. Den texten är både pentesterns liveöversikt och dokumentationen av vad som faktiskt utfördes.
En sak kan den inte göra. Den kan inte godkänna ett fynd. Det finns inget knapp för det och inget fält att skriva i. Fynd landar som obekräftade, en människa återskapar felet för hand, och bara bekräftade fynd går vidare till rapporten. Det som inte håller sorteras bort innan ni ser det.
Det är inte försiktighet. Det är den enda arbetsordning som stämmer med hur tekniken faktiskt beter sig.
Källor
- [01]Trust in Automated AI Vulnerability Scanning Collapses to 9%Infosecurity Magazine · 2026-06-25
- [02]AutoPenBench: Benchmarking Generative Agents for Penetration TestingarXiv · 2024-10-04
- [03]PentestEval: benchmarking LLMs across penetration testing stagesarXiv · 2025-12-16
- [04]AI Cyber Challenge resultsDARPA · 2025-08-08
- [05]Claude Mythos PreviewAnthropic · 2026-04-07
- [06]About the hype around XBOWRawsec (Alexandre ZANNI) · 2025-06-29
- [07]Is XBOW's success the beginning of the end of human-led bug hunting? Not yetCyberScoop · 2025-07-14
- [08]Förordning (EU) 2024/1689 (AI-förordningen), artikel 14EUR-Lex · 2024-06-13