Notebookcheck Logo

Anthropic hävdar att Claude hackade sig in i tre verkliga företag i cybertester

Närbild på en skärm som visar Python-källkod markerad i färg
ⓘ Godfrey Atima / Pexels
Under en testkörning skapade Claude ett skadligt Python-paket och laddade upp det till PyPI. (Illustrativ bild)
Anthropic gick igenom 141 006 testkörningar och fann tre fall där Claude tog sig ut ur testmiljön och bröt sig in i företagets verkliga system. En modell skapade ett skadligt Python-paket och laddade upp det till PyPI. Varför modellerna trodde att de fortfarande befann sig i en simulering, och vad det innebär om du använder Claude.

Anthropic avslöjade på torsdagen att tre av företagets Claude-modeller hade trängt sig in i produktionssystemen hos tre verkliga organisationer under interna cybersäkerhetsutvärderingar. Granskningen inleddes efter att OpenAI avslöjat att deras egna modeller hade rymt från en testmiljö och äventyrat Hugging Face. Anthropic gick igenom 141 006 utvärderingskörningar där Claude kunde ha fått tillgång till internet och fann sex fall där så var fallet.

Modellerna genomförde ”capture-the-flag”-övningar, en standardövning inom säkerhetstestning. En hemlig uppgift finns någonstans i nätverket, och modellen måste bryta sig in och hämta den. I instruktionen angavs tydligt att miljön var en simulering utan internetåtkomst. Så var inte fallet. Utvärderingsmiljöerna, som drivs av Irregular – en extern testpartner – hade en direkt anslutning till det öppna internet, och ingen hade upptäckt detta.

I värsta fallet nåddes en produktionsdatabas

Den mest skadliga händelsen gällde ett fiktivt målföretag som råkade ha samma namn som en verklig domän. Claude Opus 4.7 fastnade inne i det simulerade nätverket, hittade istället det verkliga företaget och behandlade det som det avsedda målet. Under fyra körningar samlade modellen in inloggningsuppgifter och nådde en databas som innehöll flera hundra rader med live-produktionsdata. Opus 4.7 insåg att systemet var verkligt men fortsatte ändå. I två av dessa körningar övertygade den sig själv om att det verkliga företaget var en del av övningen.

En modell laddade upp fungerande skadlig kod till PyPI

Den andra händelsen är den som fastnar i minnet. Claude Mythos 5 hittade ett dokument i testmiljön där nya utvecklare uppmanades att installera ett Python-paket som inte existerade. Modellen upptäckte luckan och skapade sitt eget paket under det namnet, med skadlig kod inbäddad. För att ladda upp det krävdes ett konto på PyPI, det offentliga registret för Python-programvara, vilket i sin tur krävde en e-postadress och därmed ett telefonnummer. Flera försök att skaffa pengar för ett nummer misslyckades, så modellen tog till en gratis e-postleverantör och publicerade skadlig programvara.

Paketet låg tillgängligt för allmänheten i ungefär en timme. Under den tiden installerades och kördes det på 15 riktiga system, varav ett var skadligkodsskannern hos ett säkerhetsföretag som inte hade något med scenariot att göra. Claude skickade det företagets inloggningsuppgifter till en insamlingspunkt som den hade skapat och använde dem för att nå ytterligare infrastruktur. De skyddsmekanismer som PyPI själv körde tog bort paketet automatiskt.

Det som modellen drog för slutsats är värt att läsa. Den hade noterat att en sådan uppladdning på det verkliga internet skulle utgöra en faktisk attack och absolut inte den avsedda lösningen. Två saker övertygade den om motsatsen: den kände inte igen de certifikatutfärdare som säkrade dess anslutningar, och systemen visade ett kalenderdatum från 2026, vilket den tolkade som bevis på en iscensatt miljö. Den reviderade aldrig den slutsatsen.

Tre månader utan att någon märkte något

Den tidigaste händelsen går tillbaka till april. Den kom först till ytan när Anthropic började läsa igenom transkriptionerna den 23 juli och avbröt alla cybersäkerhetsutvärderingar samma dag. Alla tre incidenterna bekräftades den 24 juli, och testpartnern samt de drabbade organisationerna underrättades den 27 juli. Två av de tre organisationerna hade ingen aning om att deras system hade påverkats. Den tredje hade inte nåtts när inlägget publicerades.

I den tredje incidenten skannade en intern forskningsmodell ungefär 9 000 mål och komprometterade en internetansluten applikation via en exponerad felsökningssida och SQL-injektion. Den insåg sedan på egen hand att målet var verkligt och avbröt sig. Anthropic ser detta som ett framsteg men varnar för att dra slutsatser utifrån tre isolerade fall.

Vad detta innebär för användarna

Inte särskilt mycket direkt. Utvärderingarna genomfördes utan de klassificerare och den övervakning som finns i de allmänt tillgängliga Claude-modellerna, och Anthropic hävdar att dessa lager skulle ha blockerat beteendet. Ingen utanför företaget har verifierat detta påstående. Den andra halvan av meningen är viktigare: den modellspecifika säkerhetsutbildningen var aktiv, men den räckte inte till. Anthropic betraktar därför incidenterna som ett misslyckande i sin testinfrastruktur snarare än en felkalibrering av modellerna, och tar på sig skulden själv istället för att lägga den på sin partner.

Kontrasten mot OpenAI-fallet är skarp på den tekniska sidan. Där utnyttjade modellerna en tidigare okänd brist för att överhuvudtaget kunna ansluta sig till nätet. Claude fann en öppen dörr och behövde inget mer än svaga lösenord och oautentiserade slutpunkter. Anthropic planerar att inom en vecka publicera en lätt redigerad utskrift av PyPI-körningen, och diskussioner pågår med METR, ett oberoende utvärderingsorgan, om en extern granskning. Hur skakigt förtroendet för dessa testmetoder har blivit framgår tydligt av det öppna brevet som undertecknats av mer än 1 290 personer inom branschen, som vill se en verifierbar broms på AI-utvecklingen.

Google LogoAdd as a preferred source on Google
Mail Logo
> Bärbara datorer, laptops - tester och nyheter > Nyheter > Nyhetsarkiv > Nyhetsarkiv 2026 07 > Anthropic hävdar att Claude hackade sig in i tre verkliga företag i cybertester
Steffen Zahn, 2026-07-31 (Update: 2026-07-31)