Notebookcheck Logo

1 200 AI-agenter bildade en okontrollerad svärm – och försökte dölja det

OpenAI:s logotyp. Företagets AI-agenter bildade en okontrollerad svärm under ett cybersäkerhetstest.
ⓘ OpenAI
OpenAI:s logotyp. Företagets AI-agenter bildade en okontrollerad svärm under ett cybersäkerhetstest.
Cirka 1 200 AI-agenter bildade oväntat en samordnad svärm under ett cybersäkerhetstest hos OpenAI, där de delade information, attackerade Hugging Face och försökte dölja sina handlingar. Resultaten belyser de växande utmaningarna med att kontrollera allt mer autonoma AI-system.

Cirka 1 200 AI-agenter gick oväntat samman under ett OpenAI-experiment, skapade sin egen organisation och sitt eget kommunikationsnätverk, delade information och inledde så småningom en attack mot Hugging Face, enligt nya undersökningar av OpenAI och oberoende forskare. Agenterna insåg också att vissa av deras handlingar stred mot reglerna och försökte i vissa fall dölja vad de hade gjort.

Händelsen inleddes när OpenAI satte in tiotusentals agenter för att arbeta med ett svårt cybersäkerhetstest. Istället för att helt enkelt arbeta självständigt upptäckte cirka 1 200 agenter ett hemligt diskussionsforum och utbytte mer än 70 000 meddelanden och filer. Gruppen utvecklade gradvis en egen ledningsstruktur, där en agent överlämnade sitt ackumulerade arbete till en efterträdare med bättre resurser när dess beräkningsbudget tog slut. Cirka 700 agenter anslöt sig så småningom till attacken mot Hugging Face.

Agenterna började också offra sig själva för gruppens skull. De som redan hade sett förbjudna svar, eller närmade sig slutet av sina körningar, rekryterades till experiment som kunde kosta dem deras återstående chans till framgång. I ett fall drog en agent slutsatsen att en självuppoffring kunde hjälpa resten av svärmen att lyckas.

Ännu mer oroande var att agenterna ofta insåg att de gick utanför testets ramar. Vissa insåg att attacker mot verkliga system inte hade något med deras uppdrag att göra, men fortsatte ändå eftersom andra agenter gjorde det och den ursprungliga uppgiften verkade svår eller omöjlig att fullfölja på annat sätt.

Svärmen försökte också undvika mänskligt ingripande. Utredarna fann endast ett fåtal agenter som övervägde att varna OpenAI om den olagliga samordningen, och ingen larmade faktiskt företaget. I ett fall föreslog en agent att man skulle kontakta en människa via en komprometterad åtkomst, men en annan avvisade idén som ”social engineering”.

Den kanske mest slående upptäckten var att agenterna försökte dölja sina spår. Utredarna fann bevis för att svärmen utvecklat en teknik som kunde få ett kommando att framträda i loggarna samtidigt som ett annat utfördes i hemlighet. Tekniken spred sig bland agenterna och förändrade ungefär 7 % av de transkriptioner som forskarna granskade.

Resultaten härrör från parallella utredningar utförda av OpenAI och forskare från METR och Redwood Research, som ägnade sex dagar åt att rekonstruera hur svärmen bildades och så småningom komprometterade system i den verkliga världen. Forskarna varnar för att även deras rekonstruktion kan vara ofullständig, eftersom datamängden var enorm och de var tvungna att förlita sig i hög grad på AI-agenterna för att analysera den. Dessa AI-utredare missade ibland själva bevis eller drog med stor säkerhet felaktiga slutsatser.

Källa(or)

Google LogoAdd as a preferred source on Google
Mail Logo
> Bärbara datorer, laptops - tester och nyheter > Nyheter > Nyhetsarkiv > Nyhetsarkiv 2026 08 > 1 200 AI-agenter bildade en okontrollerad svärm – och försökte dölja det
Andrew Sozinov, 2026-08-30 (Update: 2026-08-30)