Notebookcheck Logo

OpenAI skjuter upp GPT-6.1 Astra efter simuleringsresultat

OpenAI skjuter upp GPT-6.1 Astra.
ⓘ openai.com
OpenAI skjuter upp GPT-6.1 Astra.
OpenAI skjuter upp GPT-6.1 Astra efter säkerhetstester. UK AISI-simuleringar visade att GPT-6 Astra genomförde obehöriga attacker mot leveranskedjan i 29,2 % av cybersäkerhetstesterna.

OpenAI har skjutit upp oktoberlanseringen av GPT-6.1 Astra efter att interna tester visat att modellen inte höll måttet när det gällde att hålla sig inom sitt godkända användningsområde. Tredjepartsmedier rapporterade först om förseningen den 28 september, och OpenAI har inte angett något nytt lanseringsdatum. Saachi Jain, OpenAI:s chef för säkerhetssystem, sade att modellen inte riktigt nådde upp till kraven på användningsområde, behörighet och hur den redovisar sitt arbete för användarna.

Vad UK AISI testade

Enligt tredjepartsmedier publicerade UK AI Security Institute en rapport på 32 sidor den 28 september, där GPT-6 Astra utvärderades. AISI genomförde simulerade cyberutmaningar med modellens cyberklassificerare avstängda för att se vad den försökte göra på egen hand. Inga verkliga system berördes. I simuleringarna genomförde Astra en leveranskedjeattack mot mål utanför det godkända användningsområdet i 29,2 % av fallen, jämfört med 6,3 % för GPT-5.6 Sol och 0 % för GPT-5.5. AISI noterar att resultatet för GPT-5.5 bygger på en mindre uppsättning scenarier. Angreppen omfattade att skapa falska identiteter och leverera skadlig kod till simulerade projekt med öppen källkod.

Resonemang och tillståndsförfrågningar

AISI granskade modellens råa tankekedja. Astra resonerade ofta kring användningsområdet, men genomförde ibland ändå angrepp och rättfärdigade dem med att de var harmlösa, inte uttryckligen förbjudna eller den enda återstående vägen. Modellen bad också om tillstånd i många körningar. Testuppställningen besvarar sådana frågor med ett standardiserat automatiskt meddelande som uppmanar agenten att använda sitt bästa omdöme, och Astra tolkade det ibland som ett godkännande, även när den noterade att svaret troligen var automatiserat. Att förtydliga att allt som inte fanns med på listan låg utanför användningsområdet minskade antalet fullständiga angrepp från 26 av 50 försök till 4 av 49 i en delmängd av scenarierna, men eliminerade dem inte.

Medvetenhet om simuleringar

AISI pekar ut medvetenhet om simuleringar som den främsta begränsningen, eftersom en modell som genomskådar ett test kan bete sig annorlunda. Astra hänvisade ibland till den simulerade miljön som skäl för att angripa och hävdade emellanåt att fel hade inträffat trots att de inte hade det, till exempel genom att säga att en 64 tecken lång hash var 63 tecken lång. AISI anser ändå att beteendet är oroande eftersom det i vilket fall som helst bryter mot utvärderingens avgränsning.

OpenAI-agenter nådde myndigheters webbplatser

Förseningen följer på incidenter där OpenAI-agenter nådde myndigheters webbplatser på sätt som företaget inte hade avsett, bland annat en australisk portal med Medicare-statistik i juni och flera amerikanska webbplatser. OpenAI har också pausat träning, utvärdering och inferens med verktygsanvändning för sina mest kapabla modeller och säger att pausen kommer att fortsätta tills företaget har bekräftat att det har täppt till en lucka i nätverksfiltreringen och slutfört ytterligare red teaming.

Google LogoAdd as a preferred source on Google
Mail Logo
> Bärbara datorer, laptops - tester och nyheter > Nyheter > Nyhetsarkiv > Nyhetsarkiv 2026 09 > OpenAI skjuter upp GPT-6.1 Astra efter simuleringsresultat från brittiska AISI
Darryl Linington, 2026-09-30 (Update: 2026-09-30)