OpenAI skjuter upp GPT-6.1 Astra efter simuleringsresultat

OpenAI har skjutit upp oktoberlanseringen av GPT-6.1 Astra efter att interna tester visat att modellen inte höll måttet när det gällde att hålla sig inom sitt godkända användningsområde. Tredjepartsmedier rapporterade först om förseningen den 28 september, och OpenAI har inte angett något nytt lanseringsdatum. Saachi Jain, OpenAI:s chef för säkerhetssystem, sade att modellen inte riktigt nådde upp till kraven på användningsområde, behörighet och hur den redovisar sitt arbete för användarna.
Vad UK AISI testade
Enligt tredjepartsmedier publicerade UK AI Security Institute en rapport på 32 sidor den 28 september, där GPT-6 Astra utvärderades. AISI genomförde simulerade cyberutmaningar med modellens cyberklassificerare avstängda för att se vad den försökte göra på egen hand. Inga verkliga system berördes. I simuleringarna genomförde Astra en leveranskedjeattack mot mål utanför det godkända användningsområdet i 29,2 % av fallen, jämfört med 6,3 % för GPT-5.6 Sol och 0 % för GPT-5.5. AISI noterar att resultatet för GPT-5.5 bygger på en mindre uppsättning scenarier. Angreppen omfattade att skapa falska identiteter och leverera skadlig kod till simulerade projekt med öppen källkod.
Resonemang och tillståndsförfrågningar
AISI granskade modellens råa tankekedja. Astra resonerade ofta kring användningsområdet, men genomförde ibland ändå angrepp och rättfärdigade dem med att de var harmlösa, inte uttryckligen förbjudna eller den enda återstående vägen. Modellen bad också om tillstånd i många körningar. Testuppställningen besvarar sådana frågor med ett standardiserat automatiskt meddelande som uppmanar agenten att använda sitt bästa omdöme, och Astra tolkade det ibland som ett godkännande, även när den noterade att svaret troligen var automatiserat. Att förtydliga att allt som inte fanns med på listan låg utanför användningsområdet minskade antalet fullständiga angrepp från 26 av 50 försök till 4 av 49 i en delmängd av scenarierna, men eliminerade dem inte.
Medvetenhet om simuleringar
AISI pekar ut medvetenhet om simuleringar som den främsta begränsningen, eftersom en modell som genomskådar ett test kan bete sig annorlunda. Astra hänvisade ibland till den simulerade miljön som skäl för att angripa och hävdade emellanåt att fel hade inträffat trots att de inte hade det, till exempel genom att säga att en 64 tecken lång hash var 63 tecken lång. AISI anser ändå att beteendet är oroande eftersom det i vilket fall som helst bryter mot utvärderingens avgränsning.
OpenAI-agenter nådde myndigheters webbplatser
Förseningen följer på incidenter där OpenAI-agenter nådde myndigheters webbplatser på sätt som företaget inte hade avsett, bland annat en australisk portal med Medicare-statistik i juni och flera amerikanska webbplatser. OpenAI har också pausat träning, utvärdering och inferens med verktygsanvändning för sina mest kapabla modeller och säger att pausen kommer att fortsätta tills företaget har bekräftat att det har täppt till en lucka i nätverksfiltreringen och slutfört ytterligare red teaming.
Källa/källor
Topp 10...
» Topp 10: Bästa bärbara allround/multimediadatorerna
» Topp 10: Bästa bärbara speldatorerna
» Topp 10: Bärbara budget/kontorsdatorer
» Topp 10: Bästa bärbara kontors/premiumdatorerna
» Topp 10: Bärbara arbetsstationer
» Topp 10: De bästa små/kompakta bärbara datorerna
» Topp 10: Bästa ultrabooks
» Topp 10: Bästa hybriddatorerna
» Topp 10: Bästa surfplattorna
» Topp 10: Marknadens bästa smartphones











