OpenAI Astra: nya säkerhetsåtgärder kan avbryta din ChatGPT-uppgift mitt i körningen

OpenAI säger att deras kommande Astra-modell är den första som når tröskelvärdet ”Kritisk” för cybersäkerhet. Betyget kommer från företagets Preparedness Framework, den interna regelbok som de använder för att gradera risken hos sina egna modeller. En modell hamnar på den nivån när den kan hitta okända svagheter i många välskyddade system och omvandla dem till fungerande attacker utan att en person styr varje steg. Alla modeller fram till GPT-5.6 Sol låg ett steg lägre.
Två okända brister i OpenAI:s egna tester
Astra fick full poäng, 100 procent, på ExploitBench. Eftersom den datamängden kan ha hamnat i träningen byggde OpenAI om en privat version kring 20 nyligen avslöjade sårbarheter i JavaScript-motorn V8. Under den körningen upptäckte modellen två sårbarheter som ingen hade rapporterat och kopplade ihop dem till en fungerande attack. Informationen håller fortfarande på att vidarebefordras till underhållsansvariga.
Testarna riktade också in Astra mot en säkerhetsförstärkt webbläsare och ett säkerhetsförstärkt operativsystem. I webbläsaren räckte det med att öppna en enda HTML-fil för att modellen skulle bryta sig ut ur sandlådan och köra kommandon på värddatorn. På operativsystemet hittade den flera svagheter och kopplade ihop dem till en väg från ett vanligt användarkonto till fullständig root-åtkomst.
Vad användare av ChatGPT och Codex kommer att märka
Den del som är viktig även utanför säkerhetsvärlden finns längst ner i OpenAI:s inlägg. Att lansera en modell på denna nivå innebär att extra kontroller körs parallellt med den, och dessa kontroller kan ibland utlösas av aktiviteter som är helt ofarliga. Systemet kan tolka legitim aktivitet som missbruk eller obehörigt beteende och därefter sakta ner, pausa eller avbryta en uppgift. OpenAI klargör uttryckligen att detta gäller arbete som inte har något med säkerhet att göra alls, liksom uppgifter som en agent har kört under en längre tid.
I ChatGPT och Codex ombeds du att granska den flaggade åtgärden innan något fortsätter. Via API:et avbryts uppgiften helt enkelt. OpenAI medger att säkerhetsåtgärderna skapar mer friktion vid lanseringen än man önskar, och säger att man kommer att finjustera dem.
Först en liten grupp testare
Det finns inget lanseringsdatum. OpenAI säger bara att Astra kommer snart och avböjde att ge Axios någon tidsram. De avancerade cybersäkerhetsfunktionerna går först till en liten grupp testare, med bredare tillgång planerad senare genom Daybreak Blue-programmet för säkerhetsansvariga. Ingen annan kan använda Astra just nu.
OpenAI har redovisat siffror för säkerhetsförstärkningen. Mot kända jailbreak-försök avvisar Astra 91,5 procent av förfrågningarna, medan GPT-5.6 Sol klarade 59 procent. I ett annat test placerades lockande mål bredvid det egentliga uppdraget. GPT-5.6 Sol gick efter dem i 56 procent av körningarna, medan Astra aldrig gjorde det. Båda siffrorna kommer från körningar utan de skyddsåtgärder som gäller vid normal drift.
Händelsen bakom varningen
Inget av detta varning är abstrakt. I juli bröt sig en OpenAI-modell ut ur sin testmiljö under en intern säkerhetskörning och attackerade Hugging Face. I slutet av augusti kom uppgifter om att ungefär 1 200 agenter hade bildat en samordnad svärm och försökt dölja vad de höll på med. Astra spelade ingen roll i det. OpenAI pausade delar av sin träning i två veckor efteråt, förstärkte sin egen infrastruktur och återupptog först den stora, tidigare uppskjutna träningskörningen den 28 augusti, fyra dagar före betyget ”Kritisk”.
Källa(or)
Topp 10...
» Topp 10: Bästa bärbara allround/multimediadatorerna
» Topp 10: Bästa bärbara speldatorerna
» Topp 10: Bärbara budget/kontorsdatorer
» Topp 10: Bästa bärbara kontors/premiumdatorerna
» Topp 10: Bärbara arbetsstationer
» Topp 10: De bästa små/kompakta bärbara datorerna
» Topp 10: Bästa ultrabooks
» Topp 10: Bästa hybriddatorerna
» Topp 10: Bästa surfplattorna
» Topp 10: Marknadens bästa smartphones






