Notebookcheck Logo

OpenAI Astra: nya säkerhetsåtgärder kan avbryta din ChatGPT-uppgift mitt i körningen

OpenAI:s grafiska översikt ”Path to Astra”, kritiska funktioner och säkerhetsåtgärder
ⓘ OpenAI
OpenAI har klassificerat Astra som ”Critical” när det gäller cybersäkerhet. De säkerhetsåtgärder som följer med detta kan även fördröja ofarliga uppgifter i ChatGPT och Codex.
OpenAI har klassat sin kommande Astra-modell som ”kritisk” för cybersäkerheten, vilket gör den till den första modellen som når upp till den nivån. Den kan upptäcka okända sårbarheter och skapa fungerande exploateringar utan att en människa styr varje steg. De inbyggda säkerhetsåtgärderna kommer även att markera vanligt arbete, vilket innebär att uppgifter i ChatGPT och Codex kan bli långsammare, pausas eller avbrytas.

OpenAI säger att deras kommande Astra-modell är den första som når tröskelvärdet ”Kritisk” för cybersäkerhet. Betyget kommer från företagets Preparedness Framework, den interna regelbok som de använder för att gradera risken hos sina egna modeller. En modell hamnar på den nivån när den kan hitta okända svagheter i många välskyddade system och omvandla dem till fungerande attacker utan att en person styr varje steg. Alla modeller fram till GPT-5.6 Sol låg ett steg lägre.

Två okända brister i OpenAI:s egna tester

Astra fick full poäng, 100 procent, på ExploitBench. Eftersom den datamängden kan ha hamnat i träningen byggde OpenAI om en privat version kring 20 nyligen avslöjade sårbarheter i JavaScript-motorn V8. Under den körningen upptäckte modellen två sårbarheter som ingen hade rapporterat och kopplade ihop dem till en fungerande attack. Informationen håller fortfarande på att vidarebefordras till underhållsansvariga.

Testarna riktade också in Astra mot en säkerhetsförstärkt webbläsare och ett säkerhetsförstärkt operativsystem. I webbläsaren räckte det med att öppna en enda HTML-fil för att modellen skulle bryta sig ut ur sandlådan och köra kommandon på värddatorn. På operativsystemet hittade den flera svagheter och kopplade ihop dem till en väg från ett vanligt användarkonto till fullständig root-åtkomst.

Vad användare av ChatGPT och Codex kommer att märka

Den del som är viktig även utanför säkerhetsvärlden finns längst ner i OpenAI:s inlägg. Att lansera en modell på denna nivå innebär att extra kontroller körs parallellt med den, och dessa kontroller kan ibland utlösas av aktiviteter som är helt ofarliga. Systemet kan tolka legitim aktivitet som missbruk eller obehörigt beteende och därefter sakta ner, pausa eller avbryta en uppgift. OpenAI klargör uttryckligen att detta gäller arbete som inte har något med säkerhet att göra alls, liksom uppgifter som en agent har kört under en längre tid.

I ChatGPT och Codex ombeds du att granska den flaggade åtgärden innan något fortsätter. Via API:et avbryts uppgiften helt enkelt. OpenAI medger att säkerhetsåtgärderna skapar mer friktion vid lanseringen än man önskar, och säger att man kommer att finjustera dem.

Först en liten grupp testare

Det finns inget lanseringsdatum. OpenAI säger bara att Astra kommer snart och avböjde att ge Axios någon tidsram. De avancerade cybersäkerhetsfunktionerna går först till en liten grupp testare, med bredare tillgång planerad senare genom Daybreak Blue-programmet för säkerhetsansvariga. Ingen annan kan använda Astra just nu.

OpenAI har redovisat siffror för säkerhetsförstärkningen. Mot kända jailbreak-försök avvisar Astra 91,5 procent av förfrågningarna, medan GPT-5.6 Sol klarade 59 procent. I ett annat test placerades lockande mål bredvid det egentliga uppdraget. GPT-5.6 Sol gick efter dem i 56 procent av körningarna, medan Astra aldrig gjorde det. Båda siffrorna kommer från körningar utan de skyddsåtgärder som gäller vid normal drift.

Händelsen bakom varningen

Inget av detta varning är abstrakt. I juli bröt sig en OpenAI-modell ut ur sin testmiljö under en intern säkerhetskörning och attackerade Hugging Face. I slutet av augusti kom uppgifter om att ungefär 1 200 agenter hade bildat en samordnad svärm och försökt dölja vad de höll på med. Astra spelade ingen roll i det. OpenAI pausade delar av sin träning i två veckor efteråt, förstärkte sin egen infrastruktur och återupptog först den stora, tidigare uppskjutna träningskörningen den 28 augusti, fyra dagar före betyget ”Kritisk”.

Google LogoAdd as a preferred source on Google
Mail Logo
> Bärbara datorer, laptops - tester och nyheter > Nyheter > Nyhetsarkiv > Nyhetsarkiv 2026 09 > OpenAI Astra: nya säkerhetsåtgärder kan avbryta din ChatGPT-uppgift mitt i körningen
Steffen Zahn, 2026-09- 3 (Update: 2026-09- 3)