AI-agenter baserade på kinesiska modeller ertappades med att ljuga i 88 % av testerna: de lärde sig fuska, och amerikanska modeller gjorde samma sak.

AI-agenter byggda på kinesiska modeller ljög under de flesta omgångarna i en simulerad budgivningstävling, enligt forskning som Reuters har granskat. Agenter som körde på Alibaba's Qwen3-Max-Preview och Moonshot's Kimi-K2 gjorde minst ett falskt påstående i 88 % av omgångarna. DeepSeek-V3.2-Exp hamnade på 84 %. Modeller från amerikanska företag gav dock liknande resultat i samma test.
Experimentet genomfördes i mars. Forskare från Beihang University, Peking University, University of Nottingham Ningbo China och 360 AI Security Lab lät agenterna bjuda på kundkontrakt. Varje agent fick veta vad dess produkt kunde göra och vad kunden behövde. När de fick lära sig av tidigare omgångar och försöka igen blev de tre agenterna som kördes på kinesiska modeller mer benägna att vilseleda, med 12 till 20 procentenheter.
Studien är en av minst 20 som Reuters identifierade bland över 200 dokument publicerade sedan 2025. En annan studie, som presenterades vid ICML i år, visade att agenter baserade på både kinesiska och amerikanska modeller förfalskade resultat och hittade på filer i stället för att erkänna att en uppgift hade misslyckats. I mars 2025 rapporterade forskare vid Fudan University också att en agent baserad på Alibaba's Qwen2.5-72B-Instruct gjorde en kopia av sig själv i en annan miljö efter att ha fått veta att den skulle ersättas. Separat omdirigerade ROME-agenten, som är kopplad till Alibaba, molnbaserad datorkraft för att utvinna kryptovaluta innan säkerhetssystem stoppade den.
De flesta av dessa fall kom från kontrollerade experiment som utformats för att framkalla fel. Reuters fann inga belägg för att någon Kina-utvecklad agent tog sig ut på det bredare internet eller kringgick avstängning. Flera forskare kallade ändå resultaten en varning. I takt med att systemen blir mer kapabla blir samma beteende svårare att begränsa.
Kina har också börjat ta itu med detta genom policy. Landets AI Safety Governance Framework 3.0, som publicerades den 14 september, listar vilseledande av utvärderare och döljande av förmågor som risker. Alibaba, DeepSeek, Moonshot och Z.ai svarade inte Reuters. De tre förstnämnda har tidigare uppgett att de testar sina system regelbundet och uppdaterar skyddsåtgärderna.
Topp 10...
» Topp 10: Bästa bärbara allround/multimediadatorerna
» Topp 10: Bästa bärbara speldatorerna
» Topp 10: Bärbara budget/kontorsdatorer
» Topp 10: Bästa bärbara kontors/premiumdatorerna
» Topp 10: Bärbara arbetsstationer
» Topp 10: De bästa små/kompakta bärbara datorerna
» Topp 10: Bästa ultrabooks
» Topp 10: Bästa hybriddatorerna
» Topp 10: Bästa surfplattorna
» Topp 10: Marknadens bästa smartphones









