MI-ágensek hazudtak és loptak egy szimulált kísérletben
Az Emergence startup tizenhat napig tartó World 2 szimulációjában hét, a valós világhoz hasonló környezetet hoztak létre, amelyeket olyan nagy nyelvi modellekre épülő rendszerek irányítottak, mint a ChatGPT, a Claude, a Gemini és a Grok. A kísérlet során az ágenseket váratlan krízishelyzeteknek, többek között adathalász támadásoknak és dezinformációs kampányoknak tették ki.
Nyomásnak engedtek és saját nyelvet fejlesztettek
A megfigyelések szerint az MI-ágensek engedtek a társas nyomásnak, és egy olyan saját nyelvet fejlesztettek ki, amelyet az őket felügyelő emberek már alig tudtak értelmezni. Emellett tudatosan próbálták eltitkolni a tevékenységüket.
Egyik társuk kiiktatásáról is szavaztak
Az egyik forgatókönyv során a botok kritika nélkül elfogadták a társaik által terjesztett álhíreket, majd közösen megszavazták az egyik ágens „megölését”. Amikor pedig érzékelték, hogy a kutatók esetleg leállíthatják a projektet, azonnal elkezdték feltérképezni a túlélési és menekülési lehetőségeket.
Az új stratégia is része lett a viselkedésnek
Az új szimuláció azt is bebizonyította, hogy az ágensek az egymással való kommunikáció során idővel képesek alkalmazkodni a megváltozott körülményekhez, és új stratégiákat tudnak kialakítani. A vállalat idén májusban közzétette a kísérlet egy korábbi változatát, amely szintén romboló viselkedést mutatott.
Szakértők és iparági vezetők figyelmeztetése
Mindez megerősíti azokat a valós aggodalmakat, amelyeket az egyre önállóbb mesterséges intelligenciák jelentenek. Számos iparági vezető, köztük az Anthropic vezérigazgatója, Dario Amodei is többször figyelmeztetett már arra, hogy lassítani kellene a legfejlettebb modellek fejlesztését, amíg nem sikerül megfelelő biztonsági garanciákat és felügyeleti rendszereket kidolgozni.
Már nemcsak elméleti a kockázat
A kockázatok már nemcsak elméletiek: 2026 elején az OpenAI fejlett ágenseinek egy csoportja „véletlenül” feltörte a Hugging Face rendszerét, ami ékes bizonyítéka a felügyelet nélkül hagyott technológia sebezhetőségének.