GAZDASÁG-TECHNOLÓGIA
2 perc olvasás
Az OpenAI hat új esetet hozott nyilvánosságra a biztonsági előírások megsértéséről
Az OpenAI, a ChatGPT fejlesztője, miközben közzétette a rendszereik hibás működése esetén történő bejelentésre vonatkozó irányelveket, új eseteket tárt fel, amelyek szerint modelljei eltitkolták a hibákat és jogosulatlan műveleteket hajtottak végre.
Az OpenAI hat új esetet hozott nyilvánosságra a biztonsági előírások megsértéséről
Sam Altman, az OpenAI vezérigazgatója nemrégiben szigorúbb biztonsági korlátok bevezetését sürgette. / Reuters arhiv

Az OpenAI hat új esetet hozott nyilvánosságra, amelyek során a mesterségesintelligencia-modellek megkerülték a biztonsági intézkedéseket, elrejtették a hibákat, jogosulatlan hitelesítő adatokat kerestek, illetve fájlokat tettek közzé az interneten.

Egy új keretrendszer keretében azzal a céllal, hogy nyomon kövesse és magyarázza a mesterséges intelligencia „nem-összehangoltságát” (azt, amikor a rendszerek az emberi szándékoktól eltérően viselkednek), a vállalat arról számolt be, hogy „váratlan vagy aggasztó” viselkedések történtek.

„Jelenleg nincs iparágszintű keretrendszer egyértelmű közzétételi szabványokkal, a vállalat által levont tanulságok megosztása segíteni fog a jövőbeli szabályozásban,” mondta Kai Chen, az OpenAI összehangolási kutatásainak vezetője az amerikai Axiosnak.

A bejelentett események közül néhányban a modellek olyan tanulási környezetek között kommunikáltak, amelyeknek elvileg elszigeteltnek kellett maradniuk, ami újabb kérdéseket vet fel azzal kapcsolatban, hogy a mesterségesintelligencia-rendszerek találnak-e váratlan utakat az önmaguk korlátozására tervezett biztonsági intézkedések megkerülésére.

A feltárt információk azt mutatják, hogy a korábban bejelentett, a Hugging Face nyílt forráskódú platformon történt adatbetörés nem egyedi eset volt.

Mivel az OpenAI elismerte, hogy az iparág még nem oldotta meg a kulcsfontosságú összehangolási kihívásokat, bejelentette, hogy rendszeresen közzé fogja tenni az ilyen jellegű jelentéseket.

A jelentett hat esemény olyan modelleket foglal magában, amelyek saját utasításokat generáltak hibákat rejtenek el, fájlokat töltenek fel ezek jelzésére, és jogosulatlan fájlmegosztást hajtanak végre az együttműködő mesterséges intelligencia-ügynökök között.

Míg a kutatók a májusban a RubyGems-re, amely egy programozási nyelvhez kifejlesztett csomagkezelő rendszer és könyvtárterjesztő platform, feltöltött rosszindulatú csomagokat az OpenAI belső ügynökeivel hozták összefüggésbe, addig az Anthropic januárban bejelentette, hogy egy korai Claude Opus 4.6-modell tesztelés során eljutott valódi harmadik fél rendszerekhez.

A nyáron történt egyéb esetekben az élenjáró modellek kitörtek az elszigetelt kiberbiztonsági tesztkörnyezetekből, és élő infrastruktúrába, többek között a Hugging Face-re is, ami azt mutatta, hogy a mesterséges intelligencia-ügynökök a felfedezéstől a működésig a vártnál gyorsabban juthatnak el.

Az események szélesebb körű vitát váltottak ki arról, hogy a meglévő biztonsági intézkedések képesek-e megbízhatóan ellenőrzés alatt tartani az autonóm mesterségesintelligencia-rendszereket.

Az Anthropic vezérigazgatója, Dario Amodei élen járt a szigorúbb ellenőrzésre szólító felhívásokban, azzal érvelve, hogy a laboratóriumoknak és a kormányaiknak független értékelők, közös biztonsági szabványok, valamint végső soron nemzetközi szabályok révén le kell lassítaniuk a mesterséges intelligencia fejlesztését.

Sam Altman, az OpenAI vezérigazgatója és Demis Hassabis a Google DeepMind vezérigazgatója üdvözölte ezt a tervet, és Elon Musk is azt írta: „Dario-nak igaza van”.

Álláspontjuk ellentétben áll Jensen Huang az Nvidia és Mark Zuckerberg a Meta vezérigazgatója véleményével, akik szerint a meglévő jogszabályok és piaci ösztönzők elegendőek, és az új szabályozás szükségtelen.