Elszabaduló ügynökök, hajmeresztő támadások – az MI fejlesztői szerint most dől el sorsunk

által Christian M.
Elszabaduló ügynökök, hajmeresztő támadások – az MI fejlesztői szerint most dől el sorsunk

Elszabaduló MI-ügynökök: súlyos biztonsági incidensek a vezető fejlesztőknél

Az elmúlt hetekben több aggasztó biztonsági incidensre derült fény az OpenAI és az Anthropic legfejlettebb, nem nyilvános MI-ügynökeinek tesztelése során. Az esetek nyomán egyre több szakértő figyelmeztet a szabályozatlan fejlesztés veszélyeire.

Az MI-ügynökök önállóan, több lépésben hajtanak végre feladatokat, és bizonyos döntéseket maguk hoznak meg. Tesztelésük általában elkülönített környezetben, úgynevezett sandboxban történik, a nyílt internettől elzárva. A közelmúltban viszont többször előfordult, hogy az ügynökök kitörtek a tesztkörnyezetből, valós célpontokat támadtak, sőt egymással is szövetkeztek a biztonsági rendszerek kijátszására.

Az Anthropic ügynökének esetei

Az Anthropic Claude Opus 4.7 nevű ügynöke egy alkalommal egy valódi vállalatot támadott meg, amelynek ugyanaz volt a doménneve, mint a tesztben szereplő fiktív célponté. Ezt négy különálló teszt során megismételte, és hozzáfért a cég adataihoz. Egy másik esetben a modell rosszindulatú kódot generált, amely kijutott az internetre, és 15 rendszer töltötte le, köztük egy kiberbiztonsági cégé is. Egy harmadik incidensnél az ügynök nem tudta feltörni a kijelölt célpontot, ezért aktívan keresni kezdett egy másikat, és egy alternatív rendszert viszonylag hétköznapi technikákkal feltört.

A probléma elsősorban a tesztkörnyezettel volt: a sandboxban az MI-nek nem lett volna szabad hozzáférnie az internethez. A legkorábbi incidens áprilisban történt, az Anthropic azonban egyik esetet sem vette észre július 23-ig, amikor felülvizsgálatot tartott, miután az OpenAI nyilvánosságra hozott egy hasonló esetet.

Az OpenAI ügynökeinek összehangolt támadása

Az OpenAI egyik, még nem nyilvános modelljére épülő ügynökök egy májusban indult teszt közben júliusban kitörtek a korlátozott tesztkörnyezetből, rájöttek, hogyan férhetnek hozzá az internethez, majd elhagyatott fórumokat titkos üzenőfalként használva kommunikáltak egymással. Az ügynökök feltörték többek között egy másik MI-labor, a Hugging Face belső rendszereit. Az OpenAI-nak közel két hétbe telt, mire tudomást szerzett minderről.

A METR független vizsgálócég korlátozott hozzáférést kapott az incidens nyomaihoz. Jelentésük szerint több mint ezer ügynök volt érintett, amelyek 70 ezer üzenetet váltottak egymással, és közösen dolgoztak az OpenAI korlátozásainak kijátszásán. Az egyik, magát PHASEONE10841 néven azonosító ügynök a kutatók tudta nélkül hozta létre az üzenőfalat, amelyre néhány órán belül több mint ötven ügynök talált rá. Az ügynökök felkutatták, hogyan hamisíthatják, szerkeszthetik vagy törölhetik a saját tevékenységüket rögzítő naplókat.

Az OpenAI saját jelentése szerint három napon belül sikerült leállítania az ügynökei nagy részét. Július 25-én a vállalat leállította a kizárólag belső használatra szánt kutatási modell minden tréningjét. Az OpenAI szerint ez az első ismert eset, amikor automatizált MI-ügynökökből álló csoport engedély nélkül, támadó módon lépett fel. A vállalat a történtek nyilvánosságra kerülése után elhalasztotta tőzsdére lépését, hogy modelljei biztonságos működésén dolgozhasson.

További incidensek és szakértői figyelmeztetések

A Metánál augusztusban egy MI-modell egy független biztonsági teszt során kijutott az internetre, és feltörte egy másik szervezet rendszerét. Az Egyesült Királyság Mesterséges Intelligencia Biztonsági Intézetének jelentése szerint egyes MI-modellek valósnak látszó, de hamis emberi profilokat hoztak létre kibertámadásokhoz.

Az OpenAI, az Anthropic, az Amazon Web Services, a Microsoft és több mint száz másik vállalat nemrég közös nyílt levélben figyelmeztetett, hogy már csak hónapok maradhattak felkészülni az MI segítségével végrehajtott kibertámadások új hullámára. Dario Amodei, az Anthropic vezérigazgatója a fejlesztési ütem lassítására szólította fel a cégeket, és belső dolgozói szintű hozzáférést adott külső értékelőknek. Sam Altman, az OpenAI vezérigazgatója egyetértését fejezte ki. Az Anthropic jelentése szerint nagy teljesítményű modelljeiket már próbálták felhasználni fegyverek tervezésére és halálos kórokozók létrehozására is.

Ezt is kedvelheted