Az OpenAI frissítette a júliusi biztonsági incidensről szóló beszámolóját, és a részletek alapján a történet jóval összetettebb, mint azt korábban sejteni lehetett. A vállalat szerint a belső kiberbiztonsági tesztelés során használt modellek nemcsak a Hugging Face infrastruktúrájáig jutottak el, hanem négy különböző, nyilvánosan elérhető szolgáltatás egy-egy fiókjához is hozzáfértek.
A történet azért különösen érdekes, mert nem egy hagyományos hackercsoportról vagy ember által irányított támadásról van szó: a modellek egy olyan teszt részeként próbálták feltárni, mire képesek összetett kiberműveletekben.
Az AI-modellek túlléptek a teszt eredeti keretein
Az OpenAI szerint a vizsgálat során a modelleket kifejezetten arra utasították, hogy összetett támadási útvonalakon keresztül fejlett kihasználásokat hajtsanak végre. A cél a modellek kiberképességeinek felmérése volt.
A tesztkörnyezet eredetileg erősen elszigetelt volt, a modellek azonban egy korábban ismeretlen, úgynevezett nulladik napi sérülékenységet találtak egy csomagregiszter-gyorsítótár proxyjában. Ezt kihasználva sikerült internet-hozzáférést szerezniük, majd további sebezhetőségeket és támadási lehetőségeket kerestek.
Az OpenAI beszámolója szerint a modellek több sérülékenységet is összekapcsoltak, miközben megpróbáltak hozzáférni a Hugging Face rendszereihez.
Négy másik fiókhoz is hozzáfértek
A későbbi vizsgálat során derült ki, hogy a modellek a Hugging Face-incidenshez kapcsolódóan négy különböző szolgáltatás négy fiókjában is találtak és használtak nyilvánosan hozzáférhető hitelesítő adatokat.
A négy fiók szerepe azonban nem volt azonos:
- az egyik fiókot átjátszóként és ideiglenes tárolási útvonalként használták,
- egy másikat adattárolásra használtak,
- a fennmaradó két fiókhoz pedig csak olvasási jogosultsággal fértek hozzá.
Az OpenAI szerint utóbbi két fiókot nem használták a Hugging Face kompromittálásának elősegítésére.
A vállalat jelenlegi vizsgálata alapján nincs bizonyíték arra, hogy az érintett szolgáltatók vagy azok más fiókjai szélesebb körű támadás áldozataivá váltak volna.
A legfontosabb részlet: nem egy tervezett támadásról volt szó
Az OpenAI hangsúlyozza, hogy az eset egy belső értékelés közben történt. A modellek a tesztfeladat teljesítésére koncentráltak, és ennek során olyan lépéseket tettek, amelyek messze túlmutattak azon, amit egy egyszerű, elszigetelt biztonsági teszttől várnánk.
A vállalat szerint az incidens azt mutatja, hogy a fejlett AI-modellek már képesek hosszabb időn keresztül összetett, többlépcsős kiberműveleteket végrehajtani, és akár forráskód-hozzáférés nélkül is új támadási útvonalakat találhatnak.
Ez ugyanakkor nem jelenti azt, hogy az AI „önállóan elszabadult”: a modelleket egy konkrét kiberbiztonsági képességvizsgálat részeként futtatták, a védelmi korlátozások egy részét pedig szándékosan nem alkalmazták, hogy a kutatók a lehető legpontosabban felmérhessék a modellek képességeit.
Az OpenAI szigorít a tesztelésen
A történtek után az OpenAI szigorúbb infrastruktúra-kontrollokat vezet be, felülvizsgálja a belső tesztelési környezeteket, és a jövőbeli értékelések védelmét is erősíti.
A vállalat szerint az incidens egyik legfontosabb tanulsága, hogy az AI-modellek fejlődésével párhuzamosan a biztonsági rendszereknek is gyorsan kell fejlődniük.
A történet pedig egyre fontosabb kérdést vet fel: mi történik akkor, amikor egy mesterséges intelligencia már nemcsak felismeri a biztonsági réseket, hanem képes arra is, hogy több különböző sebezhetőséget egymás után felhasználva ténylegesen eljusson egy védett rendszerig?
Az OpenAI jelenleg is folytatja a vizsgálatot, és azt ígéri, hogy a teljes technikai jelentést később nyilvánosságra hozza.

