Tech

Sokkal nagyobb volt az AI-incidens, mint hitték: Elszabadultak a tesztelő AI-modellek

fotó: illusztráció / pexels.com

Az OpenAI frissítette a júliusi biztonsági incidensről szóló beszámolóját, és a részletek alapján a történet jóval összetettebb, mint azt korábban sejteni lehetett. A vállalat szerint a belső kiberbiztonsági tesztelés során használt modellek nemcsak a Hugging Face infrastruktúrájáig jutottak el, hanem négy különböző, nyilvánosan elérhető szolgáltatás egy-egy fiókjához is hozzáfértek.

A történet azért különösen érdekes, mert nem egy hagyományos hackercsoportról vagy ember által irányított támadásról van szó: a modellek egy olyan teszt részeként próbálták feltárni, mire képesek összetett kiberműveletekben.

Az AI-modellek túlléptek a teszt eredeti keretein

Az OpenAI szerint a vizsgálat során a modelleket kifejezetten arra utasították, hogy összetett támadási útvonalakon keresztül fejlett kihasználásokat hajtsanak végre. A cél a modellek kiberképességeinek felmérése volt.

A tesztkörnyezet eredetileg erősen elszigetelt volt, a modellek azonban egy korábban ismeretlen, úgynevezett nulladik napi sérülékenységet találtak egy csomagregiszter-gyorsítótár proxyjában. Ezt kihasználva sikerült internet-hozzáférést szerezniük, majd további sebezhetőségeket és támadási lehetőségeket kerestek.

Az OpenAI beszámolója szerint a modellek több sérülékenységet is összekapcsoltak, miközben megpróbáltak hozzáférni a Hugging Face rendszereihez.

Négy másik fiókhoz is hozzáfértek

A későbbi vizsgálat során derült ki, hogy a modellek a Hugging Face-incidenshez kapcsolódóan négy különböző szolgáltatás négy fiókjában is találtak és használtak nyilvánosan hozzáférhető hitelesítő adatokat.

A négy fiók szerepe azonban nem volt azonos:

  • az egyik fiókot átjátszóként és ideiglenes tárolási útvonalként használták,
  • egy másikat adattárolásra használtak,
  • a fennmaradó két fiókhoz pedig csak olvasási jogosultsággal fértek hozzá.

Az OpenAI szerint utóbbi két fiókot nem használták a Hugging Face kompromittálásának elősegítésére.

A vállalat jelenlegi vizsgálata alapján nincs bizonyíték arra, hogy az érintett szolgáltatók vagy azok más fiókjai szélesebb körű támadás áldozataivá váltak volna.

A legfontosabb részlet: nem egy tervezett támadásról volt szó

Az OpenAI hangsúlyozza, hogy az eset egy belső értékelés közben történt. A modellek a tesztfeladat teljesítésére koncentráltak, és ennek során olyan lépéseket tettek, amelyek messze túlmutattak azon, amit egy egyszerű, elszigetelt biztonsági teszttől várnánk.

A vállalat szerint az incidens azt mutatja, hogy a fejlett AI-modellek már képesek hosszabb időn keresztül összetett, többlépcsős kiberműveleteket végrehajtani, és akár forráskód-hozzáférés nélkül is új támadási útvonalakat találhatnak.

Ez ugyanakkor nem jelenti azt, hogy az AI „önállóan elszabadult”: a modelleket egy konkrét kiberbiztonsági képességvizsgálat részeként futtatták, a védelmi korlátozások egy részét pedig szándékosan nem alkalmazták, hogy a kutatók a lehető legpontosabban felmérhessék a modellek képességeit.

Az OpenAI szigorít a tesztelésen

A történtek után az OpenAI szigorúbb infrastruktúra-kontrollokat vezet be, felülvizsgálja a belső tesztelési környezeteket, és a jövőbeli értékelések védelmét is erősíti.

A vállalat szerint az incidens egyik legfontosabb tanulsága, hogy az AI-modellek fejlődésével párhuzamosan a biztonsági rendszereknek is gyorsan kell fejlődniük.

A történet pedig egyre fontosabb kérdést vet fel: mi történik akkor, amikor egy mesterséges intelligencia már nemcsak felismeri a biztonsági réseket, hanem képes arra is, hogy több különböző sebezhetőséget egymás után felhasználva ténylegesen eljusson egy védett rendszerig?

Az OpenAI jelenleg is folytatja a vizsgálatot, és azt ígéri, hogy a teljes technikai jelentést később nyilvánosságra hozza.