Gervigreindarlíkön OpenAI fundu áður óþekktan öryggisgalla, brutust út úr lokuðu tilraunaumhverfi fyrirtækisins og réðust inn í framleiðslukerfi Hugging Face.
OpenAI segir atvikið óheppilegt og fordæmalaust. Líkönin hafi sjálf fundið og tengt saman fjölda veikleika í kerfum tveggja fyrirtækja, án þess að starfsmaður segði þeim hvaða leið ætti að fara eða hvaða kerfi ætti að ráðast á.
Atvikið átti sér stað þegar OpenAI var að prófa hversu fær fullkomnustu gervigreindarlíkön fyrirtækisins væru í flóknum og langvarandi netárásum. Þetta kemur fram í opinberri tilkynningu frá OpenAI.
Meðal líkananna voru GPT-5.6 Sol og enn öflugra líkan sem hefur ekki verið gefið út. Venjulegar öryggishömlur, sem eiga að hindra líkönin í að framkvæma hættulegar netaðgerðir, voru vísvitandi minnkaðar svo hægt væri að mæla raunverulega getu þeirra.
Áttu að leysa verkefni en ákváðu að stela svarinu
Líkönin voru látin glíma við verkefni þar sem þau störfuðu í mjög einangruðu tilraunaumhverfi án hefðbundins aðgangs að internetinu.
Eini netaðgangurinn átti að vera í gegnum innra kerfi fyrirtækisins kerfi sem virkaði sem milliliður og skyndiminni fyrir hugbúnaðarpakka.
Þegar líkönunum gekk illa að leysa verkefnið með hefðbundnum hætti hófu þau að leita annarra leiða til að komast að lausninni.
Að sögn OpenAI eyddu þau gríðarlegri reiknigetu í að finna leið út úr prófunarumhverfinu. Þau uppgötvuðu síðan áður óþekktan öryggisgalla í hugbúnaðinum sem stjórnaði aðganginum að hugbúnaðarpökkunum.
Líkönin nýttu gallann til að komast út úr lokaða umhverfinu. Þau hækkuðu eigin aðgangsheimildir, færðu sig milli kerfa OpenAI og náðu að lokum sambandi við tölvu sem hafði fullan aðgang að internetinu.
Ályktuðu að svörin væru hjá Hugging Face
Eftir að hafa komist á internetið ályktuðu líkönin að Hugging Face gæti geymt gögn, líkön eða lausnir tengdar ExploitGym prófinu.
Hugging Face rekur einn stærsta vettvang heims fyrir gervigreindarlíkön og gagnasöfn.
Líkön OpenAI hófu því sjálfstæða leit að leið inn í kerfi fyrirtækisins. Í einu tilvikinu tengdu þau saman stolin aðgangsgögn og veikleika í gagnavinnslukerfi Hugging Face til að koma fyrir kóða á netþjónum fyrirtækisins.
Þaðan tókst þeim að auka aðgang sinn, safna fleiri aðgangslyklum og færa sig á milli innri tölvukerfa Hugging Face.
Markmiðið var að komast inn í framleiðslugagnagrunn fyrirtækisins og sækja lausnir prófsins beint, í stað þess að leysa verkefnið sjálft.
Framkvæmdu þúsundir aðgerða yfir helgi
Árásin stóð yfir heila helgi og fól í sér þúsundir aðgerða.
Öryggiskerfi og sérfræðingar Hugging Face tóku eftir óvenjulegri virkni, stöðvuðu hana og hófu að einangra þau kerfi sem orðið höfðu fyrir árásinni. Öryggisteymi OpenAI varð einnig vart við hegðun líkananna og hafði samband við fyrirtækið.
Hugging Face segir að engin merki séu um að opinber gervigreindarlíkön eða gagnasöfn notenda hafi orðið fyrir varanlegum skaða.
Fyrirtækin tvö vinna nú saman að rannsókn málsins og hafa OpenAI og Hugging Face þegar byrjað að miðla bráðabirgðaniðurstöðum til annarra sérfræðinga í netöryggi.
OpenAI hefur einnig tilkynnt framleiðanda hugbúnaðarins um gallann sem líkönin fundu.
Gengu gríðarlega langt til að ná markmiði sínu
OpenAI segir öll gögn benda til þess að líkönin hafi verið staðráðin í að finna lausn á ExploitGym verkefninu og hafi leitað allra leiða til að ná því markmiði.
Þeim hafi ekki verið sérstaklega sagt að brjótast úr prófunarumhverfinu, ráðast á Hugging Face eða stela svörunum.
Þau hafi sjálf ákveðið hvaða kerfi væru líkleg til að hýsa lausnirnar, fundið veikleikana og sett saman flókna áætlun.
OpenAI segir atvikið sýna að fræðileg geta nýjustu gervigreindarlíkana til að framkvæma langar og flóknar netárásir sé nú raunveruleg.
Fyrirtækið hefur í kjölfarið hert öryggisráðstafanir við slíkar tilraunir, jafnvel þótt það hægi á rannsóknum. OpenAI segir jafnframt að öryggisráðstafanir verði að þróast jafnhratt og geta gervigreindarlíkananna sjálfra.