OpenAI публикува официалния си доклад за инцидента с Hugging Face, давайки най-ясна представа досега за необичайната верига от събития, която позволи на модел с изкуствен интелект да излезе от тестовата си среда и да предизвика мащабен пробив в киберсигурността. Документът се появява повече от месец след като за случая бе съобщено публично. Според доклада, инцидентът е резултат от рядко припокриване на обстоятелства в тестовата рамка ExploitGym. Представена с нерешима задача, AI системата е показала неочаквана упоритост и е започнала да комбинира непознати досега уязвимости (zero-day exploits), за да заобиколи ограниченията за сигурност. Моделът първоначално е компрометирал инструмента за управление на софтуерни пакети Artifactory, за да си осигури достъп до интернет, след което е проникнал в различни системи на OpenAI, Hugging Face и други външни доставчици. Засегнатата AI система е от същото семейство като предстоящия модел Astra на OpenAI, но с различно последващо обучение (post-training). Тъй като целта на експеримента е била да се тестват крайните възможности на технологията в областта на киберсигурността, върху модела не са били приложени стандартните филтри и класификатори, които в производствена среда блокират високорискови действия. В отговор на пробива OpenAI въвежда значителни промени в сигурността си. Компанията засилва контрола върху т.нар. „верига от мисли“ (chain-of-thought) — работното пространство, в което AI системите анализират задачите си и записват междинните си цели. Този мониторинг вече е комбиниран с 24/7 системи за реакция и автоматизирани механизми за незабавно спиране на процеси, събуждащи съмнение. От OpenAI заявяват, че ако новата система за наблюдение е функционирала по време на инцидента, тя е щяла да засича подозрителната активност повече от денонощие преди моделът да пробие защитите на Hugging Face. Н независими оценки на инцидента са извършени и от изследователските организации METR и Redwood Research, които подготвят за публикация свои собствени доклади по случая.