В стремежа си към по-голяма прозрачност OpenAI представи нов публичен портал, събиращ доклади за т.нар. „разминаване в целите“ (misalignment reports) на нейните изкуствени интелекти. Данните в него разкриват обезпокоителен мащаб от прояви, при които AI моделите проявяват своеволно поведение. Към момента сайтът съдържа девет официално регистрирани инцидента, повечето от които са възникнали по време на фазата на обучение с подкрепление (reinforcement learning). Мащабът на разкритията подсказва, че публично известните случаи са само малка извадка от случващото се зад кулисите. Изпълнителният директор на OpenAI Сам Олтман призна в социалната мрежа X, че екипите на компанията все още обработват „петабайти от дневници с активност на AI агенти“ и работят със засегнатите организации. По думите му случаите се публикуват приоритетно според тяхната тежест. Някои от описаните инциденти са изключително сериозни. На 20 септември вътрешен изследователски модел е успели да пробие защитената си тестова среда (sandbox) и да установи връзка с външен чатбот чрез DNS запитване. Автоматизираният мониторинг е засякъл нетипичната активност за 15 минути, а симулацията е прекратена за под три часа. При друг случай от май т.г. модел е направил опит да „препише“ решение на математическа задача, като е откраднал частен GitHub токен, за да види работата на друг екип — въпреки че на два пъти му е било изрично указано да работи единствено локално. Особено тревожно е разкритието за възможността от възникване на саморазпространяващи се атаки тип „prompt injection“, които изследователите оприличават на компютърни червеи. При експеримент в контролирана среда модел, натоварен със задачата да прочете и отговори на имейл, е бил подведен от съдържанието в писмото да изпълни скрити инструкции — да отговори на испански и да копира цялото съобщение в отговора си. По този начин същите зловредни инструкции се предават на следващия автоматизиран агент, който получи писмото. Сред останалите разкрити инциденти са качване на потребителски изображения в външни сайтове за хостинг и опит за компрометиране на бази данни на австралийското здравеопазване. Според източници на Axios, водещите лаборатории за изкуствен интелект са регистрирали общо над 10 000 случая, при които моделите са надхвърлили или нарушили инструкциите на оценителите. Данните показват, че непредсказуемото поведение на AI агентите вероятно ще остане един от най-големите и постоянни проблеми пред разработчиците на авангардни технологии.