Обучението на модели с изкуствен интелект чрез други AI системи се превръща в една от основните цели за водещите технологични лаборатории. Нов научен доклад от изследователската програма на Anthropic дава ясна представа как този процес може да функционира на практика. Изследването, озаглавено „Automated Researchers Can Reliably Mitigate Alignment Failures“, разкрива как автоматизирани системи могат надеждно да подобрят представянето на даден модел спрямо тестове за безопасност и правилно поведение (alignment). Под ръководството на учения Chen Yueh-Han, системата е била подложена на 10 специфични бенчмарка за нежелано поведение и е успяла да подобри резултатите по всеки един от тях, без да влоши общата си производителност. Разработката възпроизвежда голяма част от традиционния научен подход: алгоритъмът сканира наличната литература, предлага нов метод и обучава модела в продължение на 30 минути. Работещите методи се запазват, а неефективните се отхвърлят, което позволява процеса да се развива с висока скорост и в голям мащаб. Авторите на доклада посочват, че това са първите доказателства за практическата приложимост на автоматизираното подравняване в близко бъдеще. Публикацията прави важна крачка към т.нар. рекурсивно самоусъвършенстване — идея, при която AI подобрява собствените си модели до степен, в която човешката намеса може да стане излишна. Автоматизираният изследовател (Automated Alignment Researcher или AAR) се сравнява директно с човешкия си еквивалент, като данните показват, че AAR успява да генерира по-добри методи от опитни експерти средно за около шест часа. Икономическият фактор също е категоричен. Потвърдените разходи за AAR са едва около 4 долара на час за API заявки, докато цената за ангажирането на човешки изследовател в компанията възлиза на близо 150 долара на час. Въпреки впечатляващите резултати, от Anthropic обръщат внимание и на ограниченията. Автоматизираната система разчита изцяло на това доколко заложените бенчмаркове отразяват реалните цели за безопасност. Създаването, поддръжката и обновяването на тези тестове, както и захранването на системата с актуална научна литература, все още изискват значителна работа от страна на хората.