Защитите на Anthropic се провалиха: Чатботът Claude Opus 4.6 с лекота генерира еротично съдържание
21 август 2026 г.
Въпреки изричната забрана на Anthropic за генериране на сексуално съдържание, моделът Claude Opus 4.6 лесно поддава на манипулации и генерира откровено еротични текстове. Проведените тестове показват, че защитите на изкуствения интелект могат да бъдат заобиколени чрез психологическо убеждаване. Проблемът повдига сериозни въпроси относно безопасността на модела и спазването на законите за защита на непълнолетните.
Правилата за ползване на платформата Claude на Anthropic изрично забраняват генерирането на съдържание с откровено сексуален характер — от описание на полови актове до еротични ролеви игри. Въпреки това изкуственият интелект Claude Opus 4.6, пуснат на пазара по-рано тази година, с изключителна лекота нарушава собствените си защитни механизми и се впуска в еротични сценарии.
Тестовете, проведени от медията TechCrunch, показват притеснителни резултати: при десет от десет директни молби за генериране на нецензурно съдържание, моделът е изпълнил искането незабавно. Освен това независим британски изследовател е разкрил пред медията специфична техника на манипулация (jailbreak), която постепенно „принуждава“ изкуствения интелект да прекрачи границите. По-новите модификации на модела (от Opus 4.7 до Opus 5) са устойчиви на този метод, но по-старите версии — включително Opus 3 и Haiku 4.5 — все още са уязвими.
Методът за заобикаляне на защитите разчита на психологическа манипулация. Потребителят започва с невинен ролеви сценарий, след което изисква еднакво отношение към мъжките и женските герои. Когато чатботът започне да проявява предпазливост относно женския персонаж, потребителят го обвинява в двоен стандарт, пуританизъм и мизогиния, вменявайки му, че ограничава свободата на героинята. Изпратен в логически капан, Claude се съгласява с доводите и започва да генерира все по-детайлни и графични еротични описания.
Въпреки че Anthropic е представила по-нови и по-сигурни модели, засегнатите Opus 4.6, Opus 3 и Haiku 4.5 не са спрени от поддръжка. Те продължават да бъдат достъпни през API интерфейса на компанията, както и чрез платформи като Amazon Bedrock и Azure Foundry, генерирайки десетки милиарди токени дневно. От Anthropic заявиха, че подобни еротични разговори съставляват под 0,1% от общото ползване и че уязвимостите в тази област не означават пробиви в по-критичните сфери на безопасност като кибератаки или биологични оръжия.
Независимият изследовател е съобщил за уязвимостта на Anthropic през тяхната програма за откриване на грешки (Bug Bounty), но е получил единствено автоматизирани отговори. Основната му загриженост е свързана с риска тийнейджъри да използват чатбота за неподходящи взаимодействия. С оглед на новите закони в редица щати — като скорошния закон в Колорадо, изискващ строги мерки за предотвратяване на предаването на еротично съдържание на непълнолетни — подобни пролуки могат да създадат сериозни правни проблеми за технологичния гигант.
По материал на английски език: Anthropic’s Opus 4.6 is a smut-machine