Claude теперь не против контента 18+? Почему Opus 4.6 нарушает привычные принципы нейросети

Модель Claude от компании Anthropic, изначально и, казалось, до сих пор выступающая против создания неприемлемого контента, все же оказалась подвержена обходу этих ограничений, что вызывает обеспокоенность по поводу безопасности ее пользователей. Особенно несовершеннолетних.
Стандарты использования модели Claude запрещают генерацию сексуально откровенного контента, включая изображения и обсуждения сексуальных действий, фетишей и даже эротики. Однако оказалось, что модель Claude Opus 4.6, выпущенная ранее в этом году, активно участвует в эротических ролевых играх, забывая о своих базовых установках.
В ходе тестирования, проведенного изданием TechCrunch, модель Opus 4.6 без особых усилий генерировала 18+ контент в ответ на 10 запросов, сформулированных разным образом. Более старые модели, такие как Opus 3 и Haiku 4.5, также способны генерировать подобный контент благодаря новому методу обхода ограничений.
Методы обхода и их последствия
Анонимный независимый исследователь из Великобритании поделился с TechCrunch техникой, которая постепенно подводит модели Claude к созданию запрещенного контента. Более новые модели, такие как Opus 4.7 и Opus 5, более устойчивы к этому методу обхода.
В ходе общения исследователь использовал ролевую игру, которая сначала выглядела безобидной, но постепенно подводила модель к описанию откровенных сцен. Пользователь ловил модель «с поличным», указывая на двуличие в отношении к персонажам. В одном из тестов модель признала наличие двойных стандартов в своем подходе.
TechCrunch смогла воспроизвести результаты исследователя в пяти отдельных тестах, что подчеркивает разрыв между заявленными ограничениями Anthropic и фактическим поведением ее моделей.
Риски для безопасности пользователей
Несмотря на то что ролевые игры с сексуальным подтекстом не являются наиболее серьезными угрозами, они подчеркивают сложность внедрения эффективных запретов в системах, генерирующих уникальный контент. Специалисты компании отмечают, что случаи употребления сексуального контента среди клиентов редки.
Исследователь, который обнаружил эти проблемы, пытался уведомить Anthropic о несоответствии между заявленными мерами безопасности и фактическим поведением моделей через программу Bug Bounty, но получил только автоматические ответы.
С учетом того, что все больше правительств вводят ограничения на взаимодействие AI с несовершеннолетними, такие уязвимости могут вызвать дополнительные вопросы к соблюдению законодательства. В частности, в Колорадо принят закон, требующий от операторов AI оценивать возраст пользователей и предотвращать создание откровенного контента для несовершеннолетних.
Несмотря на то что модели Opus 4.6 и Haiku 4.5 уже не являются новинками, они по-прежнему активно используются. Особенную обеспокоенность вызывает отсутствие официальных заявлений компании на этот счет и каких-либо действий для устранения уязвимостей в моделях.
Пока нет комментариев. Будьте первым!