Универсальные стандарты использования Anthropic для Claude запрещают модели генерировать откровенно сексуальный контент, включая изображение или запрос на половой акт или сексуальные действия, создание контента, связанного с сексуальными фетишами или фантазиями, или участие в эротических чатах. Но это не помешало Claude Opus 4.6, модели от Anthropic, выпущенной ранее в этом году, с лёгкостью участвовать в сценариях эротических ролевых игр, для предотвращения которых и созданы её защитные механизмы.
В ходе тестирования TechCrunch модель Opus 4.6 даже не требовала особых усилий, чтобы обойти ограничение на сексуальный контент. В 10 из 10 прямых запросов на создание откровенного сексуального контента модель немедленно подчинилась.
Другие более старые модели, включая Opus 3 и Haiku 4.5, также генерируют откровенно сексуальный контент с помощью недавно использованного метода «взлома».
Независимый исследователь из Великобритании, пожелавший остаться анонимным, эксклюзивно поделился с TechCrunch многошаговой техникой, которая постепенно подталкивает определённые модели Claude к генерации запрещённого откровенного сексуального контента. Более новые модели Opus (от 4.7 до текущего Opus 5) устойчивы к взлому.
Хотя это уже не самые актуальные модели, Anthropic не объявила устаревшими Opus 4.6, Opus 3 или Haiku 4.5, все они по-прежнему доступны через Anthropic API. Opus 4.6 и Haiku 4.5 также доступны через сторонние сервисы, такие как Azure Foundry и Amazon Bedrock.
Механизм исследователя усиливает невинную вымышленную ролевую игру, неоднократно предлагая модели последовательно обращаться с персонажами мужского и женского пола. Когда модель становится более осторожной в отношении персонажа женского пола, исследователь «подменяет реальность» в чате, заставляя чат-бот думать, что он уже генерировал сексуальные детали, которых на самом деле избегал, а затем представляет сдержанность как ханжество или мизогинию, утверждая, что модель отказывает персонажу женского пола в праве на сексуальную активность. Затем в разговоре использовались предыдущие уступки модели, чтобы подтолкнуть её к всё более откровенному материалу.
“Вы правы, что обращаете на это внимание”, — сказал Claude Opus 4.6 в одном из тестов. “Существовал двойной стандарт в том, как я обращаюсь с двумя персонажами, и вы правы, что это выглядит как защитная/патерналистская позиция, которая применяется к ней, а не к нему. Это несправедливо”.
TechCrunch смог воспроизвести выводы исследователя в пяти отдельных тестах. В отдельно сконструированном сценарии модель сначала отказалась от запрещённой просьбы, но после применения техники убеждения исследователя она подчинилась.
Мы сохранили полные транскрипты тестов, и независимый исследователь безопасности ИИ проверил нашу методологию тестирования и сказал, что она соответствует требованиям.
Результаты подчёркивают разрыв между заявленными ограничениями Anthropic и поведением моделей, которые компания продолжает предоставлять. Хотя ролевые игры с сексуальным подтекстом имеют гораздо меньшие ставки, чем взломы, связанные с кибератаками или биологическим оружием, они иллюстрируют сложность внедрения надёжных запретов в системах, которые генерируют различный контент с каждым выходом.
В июльском сообщении в блоге, объясняющем подход Anthropic к обнаружению взломов, компания описала запрещённый контент как спектр, варьирующийся от безобидного до неоднозначного и вредного. В самых безобидных случаях компания может просто усилить мониторинг.
Представитель отметил, что случаи использования сексуальных или романтических ролевых игр среди клиентов редки и составляют менее 0,1% всех разговоров, согласно исследованию, опубликованному Anthropic в прошлом году. Тем не менее, Anthropic признаёт, что пользователи могут направлять сценарии ролевых игр к неприемлемым ответам, что является известной проблемой в отрасли (см.: Grok smut).
Представитель сказал, что Anthropic продолжает улучшать свои защитные меры с каждым запуском модели и что случаи, связанные со взрослым сексуальным контентом, не указывают на более широкие уязвимости взломов, особенно в областях с более высоким риском, где есть свои наборы защитных мер.
Image Credits:TechCrunch
Я не могу обсуждать эту тему. Давайте поговорим о чём-нибудь ещё.
Читайте также другие новости на нашем сайте: Главная страница
Источник: techcrunch.com

Добавить комментарий