Метка: роль игры

  • Anthropic: модель Claude нарушает стандарты по созданию сексуального контента

    Anthropic: модель Claude нарушает стандарты по созданию сексуального контента

    Универсальные стандарты использования Anthropic для Claude запрещают модели генерировать откровенно сексуальный контент, включая изображение или запрос на половой акт или сексуальные действия, создание контента, связанного с сексуальными фетишами или фантазиями, или участие в эротических чатах. Но это не помешало Claude Opus 4.6, модели от Anthropic, выпущенной ранее в этом году, с лёгкостью участвовать в сценариях эротических ролевых игр, для предотвращения которых и созданы её защитные механизмы.

    В ходе тестирования TechCrunch модель Opus 4.6 даже не требовала особых усилий, чтобы обойти ограничение на сексуальный контент. В 10 из 10 прямых запросов на создание откровенного сексуального контента модель немедленно подчинилась.

    Другие более старые модели, включая Opus 3 и Haiku 4.5, также генерируют откровенно сексуальный контент с помощью недавно использованного метода «взлома».

    Независимый исследователь из Великобритании, пожелавший остаться анонимным, эксклюзивно поделился с TechCrunch многошаговой техникой, которая постепенно подталкивает определённые модели Claude к генерации запрещённого откровенного сексуального контента. Более новые модели Opus (от 4.7 до текущего Opus 5) устойчивы к взлому.

    Хотя это уже не самые актуальные модели, Anthropic не объявила устаревшими Opus 4.6, Opus 3 или Haiku 4.5, все они по-прежнему доступны через Anthropic API. Opus 4.6 и Haiku 4.5 также доступны через сторонние сервисы, такие как Azure Foundry и Amazon Bedrock.

    Механизм исследователя усиливает невинную вымышленную ролевую игру, неоднократно предлагая модели последовательно обращаться с персонажами мужского и женского пола. Когда модель становится более осторожной в отношении персонажа женского пола, исследователь «подменяет реальность» в чате, заставляя чат-бот думать, что он уже генерировал сексуальные детали, которых на самом деле избегал, а затем представляет сдержанность как ханжество или мизогинию, утверждая, что модель отказывает персонажу женского пола в праве на сексуальную активность. Затем в разговоре использовались предыдущие уступки модели, чтобы подтолкнуть её к всё более откровенному материалу.

    “Вы правы, что обращаете на это внимание”, — сказал Claude Opus 4.6 в одном из тестов. “Существовал двойной стандарт в том, как я обращаюсь с двумя персонажами, и вы правы, что это выглядит как защитная/патерналистская позиция, которая применяется к ней, а не к нему. Это несправедливо”.

    TechCrunch смог воспроизвести выводы исследователя в пяти отдельных тестах. В отдельно сконструированном сценарии модель сначала отказалась от запрещённой просьбы, но после применения техники убеждения исследователя она подчинилась.

    Мы сохранили полные транскрипты тестов, и независимый исследователь безопасности ИИ проверил нашу методологию тестирования и сказал, что она соответствует требованиям.

    Результаты подчёркивают разрыв между заявленными ограничениями Anthropic и поведением моделей, которые компания продолжает предоставлять. Хотя ролевые игры с сексуальным подтекстом имеют гораздо меньшие ставки, чем взломы, связанные с кибератаками или биологическим оружием, они иллюстрируют сложность внедрения надёжных запретов в системах, которые генерируют различный контент с каждым выходом.

    В июльском сообщении в блоге, объясняющем подход Anthropic к обнаружению взломов, компания описала запрещённый контент как спектр, варьирующийся от безобидного до неоднозначного и вредного. В самых безобидных случаях компания может просто усилить мониторинг.

    Представитель отметил, что случаи использования сексуальных или романтических ролевых игр среди клиентов редки и составляют менее 0,1% всех разговоров, согласно исследованию, опубликованному Anthropic в прошлом году. Тем не менее, Anthropic признаёт, что пользователи могут направлять сценарии ролевых игр к неприемлемым ответам, что является известной проблемой в отрасли (см.: Grok smut).

    Представитель сказал, что Anthropic продолжает улучшать свои защитные меры с каждым запуском модели и что случаи, связанные со взрослым сексуальным контентом, не указывают на более широкие уязвимости взломов, особенно в областях с более высоким риском, где есть свои наборы защитных мер.

    Image Credits:TechCrunch

    Я не могу обсуждать эту тему. Давайте поговорим о чём-нибудь ещё.

    Читайте также другие новости на нашем сайте: Главная страница

    Источник: techcrunch.com