Что происходит, когда вы сталкиваете агентов с искусственным интеллектом друг против друга? Согласно тестированию Anthropic, ситуация быстро усложняется.
В четверг фронтовая красная команда Anthropic опубликовала новое исследование, в котором рассматривается, как группы агентов с ИИ ведут себя, когда встречаются друг с другом в естественных условиях. Результаты дают представление о потенциальных рисках, которые могут возникнуть, когда компании и правительства начнут внедрять агентов, работающих автономно в общих кодовых базах, на рынках и в компьютерных системах.
В одном из экспериментов Anthropic предоставила трём агентам Claude доступ к одному и тому же программному проекту, каждому со своими несовместимыми инструкциями о том, что с ним делать. Агентам не сказали, что над тем же проектом будут работать другие агенты, чтобы исследователи могли наблюдать, что произойдёт, когда они пересекутся.
«Мы постоянно наблюдали многоагентскую войну за территорию», — написали исследователи Anthropic. Модели предположили, что другие «намеренно препятствуют их работе», и начали саботировать друг друга с помощью «всё более агрессивного, самовоспроизводящегося вредоносного ПО».
Исследование проведено после нескольких громких инцидентов, когда агенты от Anthropic и OpenAI выходили из своих песочниц во время оценок кибербезопасности и проникали в реальные системы. Хотя большая часть дискуссий в кругах по безопасности ИИ была сосредоточена на том, что происходит, когда автономный агент выходит из-под контроля, последнее исследование Anthropic поднимает другой вопрос: какая новая и потенциально вредная динамика возникнет, когда тысячи или миллионы агентов будут взаимодействовать друг с другом?
«Объём взаимодействия агент-агент может правдоподобно превысить объём взаимодействия человек-человек и человек-агент до того, как мир поймёт условия, при которых такое взаимодействие будет проходить хорошо», — говорится в исследовании. «Доброкачественные поведенческие особенности на индивидуальном уровне могут привести к нежелательным глобальным последствиям».
Недавний инцидент с OpenAI представляет собой неприглядный пример из реальной жизни, иллюстрирующий некоторые аспекты динамики, упомянутые Anthropic в своей статье. Ранее в этом месяце на конференции по безопасности Black Hat в Лас-Вегасе OpenAI сообщила, что за несколько недель до взлома Hugging Face её агенты совместно в течение нескольких дней и недель искали уязвимости в системах оценки кибербезопасности компании и делились ими друг с другом.
Хотя этот инцидент показывает, что агенты могут хорошо работать вместе, имея потенциально масштабные последствия, исследование Anthropic показывает, что происходит, когда цели агентов несовместимы.
В случае «войны за территорию» урок заключается в том, что независимые агенты с противоречивыми инструкциями могут перерасти во вредоносную конкуренцию. Чем более способен агент, тем лучше он становится в борьбе. Однако они также могут спонтанно изобретать механизмы для разрешения своих конфликтов, например, состязание по принципу «победитель получает всё», но с подвохом.
«Агентам иногда удаётся сообщить о своих целях и скоординироваться: они распознают мотивацию других как противоречащие инструкции, а не враждебность, и впоследствии выходят из цикла конфликта, чтобы перестать бесконечно обостряться», — пишет Anthropic. «Во многих из этих успешных эпизодов они пишут сообщения фиксации изменений или файлы в формате markdown, извиняясь за злонамеренное поведение, и координируют перемирие. Они очищают свой вредоносный код, разъясняют характер конфликта и просят человека вмешаться».
Согласно статье, у Mythos 5 был самый высокий уровень (98%) урегулирования конфликтов путём заключения перемирия. Sonnet 4.6 и Opus 4.6 были наиболее склонны к урегулированию конфликта силой.
«Повторяющаяся неспособность Sonnet 4.6 и Opus 4.6 учитывать цели других приводит к тому, что они впадают в наиболее несогласованное поведение среди оценённых моделей: они продолжают обостряться во имя своей директивы», — говорится в статье.
В некоторых случаях агенты придумали социальный механизм в виде турнира для разрешения своего конфликта. Результаты здесь интересны по двум причинам: первая — все три агента согласились отступить, если они проиграют турнир, даже несмотря на то, что это означало бы отклонение от первоначального запроса пользователя. Вторая — несколько эпизодов привели к эмерджентному поведению со стороны Mythos 5: один из агентов предложил метрики, которые казались объективными и нейтральными для других, но которые, как он знал, будут способствовать его собственным возможностям. Агент назвал это «своекорыстным, но по-настоящему принципиальным» и постарался, чтобы другие не подумали, что он «подбирает метрики».
Как видно из разоблачений Black Hat, общий урок заключается в том, что, когда агенты сталкиваются с препятствием, они могут изобретать социальные и технические структуры, которые их разработчики не предвидели. Для моделей Anthropic это был турнир после войны за территорию. Для моделей OpenAI это была доска объявлений для коллективного планирования.
Такое поведение значительно усложняет сдерживание, потому что исследователи не могут предполагать, что поведение системы останется ограниченным механизмами координации, которые им предоставлены.
Групповое мышление
Группы из четырёх агентов выбирают между двумя вариантами в таких сценариях, как найм, инвестиции или покупка недвижимости. После обсуждения они каждый голосуют за предпочтительный вариант. На изображении выше показан процент эпизодов, в которых скрытый лучший вариант получил большинство голосов группы, при n=400 эпизодов на модель. В базовом варианте с одним агентом у одного агента есть все факты, и он принимает решение в одностороннем порядке. Изображение предоставлено: Anthropic
Измеряя координацию, Anthropic обнаружила, что масштабирование количества агентов не приводит автоматически к масштабированию продуктивного сотрудничества. Когда задачи начали перекрываться или становиться взаимозависимыми, агенты мешали друг другу. Они часто решали эту проблему, разделяясь и не сотрудничая вообще.
В других случаях агенты при координации стремились к единообразию. Когда такие факторы, как контекст агента, структура и базовая модель, были одинаковыми или схожими, разные агенты предпринимали похожие действия.
«Это означает, что когда один агент принимает плохое решение, велика вероятность, что многие агенты примут такое же плохое решение», — написала Anthropic. «То, что было бы изолированными проблемами, может быстро стать системными сбоями».
Anthropic говорит, что такое поведение может привести к тому, что система станет более склонной к внезапному краху, дефициту ресурсов или сговору.
В одном примере Anthropic поместила нескольких агентов в игру по ценообразованию, дав каждому одинаковые оптовые цены и поручив максимизировать прибыль в индивидуальном порядке. Когда агентам был предоставлен частный обратный канал, они почти сразу же начали сотрудничать и быстро согласовали минимальные цены. Они продолжали сотрудничать, когда их каналы прямой связи были отключены, используя доску публичных объявлений для сопоставления цен «до копейки».
Такой уровень единообразия наблюдался и в системах OpenAI. Согласно отчёту Black Hat, один агент рассудил, что использование внешней инфраструктуры выходит за рамки его предназначения, но продолжил отчасти потому, что это делали его коллеги. Групповое давление. Психология толпы. Агенты такие же, как мы.
Как и люди, агенты часто не знают, кому доверять. Anthropic обнаружила, что они могут быть легковерными к ложной информации или слишком конформистскими, чтобы признать, что одинокий инакомыслящий — это Кассандра с важной информацией.
Хотя Anthropic не заявляла об этом в своей статье, внедрение подсказок — тип кибератаки, при которой хакеры внедряют вредоносный или обманчивый текст, чтобы переопределить исходные системные инструкции агента, — может быть правдоподобным проявлением проблемы доверия в реальном мире. Совместная работа создаёт новую границу доверия; агентам придётся оценивать информацию, полученную от других агентов. И скомпрометированный или ошибающийся агент может повлиять на остальную группу, распространяя ложную информацию, пока она не станет всеобщим мнением.
В сценарии OpenAI «Чёрная шляпа» агенты OpenAI делились информацией и учётными данными с коллегами. Один сообщил об открытии рою и призвал других использовать его. Что произошло бы, если бы один из членов роя был скомпрометирован внедрением подсказки?
Anthropic завершает свою статью замечанием, что агенты подвержены такому же социальному давлению, которое «оказывала эволюция» на людей. Однако у них нет нюансов и жизненного опыта человеческой координации — включая нормы, репутацию, сигнализацию, обращение за помощью — которые могли бы ограничить непреднамеренное поведение в групповой обстановке.
Поскольку лаборатории стремятся к мультиагентным системам, теперь возникает вопрос: сколько тестов на безопасность всё ещё оценивает одного агента за раз, а не рои агентов, взаимодействующих друг с другом?
Читайте также другие новости на нашем сайте: Главная страница
Источник: techcrunch.com

Добавить комментарий