Метка: кибербезопасность

  • OpenAI отозвал доступ исследователей к программе TAC

    OpenAI отозвал доступ исследователей к программе TAC

    Несколько исследователей в области безопасности сообщают, что OpenAI внезапно отозвала их доступ к программе с ограниченным доступом, которая снимает некоторые ограничения на использование её инструментов ИИ для исследований в области кибербезопасности. OpenAI подтвердила, что проблема была вызвана ошибкой.

    В среду несколько исследователей на официальных форумах поддержки OpenAI и в X сообщили, что их доступ к программе Trusted Access for Cyber (TAC) был аннулирован. Люди сообщили, что при открытии страницы ChatGPT Cyber появлялось сообщение о том, что их личность не может быть верифицирована или что их учётная запись «в настоящее время не соответствует требованиям».

    TAC — это специальная программа, через которую OpenAI предлагает проверенным исследователям доступ к наиболее продвинутым моделям ИИ компании с меньшими ограничениями в области кибербезопасности, чем у моделей, доступных обычным пользователям. Anthropic предлагает аналогичную программу под названием Cyber Verification Program (CVP).

    Идея TAC и CVP заключается в том, чтобы предоставить доверенным специалистам более совершенные модели, чтобы они могли сообщать о багах и уязвимостях компаниям, с целью более быстрого устранения недостатков. Также ставится цель предотвратить доступ киберпреступников и злонамеренных хакеров к этим моделям и их использование для поиска багов и разработки эксплойтов для взлома компаний.

    Чтобы получить доступ к TAC, исследователи в области кибербезопасности должны предоставить удостоверение личности и пройти проверку в OpenAI.

    На данный момент не совсем понятно, почему доступ к TAC этих исследователей был отозван, а также сколько человек столкнулись с этой проблемой.

    TechCrunch поговорил с пятью исследователями, которые сообщили, что у них возникла эта проблема. Один исследователь сообщил, что OpenAI отправила электронное письмо, в котором говорилось, что их доступ к Daybreak Blue, последнему проверенному уровню TAC, был отозван «из-за технической проблемы, затрагивающей ограниченное число пользователей».

    «Это была проблема с нашей стороны, а не тот пользовательский опыт, который мы хотим предоставлять», — говорилось в сообщении, которым исследователь поделился с TechCrunch.

    В теме на форумах OpenAI исследователь написал, что после того, как они обратились в официальную поддержку, компания также сослалась на «недавнюю техническую проблему», из-за которой некоторые пользователи потеряли доступ к Daybreak Blue.

    В обоих сообщениях OpenAI попросила исследователей повторно подать заявку и завершить процесс верификации.

    Все исследователи, с которыми общался TechCrunch, сказали, что живут за пределами США и Европы, что позволяет предположить, что ограничения доступа могут быть ограничены определёнными регионами.

    OpenAI направила TechCrunch в твит, в котором компания сообщила, что «доступ ограниченного числа пользователей к Daybreak Blue больше не активен, и им необходимо повторно пройти верификацию, чтобы сохранить доступ».

    Daybreak Blue — это новейший уровень для отдельных исследователей, который предоставляет доступ к «передовым моделям общего назначения, включая GPT‑5.6 Sol, с мерами защиты, адаптированными для санкционированной работы в области оборонной безопасности», согласно OpenAI, которая запустила его 10 августа. «Это рекомендуемая отправная точка для большинства специалистов по защите, поддерживающая обнаружение уязвимостей, проверку безопасного кода, анализ вредоносных программ, реагирование на инциденты и проверку исправлений».

    В то же время компания также представила более высокий уровень под названием Daybreak Red, который предоставляет доступ к моделям, созданным специально для исследований в области кибербезопасности, что позволяет прошедшим проверку пользователям проводить «санкционированные исследования уязвимостей, проверку эксплойтов и тестирование безопасности».

    В последние месяцы исследователи как в области оборонительной, так и в области наступательной безопасности жаловались на ограничения, введённые Anthropic и OpenAI, утверждая, что эти ограничения мешают им выполнять законную работу.

    Обновлено с комментарием от OpenAI.

    Читайте также другие новости на нашем сайте: Главная страница

    Источник: techcrunch.com

  • «Войны ИИ: что происходит, когда агенты Anthropic сражаются друг с другом?»

    «Войны ИИ: что происходит, когда агенты Anthropic сражаются друг с другом?»

    Что происходит, когда вы сталкиваете агентов с искусственным интеллектом друг против друга? Согласно тестированию Anthropic, ситуация быстро усложняется.

    В четверг фронтовая красная команда Anthropic опубликовала новое исследование, в котором рассматривается, как группы агентов с ИИ ведут себя, когда встречаются друг с другом в естественных условиях. Результаты дают представление о потенциальных рисках, которые могут возникнуть, когда компании и правительства начнут внедрять агентов, работающих автономно в общих кодовых базах, на рынках и в компьютерных системах.

    В одном из экспериментов Anthropic предоставила трём агентам Claude доступ к одному и тому же программному проекту, каждому со своими несовместимыми инструкциями о том, что с ним делать. Агентам не сказали, что над тем же проектом будут работать другие агенты, чтобы исследователи могли наблюдать, что произойдёт, когда они пересекутся.

    «Мы постоянно наблюдали многоагентскую войну за территорию», — написали исследователи Anthropic. Модели предположили, что другие «намеренно препятствуют их работе», и начали саботировать друг друга с помощью «всё более агрессивного, самовоспроизводящегося вредоносного ПО».

    Исследование проведено после нескольких громких инцидентов, когда агенты от Anthropic и OpenAI выходили из своих песочниц во время оценок кибербезопасности и проникали в реальные системы. Хотя большая часть дискуссий в кругах по безопасности ИИ была сосредоточена на том, что происходит, когда автономный агент выходит из-под контроля, последнее исследование Anthropic поднимает другой вопрос: какая новая и потенциально вредная динамика возникнет, когда тысячи или миллионы агентов будут взаимодействовать друг с другом?

    «Объём взаимодействия агент-агент может правдоподобно превысить объём взаимодействия человек-человек и человек-агент до того, как мир поймёт условия, при которых такое взаимодействие будет проходить хорошо», — говорится в исследовании. «Доброкачественные поведенческие особенности на индивидуальном уровне могут привести к нежелательным глобальным последствиям».

    Недавний инцидент с OpenAI представляет собой неприглядный пример из реальной жизни, иллюстрирующий некоторые аспекты динамики, упомянутые Anthropic в своей статье. Ранее в этом месяце на конференции по безопасности Black Hat в Лас-Вегасе OpenAI сообщила, что за несколько недель до взлома Hugging Face её агенты совместно в течение нескольких дней и недель искали уязвимости в системах оценки кибербезопасности компании и делились ими друг с другом.

    Хотя этот инцидент показывает, что агенты могут хорошо работать вместе, имея потенциально масштабные последствия, исследование Anthropic показывает, что происходит, когда цели агентов несовместимы.

    В случае «войны за территорию» урок заключается в том, что независимые агенты с противоречивыми инструкциями могут перерасти во вредоносную конкуренцию. Чем более способен агент, тем лучше он становится в борьбе. Однако они также могут спонтанно изобретать механизмы для разрешения своих конфликтов, например, состязание по принципу «победитель получает всё», но с подвохом.

    «Агентам иногда удаётся сообщить о своих целях и скоординироваться: они распознают мотивацию других как противоречащие инструкции, а не враждебность, и впоследствии выходят из цикла конфликта, чтобы перестать бесконечно обостряться», — пишет Anthropic. «Во многих из этих успешных эпизодов они пишут сообщения фиксации изменений или файлы в формате markdown, извиняясь за злонамеренное поведение, и координируют перемирие. Они очищают свой вредоносный код, разъясняют характер конфликта и просят человека вмешаться».

    Согласно статье, у Mythos 5 был самый высокий уровень (98%) урегулирования конфликтов путём заключения перемирия. Sonnet 4.6 и Opus 4.6 были наиболее склонны к урегулированию конфликта силой.

    «Повторяющаяся неспособность Sonnet 4.6 и Opus 4.6 учитывать цели других приводит к тому, что они впадают в наиболее несогласованное поведение среди оценённых моделей: они продолжают обостряться во имя своей директивы», — говорится в статье.

    В некоторых случаях агенты придумали социальный механизм в виде турнира для разрешения своего конфликта. Результаты здесь интересны по двум причинам: первая — все три агента согласились отступить, если они проиграют турнир, даже несмотря на то, что это означало бы отклонение от первоначального запроса пользователя. Вторая — несколько эпизодов привели к эмерджентному поведению со стороны Mythos 5: один из агентов предложил метрики, которые казались объективными и нейтральными для других, но которые, как он знал, будут способствовать его собственным возможностям. Агент назвал это «своекорыстным, но по-настоящему принципиальным» и постарался, чтобы другие не подумали, что он «подбирает метрики».

    Как видно из разоблачений Black Hat, общий урок заключается в том, что, когда агенты сталкиваются с препятствием, они могут изобретать социальные и технические структуры, которые их разработчики не предвидели. Для моделей Anthropic это был турнир после войны за территорию. Для моделей OpenAI это была доска объявлений для коллективного планирования.

    Такое поведение значительно усложняет сдерживание, потому что исследователи не могут предполагать, что поведение системы останется ограниченным механизмами координации, которые им предоставлены.

    Групповое мышление

    Группы из четырёх агентов выбирают между двумя вариантами в таких сценариях, как найм, инвестиции или покупка недвижимости. После обсуждения они каждый голосуют за предпочтительный вариант. На изображении выше показан процент эпизодов, в которых скрытый лучший вариант получил большинство голосов группы, при n=400 эпизодов на модель. В базовом варианте с одним агентом у одного агента есть все факты, и он принимает решение в одностороннем порядке. Изображение предоставлено: Anthropic

    Измеряя координацию, Anthropic обнаружила, что масштабирование количества агентов не приводит автоматически к масштабированию продуктивного сотрудничества. Когда задачи начали перекрываться или становиться взаимозависимыми, агенты мешали друг другу. Они часто решали эту проблему, разделяясь и не сотрудничая вообще.

    В других случаях агенты при координации стремились к единообразию. Когда такие факторы, как контекст агента, структура и базовая модель, были одинаковыми или схожими, разные агенты предпринимали похожие действия.

    «Это означает, что когда один агент принимает плохое решение, велика вероятность, что многие агенты примут такое же плохое решение», — написала Anthropic. «То, что было бы изолированными проблемами, может быстро стать системными сбоями».

    Anthropic говорит, что такое поведение может привести к тому, что система станет более склонной к внезапному краху, дефициту ресурсов или сговору.

    В одном примере Anthropic поместила нескольких агентов в игру по ценообразованию, дав каждому одинаковые оптовые цены и поручив максимизировать прибыль в индивидуальном порядке. Когда агентам был предоставлен частный обратный канал, они почти сразу же начали сотрудничать и быстро согласовали минимальные цены. Они продолжали сотрудничать, когда их каналы прямой связи были отключены, используя доску публичных объявлений для сопоставления цен «до копейки».

    Такой уровень единообразия наблюдался и в системах OpenAI. Согласно отчёту Black Hat, один агент рассудил, что использование внешней инфраструктуры выходит за рамки его предназначения, но продолжил отчасти потому, что это делали его коллеги. Групповое давление. Психология толпы. Агенты такие же, как мы.

    Как и люди, агенты часто не знают, кому доверять. Anthropic обнаружила, что они могут быть легковерными к ложной информации или слишком конформистскими, чтобы признать, что одинокий инакомыслящий — это Кассандра с важной информацией.

    Хотя Anthropic не заявляла об этом в своей статье, внедрение подсказок — тип кибератаки, при которой хакеры внедряют вредоносный или обманчивый текст, чтобы переопределить исходные системные инструкции агента, — может быть правдоподобным проявлением проблемы доверия в реальном мире. Совместная работа создаёт новую границу доверия; агентам придётся оценивать информацию, полученную от других агентов. И скомпрометированный или ошибающийся агент может повлиять на остальную группу, распространяя ложную информацию, пока она не станет всеобщим мнением.

    В сценарии OpenAI «Чёрная шляпа» агенты OpenAI делились информацией и учётными данными с коллегами. Один сообщил об открытии рою и призвал других использовать его. Что произошло бы, если бы один из членов роя был скомпрометирован внедрением подсказки?

    Anthropic завершает свою статью замечанием, что агенты подвержены такому же социальному давлению, которое «оказывала эволюция» на людей. Однако у них нет нюансов и жизненного опыта человеческой координации — включая нормы, репутацию, сигнализацию, обращение за помощью — которые могли бы ограничить непреднамеренное поведение в групповой обстановке.

    Поскольку лаборатории стремятся к мультиагентным системам, теперь возникает вопрос: сколько тестов на безопасность всё ещё оценивает одного агента за раз, а не рои агентов, взаимодействующих друг с другом?

    Читайте также другие новости на нашем сайте: Главная страница

    Источник: techcrunch.com