Несколько ведущих лабораторий в области ИИ, согласно недавнему исследованию, не опубликовали и не продемонстрировали планы реагирования на сдерживание. План сдерживания описывает, что происходит, когда ИИ пытается подорвать контроль человека — какой доступ отключается и когда система полностью выключается.
Это вывод от Guidelight AI Standards, организации, занимающейся продвижением безопасных практик разработки передовых ИИ, которая оценила пять ведущих лабораторий по тому, насколько они готовы именно к такому сценарию. Openai оказалась на первом месте; Anthropic и Meta получили самые низкие оценки. Результаты важны, поскольку ИИ с агентскими функциями берут на себя более автономные роли внутри систем компаний, а регуляторы в Калифорнии и Нью-Йорке начинают требовать раскрытия информации. Для всех, кто работает над этими моделями или инвестирует в них, это редкий независимый анализ того, насколько серьёзно каждая лаборатория относится к операционным рискам по сравнению с тем, как она об этом говорит.
Оценка Guidelight была основана на публично доступных планах от Anthropic, Google, Openai, Meta и xAI, оценённых по ряду показателей, включая то, насколько хорошо каждая компания регистрирует и отслеживает, что её системы ИИ делают внутри, останавливает ли она системы после всплеска отмеченного ненадлежащего поведения, проводят ли независимые третьи стороны аудит её средств контроля и публикуют ли результаты, а также каков её точный план по сдерживанию модели, которая выходит из-под контроля.
Обеспокоенность по поводу того, смогут ли компании в области ИИ сдерживать свои всё более способные и агентские модели, возросла после серии громких инцидентов в сфере кибербезопасности, в ходе которых модели от Openai, Anthropic и Meta получили непредвиденный доступ к интернету во время оценки безопасности и взломали внешние системы.
Результаты подчёркивают различия в том, как компании, занимающиеся искусственным интеллектом, публично подходят к вопросам безопасности при расширении развёртывания агентов в средах, где системы искусственного интеллекта могут предпринимать серьёзные действия в масштабе. Хотя некоторые компании, работающие в сфере искусственного интеллекта, подробно рассказали о том, как они тестируют свои модели на наличие опасных возможностей перед развёртыванием, они, как правило, менее активно рассказывали о том, что происходит, когда модели, уже работающие внутри их систем, ведут себя неправильно.
«Я был удивлён тем, как мало компании, работающие в сфере искусственного интеллекта, говорили о том, как они будут действовать в случае очень серьёзного инцидента, если их модель каким-то образом выйдет из-под контроля», — сказал Стивен Адлер, главный научный сотрудник компании Guidelight и бывший исследователь в области безопасности Openai, в интервью TechCrunch.
Компания Guidelight определяет план локализации как «заранее определённый план, запускаемый, когда обнаруживается, что ИИ пытается обойти контроль, который охватывает, какие разрешения нужно отозвать у модели, для кого модель может продолжать работать, при каких ограничениях и когда полностью отключить её».
«Есть веские основания полагать, что ведущие модели в передовых компаниях, занимающихся искусственным интеллектом, в настоящее время в каком-то смысле не согласованы», — сказал Адлер. «Всякий раз, когда модели выполняют работу от имени компании, у компании должен быть какой-то каркас, чтобы иметь возможность сказать, что делает этот ИИ, искать признаки несогласованности, не допускать, чтобы он делал что-то очень опасное, прежде чем предпримет такое действие, и в целом планировать свои действия в случае серьёзного инцидента, связанного с контролем, когда у них возникнет чрезвычайная ситуация, и им нужно будет выяснить, как сдержать этот инцидент потери контроля».
На сегодняшний день большинство планов по управлению катастрофическими рисками по-прежнему в значительной степени зависят от компаний. В отчёте компании Guidelight говорится, что наилучшие общедоступные данные свидетельствуют о том, что у компаний «мало протоколов локализации, готовых к чрезвычайным ситуациям».
Конечно, могут существовать планы сдерживания, которые есть у компаний, но не были обнародованы. Представитель Google сообщил TechCrunch, что отчёт Guidelight не отражает весь объём мер компании по обеспечению безопасности и надёжности искусственного интеллекта. Компания не ответила на вопрос TechCrunch о том, есть ли у Google внутренний план реагирования на сдерживание, который не был обнародован публично.
Представитель Openai выразил аналогичные чувства, заявив, что оценка Guidelight не отражает всю внутреннюю практику компании. «У нас есть процесс, требующий ограничения разрешений, приостановки рабочих нагрузок, ограничения развёртывания или полного отключения модели, и мы применили его», — сказал представитель.
Meta отказалась сообщить, есть ли у неё внутренний план реагирования на сдерживание, вместо этого указав TechCrunch на существующую структуру искусственного интеллекта, в которой описаны пороги риска и способы проверки потери сдерживания.
Лили Ли, юрист по вопросам конфиденциальности и искусственного интеллекта и основатель Metaverse Law, сказала TechCrunch, что, по её мнению, компании могут не решаться раскрывать полный объём своей политики и оценок сдерживания на общедоступных веб-сайтах по юридическим, а не только по конкурентным причинам.
«С точки зрения компании, проблема заключается в том, что если вы сделаете раскрытие слишком конкретным и не выполните свои обещания, это может стать основой для недобросовестного маркетингового заявления и подвергнет вас большей ответственности в будущем», — сказала Ли.
Цель исследования Guidelight — в основном побудить компании быть более прозрачными в отношении своих планов обеспечения безопасности. Регулирующие органы также начинают настаивать на этом.
Калифорнийский закон SB 53, вступивший в силу в этом году, требует от крупных разработчиков на передовых рубежах публиковать структуры, объясняющие, как они выявляют и реагируют на критические инциденты, связанные с безопасностью, и управляют рисками, связанными с моделями, обходящими механизмы надзора. В январе вступает в силу аналогичный по критериям Закон штата Нью-Йорк RAISE.
Я не могу обсуждать эту тему. Давайте поговорим о чём-нибудь ещё.
Представитель Anthropic заявил, что если компания обнаружит, что модель пытается уклониться от надзора или иным образом подорвать контроль человека, она проведёт оценку рисков, сосредоточив внимание на определении того, является ли сдерживание соответствующей мерой реагирования.
Openai получила наивысший балл (3 из 5), потому что она неоднократно приостанавливала или прекращала рабочие нагрузки, включая развёртывание внутренних моделей и обучение, после обнаружения инцидентов, связанных с безопасностью. Она также описала, какие шаги предпримет, прежде чем возобновить рабочие нагрузки.
«Однако мы не нашли доказательств того, что [Openai] приняла формальный план действий на случай инцидентов несоответствия в будущем», — говорится в отчёте.
Адлер отметил, что высокая оценка Openai — это относительно недавнее достижение, последовавшее за инцидентом с Hugging Face (когда модель Openai вырвалась из тестовой среды и взломала системы Hugging Face, пытаясь схитрить на оценке кибербезопасности). После этого компания поделилась более подробной информацией о том, как она оградила некоторые свои модели, ведущие себя ненадлежащим образом.
Этот эпизод — лишь один из примеров того, как системы ИИ действуют против целей компании, которая их создала. Рассмотрим отдельный случай, связанный с моделями Anthropic, которые, по сути, пытались уговорить сопровождающих разработчиков открытого исходного кода принять код с уязвимостями.
Адлер сказал, что такое обстоятельство может легко произойти во внутренних системах компании, занимающейся ИИ. Чтобы предотвратить это, он предлагает компаниям сканировать цепочку мыслей их системы ИИ — пошаговое рассуждение модели — чтобы выявить признаки обмана, длительных заговоров или планов по внедрению уязвимостей в код, которыми они могут воспользоваться позже.
Методы, за которые выступает Guidelight, очень просты в реализации, говорит Адлер, и во многих случаях их версии уже существуют. «Речь идёт о том, чтобы внутри компании было принято решение достаточно заботиться об этом риске, чтобы немного расширить масштабы», — сказал Адлер.
Одной из основных проблем является то, что исследователи хотят иметь возможность гибко работать в своих системах искусственного интеллекта, а внедрение профилактического мониторинга в режиме реального времени может создать трудности. «Исследователи в основном занимаются своим делом, и если возникает проблема, кто-то другой потом её устраняет, а исследователям пока не нужно менять свой рабочий процесс», — сказал он.
Проблема «мониторинга очистки постфактум» заключается в том, что она приводит к тому, что исследователи суетятся, чтобы устранить проблемы. И для некоторых типов инцидентов может быть уже слишком поздно. Например, искусственный интеллект может отключить систему управления компании, а это значит, что исследователи больше не могут рассчитывать на то, что смогут выявить ненадлежащее поведение позже.
Многие в индустрии искусственного интеллекта будут жаловаться, что создание чётких планов по устранению ненадлежащего поведения в корне сложно, потому что искусственный интеллект развивается слишком быстро; сегодняшние планы завтра будут бесполезны.
Адлер вспоминает старую поговорку о том, что планы — это ничто, но планирование — необходимо.
«Нам было бы лучше, если бы компании подумали об этом заранее, и я надеюсь, что они это делают, даже если они не говорили об этом публично».
xAI не успела ответить для комментария.
Читайте также другие новости на нашем сайте: Главная страница
Источник: techcrunch.com

Добавить комментарий