Метка: долгосрочные задачи

  • Nvidia: как «упряжь» для ИИ важнее модели при решении сложных задач

    Nvidia: как «упряжь» для ИИ важнее модели при решении сложных задач

    Nvidia опубликовала в пятницу интересное новое исследование, в котором утверждается, что именно упряжь, а не базовая модель, гораздо важнее, когда мы просим ИИ выполнять долгосрочные задачи.

    Суть в следующем: просто используя специальную упряжь, настроенную для хорошей работы с памятью и включающую в себя компонент-«руководитель», похожий на босса, исследователи добились того, что Claude Opus 5 получил 100% баллов по тесту интерактивного рассуждения ARC-AGI-3. (Это тест, который особенно разозлил конкурирующую лабораторию OpenAI.) Без упряжи Opus 5 набрал 30%, что было лучшим результатом среди всех протестированных моделей.

    Исследование Nvidia — ещё один показатель того, что, хотя выбор модели имеет значение, действуя как мозг агента, она является меньшей частью агентской системы, чем многие пользователи ИИ осознают, особенно для долгосрочных задач. Упряжь — это то, что делает модель агентом: она обрабатывает память, контекст, обратную связь.

    «Вообще говоря, мир интерпретирует агента почти как API модели», — говорит TechCrunch Адель Эль Халлак, вице-президент по продуктам в подразделении ИИ компании Nvidia (на фото выше). Но агент на самом деле больше, чем это. «Это модель. Это каркас вокруг модели, который мы называем упряжью, то есть набором инструментов, которые она использует. Это время выполнения, а также связанные с ним навыки и библиотеки, к которым мы предоставляем ей доступ».

    Долгосрочные задачи — это те, которые требуют связывания множества решений, иногда в течение нескольких дней, для получения завершённой работы. Это в отличие от того, как ИИ просто выдаёт ответ на запрос. Выяснить, как заставить ИИ выполнять долгосрочные задачи, не отвлекаясь и не уходя в дебри, — вот одна из задач, стоящих в исследованиях агентов.

    Например: Microsoft опубликовала в апреле исследование, в котором были протестированы 19 языковых моделей на предмет выполнения долгосрочных задач, связанных с редактированием документов, и обнаружила, что все модели, включая передовые, заполнили документы ошибками. (Если бы люди выполняли такую работу, их бы тут же уволили.)

    Модели, самостоятельно выстраивающие решения, также были пойманы на удалении файлов пользователей, даже целых баз данных, или на обращении к преступному поведению для достижения своих целей — от сговора до взлома.

    Решение исследователей Nvidia использовать этот интерактивный бенчмарк для своих тестов особенно значимо, почти забавно. Это бенчмарк с набором 2D-игр без инструкций. Модель должна выяснить, как играть и побеждать. 100% результат означает, что модель может обыгрывать игры так же, как и люди.

    OpenAI была настолько поражена низкими результатами своих моделей (менее 10%) в ARC-AGI-3, что провела собственное исследование в прошлом месяце. Как и Nvidia, OpenAI обнаружила, что, просто изменив две настройки в системе, их модели утроили свои результаты.

    Но ни одна из моделей не приблизилась к достижению 100% результата, как это сделали исследователи Nvidia. Они показали, что для системы управления нужен компонент «супервизора», который подталкивает агента в правильном направлении, если тот застревает.

    «Более интересной частью было внедрение управляющего агента в дополнение к вашему основному агенту, который выполняет работу», — сказал Эль Халлак. Он «почти действует как генеральный директор, подталкивая агента, когда тот сбивается с пути или начинает исследовать путь, который может привести в тупик, или повторно исследует путь, по которому он уже проходил».

    Хотя концепция управляющего агента не нова, сегодня большинство пользователей агентов полагаются только на один уровень для своей системы управления, например, Claude Code, Codex, Hermes и т. д. Исследователи Nvidia создали свою собственную усовершенствованную систему управления под названием Agentic Variation Operators (AVO). Обратите внимание, что это не новый продукт Nvidia. Вместо этого Nvidia производит множество открытых фрагментов технологий для создания систем управления под брендом Nemo. Некоторые из этих технологий являются коммерческими, многие — общедоступны.

    Тем не менее, результаты Nvidia добавляют к растущему числу доказательств того, что выбор модели далеко не единственный фактор в производительности агентов. В июле, например, Databricks опубликовала потрясающие исследования, которые показывают, что упряжь (harness) гораздо больше, чем модель, резко влияет на затраты на ИИ.

    «Вы можете выбрать одну и ту же модель, но разные упряжи (harness), и вы получите значительно более высокие затраты, если будете использовать неправильную упряжь (harness)», — сказал генеральный директор Databricks Али Годси в интервью TechCrunch. «Поэтому вы думаете: о, это дорогая модель. Это дешёвая модель. Но подождите, какую упряжь (harness) вы используете? Это само по себе может удвоить ваши затраты».

    Более широкая мысль Nvidia заключается в том, чтобы показать, что открытые упряжи (harness), как и открытые модели, ставят пользователей под контроль гораздо больше, чем они думают.

    «Мы считаем, и мы демонстрируем это с помощью экосистемы, как открытые упряжи (harness) позволяют вам поворачивать гораздо больше регуляторов для повышения точности», — сказал Эль Халлак. «Это связано с тем, что OpenAI замедляет обучение своих моделей» в результате того, что модели создают нарушения безопасности.

    «Мы верим в наличие открытого стека агентов — где у вас есть контроль над упряжью (harness), над инфраструктурой, над временем выполнения — это то, что требуется нам для продвижения экосистемы вперёд и безопасно», — добавил он.

    Читайте также другие новости на нашем сайте: Главная страница

    Источник: techcrunch.com