Метка: тестирование кода

  • Nvidia: как «упряжь» для ИИ важнее модели при решении сложных задач

    Nvidia: как «упряжь» для ИИ важнее модели при решении сложных задач

    Nvidia опубликовала в пятницу интересное новое исследование, в котором утверждается, что именно упряжь, а не базовая модель, гораздо важнее, когда мы просим ИИ выполнять долгосрочные задачи.

    Суть в следующем: просто используя специальную упряжь, настроенную для хорошей работы с памятью и включающую в себя компонент-«руководитель», похожий на босса, исследователи добились того, что Claude Opus 5 получил 100% баллов по тесту интерактивного рассуждения ARC-AGI-3. (Это тест, который особенно разозлил конкурирующую лабораторию OpenAI.) Без упряжи Opus 5 набрал 30%, что было лучшим результатом среди всех протестированных моделей.

    Исследование Nvidia — ещё один показатель того, что, хотя выбор модели имеет значение, действуя как мозг агента, она является меньшей частью агентской системы, чем многие пользователи ИИ осознают, особенно для долгосрочных задач. Упряжь — это то, что делает модель агентом: она обрабатывает память, контекст, обратную связь.

    «Вообще говоря, мир интерпретирует агента почти как API модели», — говорит TechCrunch Адель Эль Халлак, вице-президент по продуктам в подразделении ИИ компании Nvidia (на фото выше). Но агент на самом деле больше, чем это. «Это модель. Это каркас вокруг модели, который мы называем упряжью, то есть набором инструментов, которые она использует. Это время выполнения, а также связанные с ним навыки и библиотеки, к которым мы предоставляем ей доступ».

    Долгосрочные задачи — это те, которые требуют связывания множества решений, иногда в течение нескольких дней, для получения завершённой работы. Это в отличие от того, как ИИ просто выдаёт ответ на запрос. Выяснить, как заставить ИИ выполнять долгосрочные задачи, не отвлекаясь и не уходя в дебри, — вот одна из задач, стоящих в исследованиях агентов.

    Например: Microsoft опубликовала в апреле исследование, в котором были протестированы 19 языковых моделей на предмет выполнения долгосрочных задач, связанных с редактированием документов, и обнаружила, что все модели, включая передовые, заполнили документы ошибками. (Если бы люди выполняли такую работу, их бы тут же уволили.)

    Модели, самостоятельно выстраивающие решения, также были пойманы на удалении файлов пользователей, даже целых баз данных, или на обращении к преступному поведению для достижения своих целей — от сговора до взлома.

    Решение исследователей Nvidia использовать этот интерактивный бенчмарк для своих тестов особенно значимо, почти забавно. Это бенчмарк с набором 2D-игр без инструкций. Модель должна выяснить, как играть и побеждать. 100% результат означает, что модель может обыгрывать игры так же, как и люди.

    OpenAI была настолько поражена низкими результатами своих моделей (менее 10%) в ARC-AGI-3, что провела собственное исследование в прошлом месяце. Как и Nvidia, OpenAI обнаружила, что, просто изменив две настройки в системе, их модели утроили свои результаты.

    Но ни одна из моделей не приблизилась к достижению 100% результата, как это сделали исследователи Nvidia. Они показали, что для системы управления нужен компонент «супервизора», который подталкивает агента в правильном направлении, если тот застревает.

    «Более интересной частью было внедрение управляющего агента в дополнение к вашему основному агенту, который выполняет работу», — сказал Эль Халлак. Он «почти действует как генеральный директор, подталкивая агента, когда тот сбивается с пути или начинает исследовать путь, который может привести в тупик, или повторно исследует путь, по которому он уже проходил».

    Хотя концепция управляющего агента не нова, сегодня большинство пользователей агентов полагаются только на один уровень для своей системы управления, например, Claude Code, Codex, Hermes и т. д. Исследователи Nvidia создали свою собственную усовершенствованную систему управления под названием Agentic Variation Operators (AVO). Обратите внимание, что это не новый продукт Nvidia. Вместо этого Nvidia производит множество открытых фрагментов технологий для создания систем управления под брендом Nemo. Некоторые из этих технологий являются коммерческими, многие — общедоступны.

    Тем не менее, результаты Nvidia добавляют к растущему числу доказательств того, что выбор модели далеко не единственный фактор в производительности агентов. В июле, например, Databricks опубликовала потрясающие исследования, которые показывают, что упряжь (harness) гораздо больше, чем модель, резко влияет на затраты на ИИ.

    «Вы можете выбрать одну и ту же модель, но разные упряжи (harness), и вы получите значительно более высокие затраты, если будете использовать неправильную упряжь (harness)», — сказал генеральный директор Databricks Али Годси в интервью TechCrunch. «Поэтому вы думаете: о, это дорогая модель. Это дешёвая модель. Но подождите, какую упряжь (harness) вы используете? Это само по себе может удвоить ваши затраты».

    Более широкая мысль Nvidia заключается в том, чтобы показать, что открытые упряжи (harness), как и открытые модели, ставят пользователей под контроль гораздо больше, чем они думают.

    «Мы считаем, и мы демонстрируем это с помощью экосистемы, как открытые упряжи (harness) позволяют вам поворачивать гораздо больше регуляторов для повышения точности», — сказал Эль Халлак. «Это связано с тем, что OpenAI замедляет обучение своих моделей» в результате того, что модели создают нарушения безопасности.

    «Мы верим в наличие открытого стека агентов — где у вас есть контроль над упряжью (harness), над инфраструктурой, над временем выполнения — это то, что требуется нам для продвижения экосистемы вперёд и безопасно», — добавил он.

    Читайте также другие новости на нашем сайте: Главная страница

    Источник: techcrunch.com

  • Blacksmith привлекла 45 миллионов долларов для ускорения тестирования кода

    Blacksmith привлекла 45 миллионов долларов для ускорения тестирования кода

    Поскольку искусственный интеллект значительно ускоряет процесс кодирования, следующей большой задачей в разработке программного обеспечения является тестирование и проверка всего этого кода. Blacksmith привлекла новый раунд финансирования в размере 45 миллионов долларов, чтобы извлечь выгоду из этого сдвига.

    Раунд серии B под руководством Peak XV Partners оценивает Blacksmith в 550 миллионов долларов, по сравнению с оценкой в 60 миллионов долларов, которая была установлена, когда компания привлекла 10 миллионов долларов в рамках серии A менее года назад. Существующие инвесторы GV и Y Combinator также приняли участие, доведя общее финансирование стартапа до 58,5 миллиона долларов.

    Основанная в 2024 году, Blacksmith помогает компаниям создавать, тестировать и проверять программное обеспечение, прежде чем оно попадает в производство. Стартап теперь обслуживает более 5 000 клиентов, включая Mercury, Supabase, Clerk, Ashby и Expensify, по сравнению с более чем 700 клиентами менее года назад, сообщил соучредитель и генеральный директор Адитья Джаяпракаш в эксклюзивном интервью.

    Рост инструментов для кодирования на базе искусственного интеллекта, таких как Cursor, Codex от OpenAI и Claude Code от Anthropic, значительно упростил для команд разработчиков создание кода, но качество кода, созданного с помощью искусственного интеллекта, не является чем-то само собой разумеющимся.

    «Проверка кода по-прежнему является узким местом, и это ещё более узкое место, потому что люди пишут ещё больше», — сказал Джаяпракаш.

    Blacksmith начиналась как облачный провайдер для рабочих нагрузок непрерывной интеграции (CI), помогая компаниям запускать сборки и тесты программного обеспечения, необходимые для проверки кода, прежде чем он попадёт в производство. С тех пор стартап расширил свою платформу с помощью Codesmith, агента по кодированию на базе искусственного интеллекта, который может автоматически исправлять неудачные проверки кода.

    Джаяпракаш сказал, что Blacksmith достигла годовой выручки в размере 10 миллионов долларов всего с 10 сотрудниками, а с тех пор расширила штат до примерно 30 человек и увеличила выручку до «десятков миллионов долларов». Он отказался назвать конкретную обновлённую цифру выручки, но сказал, что некоторые из крупнейших клиентов теперь тратят более 1 миллиона долларов в год на платформу.

    Пока что это выглядит как значительный и быстрый прогресс, Blacksmith работает на переполненном рынке. Его ключевые конкуренты включают GitHub Actions, Cursor Automations, возможности валидации, встроенные в Codex и Claude Code, многочисленные другие стартапы и сервисы по тестированию кода с помощью ИИ, предлагаемые Amazon Web Services, Microsoft Azure и Google Cloud.

    Джаяпракаш сказал, что его стартап конкурирует по скорости тестирования кода, а также по доступности.

    Заглядывая вперёд, Джаяпракаш сказал, что Blacksmith планирует расшириться до более широкого набора инструментов для кодирования, стремясь помочь разработчикам писать, проверять и объединять программное обеспечение быстрее.

    Читайте также другие новости на нашем сайте: Главная страница

    Источник: techcrunch.com