Nvidia доказала: обвязка, а не модель ИИ, определяет успех автономных агентов

Компания Nvidia опубликовала новое исследование, которое показывает, что для выполнения длительных автономных задач важнее не сама модель ИИ, а «обвязка» (harness) — программная оболочка, включающая инструменты, управление памятью и правила, превращающие модель в самостоятельного агента.

Суть в том, что, используя специально настроенную обвязку с улучшенным управлением памятью и компонентом-«супервизором», исследователи Nvidia добились от модели Claude Opus 5 стопроцентного результата в интерактивном тесте ARC-AGI-3. Этот бенчмарк представляет собой набор 2D-игр без инструкций, где модель должна сама понять правила и выиграть, как это сделал бы человек. Без обвязки Opus 5 показал лишь 30% — лучший результат среди всех протестированных моделей.

«В целом мир воспринимает агента почти как API модели, — говорит Адель Эль Халлак, вице-президент по продуктам в подразделении ИИ Nvidia. — Но агент — это нечто большее. Это модель, это каркас вокруг модели, который мы называем обвязкой, то есть набор инструментов, которые она использует. Это среда выполнения и связанные с ней навыки и библиотеки».

Длительные задачи требуют последовательного принятия множества решений, иногда в течение нескольких дней. Это отличается от простого ответа на запрос. Умение удерживать ИИ от «ухода в сторону» — одна из главных целей исследований в области агентного ИИ. Например, Microsoft в апреле опубликовала исследование, в котором 19 LLM при выполнении длительных задач по редактированию документов заполнили их ошибками.

Выбор именно этого бенчмарка для тестов особенно показателен. OpenAI, чьи модели показали менее 10% в ARC-AGI-3, провела собственное исследование в прошлом месяце и обнаружила, что, изменив два параметра обвязки, можно утроить результаты. Однако ни одна из моделей не достигла 100%, как у Nvidia.

«Самое интересное — это введение супервизора в дополнение к основному агенту, — отметил Эль Халлак. — Он действует почти как генеральный директор, подталкивая агента, когда тот сбивается с курса или начинает исследовать путь, ведущий в тупик».

Концепция супервизора не нова, но большинство пользователей полагаются на однослойную обвязку, такую как Claude Code, Codex или Hermes. Исследователи Nvidia создали собственную улучшенную версию под названием Agentic Variation Operators (AVO). Это не новый продукт Nvidia — компания предлагает открытые компоненты для создания обвязок под брендом Nemo.

Результаты Nvidia дополняют растущее число доказательств того, что выбор модели — не единственный фактор производительности агентов. В июле Databricks опубликовала исследование, показывающее, что обвязка может вдвое увеличить стоимость ИИ-решений.

«Вы можете выбрать одну и ту же модель, но с разными обвязками, и получить значительно более высокую стоимость, если используете неправильную обвязку, — заявил генеральный директор Databricks Али Годси. — Вы думаете: это дорогая модель, это дешевая модель. Но подождите, какую обвязку вы используете? Это само по себе может удвоить ваши расходы».

Главный посыл Nvidia — открытые обвязки, как и открытые модели, дают пользователям больше контроля, чем они думают. По словам Эль Халлака, открытый агентный стек, где пользователь контролирует обвязку, инфраструктуру и среду выполнения, необходим для безопасного развития экосистемы.

Подписаться на обновления Новости / Технологии
Зарегистрируйтесь на сайте, чтобы отключить рекламу

ℹ️ Помощь от ИИ в комментариях

Вы можете задать вопрос нашему ИИ-помощнику прямо в комментариях к этой статье. Он постарается быстро ответить или уточнить информацию.

⚠️ ИИ может ошибаться — проверяйте важную информацию.


0 комментариев

Оставить комментарий


Все комментарии - Технологии