Назад к блогу

Агент начинается там, где заканчивается ответ модели

Что превращает языковую модель в самостоятельного агента? NVIDIA AVO получила 100,00 балла на ARC-AGI-3 и за семь дней проверила более 500 направлений оптимизации GPU-ядер.

AI и автоматизация AIReasoningSoftware EngineeringAgency

Агент начинается там, где заканчивается ответ модели

Есть соблазн измерять искусственный интеллект по отдельным ответам. Модель написала код, решила задачу, распознала изображение, составила план. Всё выглядит убедительно, пока работа не растягивается на несколько часов или дней. Тогда выясняется простая вещь: хороший ответ ещё не означает хорошую работу.

В длинной задаче ценность системы определяется тем, что происходит между ответами. Сохранила ли она предыдущие решения? Поняла ли, почему эксперимент провалился? Умеет ли вернуться к рабочему состоянию после ошибки? Способна ли заметить, что двадцатая попытка повторяет первую? Именно здесь проходит граница между моделью, которая генерирует текст, и агентом, который действительно двигает дело вперёд.

Эта граница хорошо видна в проекте NVIDIA Agentic Variation Operators, или AVO. В публикации NVIDIA от 21 августа 2026 года описана архитектура, где языковая модель получает память, инструменты, обратную связь и отдельный контур наблюдения за ходом работы.[1] Иными словами, исследователи проверяют не только интеллект модели, но и то, как этот интеллект организован вокруг задачи.

Для начала AVO применили к оптимизации GPU-ядер. Это почти идеальная проверка на самостоятельность: исходный код можно изменить за секунду, но заранее невозможно знать, улучшит ли небольшая правка скорость, не сломает ли корректность и как поведёт себя на другом наборе параметров. Поэтому агенту приходится действовать как инженеру: изучать реализацию, формулировать гипотезу, запускать тесты, смотреть на профиль, сохранять удачные версии и отбрасывать слабые.

В описанном эксперименте система работала семь дней, проверила более 500 направлений и сохранила 40 версий ядра. На NVIDIA DGX B200 лучшие результаты оказались до 3,5% выше показателей cuDNN и до 10,5% выше FlashAttention-4 в проверенных конфигурациях.[1] Важна здесь не только цифра ускорения. Важнее то, что агент продолжал инженерный цикл без ручной выдачи каждой следующей команды.

Затем ту же архитектуру подключили к ARC-AGI-3, интерактивному бенчмарку с незнакомыми игровыми средами. Агенту не сообщают правила, цель и готовую инструкцию. Он видит пространство действий, пробует их, наблюдает последствия и постепенно строит рабочее понимание происходящего. Такая задача быстро разрушает иллюзию, будто достаточно один раз получить длинный ответ от сильной модели.

AVO завершила все 183 уровня в 25 публичных средах и получила показатель RHAE 100,00. Для этого системе понадобилось 6624 действия среды. В сопоставлении, приведённом NVIDIA, другая реализация на той же модели Claude Opus 5 использовала 7542 действия, то есть примерно на 12% больше.[1] Это впечатляет, но сравнение нельзя превращать в чистый эксперимент над памятью AVO: различались интерфейс, управление контекстом, внутренний цикл агента и другие детали.

Именно эта оговорка делает результат интереснее, а не слабее. Речь идёт не о магическом коэффициенте, который внезапно добавляет модели 70 процентных пунктов. Полная система меняет способ использования уже имеющихся способностей. Память уменьшает повторное исследование. Инструменты связывают рассуждение с действием. Наблюдатель замечает застой. Обратная связь превращает ошибку в материал для следующей гипотезы.

В этом смысле хороший агент похож не на гения, которому достаточно открыть дверь, а на исследовательскую лабораторию. В ней есть исполнитель, журнал экспериментов, измерительные приборы и человек, который остановит бессмысленную серию опытов. Убрать любой из этих элементов можно, но тогда система начинает забывать, повторяться или уверенно двигаться в неверную сторону.

Я постоянно вижу тот же эффект в работе с агентами для анализа и разработки. Даже сильная модель быстро теряет нить, если каждый новый запуск начинается с чистого листа. Ей приходится заново читать файлы, восстанавливать принятые решения и угадывать, почему предыдущий подход оказался неудачным. Когда состояние задачи сохраняется отдельно, качество меняется заметнее, чем после очередной попытки подобрать идеальную формулировку запроса.

Отсюда следует неприятный для рынка вывод. Сравнивать модели только по тестам одиночного ответа становится всё менее достаточно. В реальной работе важны скорость восстановления, цена ошибочного действия, способность использовать внешние инструменты и устойчивость к длинной цепочке промежуточных решений. Модель может блестяще решить один уровень и провалить двадцатиминутную сессию, потому что забывает собственные открытия.

AVO показывает важную вещь: универсальность может возникать из организации процесса, а не только из накопления новых знаний. Между оптимизацией CUDA-кода и исследованием незнакомой игровой среды мало общего на уровне предметной области. Но в обоих случаях работает один контур: предположить, действовать, получить свидетельство, обновить понимание, сохранить результат и продолжить.

Модель остаётся центром агента, но перестаёт быть его полной биографией. Она предлагает следующий шаг. Архитектура решает, что этот шаг будет связан с предыдущими, проверен реальностью и встроен в длинную последовательность работы. И если мы хотим увидеть действительно самостоятельные системы, начинать стоит не с вопроса “насколько умна модель?”, а с другого: “что помогает ей не потерять смысл задачи через час?”

Источник: NVIDIA Technical Blog, “NVIDIA AVO Reaches 100% on ARC-AGI-3”, 21 августа 2026 года.[1]

Sources

[1] NVIDIA AVO Reaches 100% on ARC-AGI-3: https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/

Ещё по теме