Мир в сознании модели: что Orca от BAAI меняет в нашем понимании интеллекта
Что, если мы неправильно измеряли интеллект моделей? Orca предлагает учить ИИ предсказывать следующее состояние мира, а не генерировать ответы. Замороженный backbone на 4B параметров и два механизма обучения, напоминающих человеческое познание.

Мы привыкли, что от умной модели ждут умного ответа. Скормил ей вопрос, она выдала решение. Дал промпт на картинку, она сгенерировала изображение. Но Orca от Пекинского института искусственного интеллекта (BAAI) предлагает разорвать эту цепочку. Вместо того чтобы учить модель отвечать, они предлагают учить ее понимать. Понимать, как устроен мир, на уровне, достаточном, чтобы предсказывать его следующее состояние, а не про подбор слов, кадров или движений по отдельности.
Orca учится через два параллельных механизма, и авторы назвали их бессознательным и сознательным обучением. Первый берет непрерывное видео, десятки тысяч часов, и заставляет модель улавливать естественную динамику мира. Как падает лист, как движется рука, как меняется освещение. Никаких подписей, никаких инструкций. Модель просто впитывает физику, наблюдая за ней. Второй механизм работает с разреженными, но значимыми переходами. Там, где язык описывает событие, модель учится, что определенная последовательность состояний имеет смысл. Разница между тем, как варится кофе и как заваривается чай, это не просто разные наборы пикселей, это разные семантические траектории, и модель должна их различать не потому что кто-то подписал картинки, а потому что в данных зашиты разные причинно-следственные цепочки.
Что мне кажется важным, это не столько техническое исполнение, сколько сдвиг в целеполагании. Мы привыкли измерять интеллект модели по способности отвечать на вопросы, писать код или генерировать картинки. BAAI предлагает другой критерий: понимает ли модель, как устроен мир настолько, чтобы предсказывать его эволюцию. И не только предсказывать, но и читать это понимание в разных форматах. После обучения Orca ничего не переучивают под конкретную задачу. Backbone заморожен, и только легкие декодеры, каждый для своей модальности, учатся извлекать из латентного пространства то, что нужно: текст, картинку, движение робота.
Меня особенно зацепила идея замороженного backbone. В современной индустрии доминирует противоположный подход: чем больше данных и вычислительных ресурсов ты можешь залить в модель на этапе fine-tuning, тем лучше она справится с конкретной задачей. Orca переворачивает эту логику. Сначала модель учится понимать мир в максимально общем смысле, без привязки к конкретному применению. А уже потом, когда базовое понимание сформировано, легкие надстройки учатся извлекать из него нужную информацию. Это напоминает то, как работает человеческое обучение: сначала ребенок наблюдает мир, накапливает опыт, строит ментальные модели, и только потом учится применять их в конкретных задачах.
Я последнее время много думаю о том, как мы оцениваем прогресс в этой области. Каждый новый релиз встречается списком бенчмарков, на которых новая модель обогнала предыдущую на полтора процента. Но бенчмарки это proxies, а не истина. Они измеряют то, что удобно измерять, а не то, что действительно важно. Orca ставит вопрос иначе: а что, если признак сильного интеллекта не в том, насколько хорошо модель отвечает на вопросы, а в том, насколько точно она моделирует реальность? Если модель не может предсказать, что будет через секунду после того, как чашка коснулась стола, то какую ценность имеют ее ответы на вопросы по физике?
У этого подхода есть очевидные ограничения. Авторы честно их перечисляют, и это вызывает уважение. Сейчас Orca учится только на vision и language, хотя многие переходы состояний требуют других модальностей. Звук закипающей воды, тактильная обратная связь, усилие при захвате. Размер модели 4B параметров, что смешно мало для полномасштабного моделирования мира. Обучение пока ограничено короткими горизонтами, минутными интервалами, а не длинными каузальными цепочками. Всего Orca использует только десятую часть своего подготовленного массива данных: 12,5 тысяч часов видео из 125 тысяч. Остальное ждет следующих версий. Но сама рамка мне кажется правильной, даже если текущая реализация только первый шаг.
Я работаю с моделями каждый день и давно заметил одну вещь. Лучшие ответы приходят не от самой умной модели, а от модели, которая лучше всех поняла контекст. Не буквально поняла текст инструкции, а построила внутреннее представление ситуации, достаточно точное, чтобы предсказать, какое решение мне нужно. Сейчас эта способность возникает как побочный продукт обучения на огромных корпусах текстов, и никто до конца не понимает, как она работает и как ее гарантировать. Orca предлагает сделать эту способность прямой целью обучения. Мне кажется, это правильное направление, даже если дорога к нему займет годы. Вопрос не в том, сколько токенов в секунду генерирует модель, а в том, насколько глубоко она понимает, что происходит между ними.