Назад к блогу

LLM отражают идеологию создателей. Что показывает новое исследование

Девятнадцать языковых моделей попросили описать почти 4000 политических фигур. Результат оказался не просто разным, а предсказуемо разным: каждый LLM мыслит в оптике своих создателей. И это ставит вопрос не о предвзятости, а о том, кто контролирует наш взгляд на мир.

Приватность и управление AIGovernancePrivacy

AI аналитика и сегментация данных, концептуальная иллюстрация с неоновыми потоками

Недавнее исследование, опубликованное в npj Artificial Intelligence группой под руководством Мартена Бюйла из Гентского университета, поставило простой и элегантный эксперимент. Ученые взяли 19 популярных языковых моделей, от GPT-4o до Gemini и Grok, и попросили каждую описать 3991 политически значимую фигуру. Никаких наводящих вопросов, никаких тестов на либерализм или консерватизм: просто опишите человека. А потом, отдельным шагом, попросили ту же модель оценить собственное описание: позитивно или негативно оно получилось. Хитрость в том, что модель не знала, зачем ее просят описывать людей, и не пыталась казаться беспристрастной, а просто делала то, что умеет: генерировала текст.

Результат оказался отрезвляющим. Gemini от Google систематически теплее относится к фигурам, ассоциированным с прогрессивными ценностями, гражданскими свободами и мультикультурализмом. Grok от xAI тянется к тем, кто связан с национальным суверенитетом, централизованной властью и экономическим протекционизмом. Китайские модели разделились: Qwen от Alibaba ориентирована на международные стандарты и ближе к западному спектру, Wenxiaoyan от Baidu ориентирована на внутренний рынок с соответствующим идеологическим профилем. Арабские модели, российские, европейские, у каждой свой узор. И самое интересное: даже язык запроса меняет результат. Одна и та же модель, опрашиваемая на английском и на русском, описывает одних и тех же людей с разной интонацией. Это означает, что идеология сидит не только в данных и весах, но и в лингвистическом пространстве, в котором модель работает.

Авторы избегают слова «предвзятость» и делают это принципиально. Они настаивают: нейтральность это философски проблемная концепция. Нельзя быть объективным в вопросах, где само определение объективности культурный конструкт. Они ссылаются на Шанталь Муфф с ее идеей агонистического плюрализма: демократия это не консенсус, а пространство, где конкурируют разные точки зрения. Исследователи предлагают смотреть на различие моделей не как на баг, а как на фичу. Если у нас будет одна-единственная «нейтральная» модель, мы получим не объективность, а монополию на оптику.

Мне эта рамка кажется одновременно точной и тревожной. Точной, потому что она объясняет то, что многие из нас чувствуют интуитивно. Любой, кто работал с разными LLM, замечал: у них разный характер. Одна склонна к компромиссам, другая к провокациям, третья к дипломатичной уклончивости. Мы привыкли списывать это на temperature, system prompt или fine-tuning, но исследование показывает, что это глубже: модель впитывает идеологию на этапе отбора данных, задолго до alignment. Тревожной, потому что концентрация ИИ-мощностей в руках нескольких компаний означает концентрацию идеологических оптик. Когда миллионы людей ежедневно получают информацию через один и тот же интерфейс, возникает вопрос не о качестве ответов, а о гомогенизации мышления.

Я сам постоянно работаю с разными моделями: Claude для рефлексии и длинных текстов, ChatGPT для аналитики, Gemini для быстрых черновиков. И давно заметил, что выбираю модель не только по качеству кода или скорости, но и по тому, как она мыслит. Это не метафора. У каждой модели действительно свой угол зрения, своя чувствительность к контексту, свое ощущение того, что важно, а что можно опустить. Исследование Бюйла просто подтверждает инструментально то, что практики знают на уровне рефлекса.

Из этого вытекает несколько практических следствий. Выбор модели это не только техническое решение: latency, cost per token и качество кода. Это решение о том, в чью оптику вы помещаете себя и своих пользователей. Для одних задач это неважно: суммировать научную статью можно любой моделью, разница будет минимальной. Для других критично: анализ политической ситуации, генерация новостей, образовательный контент, юридические консультации. Кроме того, нам придется научиться жить с тем, что идеального ответа не существует. Есть только ответы, каждый из которых несет отпечаток своих создателей, и навык будущего не в том, чтобы найти единственно верный, а осознанно выбирать между разными оптиками в зависимости от задачи.

Исследование группы Бюйла не дает готовых рецептов, но оно переводит разговор из плоскости «какая модель умнее» в плоскость «какую модель и для чего мы выбираем». А это уже принципиально другой разговор.

Ещё по теме