Инструментов много, понимания нет. Почему мы не понимаем, как работает искусственный интеллект?

Пятнадцать лет назад, в начале 2010-х, когда сверточные нейросети начали побеждать людей в задачах распознавания изображений, стало ясно, что модели, которые мы строим, работают, но никто не понимает, как именно. В ответ на это выросла целая область, которая должна была объяснить работу ИИ.

Но к 2026 году мы вообще приблизились к пониманию моделей? Или просто построили огромную фабрику инструментов, которыми никто не пользуется по назначению?

Инструментов много, понимания нет: что не так с объяснимым ИИ и почему он объяснял не то

Кто объяснит «черный ящик»

Многие современные модели машинного обучения, особенно глубокие нейронные сети, работают по принципу «черного ящика». Они выдают точные результаты, но внутренняя логика их принятия решений остается непонятной даже для разработчиков. Это создает проблемы с доверием, безопасность, соблюдением законов и возможность улучшать модель. 

Объяснимый искусственный интеллект (Explainable AI, XAI) — это направление в области ИИ, которое фокусируется на создании методов и инструментов, позволяющих системам искусственного интеллекта предоставлять понятные человеку объяснения своих решений и действий. Проще говоря, XAI стремится сделать логику работы алгоритмов прозрачной, чтобы пользователи — от обычных людей до экспертов — могли понять, почему система пришла к тому или иному выводу.

Некоторые классические научные работы настолько мифологизированы в своей области, что цитируют их чуть ли не на автомате, а ученые, слыша о них, просто понимающе кивают. 

В новой статье авторы утверждают, что человечество потратило полтора десятилетия на сравнение молотков друг с другом, вместо того чтобы строить дома.

Взгляд из 2026 года

В машинном обучении принято публиковать работы, которые предлагают что-то новое: архитектуру, алгоритм, бенчмарк. А в этой статье авторы говорят: «Стоп. Мы делаем не то». Такие тексты появляются редко, и их стоит читать внимательно, потому что они меняют не инструменты, а направление движения целой области.

Проблема в том, что инструментов много

За последние полтора десятилетия объяснимый ИИ собрал зрелую и разнообразную коллекцию методов. Их можно разделить на четыре большие группы.

  • Атрибуция. Самый старый и самый изученный класс. Вопрос всегда простой и заключается в том, какие пиксели повлияли на решение модели. Градиентные методы, методы на основе активаций, методы на основе возмущений — все они пытаются ответить на этот вопрос. За годы их существования выяснилось много неприятного, например, некоторые популярные методы ведут себя не лучше детектора границ и не чувствительны к случайной инициализации модели. Но именно эти методы сегодня лучше всего помогают людям предсказывать поведение модели на новых данных.
  • Визуализация признаков. Атрибуция говорит, где модель смотрит, но не говорит, что она там видит. Визуализация признаков показывает, какие изображения максимально активируют конкретный нейрон или слой. Синтезированные изображения могут быть красивыми, но неверными. Если не ограничить оптимизацию, они превращаются в состязательные примеры. 
  • Концептные методы. Вместо отдельных нейронов они работают с направлениями в пространстве представлений, соответствующими человеко-понятным концептам. TCAV использует заданные человеком концепты, ACE автоматически находит их в представлениях модели, а разреженные автоэнкодеры (SAE) декомпозируют представления на тысячи интерпретируемых признаков. Сегодня это самый сильный инструмент для понимания того, что модель знает.
  • Цепные методы. Самый молодой класс. Он отвечает не на вопрос «что модель представляет», а на вопрос «как она вычисляет». В зрении это направление пока нишевое.

Каждый из этих четырех классов отвечает на свой вопрос и каждый уже достаточно зрел, чтобы служить надежным инструментом. Но почти все усилия сообщества ушли на то, чтобы сравнивать методы между собой, а не на то, чтобы сравнивать модели.

Взгляд из 2026 года

Здесь важно понять масштаб претензии. Методы перестали быть целью и стали самоцелью. Это как если бы в биологии вместо изучения организмов ученые полвека сравнивали бы микроскопы. Именно это произошло в сфере XAI. Инструменты созрели, но объект изучения — сама модель — остался на периферии внимания.

3 аргумента в пользу того, что момент для смены фокуса настал

Во-первых, несовершенные инструменты не мешают науке. Можно провести параллель с нейробиологией. В конце 1950-х Леттвин и коллеги читали детекторы насекомых прямо со зрительного нерва лягушки. Хьюбел и Визель картировали ориентационно-избирательные рецептивные поля в коре кошки с помощью одиночных электродов и щелей света от проектора. Инструменты были грубыми, но именно они заложили основу понимания зрения, которое позже уточнялось, а не отбрасывалось.

Не нужно ждать идеального метода, чтобы начать изучать модели. Прогресс приходит от использования того, что есть.

Во-вторых, ландшафт моделей сходится. Компьютерное зрение прошло путь от множества разных сверточных архитектур до нескольких основных семейств моделей. Это, например, визуальные трансформеры, модели, обучаемые на парах «картинка — текст», модели, которые учатся без разметки, методы маскированного обучения и модели, предсказывающие будущие кадры. Все они все чаще устроены одинаково — на основе трансформера — и дают похожие внутренние представления. 

Это означает, что вместо разработки новых методов объяснения для каждой новой архитектуры можно использовать существующие инструменты для систематического сравнения того, как разные цели обучения и наборы данных формируют внутренние представления и вычисления.

В-третьих, появились инструменты для сравнения моделей. Раньше сравнение было трудным, потому что представления каждой модели живут в своем идиосинкратическом базисе. Обходные пути — подсчет уникальных детекторов концептов или усредненные оценки интерпретируемости — давали лишь приблизительные ответы. Но недавно появились универсальные разреженные автоэнкодеры, которые учат общее пространство концептов для нескольких моделей и позволяют сравнивать их на более тонком уровне. 

Взгляд из 2026 года

Нейробиологи не ждали, пока появятся фМРТ и оптогенетика, чтобы начать изучать мозг. Они использовали электроды и свет, получали результаты, а потом уточняли их. Для ИИ подойдет тот же путь, надо начать использовать то, что уже есть. 

Что делать дальше

Нужна программа перехода к объяснимому ИИ, который изучает модели, а не методы:

  • Договориться, что значит «понимать». Ученые так и не сошлись на едином определении интерпретируемости. Объяснение работает только тогда, когда человек действительно понимает, это не придирка к словам. 
  • Начать со структуры — это проще всего. Часть работы можно вести без человека. Инструменты вроде кросс-кодеров и универсальных разреженных автоэнкодеров позволяют напрямую сравнивать представления и признаки разных моделей. 
  • Человеческое понимание — цель. То, что модели согласны между собой, еще не значит, что их понимает человек. Психофизика начала показывать, что делает представление понятным для людей, но такие оценки слишком дороги. К тому же инструменты генерируют больше представлений, чем любое исследование успеет проверить.

Вроде бы кажется, что решение, которое поможет упростить все, лежит на поверхности, к примеру, пусть модель оценивает модель. Первая серьезная попытка так и делает: автоматизирует задачу, где человек выбирает, какие изображения ближе, и оценивает, насколько последовательно это делает обученная модель восприятия. Подвох в том, что автоматический судья сам является моделью человеческого восприятия. Получается, интерпретируемость сводится к согласию с прокси, а не с человеком. 

Взгляд из 2026 года

Здесь есть структурная проблема. Конференции по машинному обучению вознаграждают новые методы и прирост на бенчмарках, а не тщательные систематические оценки моделей.

Системная нейробиология построила науку вокруг объекта, который она едва могла наблюдать. У нас противоположная проблема: модели доступны, но часто остаются непрозрачными. 

Понимаем ли мы ИИ-модели? Нужно вернуться именно к исходному вопросу. Потому что полтора десятилетия спустя мы знаем гораздо больше о том, как сравнивать методы, а сами ИИ-модели не стали нам понятнее. Получается, что сфера XAI, которая обещала, как раз объяснить, как работает искусственный интеллект, развивалась зря.

Интерпретируемость — это не только соответствие требованиям, а еще также наша лучшая возможность учиться у этих систем, например, обнаруживать, как они представляют зрение, язык и другие области, где они уже соперничают или превосходят человека.

Читать еще:

Что будем искать? Например,ChatGPT

Мы в социальных сетях