Специалисты МФТИ проверили четыре популярных ИИ-алгоритма для моделирования лекарств — AlphaFold 3, Boltz-2, Chai-1 и Protenix-v1. Выяснилось, что их предсказания зависят от формата входных данных, а геометрия молекул часто предсказывается с физически невозможными параметрами.

В последние годы нейросетевые методы значительно ускорили процесс предсказания трехмерной структуры белков и их взаимодействия с небольшими молекулами, что открыло новые возможности для создания лекарственных средств. Однако, как показало исследование, точность этих прогнозов может варьироваться в зависимости от ряда факторов, которые ранее не изучались системно.
Ученые подавали на вход нейросетям информацию об одних и тех же молекулах в двух разных форматах — стандартном химическом справочнике CCD и строковом описании SMILES, — после чего сравнивали полученные предсказания. Выяснилось, что в большинстве случаев итоговая структура комплекса сильнее зависела от того, в каком формате были поданы данные, чем от реального заряда молекулы. Это указывает на то, что алгоритмы не улавливают ключевое физико-химическое свойство соединений, а вместо этого подстраиваются под особенности входного описания.
Авторы работы детально проанализировали геометрию предсказанных структур. Они измерили длины химических связей и обнаружили систематическое занижение этих значений. Например, в одном из случаев программа предсказала длину связи 0,0075 нанометра, тогда как даже минимальная реально возможная длина для такого типа связи должна быть как минимум в десять раз больше. Такие результаты говорят о том, что нейросети могут генерировать молекулы с физически невозможной геометрией, что ставит под сомнение достоверность их прогнозов о поведении соединений в организме.
По итогам эксперимента ученые отметили, что ни один из четырех протестированных методов не продемонстрировал явного преимущества по качеству предсказаний. Все они показали схожие систематические ошибки. Отмечается, что полученные результаты следует интерпретировать с осторожностью, а сами алгоритмы требуют дальнейшей доработки. В качестве первоочередных задач выделено два направления: нейросети должны выдавать одинаковый результат независимо от формата входных данных, а при обучении таких моделей необходимо включать информацию о том, что молекулы могут менять свой заряд в зависимости от среды. Решение этих проблем, по мнению авторов, позволит повысить надежность ИИ-инструментов и сделает их более полезными для фармацевтической отрасли.
Читайте также: Российские ИИ-модели проверят на соответствие духовно-нравственным ценностям