MWS AI (входит в МТС Web Services) проверила способности мультимодальных моделей искусственного интеллекта (Visual Language Models, VLM) распознавать признаки поддельных документов. Тестирование провели на открытом бенчмарке MWS AI Vision Bench, который позволяет оценить качество работы нейросетей в области оптического распознавания символов (OCR) и понимания документов. По итогам тестирования выяснилось, что новые модели могут уступать предыдущим версиям в выявлении поддельных документов.

Для проверки команда дополнила открытый бенчмарк MWS AI Vision Bench датасетом и набором заданий Anti-fraud для выявления подделок. В датасете собраны 430 изображений: 200 исходных, 130 с ручными правками и 100 пересозданных генеративной моделью. В рамках экспериментальной задачи нейросети должны были определить, к какой категории относится изображение, и перечислить подозрительные элементы. Исследователи проверяли, могут ли модели выявить подмену реквизитов в отсканированных документах и отличают ли изображения, созданные ИИ, от исходных (изображения, которые в эксперименте не редактировали). При оценке учитывались корректность классификации и качество объяснения того, какие поля изменили вручную.
Среди лидеров по выявлению поддельных документов — модели семейств Claude, GPT и GLM. Ниже представлены семь лучших результатов на открытой части набора.
Чем выше балл, тем лучше результат работы моделей в исследуемых категориях. В overall задачи из категории anti-fraud не входят. Общая оценка (Overall) — средний балл по пяти задачам: OCR, восстановление структуры документа, определение расположения текста, извлечение данных и ответы на вопросы по содержимому.
Результаты показали, что модели, которые хорошо читают и понимают документы, могут уступать другим нейросетям в выявлении подделок. Например, GPT-6.1 Sol занимает первое место по общей оценке, но третье — по способности обнаруживать подмены. В этой категории лидирует Claude Opus 5.5.
«Новая задача Anti-fraud носит экспериментальный характер: публичный набор отличается от реального потока документов, а некоторые его особенности могут подсказывать модели правильный ответ. Поэтому оценку выявления подделок мы публикуем отдельно и не включаем в общий балл MWS AI Vision Bench. Набор помогает предварительно сравнить качество универсальных нейросетей, но для защиты от мошенничества на реальных документах лучше использовать специализированные решения».
Георгий Гайков, создатель бенчмарка
С помощью дополнительного набора исследователи могут сравнить модели, изучить их ответы и проверить, замечают ли они измененные поля документов. Это поможет сократить объем ручной подготовки данных и проверок при выборе модели для работы в продакшене.
MWS AI Vision Bench — открытый бенчмарк MWS AI для оценки мультимодальных нейросетей на русскоязычных документах. Он проверяет оптическое распознавание символов (OCR), восстановление структуры документа, определение расположения текста, извлечение данных и ответы на вопросы по содержимому. Основной набор включает 800 изображений и 2 580 заданий: сканы документов, таблицы, рукописные записи, схемы, чертежи и графики.