Вопрос доверия к провайдерам LLM-сервисов становится все более актуальным по мере роста рынка. Заказчик, оплачивающий доступ к дорогой модели, не всегда может гарантированно подтвердить, что получает именно ту систему, за которую платит. Провайдеры и посредники могут использовать более дешевые модели для части запросов без уведомления клиента, а субъективные ощущения пользователя не являются достаточным доказательством для претензий.

Исследователи из Университета Цинхуа и Национального университета Сингапура представили систему IRIS, позволяющую проверять соответствие API-ответов заявленной языковой модели. Метод основан на анализе характерных предпочтений моделей при генерации случайных последовательностей — своего рода «цифрового почерка», который остается уникальным даже для моделей с близкими параметрами.
Система IRIS (Information-Rate Inspection from Strings) предлагает элегантное решение: она просит API генерировать случайные цифры и короткие строки, а затем анализирует характерные предпочтения в символах и повторах. У языковых моделей настоящей случайности не получается — каждая модель чаще выбирает определенные числа, цвета и животных, формируя уникальный «отпечаток».
Например:
- GPT-4o любит 42, 37 и 57
- Claude Sonnet 5 предпочитает 47
- Qwen3-Max в 30 запросах из 30 назвал 42
- Llama 3.3 чаще всего выдает 53
Исследователи из Цинхуа и Сингапура протестировали IRIS на библиотеке из 45 моделей и 27 тыс. ответов. Результаты:
- 8 запросов позволяют правильно определить модель в 85% случаев.
- 16 запросов поднимают точность до 90%.
- При проверке, соответствует ли API заявленной модели, показатель качества различения достиг 0,98 (где 0,5 — случайное угадывание, 1,0 — безошибочное разделение).
Полная подмена модели — задача сравнительно простая. Куда хитрее случай, когда дешевая модель обслуживает только часть запросов.
Авторы собрали потоки из 80 реальных ответов OpenRouter и заменили 30% ответами другой модели. Для заранее различимых пар IRIS обнаруживала подмену в среднем в 85% случаев с ложной тревогой в 1,7% случаев.
В июне вышла система FLIPS, которая различала конфигурации модели по двоичным последовательностям с точностью до 96%. В июле появилась One Token Is Enough (OTIE), строящая отпечатки по тому, какие числа, цвета и животные модель выбирает чаще других.
Будущее, вероятно, не за одним идеальным тестом, а за крупными независимыми аудиторами, которые одновременно следят за ответами, качеством на контрольных задачах, ценой, задержками и аппаратными подтверждениями запуска. Каждый признак можно подделать по отдельности, но подделать все сразу — уже дороже самой честной модели.
Читайте также: Nvidia создает альянс по кибербезопасности автономных ИИ-агентов
