Ученые Исследовательского центра в сфере искусственного интеллекта Университета Иннополис запатентовали три разработки, связанные с моделированием движений глаз при чтении и использованием этих данных для обучения языковых моделей. Все патенты зарегистрированы при поддержке Межотраслевого центра трансфера технологий вуза.

Первое изобретение касается системы, которая предсказывает движения глаз человека в процессе чтения текста. Разработка работает с английским, корейским, немецким и еще десятью языками, используя единую нейросетевую архитектуру.
Технически решение объединяет многоязычную языковую модель и трансформерную модель прогнозирования фиксаций взгляда. Последняя обучена на реальных записях движений глаз носителей разных языков. На выходе система генерирует синтетические последовательности фиксаций — то есть имитирует, как человек мог бы читать предложенный текст. Оценка качества происходит по нескольким критериям, включая вероятность пропуска слов и количество фиксаций при первом прочтении.
Основное практическое назначение — создание реалистичных синтетических данных для дообучения языковых моделей в задачах обработки естественного языка. Это позволяет компенсировать нехватку дорогостоящих реальных данных, полученных с помощью айтрекинга.
Руководитель Лаборатории ИИ в медицине Университета Иннополис Илья Першин отметил, что синтетические данные часто оказываются единственным доступным решением при дефиците реальных записей взгляда, особенно в медицинских исследованиях. По его словам, в одном из проектов такие данные позволили на 20–30% повысить точность прогнозирования взгляда врача на рентгеновских снимках, что значимо для диагностических ИИ-сервисов.
Вторая запатентованная разработка направлена на решение проблемы отсутствия единых протоколов для сравнения последовательностей фиксаций взгляда, сгенерированных разными моделями.
Предложенный подход предполагает сравнение траекторий по пространственным и временным характеристикам, а также оценку различных признаков движений глаз — на уровне всего текста, отдельных слов и предложений. Дополнительно анализируется, как свойства текста (например, длина слов или их частотность) влияют на параметры взгляда. Проверка проводится на разных текстах, чтобы исключить привязку к обучающей выборке.
Этот метод повышает надежность оценки генеративных моделей и позволяет исследователям выбирать ту из них, чьи траектории наилучшим образом соответствуют реальным данным применительно к конкретной задаче.
Третье изобретение интегрирует данные о зрительном внимании в процесс обучения больших языковых моделей с подкреплением на основе обратной связи от человека.
Как пояснил специалист лаборатории Иван Стебаков, для обучения ИИ требуются большие массивы данных. Один из распространенных подходов — RLHF — предполагает, что на основе реальных предпочтений людей обучается вспомогательная модель, которая затем автоматически оценивает ответы основной языковой модели в ходе ее дообучения. Этот метод считается одной из ключевых причин недавнего прогресса в качестве больших языковых моделей.
Новое запатентованное решение включает генерацию синтетических последовательностей фиксаций взгляда и признаков внимания, а затем реализует алгоритм RLHF с учетом паттернов человеческого внимания — например, пропусков слов при быстром чтении.
По данным разработчиков, технология позволяет ускорить обучение ИИ в 1,5–2 раза, снизить вычислительные затраты, воспроизводить паттерны внимания человека с точностью до 93% и сохранять работоспособность даже для языков с ограниченным объемом данных.
Все три патента зарегистрированы в Федеральном институте промышленной собственности, а их авторы связывают дальнейшие перспективы с применением в медицине, лингвистике и при разработке более эффективных систем обработки текста.
Читайте также: В МФТИ нашли систематические ошибки нейросетей при разработке лекарств