Руководитель отдела продаж или техподдержки не имеет полного представления о том, что на самом деле происходит в разговорах с клиентами. Обычно супервайзер выбирает несколько звонков из сотни и разбирает их с командой вручную. Классические системы речевой аналитики устроены похоже, ведь они ищут в разговоре заранее заданные слова и фразы, а любое изменение скрипта продаж требует ручного обновления словаря — обычно на это уходит день-два.
Именно с этой проблемой работали ИИ-разработчик Metamentor и облачный провайдер Cloud.ru — они создали новую архитектуру сервиса речевой аналитики Callmentor. Сервис оценивает не совпадения с набором ключевых слов, а смысл диалога и настраивается под бизнес-задачи через промпты без дообучения моделей. Облачная инфраструктура Cloud.ru обеспечила его размещение и помогла минимум втрое снизить стоимость обработки звонков.

Промпты вместо словаря
Callmentor объединяет транскрибацию звонков, разделение речи клиента и менеджера, оценку диалогов по заданным критериям и подготовку отчетов для руководителей, а подключается к CRM, телефонии или контакт-центру через API.
Ключевое отличие от классических решений речевой аналитики — принцип оценки. Callmentor не ищет слова и фразы из заранее составленного словаря, а анализирует смысл диалога. Например, действительно ли менеджер выявил потребность клиента, отработал возражение или предложил следующий шаг, даже если сделал это своими словами.
Сервис настраивается через промпты под конкретный сценарий продаж, тип клиента, отдел или линию поддержки. Если обновление словаря обычно занимает один-два дня, то систему оценки на промптах можно адаптировать под новый скрипт за несколько часов.
Что происходит со звонком внутри системы
Запись поступает из телефонии или CRM, и первым делом система определяет ее формат — моноканальная она или двухканальная, и разделяет реплики между участниками разговора. Дальше каждый канал отдельно уходит на распознавание речи в модель T-one, и на выходе получается структурированная расшифровка с указанием спикера, текста фразы и временных меток.
Затем в дело вступает LLM Qwen — она отвечает сразу за два этапа. Сначала за постобработку текста: расставляет знаки препинания и заглавные буквы, корректирует названия компаний и термины, определяет, кто из спикеров менеджер, а кто клиент.
Затем — за саму оценку. Подготовленный диалог вместе со схемой метрик в формате JSON передается в модель, для каждой метрики формируется отдельный промпт, а результат возвращается тоже в JSON — с выбранным вариантом ответа и текстовым объяснением. Разговор передается модели целиком, а не фрагментами, чтобы сохранить контекст между этапами звонка.
Всю адаптацию под бизнес-логику клиента команда Metamentor делает на уровне промптов — описаний метрик, вариантов ответа и дополнительного контекста, а не за счет дообучения T-one и Qwen на данных заказчика. Это ускоряет запуск, ведь не нужно собирать датасет звонков и обучать отдельную модель под каждого клиента.
Качество оценки при этом калибруется итеративно — на основе скриптов и требований клиента формируется первый набор промптов, сервис обрабатывает выборку звонков, клиент получает результаты в Excel и при необходимости корректирует оценки, а скорректированная выборка становится эталоном для доработки промптов.
После настройки совпадение оценки системы с оценкой специалиста в среднем составляет около 85%. В зависимости от качества исходных требований и специфики метрики показатель может находиться в диапазоне 80–90%.
Экономика: локальные модели вместо LLM и ASR по API
В прежней схеме активнее использовались LLM и ASR по API, что вело к значительному расходу токенов и увеличивало стоимость и время обработки. В новой архитектуре отдельные задачи распределены между специализированными локальными моделями — диаризация, транскрибация, постобработка и аналитика выполняются последовательно на своих этапах в облаке Cloud.ru. Для размещения Qwen используется vLLM и квантизированная версия модели — это снижает требования к вычислительным ресурсам и позволяет обрабатывать текущий поток звонков на сервере сравнительно небольшой мощности.
«В продажах и клиентском сервисе руководителю важно контролировать, что происходит в разговорах с клиентами: какие вопросы повторяются, где команда теряет заявки, какие скрипты требуют доработки. Совместная работа позволила нам предложить рынку технологически зрелое и удобное решение, полностью готовое к работе в облаке».
Матвей Пак, генеральный директор Metamentor
При выборе моделей команда ориентировалась на три критерия: поддержку JSON-схемы на входе и выходе, достаточное контекстное окно для разговора целиком и соответствие требованиям проекта по качеству и скорости. В результате миграции:
- Обработка минуты аудио подешевела минимум в 3 раза.
- Минута звонка обрабатывается за 10-15 секунд.
- Совпадение оценки системы с ручной оценкой специалиста — в среднем около 85%.
- Адаптация под новый сценарий занимает часы вместо одного-двух дней при словарном подходе.
- Очереди между микросервисами гарантируют, что звонок, не обработанный из-за сбоя, не теряется — систему можно перезапустить вручную.
«Ручная проверка звонков дает только фрагментарную картину и занимает много времени. Callmentor автоматизирует эту работу и помогает принимать решения на данных по всем коммуникациям. Облачная инфраструктура Cloud.ru позволяет запускать такие ИИ-сценарии без закупки собственного оборудования и масштабировать сервис под объем звонков конкретной компании».
Дмитрий Юдин, директор департамента стратегии и развития ИИ Cloud.ru
Для защиты данных Callmentor работает как полностью локальное решение. Модели и компоненты системы размещаются внутри выбранной инфраструктуры, а персональные данные не передаются в иностранные сервисы. При необходимости к решению можно подключить российского модельного провайдера или развернуть систему в закрытом контуре заказчика, не выпуская данные звонков за его пределы.