«Роботы будут доминировать»: Владимир Киселев из VOXYS об эволюции голосовых помощников

Звонок в поддержку больше не квест с выбором цифр на клавиатуре. Современные системы понимают голос, выделяют суть запроса и сами ведут диалог. Но даже сейчас компании не готовы отпустить их в «свободное плавание». Вместо этого они держат машины на поводке — в жестких сценариях и скриптах.

О том, какие задачи уже решают голосовые ассистенты, почему скрипты пока важнее языковых моделей и когда общаться с роботом станет так же просто, как с человеком, «Компьютерре» рассказал Владимир Киселев, генеральный директор «Воксис Лаб», технологического подразделения компании VOXYS.

Звонок в поддержку больше не квест с выбором цифр на клавиатуре. Современные системы понимают голос, выделяют суть запроса и сами ведут диалог.

Из телефонного лабиринта — в обычный разговор

— Если проследить эволюцию голосовых помощников (IVR), с чего все начиналось?

С обычных тональных меню (DTMF). Человек звонил в компанию, переводил телефон в DTMF-режим и нажимал кнопки, чтобы добраться до нужного раздела меню. Для пользователя это было как запутанный лабиринт, но для бизнеса система приносила эффект — типовые вопросы удавалось решать без участия оператора.

В какой-то момент появились системы, которые научились распознавать простые голосовые команды. Уже не обязательно было нажимать кнопку, можно было сказать «да», «нет» или назвать цифру.

Следующий этап — распознавание речи. Голос начали переводить в текст, из текста выделять смысл, а затем формировать ответ и снова переводить его в голос. Так появились голосовые роботы, которые могли вести уже гораздо более сложный диалог.

По сути, это был один из первых промышленных сценариев применения искусственного интеллекта. Сначала машинное обучение научилось распознавать речь, потом — понимать смысл сказанного. Сейчас к этой системе добавляются большие языковые модели.

— Почему именно сейчас к IVR стали предъявлять гораздо более высокие требования?

Потому что изменился сам клиентский опыт. У многих дома есть голосовая колонка. Мы привыкли говорить с ней обычным языком и ожидаем, что она нас поймет. То же самое происходит с чат-ботами и большими языковыми моделями.

Когда человек звонит в контакт-центр, он уже хочет получить примерно такой же уровень понимания от робота. Но здесь есть важное отличие. У колонки дома мы можем просто спросить что-нибудь из любопытства. Если она ошибется, ничего страшного. А в контакт-центр человек обычно обращается с проблемой, которую ему нужно решить.

Например, у него непонятное списание по банковской карте или возникла проблема с авиабилетом. В такой ситуации требования к роботу намного выше.

Меню не исчезнут, но перестанут быть лабиринтом

— Значит, привычные голосовые меню скоро уйдут?

Сложные меню действительно постепенно уходят. Сейчас человек может просто описать свою проблему голосом, а система сама определит, куда его направить. Иногда она сразу подключит оператора, если понимает, что человек в этом случае справится лучше и быстрее.

Но полностью отказываться от меню не будут. Есть задачи, которые по-прежнему удобнее решать кнопками. Например, если нужно ввести длинный номер карты или билета, проще набрать его на клавиатуре, чем произносить по одной цифре.

Поэтому такие системы останутся, но их область применения станет гораздо уже. Сложный лабиринт из десятков пунктов постепенно становится прошлым.

— Почему тогда бизнес иногда все равно выбирает более простой сценарий, а не современного голосового помощника?

У каждого сценария своя экономика. Голосовой робот — это тоже отдельный сервис со своей себестоимостью. Компания сама определяет, какой набор возможностей ей нужен.

Иногда более простой вариант действительно оказывается оптимальным. Если задача хорошо решается меню, нет смысла усложнять систему только ради того, чтобы она выглядела современнее. Но общая тенденция понятна.

Бизнес стремится передавать роботам все больше обращений. Они способны одновременно обрабатывать большой поток запросов, а автоматизация обходится дешевле работы операторов. По этой причине спрос на голосовых роботов растет.

Нейросети пока не дают им полной свободы

— Что мешает прямо сейчас передать языковой модели управление всем разговором?

Контроль — сейчас сценарий диалога задается заранее. Люди определяют, как робот должен общаться с клиентом и какие действия он может выполнять. Это ограничивает систему, зато мы понимаем, что произойдет во время разговора.

Большая языковая модель позволяет сделать диалог намного свободнее. Но у нее есть известная проблема — галлюцинации. Модель может придумать факт, которого не существует, или сформулировать ответ некорректно.

Для клиентского сервиса это серьезный риск. Ошибка может привести к репутационным и финансовым потерям, а в некоторых случаях — к юридическим проблемам.

Поэтому передавать модели полный контроль над разговором нужно очень аккуратно. Мы уже экспериментируем с этим, проводим лабораторные исследования и пилоты. Но это пока не тот этап, когда можно просто взять и заменить сценарий нейросетью.

— А если клиент специально попытается вывести робота из заданных рамок с помощью промпт-инъекции?

В настоящий момент основа нашего взаимодействия — сценарий и скрипт. Языковая модель используется для того, чтобы распознать смысл текста и сгенерировать ответ, но сам сценарий не дает ей выйти за установленные рамки. Поэтому в такой архитектуре риск значительно ниже.

При этом сама проблема промпт-инъекций существует. Можно сформулировать запрос так, чтобы модель выдала некорректный ответ или попыталась сделать то, чего от нее не ожидали. Поэтому мы развиваем внутри компании соответствующую компетенцию и тестируем такие сценарии.

— Уже были подобные инциденты?

Нет. Мы пока достаточно осторожно тестируем языковые модели именно как механизм управления диалогом. Перейдем к этому только тогда, когда будем понимать, что клиенты надежно защищены от таких рисков.

Оператор станет сложнее и дороже

— Если роботы забирают все больше обращений, что останется человеку?

Мы видим по своей статистике, что количество переводов разговоров от робота к оператору год от года сокращается. Все больше вопросов роботы способны закрыть самостоятельно.

А человек будет подключаться там, где задача сложнее. Например, клиенту трудно сформулировать проблему, ему нужно уделить больше внимания или требуется именно человеческое участие.

В перспективе оператор может стать своего рода премиальным уровнем обслуживания. Это не значит, что искусственный интеллект заканчивает работу в тот момент, когда в разговоре появляется человек. Наоборот, он продолжает помогать оператору. В реальном времени можно переводить речь в текст, определять смысл разговора и показывать сотруднику подсказки из базы знаний.

Получается, ИИ работает с обеих сторон. Сначала пытается решить проблему самостоятельно, а если не справляется — помогает оператору сделать это быстрее.

— А клиенту в таком случае не придется второй раз объяснять свою проблему?

Нет. У нас взаимодействие бесшовное. Все, что клиент сказал роботу, переводится в текст и суммаризуется. Если разговор передается оператору, он видит историю и описание проблемы.

Это базовая вещь. Мы не должны заставлять человека дважды рассказывать одно и то же.

В такой модели меняется сама роль контакт-центра. Раньше оператор был основным способом связаться с компанией, а автоматизация скорее отсеивала простые обращения. Теперь все чаще происходит обратное: робот берет на себя стандартные задачи, а человеку достаются случаи, где требуется больше гибкости.

— Как вы считаете, эта тенденция продолжится?

Роботы точно будут доминировать в коммуникациях — как во входящих, так и в исходящих. А люди будут подключаться во все более сложных случаях.

При этом голос остается только одним из каналов. «Воксис Лаб» развивает и чат-боты. Технологически они устроены похожим образом: только вместо преобразования голоса в текст система сразу получает текст от пользователя.

Разница может быть и в привычках самих клиентов. Одним удобнее позвонить, другим — написать сообщение. Поэтому задача бизнеса не сводится к выбору одного универсального интерфейса.

Где живут роботы

— Где физически находятся ваши голосовые роботы — на ваших серверах или у заказчика?

На нашей стороне. Мы предоставляем эту услугу под ключ, поэтому клиенту не нужно самостоятельно разворачивать инфраструктуру и заниматься всей технической сложностью.

Для таких систем нужны обычные серверы, а для задач искусственного интеллекта — в том числе серверы с видеокартами, которые ускоряют вычисления. Все зависит от масштаба. У нас много клиентов и большой поток входящих и исходящих коммуникаций, поэтому мы инвестируем в собственную инфраструктуру.

Если заказчик будет строить такую инфраструктуру самостоятельно, это может оказаться дороже. Мы можем оптимизировать затраты за счет масштаба.

— Рост цен на видеокарты вас затронул?

Конечно. Все почувствовали рост цен на видеокарты. А вот вопрос о том, как это отражается на стоимости услуг для клиентов, уже относится к экономике компании.

Российские технологии вместо западных

— На каких технологиях работают ваши роботы?

Если говорить непосредственно о роботах, это отечественная разработка и наши технологии. Отдельные компоненты, например распознавание речи, могут быть собственными или решениями российских разработчиков.

Языковые модели мы используем и локально, разворачивая их у себя, и в виде российских облачных решений. В основном это российские технологии и открытые разработки. Западные решения мы не используем.

— Можете назвать конкретные модели?

Qwen, если говорить про open source модели, которые мы используем в собственной инфраструктуре. Если говорить о партнерских решениях, то, как правило, это модель «Яндекса».

— Почему именно она?

Для себя мы поняли, что по сочетанию качества и удобства она для нас сейчас выгоднее. Если сравнивать по критериям цена — качество, «Яндекс» для нас более приоритетный партнер.

Через несколько лет роботы начнут разговаривать друг с другом

— Когда, по вашему прогнозу, голосовые роботы окончательно перейдут от сценариев к языковым моделям?

Мы уже внутри этого перехода. Пока это лабораторные исследования и пилоты, но я ожидаю, что в горизонте одного-двух лет произойдет качественное изменение.

Скорость развития технологий сейчас очень высокая. Практически каждую неделю появляются новые возможности.

Поэтому все больше управления диалогом будет передаваться языковым моделям, а классические роботы, построенные на сценариях, начнут отходить на второй план. Следующий этап может оказаться еще интереснее.

— Если посмотреть в будущее, каким вы видите развитие сферы?

Я полагаю, что языковые модели будут все глубже интегрироваться в смартфоны и становиться личными помощниками. Человек сможет поручить такому агенту забронировать столик, записаться куда-то или решить другую бытовую задачу.

Дальше агенты могут начать взаимодействовать друг с другом. Личный помощник человека будет получать задачу и связываться с агентом компании, который уже решает ее со своей стороны.

Пока это скорее прогноз, чем сложившаяся технология. Но именно в такую сторону может двигаться клиентская коммуникация в перспективе пяти-семи лет.

«Для нас главным будет не канал»

— Какое будущее вы видите для своей компании?

Наша главная компетенция — то, что мы очень хорошо понимаем потребности людей. У нас огромный накопленный опыт. Сейчас основные каналы — голос и чат-боты, но они могут измениться.

Для нас главным будет не конкретный канал, а компетенция в клиентском сервисе, взаимодействии с людьми и телемаркетинге.

Сейчас мы проходим технологическую трансформацию и постепенно превращается из традиционного игрока рынка контакт-центров в провайдера технологических решений, который помогает бизнесу выстраивать взаимодействие с клиентами от первого касания до долгосрочной лояльности.

Каналы при этом могут меняться. Уже сейчас робот может начать разговор с человеком в мобильном приложении или на сайте, а затем передать его оператору там же.

Это возвращает нас к главному изменению, которое происходит с голосовыми помощниками. Они постепенно перестают быть отдельным «голосовым меню», через которое нужно пробраться до нужной кнопки. Сначала машина научилась слышать человека, потом — понимать смысл его слов. Теперь ее пытаются научить вести разговор самостоятельно.

Именно последний шаг оказался самым сложным. Бизнесу недостаточно, чтобы робот говорил естественно. Он должен понимать, где заканчивается свобода ответа и начинается ответственность компании.

Пока эту границу задают сценарии. Но, судя по всему, это ненадолго.

Читайте также: 

Что будем искать? Например,ChatGPT

Мы в социальных сетях