Клиент часто звонит именно потому, что не хочет ещё одного меню «нажмите один, чтобы продолжить». Поэтому мне сложно считать хорошим Voice AI любой сервис, который просто заменил кнопки более естественным голосом.
Для человека важнее другое: понял ли его собеседник, можно ли перебить длинную реплику, не пришлось ли повторять номер заказа три раза и что произойдёт, если вопрос оказался сложнее стандартного сценария. Голосовой бот для звонков становится полезным не тогда, когда красиво говорит, а когда клиенту действительно проще решить вопрос.
Современные realtime voice API действительно позволяют строить диалог с низкой задержкой, поддерживать прерывания и связывать голос с инструментами. Но хороший клиентский опыт появляется не из самой технологии. Он появляется из аккуратно выбранной границы: где разговор можно закончить автоматически, а где человеку уже нужен оператор.
Голосовой AI не должен быть разговорным IVR
Старый IVR заставляет клиента угадывать структуру компании: продажи, доставка, возвраты, гарантия. Voice AI может начать с человеческого вопроса и сам определить намерение. Это уже заметное улучшение, если система не превращает свободную речь в скрытое меню из тех же веток.
Я бы смотрела на первый минутный опыт. Клиент описал проблему своими словами. Система уточнила только то, чего действительно не хватает. Не попросила повторить данные, которые уже есть в контексте. Не перебила человека заранее подготовленным монологом.
Если после этого разговор всё равно сводится к десяти жёстким шагам, натуральный голос мало что меняет. Клиент слышит более приятный интерфейс, но проходит тот же лабиринт.
Проверяемые источники: OpenAI — Realtime and audio · OpenAI — Realtime conversations
Задержка и перебивание влияют на доверие сильнее красивого тембра
В голосе несколько секунд тишины ощущаются иначе, чем в чате. Человек не знает, система думает, связь пропала или его просто не услышали. Поэтому Voice AI должен либо отвечать достаточно быстро, либо честно обозначать, что сейчас проверяет информацию.
Ещё важнее возможность перебить. Если клиент уже назвал нужную дату, а система продолжает зачитывать варианты, разговор начинает раздражать. Realtime-интерфейсы поддерживают turn-taking и interruption; в продукте это нужно превратить в нормальное поведение, а не просто техническую возможность.
Я бы тестировала не только среднюю latency. Полезнее слушать реальные диалоги: где пауза воспринимается нормально, где клиент начинает повторять вопрос и где система говорит поверх человека.
Проверяемые источники: OpenAI — Realtime and audio · OpenAI — Realtime conversations · Microsoft — Voice Live API Overview
Критичные данные лучше подтверждать иначе, чем обычный контекст
Имя продукта можно переспросить один раз. Сумму возврата, адрес доставки или дату записи лучше подтвердить явно. На слух похожие числа и фамилии легко перепутать, особенно при плохой связи.
Мне нравится схема, где система повторяет только критичное значение и просит короткое подтверждение: «Правильно понимаю, сумма 14 500 рублей?» При сомнении лучше переключиться на другой канал — отправить SMS или ссылку, где клиент видит значение глазами.
Важный момент: подтверждение не должно превращать весь разговор в диктант. Нужно заранее определить небольшой список полей, ошибка в которых действительно меняет результат. Остальное можно оставить в обычном контексте диалога.
Проверяемые источники: Microsoft — Voice Live API Overview
Хороший self-service заканчивается реальным действием
Ответ «ваш заказ в пути» может быть достаточным. Но если клиент звонит изменить адрес, голосовой AI полезен только тогда, когда у него есть разрешённый инструмент и понятная проверка перед изменением. Иначе разговор звучит умно, а задачу всё равно приходится решать позже.
Я бы выбирала для self-service сценарии с ясным результатом: проверить статус, перенести запись в допустимом диапазоне, повторно отправить документ, создать обращение с уже собранным контекстом. Сложные споры, деньги, неоднозначные исключения и эмоционально тяжёлые случаи лучше переводить человеку раньше.
Граница зависит не от того, насколько уверенно говорит модель, а от того, насколько проверяемо действие и насколько дорого ошибиться. Для клиента это ощущается очень просто: вопрос либо решён, либо его честно передали тому, кто может решить.
Проверяемые источники: Microsoft — Voice Live API Overview
Передача оператору должна сохранять контекст, а не начинать разговор заново
Самый болезненный handoff — когда после пяти минут с AI человек говорит оператору: «Расскажите, пожалуйста, всё сначала». Для клиента это выглядит так, будто предыдущий разговор вообще не существовал.
При передаче я бы отдавала оператору короткую сводку: причина звонка, подтверждённые данные, уже выполненные проверки, открытый вопрос и действия, которые система не стала выполнять. Голосовую запись и полный transcript можно оставить доступными по правилам компании, но не заставлять оператора перечитывать всё во время разговора.
Dynamics 365, например, поддерживает transfer и consult в voice channel. Независимо от конкретной платформы хороший принцип тот же: вместе со звонком должен передаваться смысл, а не только аудиоканал.
Проверяемые источники: Microsoft — Transfer calls and consult with users in the voice channel
Оценивать Voice AI стоит по решению клиента, а не по естественности речи
Натуральный голос впечатляет на демонстрации. В работе я бы смотрела на другое: сколько задач решено без повторного звонка, где клиент просил оператора, сколько раз пришлось повторить критичные данные и на каком шаге люди бросают разговор.
Отдельно нужны записи сложных случаев. Иногда метрика self-service выглядит высокой просто потому, что система не эскалирует вовремя. Клиент завершает звонок, а затем пишет в чат или звонит ещё раз. Такое «успешное» завершение нельзя считать решением.
Для меня Voice AI готов к расширению только тогда, когда человек получает результат не хуже привычного канала и не платит за автоматизацию дополнительным терпением.
Проверяемые источники: OpenAI — Realtime and audio · Microsoft — Voice Live API Overview
Что обычно хочется уточнить
Чем голосовой AI отличается от обычного голосового бота?
Современный Voice AI может понимать свободную речь, поддерживать прерывания и обращаться к инструментам в реальном времени. Но для клиента различие важно только тогда, когда разговор становится короче и приводит к реальному решению.
Когда голосовой AI должен передавать звонок оператору?
Когда данных недостаточно, информация конфликтует, действие рискованное или клиент явно просит человека. Я бы также эскалировала случаи, где повторные уточнения уже ухудшают опыт.
Какие метрики нужны для Voice AI в поддержке?
Смотрите на решение задачи, повторные контакты, эскалации, ошибки критичных данных, задержку и долю разговоров, которые клиент прервал. Одной оценки «естественности голоса» недостаточно.
Хороший голосовой AI я замечаю не по тому, насколько он похож на человека. Я замечаю его по тому, что клиенту не приходится бороться с интерфейсом. Он объяснил проблему, получил понятное действие или вовремя оказался у оператора. Ради этого голосовой канал и стоит автоматизировать.
Если продолжать с точки зрения клиентского опыта для «голосовой бот для звонков»: Когда AI должен передать обращение оператору · Как внедрить AI в поддержку без увольнения операторов и падения качества · Как контролировать качество ответов AI в поддержке.
