Как распознавание речи превращает звонок в текст, где потом лежит расшифровка разговора с ИИ-агентом, что такое саммари звонка и какие настройки влияют на точность.
Транскрибация в голосовом агенте — не отдельный инструмент, а часть разговора: речь клиента распознаётся в реальном времени, иначе агенту не на что отвечать. Готовый текст оседает в журнале диалога вместе с ответами агента и вызовами функций, полная история выгружается экспортом, а короткий итог разговора сохраняется саммари. Точность зависит от трёх параметров распознавания и от того, переспрашивает ли агент.
Расшифровку разговоров обычно ищут как отдельный сервис: загрузил запись, получил текст, читаешь. С ИИ-агентом логика другая. Текст появляется раньше, чем разговор заканчивается, потому что без текста агент не смог бы ответить.
Это меняет и то, зачем расшифровка нужна, и то, где её искать.
Транскрибация звонка — это превращение звучащей речи в текст. В голосовом агенте она встроена в цикл ответа: звук с линии попадает в распознавание речи, распознанный текст уходит в модель вместе с инструкцией, модель формирует ответ, синтез произносит его вслух.
Никакого отдельного шага «расшифровать запись» в этой цепочке нет. Разговор изначально существует в двух формах — как звук на линии и как текст в системе.
Побочный эффект приятный: у вас нет стопки аудиофайлов, которые кто-то однажды должен прослушать. У вас есть переписка, по которой можно искать словами.
Всё, что распозналось, попадает в журнал диалога наравне с текстовыми обращениями.
Саммари стоит завести отдельно от расшифровки, и не вместо неё. Полная расшифровка нужна, когда разбираешься, почему конкретный разговор пошёл не так. Саммари — когда менеджеру надо за десять секунд понять, о чём говорили, прежде чем перезвонить.
Проверьте на своих диалогах.Регистрация без карты, 500 ₽ на тест по промокоду BLOG500
Собрать агентаРечь распознаётся неидеально, и это не особенность конкретной платформы. Хуже всего проходят через распознавание именно те данные, которые важнее прочих: имена, адреса, номера телефонов, адреса почты.
Три параметра, которыми это регулируется:
| Параметр | Что делает | Симптом неверной настройки |
|---|---|---|
| Чувствительность к голосу | порог, после которого звук считается речью | слишком высокая — агент не слышит тихого клиента |
| Минимальная длительность речи | сколько должен звучать голос, чтобы стать репликой | слишком большая — короткие «да» и «угу» теряются |
| Пауза для завершения речи | сколько тишины означает конец реплики | слишком короткая — агент перебивает на середине фразы |
В руководстве платформы рекомендуют держаться значений по умолчанию и менять их аккуратно, по одному: качество голосового агента заметно зависит от сочетания настроек распознавания и синтеза, и вращение сразу трёх ручек лишает вас возможности понять, что помогло.
В аналитике звонков есть диаграмма причин завершения. Большая доля «Молчания абонента» почти всегда означает не молчаливых клиентов, а слишком строгие настройки распознавания: агент не засчитывает реплики и кладёт трубку по тишине.
Настройками ошибки распознавания снимаются наполовину. Вторая половина закрывается тем, как агент себя ведёт, когда расслышал плохо.
Три правила, которые стоит заложить в инструкцию голосового агента:
Если в вашем сценарии есть артикулы, VIN или промокоды, добавьте короткую подсказку, как их диктовать: по буквам, с паузами, с повтором. Базовые правила произношения цифр уже заданы служебной инструкцией, которая появляется у агента при переходе в режим «Голос».
По умолчанию неактивные диалоги и сообщения хранятся 45 дней, после чего удаляются. Срок настраивается в разделе «Безопасность» — там же, где живут маскирование персональных данных и удаление истории.
Это стоит учесть, если расшифровки нужны вам для обучения сотрудников или для разбора спорных ситуаций: то, что должно жить дольше, надо выгружать отчётом, а не рассчитывать найти в журнале через полгода.
Возьмите один свой звонок и выгрузите его экспортом. Не десять и не выборку за месяц — один.
Читать его надо не на предмет «как агент отвечал», а на предмет «что он услышал». Половина претензий к голосовым агентам на деле оказывается претензией к одной строчке распознанного текста, из которой разговор свернул не туда. Как из этой строчки рождается неверный ответ и чем его ловить — в разборе про то, почему ИИ-агент выдумывает.
Транскрибация — это превращение звучащей речи в текст. В разговоре с голосовым ИИ-агентом она идёт прямо во время разговора: каждая реплика клиента распознаётся сразу, иначе агенту было бы нечего отвечать.
В разделе «Чаты» у нужного диалога: журнал показывает реплики клиента и ответы агента, а рядом — вызовы функций. Отдельно есть экспорт диалога, который сохраняет полную историю вместе с вложениями.
Расшифровка — это весь разговор дословно. Саммари — короткий пересказ итога, который агент составляет сам. Сохранение саммари включается флагом «Добавить саммари звонка» в настройках исходящего звонка.
Имена, адреса, номера телефонов и почта распознаются хуже обычной речи. Лечится это инструкцией: агент должен переспрашивать при неуверенности и проговаривать важные данные для подтверждения.
Чувствительность к голосу, минимальная длительность речи и пауза для завершения речи. Слишком строгие значения приводят к тому, что агент не слышит клиента и завершает разговор по тишине — это видно в аналитике как большая доля «Молчания абонента».
По умолчанию неактивные диалоги и сообщения хранятся 45 дней, после чего удаляются. Срок хранения задаётся в разделе «Безопасность».