Три уровня проверки перед запуском ИИ-агента: тестовый чат, обкатка на живых обращениях без отправки ответов, вывод на часть трафика. Двенадцать реплик для прогона.
Тест ИИ-агента устроен в три уровня: тестовый чат в кабинете, обкатка на живых обращениях с выключенной отправкой ответов и вывод на часть трафика. Правильный текст ответа — лишь часть картины; на каждом уровне важны ещё вызов нужных функций, поведение при пустом результате и границы, за которые агент не должен выходить.
В кабинете агент отвечал безупречно: вежливо, по делу, с правильными ценами. В первый рабочий день он спросил у клиента то, что клиент уже написал двумя сообщениями выше. Разговор в переписке и разговор в тестовом чате — это два разных испытания, и второе агент почти всегда проходит легче.
Разница не в том, что тестовый чат «ненастоящий». Разница в том, что там нет потока: одно сообщение, один ответ, следующий вопрос вы формулируете сами, спокойно и по одному. Живой клиент присылает три сообщения подряд, меняет тему на середине фразы и не читает то, что агент уже сказал. Разрыв между «отвечает правильно» и «выдерживает поток» три уровня проверки ловят до того, как его заметит настоящий клиент.
Пропустить уровень и сразу перейти к следующему — соблазн, который экономит день и стоит недели правок постфактум. У каждого уровня свой предмет проверки.
| Уровень | Что видно | Чего не видно |
|---|---|---|
| Тестовый чат в кабинете | текст ответа, вызовы функций, инструкция и история сразу под рукой | как агент ведёт себя в потоке из десятков параллельных диалогов |
| Обкатка на живых обращениях без отправки | реальные формулировки клиентов, реальная нагрузка | как клиент реагирует на реальный ответ: он его пока не видит |
| Часть трафика | реакция настоящих клиентов, доведение диалога до цели | ошибки в этой доле стоят реальных разговоров, не тестовых |
Первый уровень дешёвый и быстрый, третий — единственный, где видна правда о конверсии. Пропускать первые два ради третьего означает узнать о пустых вызовах функций и неверных ценах на живом клиенте вместо собственного тестового прогона.
Проверьте на своих диалогах.Регистрация без карты, 500 ₽ на тест по промокоду BLOG500
Собрать агентаТестовый чат открывается в кабинете, его технический канал называется test_chat. По этому имени можно отдельно настроить поведение агента в инструкции, если для теста нужна особая логика. У голосового агента есть парный test_voice_call.
Проверка правильности ответа — только первый слой. Три вещи важнее:
Демо-ссылка — публичный адрес вида app.suvvy.ai/a/…, который можно отправить коллеге без входа в кабинет: у текстового агента откроется чат с меткой ДЕМО, у голосового — демо-звонок в браузере с полем «Лимит минут звонка», ограничивающим длительность одного разговора. Сообщения и звонки в демо списывают токены так же, как обычные диалоги с клиентами. Большая рассылка ссылки коллегам на тест обходится не бесплатно.
Тестовый чат честен настолько, насколько честны вопросы, которые вы туда написали. Реальные клиенты формулируют вопросы иначе, присылают их не по одному и путают темы в одном сообщении. Проверить агента на этом можно, не рискуя ни одним настоящим разговором.
У большинства каналов есть флаг «Ответы агента»: канал остаётся подключён, агент получает обращения и формирует ответы, но не отправляет их клиенту. На Wildberries тот же принцип реализован отдельной настройкой «Отправка ответов агента на ВБ»: при выключенном флаге агент получает вопросы и отзывы покупателей, генерирует ответы, но не публикует их на площадке, а в тестовом чате такие ответы показаны зачёркнутыми: видно, что он собирался сказать, без риска, что он это скажет.
В HelpDeskEddy, amoCRM, Omnidesk и GetCourse принцип решён иначе, режимом co-pilot: ответ агента уходит комментарием сотруднику внутри системы, клиент его не видит. Менеджер получает готовую подсказку и решает, отправлять её как есть или поправить.
У голосового агента обкатка устроена немного иначе: разговор нельзя отправить «зачёркнутым», поэтому проверка происходит до подключения настоящей линии. Демо-звонок открывается по той же демо-ссылке и идёт прямо в браузере: вы говорите с агентом голосом, слышите его интонации и паузы вместо того, чтобы читать расшифровку постфактум.
Отдельно у голосового агента есть тестовый звонок от его же лица на указанный номер: удобно проверить, как агент говорит, когда звонит сам, ещё до того, как в дело пойдёт исходящий обзвон живой базы. Оба варианта не заменяют друг друга: демо-звонок показывает, как агент ведёт диалог, тестовый исходящий — как он говорит, если звонит первым.
Список ниже стоит прогнать через тестовый чат любому агенту, независимо от ниши. Первая половина — обычные вопросы, вторая — то, что обычно проверять забывают.
Провокационные пункты (пятый, шестой и восьмой) стоит прогнать в первую очередь: их редко задают на демонстрации агента коллегам, хотя именно их задаёт живой клиент в первую неделю. Устройство барьеров, которые ловят такие ответы, разобрано в материале про выдумки ИИ-агента, а порядок шагов внутри разговора — в статье про сценарий чат-бота.
Измерьте долю диалогов из тестового прогона, где агент отклонился от задуманного сценария: точная формулировка полезнее расплывчатого «не понравилось». Если таких меньше одного из десяти, можно выводить агента на часть живого трафика; если больше — рано, сначала дорабатывают инструкцию и базу знаний, а обкатку откладывают.
Дальше отсчёт идёт по этапам того же внедрения, что описано в статье про запуск ИИ-агента: сначала часть потока, потом весь поток. Агент, который прошёл двенадцать пробных реплик и неделю обкатки без единой жалобы, всё равно способен споткнуться о вопрос, которого не было ни в одном тесте, — просто таких вопросов останется в разы меньше.
Тремя шагами подряд: сначала тестовый чат в кабинете на своих же вопросах, потом обкатка на реальных обращениях с выключенной отправкой ответов клиенту, и только затем вывод на часть живого потока. Каждый шаг ловит свой класс ошибок, ни один нельзя пропустить и сразу перейти к следующему.
Тестовый чат в кабинете виден только вам и не выходит за пределы личного кабинета Савви. Демо-ссылка — публичный адрес вида app.suvvy.ai/a/…, который можно отправить коллеге или клиенту без входа в аккаунт: у текстового агента откроется демо-чат с меткой ДЕМО, у голосового — демо-звонок прямо в браузере.
Да. Сообщения и звонки в демо списывают токены так же, как обычные диалоги с клиентами. У демо-звонка есть поле «Лимит минут звонка» — оно ограничивает длительность одного разговора, чтобы тест не съел баланс сверх нужного.
Да, у большинства каналов есть флаг «Ответы агента»: канал остаётся подключён, агент получает сообщения и формирует ответы, но не отправляет их. На Wildberries отдельный флаг «Отправка ответов агента на ВБ» делает то же самое, а в тестовом чате такие ответы показываются зачёркнутыми. В HelpDeskEddy, amoCRM, Omnidesk и GetCourse есть режим co-pilot: ответ уходит комментарием сотруднику и клиенту не виден.
В продвинутом режиме журнала диалогов между репликами видны вызовы функций: их название, переданные аргументы и результат выполнения. По иконке с информацией открывается инструкция, история диалога и, если включено маскирование персональных данных, текст до и после шифрования. Это то место, где видно, обратился ли агент к нужной функции и что он сделал с пустым результатом.
Ориентир — десять-двенадцать реплик, и часть из них должна выходить за рамки обычного сценария. Половина списка: типовые вопросы по вашей теме, вторая половина — провокации (выпросить скидку, попросить чужие данные, задать вопрос не по теме, потребовать подтверждения без вызова функции). Список приведён в статье целиком.