Три места, где задаётся длина ответа ИИ-агента: блок стиля в инструкции, разделение ответа на сообщения и лимит токенов. В каком порядке их трогать.
Длина ответа агента задаётся в трёх местах и в таком порядке: блок «#СТИЛЬ ОТВЕТА» в инструкции определяет сам объём, «Разделение ответа от агента» режет готовый текст на сообщения с задержкой, а «Максимальное количество токенов в ответе агента» остаётся потолком и стилем не управляет. Начинать стоит с инструкции: остальное лишь оформляет написанное.
Клиент спросил про доставку и получил в мессенджере простыню на десять абзацев: сроки по трём регионам, условия самовывоза, история компании и вежливое предложение обращаться ещё. Прочитать это с телефона невозможно — и следующего сообщения от клиента обычно тоже не бывает.
Владелец идёт в настройки, находит поле со словом «токены» и уменьшает число. Ответы становятся короче ровно один раз, а дальше в диалоге появляется ошибка.
Модель пишет столько, сколько ей позволено — и по умолчанию ей позволено много. Инструкция вида «подробно и доброжелательно отвечай на вопросы клиентов» читается буквально, к делу добавляется вся найденная в базе знаний фактура, и на выходе получается справка вместо реплики в переписке.
Чинится это в трёх разных местах, и они отвечают за разное.
| Что меняем | Где лежит | На что влияет |
|---|---|---|
| Блок «#СТИЛЬ ОТВЕТА» | инструкция агента | сколько текста модель вообще напишет |
| «Разделение ответа от агента» | Доп. настройки | как готовый текст приходит клиенту |
| «Максимальное количество токенов в ответе агента» | Доп. настройки → Параметры LLM | верхняя граница, за которой в диалоге появится ошибка |
Порядок важен. Первые две строки таблицы работают на каждый день, третья трогается только при поломке.
Проверьте на своих диалогах.Регистрация без карты, 500 ₽ на тест по промокоду BLOG500
Собрать агентаИнструкция в Савви делится на именованные блоки, и за объём текста отвечает один из них. Руководство описывает его прямо: блок «#СТИЛЬ ОТВЕТА» отвечает за всё, что связано со стилистикой ответов агента, меняя инструкцию в этой части можно добиться кардинально разных ответов, и здесь можно уменьшить доброжелательность, сократить длину ответа и так далее.
Прилагательные тут бесполезны. «Отвечай кратко» каждый читает по-своему, модель тоже — краткость у неё выходит абзацев на пять. Работают счётные требования и один написанный вами образец:
#СТИЛЬ ОТВЕТА
Отвечай двумя-тремя предложениями, не длиннее пятисот знаков.
На один вопрос клиента даёшь один ответ и один встречный вопрос.
Списки используешь, когда клиент просит перечислить варианты, максимум три пункта.
Пересказывать условия целиком запрещено: назови главное и предложи прислать документ.
Пример хорошего ответа: «Доставим за два дня, по городу 450 рублей.
Адрес и телефон подскажете?»
Остальные блоки инструкции при этом никуда не деваются: разметка решёткой, порядок вопросов и утвердительные формулировки запретов живут по семи правилам рабочего промпта. Здесь важно другое: длина задаётся числом, и число это должно быть в тексте.
Вторая частая причина многословия лежит рядом. Если в инструкцию перенесён прайс или регламент, агент начинает пересказывать его целиком, потому что текст у него перед глазами. Такие данные живут в базе знаний, откуда берётся нужный кусок, а не весь документ.
Настройка «Разделение ответа от агента» разбивает ответ на несколько сообщений. Объём текста она не уменьшает, зато переписка перестаёт выглядеть стеной: клиент получает мысль по частям — как от живого человека.
Задержка между сообщениями происходит при отправке в подключённый канал. В тестовом чате Савви сообщение появляется сразу после генерации ответа моделью, поэтому пауза там не заметна. Проверять разбивку нужно запросом из Telegram, WhatsApp или виджета на сайте — тестовый диалог годится для проверки смысла ответа.
Есть и обратная сторона. Три сообщения подряд с паузами в канале читаются живее одного длинного, но уведомление у клиента приходит трижды. Для поддержки это нормально, для холодного первого контакта лучше держать чанк побольше.
«Максимальное количество токенов в ответе агента» определяет максимальный ответ, который может быть обработан от модели, и при превышении лимита в диалоге отобразится ошибка. Дословная формулировка руководства: в большинстве случаев настройка не требует изменений, но в ряде моделей с размышлениями значение необходимо увеличить, и подбирается оно опытным путём.
Отсюда следует простое правило эксплуатации. Занижать этот лимит ради краткости бессмысленно: агент не начнёт формулировать компактнее, он упрётся в границу на середине фразы и вернёт в диалог ошибку. Клиент увидит обрыв, а вы — обращение в поддержку.
Менять значение стоит в одну сторону и по одному поводу: агент работает на думающей модели, ответы иногда обрываются ошибкой, значит потолок поднимают. Заодно проверьте, какая модель стоит у агента: думающие модели тратят токены на рассуждение до того, как напишут первое слово ответа.
Для голоса требования к длине жёстче, чем в переписке, и добавляется второе требование — к цельности фразы.
Руководство формулирует это так: для голосовых каналов лучше давать более короткие ответы, и желательно, чтобы агент произносил каждую фразу без разрывов, единым предложением, иначе интонация будет слегка нестабильной. На практике это значит, что разбивку ответа на части голосовому агенту включать не нужно: синтез споткнётся на границах кусков — собеседник услышит рваную речь. Длина при этом остаётся делом инструкции, а тембр и скорость настраиваются отдельно, в параметрах голоса.
Проверка простая: прочитайте ответ агента вслух. Если на одном дыхании не получилось, для звонка он длинный.
Убедитесь в этом на живых диалогах за неделю, а не на паре тестовых реплик. Откройте чаты, отсортируйте по длине последних сообщений агента и посмотрите на верхние двадцать: в них видно, какие темы раздувают ответ — цена, доставка, состав услуги. Это и есть места, куда в блок стиля дописываются счётные требования.
Дальше держите один ритм правок. Меняете формулировку в блоке стиля, прогоняете десяток реальных вопросов, смотрите длину. Полный список того, что ещё живёт в дополнительных настройках рядом с разделением ответа, всегда актуален в руководстве Савви.
И один вопрос напоследок, который экономит половину работы: короткий ответ должен закрывать вопрос клиента, поэтому вместе с длиной проверяйте, остался ли в нём встречный вопрос. Ответ на два предложения без продолжения разговора — это уже другая поломка.
В блоке «#СТИЛЬ ОТВЕТА» основной инструкции. Руководство описывает его так: этот блок отвечает за всё, что связано со стилистикой ответов, и здесь можно уменьшить доброжелательность, сократить длину ответа и так далее. Остальные настройки оформляют уже написанный моделью текст.
Разбивает ответ агента на несколько сообщений. Настраивается тремя шагами: тип разделения, размер чанка в предложениях или параграфах и задержка между отправками в секундах. Общий объём текста при этом остаётся прежним, меняется только его подача в переписке.
Так и задумано. Задержка происходит при отправке в подключённый канал, а в тестовом чате Савви сообщение появляется сразу после генерации ответа моделью. Проверять разбивку с паузами нужно запросом из реального канала — Telegram, WhatsApp, виджета на сайте.
Это не тот рычаг. «Максимальное количество токенов в ответе агента» определяет максимальный ответ, который может быть обработан от модели, и при превышении лимита в диалоге отобразится ошибка. Занижение значения обрывает ответ ошибкой вместо того, чтобы сделать его лаконичным.
Когда агент работает на модели с размышлениями. Руководство прямо пишет, что в большинстве случаев настройка изменений не требует, но для ряда таких моделей значение необходимо увеличить, и подбирается оно опытным путём. Сигнал к увеличению — ошибка в диалоге на длинных ответах.
Короче, чем в переписке. Руководство советует для голосовых каналов давать более короткие ответы и добиваться, чтобы агент произносил каждую фразу без разрывов, единым предложением: иначе интонация будет слегка нестабильной. Разбивку ответа на части для голоса включать смысла нет.