Наименование организации:
ООО «Мой Софт»
40702810310000021416
Расчетный счет:
АО «ТИНЬКОФФ БАНК»
Банк:
044525974
БИК:
781101001
Корреспондентский счет:
7811616280
ИНН:
781101001
КПП:
1167847299410
ОГРН:
ОКПО:
03614300
Бесщетников Антон Игоревич
Генеральный директор:
192019, г. Санкт-Петербург, ул. Мельничная, д. 18, литер А, пом. 18-H 10, оф. 805
Юридический адрес:
Почтовый адрес:
192019, г. Санкт-Петербург, а/я 2
Реквизиты компании ООО «Мой Софт»
Инструкции и промпты

Агент отвечает слишком длинно: как укоротить ответы

Три места, где задаётся длина ответа ИИ-агента: блок стиля в инструкции, разделение ответа на сообщения и лимит токенов. В каком порядке их трогать.

Команда платформы СаввиОбновлено 23 сентября 20266 мин чтения
Длинный бумажный свиток сворачивается в короткую коралловую карточку на светлом фоне
Коротко

Длина ответа агента задаётся в трёх местах и в таком порядке: блок «#СТИЛЬ ОТВЕТА» в инструкции определяет сам объём, «Разделение ответа от агента» режет готовый текст на сообщения с задержкой, а «Максимальное количество токенов в ответе агента» остаётся потолком и стилем не управляет. Начинать стоит с инструкции: остальное лишь оформляет написанное.

Клиент спросил про доставку и получил в мессенджере простыню на десять абзацев: сроки по трём регионам, условия самовывоза, история компании и вежливое предложение обращаться ещё. Прочитать это с телефона невозможно — и следующего сообщения от клиента обычно тоже не бывает.

Владелец идёт в настройки, находит поле со словом «токены» и уменьшает число. Ответы становятся короче ровно один раз, а дальше в диалоге появляется ошибка.

Почему ответ агента разрастается

Модель пишет столько, сколько ей позволено — и по умолчанию ей позволено много. Инструкция вида «подробно и доброжелательно отвечай на вопросы клиентов» читается буквально, к делу добавляется вся найденная в базе знаний фактура, и на выходе получается справка вместо реплики в переписке.

Чинится это в трёх разных местах, и они отвечают за разное.

Что меняемГде лежитНа что влияет
Блок «#СТИЛЬ ОТВЕТА»инструкция агентасколько текста модель вообще напишет
«Разделение ответа от агента»Доп. настройкикак готовый текст приходит клиенту
«Максимальное количество токенов в ответе агента»Доп. настройки → Параметры LLMверхняя граница, за которой в диалоге появится ошибка

Порядок важен. Первые две строки таблицы работают на каждый день, третья трогается только при поломке.

Проверьте на своих диалогах.Регистрация без карты, 500 ₽ на тест по промокоду BLOG500

Собрать агента

Блок «#СТИЛЬ ОТВЕТА» решает почти всё

Инструкция в Савви делится на именованные блоки, и за объём текста отвечает один из них. Руководство описывает его прямо: блок «#СТИЛЬ ОТВЕТА» отвечает за всё, что связано со стилистикой ответов агента, меняя инструкцию в этой части можно добиться кардинально разных ответов, и здесь можно уменьшить доброжелательность, сократить длину ответа и так далее.

Прилагательные тут бесполезны. «Отвечай кратко» каждый читает по-своему, модель тоже — краткость у неё выходит абзацев на пять. Работают счётные требования и один написанный вами образец:

#СТИЛЬ ОТВЕТА
Отвечай двумя-тремя предложениями, не длиннее пятисот знаков.
На один вопрос клиента даёшь один ответ и один встречный вопрос.
Списки используешь, когда клиент просит перечислить варианты, максимум три пункта.
Пересказывать условия целиком запрещено: назови главное и предложи прислать документ.
Пример хорошего ответа: «Доставим за два дня, по городу 450 рублей.
Адрес и телефон подскажете?»

Остальные блоки инструкции при этом никуда не деваются: разметка решёткой, порядок вопросов и утвердительные формулировки запретов живут по семи правилам рабочего промпта. Здесь важно другое: длина задаётся числом, и число это должно быть в тексте.

Вторая частая причина многословия лежит рядом. Если в инструкцию перенесён прайс или регламент, агент начинает пересказывать его целиком, потому что текст у него перед глазами. Такие данные живут в базе знаний, откуда берётся нужный кусок, а не весь документ.

Разделение ответа: длинный текст приходит частями

Настройка «Разделение ответа от агента» разбивает ответ на несколько сообщений. Объём текста она не уменьшает, зато переписка перестаёт выглядеть стеной: клиент получает мысль по частям — как от живого человека.

1 Тип разделения Выбираете, по какой границе резать готовый ответ агента.
2 Размер чанка Задаёте количество предложений или параграфов в одной части.
3 Задержка Выставляете паузу между отправками сообщения в секундах.
!
Задержку видно только в реальном канале

Задержка между сообщениями происходит при отправке в подключённый канал. В тестовом чате Савви сообщение появляется сразу после генерации ответа моделью, поэтому пауза там не заметна. Проверять разбивку нужно запросом из Telegram, WhatsApp или виджета на сайте — тестовый диалог годится для проверки смысла ответа.

Есть и обратная сторона. Три сообщения подряд с паузами в канале читаются живее одного длинного, но уведомление у клиента приходит трижды. Для поддержки это нормально, для холодного первого контакта лучше держать чанк побольше.

Максимум токенов — это потолок, а не регулятор стиля

«Максимальное количество токенов в ответе агента» определяет максимальный ответ, который может быть обработан от модели, и при превышении лимита в диалоге отобразится ошибка. Дословная формулировка руководства: в большинстве случаев настройка не требует изменений, но в ряде моделей с размышлениями значение необходимо увеличить, и подбирается оно опытным путём.

Отсюда следует простое правило эксплуатации. Занижать этот лимит ради краткости бессмысленно: агент не начнёт формулировать компактнее, он упрётся в границу на середине фразы и вернёт в диалог ошибку. Клиент увидит обрыв, а вы — обращение в поддержку.

Менять значение стоит в одну сторону и по одному поводу: агент работает на думающей модели, ответы иногда обрываются ошибкой, значит потолок поднимают. Заодно проверьте, какая модель стоит у агента: думающие модели тратят токены на рассуждение до того, как напишут первое слово ответа.

Голосовой агент: короче и без разрывов

Для голоса требования к длине жёстче, чем в переписке, и добавляется второе требование — к цельности фразы.

Руководство формулирует это так: для голосовых каналов лучше давать более короткие ответы, и желательно, чтобы агент произносил каждую фразу без разрывов, единым предложением, иначе интонация будет слегка нестабильной. На практике это значит, что разбивку ответа на части голосовому агенту включать не нужно: синтез споткнётся на границах кусков — собеседник услышит рваную речь. Длина при этом остаётся делом инструкции, а тембр и скорость настраиваются отдельно, в параметрах голоса.

Проверка простая: прочитайте ответ агента вслух. Если на одном дыхании не получилось, для звонка он длинный.

Как убедиться, что ответы действительно стали короче

Убедитесь в этом на живых диалогах за неделю, а не на паре тестовых реплик. Откройте чаты, отсортируйте по длине последних сообщений агента и посмотрите на верхние двадцать: в них видно, какие темы раздувают ответ — цена, доставка, состав услуги. Это и есть места, куда в блок стиля дописываются счётные требования.

Дальше держите один ритм правок. Меняете формулировку в блоке стиля, прогоняете десяток реальных вопросов, смотрите длину. Полный список того, что ещё живёт в дополнительных настройках рядом с разделением ответа, всегда актуален в руководстве Савви.

И один вопрос напоследок, который экономит половину работы: короткий ответ должен закрывать вопрос клиента, поэтому вместе с длиной проверяйте, остался ли в нём встречный вопрос. Ответ на два предложения без продолжения разговора — это уже другая поломка.

Частые вопросы

Где в Савви задаётся длина ответа агента

В блоке «#СТИЛЬ ОТВЕТА» основной инструкции. Руководство описывает его так: этот блок отвечает за всё, что связано со стилистикой ответов, и здесь можно уменьшить доброжелательность, сократить длину ответа и так далее. Остальные настройки оформляют уже написанный моделью текст.

Что делает настройка «Разделение ответа от агента»

Разбивает ответ агента на несколько сообщений. Настраивается тремя шагами: тип разделения, размер чанка в предложениях или параграфах и задержка между отправками в секундах. Общий объём текста при этом остаётся прежним, меняется только его подача в переписке.

Почему задержка между сообщениями не работает в тестовом чате

Так и задумано. Задержка происходит при отправке в подключённый канал, а в тестовом чате Савви сообщение появляется сразу после генерации ответа моделью. Проверять разбивку с паузами нужно запросом из реального канала — Telegram, WhatsApp, виджета на сайте.

Можно ли укоротить ответы через максимум токенов

Это не тот рычаг. «Максимальное количество токенов в ответе агента» определяет максимальный ответ, который может быть обработан от модели, и при превышении лимита в диалоге отобразится ошибка. Занижение значения обрывает ответ ошибкой вместо того, чтобы сделать его лаконичным.

Когда максимум токенов всё-таки нужно менять

Когда агент работает на модели с размышлениями. Руководство прямо пишет, что в большинстве случаев настройка изменений не требует, но для ряда таких моделей значение необходимо увеличить, и подбирается оно опытным путём. Сигнал к увеличению — ошибка в диалоге на длинных ответах.

Какой длины должны быть ответы у голосового агента

Короче, чем в переписке. Руководство советует для голосовых каналов давать более короткие ответы и добиваться, чтобы агент произносил каждую фразу без разрывов, единым предложением: иначе интонация будет слегка нестабильной. Разбивку ответа на части для голоса включать смысла нет.

Команда платформы СаввиПишем о том, как бизнес внедряет ИИ-агентов, на данных платформы. Обновлено 23 сентября 2026.
BLOG500
Собрать агента