Наименование организации:
ООО «Мой Софт»
40702810310000021416
Расчетный счет:
АО «ТИНЬКОФФ БАНК»
Банк:
044525974
БИК:
781101001
Корреспондентский счет:
7811616280
ИНН:
781101001
КПП:
1167847299410
ОГРН:
ОКПО:
03614300
Бесщетников Антон Игоревич
Генеральный директор:
192019, г. Санкт-Петербург, ул. Мельничная, д. 18, литер А, пом. 18-H 10, оф. 805
Юридический адрес:
Почтовый адрес:
192019, г. Санкт-Петербург, а/я 2
Реквизиты компании ООО «Мой Софт»
Инструкции и промпты

Как снизить стоимость диалога с ИИ-агентом

Шесть приёмов сокращают счёт за диалог: обрезка истории, отключение лишних логов, подчинённый агент, LIMIT в таблице, смена модели и языка инструкции.

Команда платформы СаввиОбновлено 22 сентября 20266 мин чтения
Пластилиновая стопка монет уменьшается справа налево, рядом лежит срезанная катушка ленты
Коротко

Стоимость диалога снижают шесть приёмов: обрезка истории по времени или по числу сообщений, отключение сохранения истории вызовов функций, вынос редких функций в подчинённого агента, лимит строк в ответе таблицы, английский язык в инструкции и смена модели с проверкой промпта. Эффект измеряют через экспорт диалога, число токенов и флаг стоимости в тестовом чате.

Счёт за диалоги в этом месяце вырос вдвое, а клиентов не прибавилось ни одного: тот же поток обращений, та же нагрузка на канал, но в конце месяца другая цифра. Обычно объяснение простое: в инструкции, истории и функциях агента незаметно накопился лишний вес. Найти его и срезать — задача на один вечер, без переписывания агента заново.

Из чего в диалоге незаметно набегает счёт

В модель на каждую реплику уходит больше, чем последнее сообщение клиента: туда добавляется инструкция целиком, описания всех подключённых функций, данные, которые эти функции вернули, история переписки и история вызовов функций. Платформа считает по токенам, и ориентир простой — тысяча токенов стоит около рубля.

Общая формула счёта знакома по статье «Сколько стоит чат-бот с ИИ»: один диалог стоит около пятнадцати рублей в среднем по платформе. Здесь эта сумма оказывается вдвое или втрое выше обычной, и разбираемся, за счёт какого из шести кусков контекста это происходит и что из них можно обрезать руками.

Проверьте на своих диалогах.Регистрация без карты, 500 ₽ на тест по промокоду BLOG500

Собрать агента

Обрежьте историю, которая уходит в модель на каждую реплику

В дополнительных настройках агента есть два способа ограничить историю: передавать её за определённое число минут или за определённое число последних сообщений. Без этой настройки в модель на каждую реплику уходит весь диалог с самого начала, сколько бы сообщений в нём ни накопилось.

Способ по минутам подходит клиентам, которые пишут с перерывами в дни и недели, — например, постоянным посетителям салона красоты, обращающимся раз в две недели по одному и тому же номеру. Старый разговор к моменту нового визита уже не нужен модели для контекста, но без обрезки он продолжает ехать в каждую реплику. Способ по числу сообщений лучше подходит коротким сервисным диалогам, где хватает последних десяти-пятнадцати сообщений, чтобы понять контекст вопроса.

Отключите сохранение истории вызовов функций

Соседняя настройка в том же разделе решает другой вопрос: передавать ли в модель результаты прошлых вызовов функций вместе с текущим запросом. Она полезна, когда агент получил данные, которые пригодятся позже в этом же разговоре: например, номер заказа и его статус, к которым клиент может вернуться через несколько сообщений.

Если нужные сведения и так остаются в тексте самого диалога (агент уже написал клиенту номер заказа и дату сборки), повторно тащить их через историю вызовов не обязательно. На длинных переписках, где функция вызывалась пять-шесть раз, отключение этого флага заметно сокращает объём, который агент пересылает модели на каждом следующем шаге. Определить заранее, можно ли его выключить, получится только тестированием на своих сценариях.

Вынесите редкие функции в подчинённого агента

Каждая подключённая функция (таблица, действие, элемент базы знаний, чтение поля CRM) — это отдельное описание: название, назначение, структура параметров. Оно передаётся модели при любом обращении к агенту, даже если клиент спросил о доставке, а не о том, что делает эта функция.

Если у агента подключено много функций, которые нужны редко (сверка остатков по десятку складов, работа с архивными прайсами, узкий сценарий возврата), их можно собрать в отдельном подчинённом агенте. У главного агента вместо десятка описаний остаётся одно: вызов подчинённого, и оно уходит в модель на каждую реплику вместо всех десяти. Полный набор функций подключается, только когда диалог действительно доходит до этого сценария. Устройство такой передачи между агентами работает по тем же правилам, что и вся система из нескольких ИИ-агентов.

Ограничьте таблицу лимитом, смените язык инструкции или саму модель

Три способа сузить то, что агент передаёт модели, — два внутри инструкции и один на уровне модели целиком.

ПриёмГде применяетсяЧто даёт
Оператор LIMIT в запросе к таблицеФункция чтения строк из таблицыЗадаёт потолок строк в ответе, когда сузить поиск заранее нельзя
Английский язык в инструкцииСистемный промпт агентаВ кириллице отдельная буква иногда занимает два токена, латиница экономичнее по объёму символов на ту же мысль
Смена моделиДополнительные настройки → параметры LLMМодели различаются на порядок по расходу токенов на один и тот же ответ

Если найти строку по параметрам запроса клиента не получается, а таблица большая, оператор LIMIT не даст функции вернуть все двадцать совпавших строк вместо трёх нужных — лишний объём в ответе увеличивает и стоимость этой конкретной реплики. Перевод инструкции на английский язык работает на том же принципе экономии символов, только охватывает всю инструкцию сразу, а не разовый ответ функции — эффект действует в каждом диалоге до тех пор, пока она не изменится.

Разница в цене между моделями порядковая, а не косметическая, поэтому смена модели обычно даёт самый заметный эффект из всех приёмов на этой странице. Но модель, помимо цены, меняет ещё и то, как агент читает инструкцию: формулировки вида «постарайтесь уточнить» разные модели выполняют по-разному. Переключение на дешёвую модель без проверки может дать пустые или неточные ответы там, где раньше диалог шёл ровно.

Порядок безопасный: переключить модель, прогнать пять-десять типовых диалогов в тестовом чате (включая сценарии с вызовом функций), сравнить ответы со старыми и при расхождениях поправить инструкцию под новую модель вместо отката на прежнюю. Под конкретную задачу модель выбирают по критериям выбора модели для ИИ-агента; здесь важно только то, что переход без проверки экономит рубли и рискует качеством ответов.

!
Меняйте по одному приёму за раз

Обрезка истории, отключённый лог вызовов и смена модели одновременно дают эффект, который потом невозможно разложить обратно: непонятно, что именно снизило счёт и что именно испортило ответ, если что-то пошло не так. Каждое изменение стоит проверить отдельно, прежде чем добавлять следующее.

Снимите цифры до и после — без них экономия останется ощущением

Снимите две точки отсчёта: стоимость диалога до правки и через несколько дней после неё. Без сравнения кажется, что стало дешевле, хотя разница может объясняться просто более коротким днём у клиентов.

1 Экспортируйте диалоги за неделю до изменения Возьмите обычную неделю, без сезонного всплеска обращений — иначе разница спишется на объём, а не на настройку.
2 Примените один приём из списка выше Обрезка истории, отключение лога вызовов, подчинённый агент, LIMIT, смена модели или языка — по одному за раз.
3 Прогоните пять-десять диалогов в тестовом чате Включите флаг «Отображать стоимость диалога в тестовом чате» — он показывает точную цену именно этого сценария в рублях.
4 Сравните число токенов и итоговую цену Разница должна быть заметна на одном и том же сценарии. Если её нет — приём не подошёл именно вашему агенту, и стоит пробовать следующий.

Полный список настроек (обрезка истории, лог вызовов, лимиты) со всеми полями находится в руководстве платформы. Жёсткие ограничения, которые останавливают диалог целиком при перерасходе, — тема отдельная, это аварийный тормоз: подробности — в статье «Лимиты и контроль расходов ИИ-агента», а здесь — про то, как снизить цену диалога, который и так укладывается в лимиты.

Частые вопросы

Почему стоимость диалога с ИИ-агентом растёт без видимой причины

Причина обычно в том, что каждую реплику в модель уходит весь контекст: история переписки, инструкция целиком, описания функций и данные, которые эти функции вернули. Если ни один из этих кусков не обрезан, счёт растёт вместе с длиной переписки, даже когда число обращений не изменилось.

Как обрезать историю переписки, которая уходит в модель

В дополнительных настройках агента есть выбор: передавать историю за X минут или за X сообщений. Первый вариант удобен для регулярных клиентов, которые пишут с перерывами в дни и недели, второй — для сервисных ботов с короткими диалогами. Без ограничения длинная переписка передаётся в модель заново на каждую реплику.

Зачем отключать сохранение истории вызовов функций

Эта настройка решает, приходят ли в модель результаты прошлых вызовов функций вместе с текущим запросом. Если нужная информация и так остаётся в тексте диалога, флаг можно выключить — на длинных переписках это заметно сокращает объём, который агент пересылает модели на каждом шаге.

Как вынос функций в подчинённого агента снижает счёт

Каждая подключённая функция — это отдельное описание, которое передаётся модели при любом обращении, даже если клиент спросил совсем не про неё. Собрав редко нужные функции в отдельном подчинённом агенте, вы оставляете у главного агента одну функцию вызова вместо десятка, и она передаётся в модель, только когда действительно нужна.

Как ограничить объём данных из таблицы

Оператором LIMIT в запросе к таблице: он задаёт максимальное число возвращаемых строк. Двадцать найденных строк вместо трёх увеличивают ответ функции, а вместе с ним и счёт за реплику, хотя клиенту нужна была одна позиция.

Как проверить, что смена модели или языка инструкции действительно снизила счёт

Переключить одну настройку за раз и прогнать пять-десять типовых диалогов в тестовом чате, включив флаг «Отображать стоимость диалога в тестовом чате». Так виден точный расход в рублях на конкретном сценарии, а не средняя цифра по платформе.

Команда платформы СаввиПишем о том, как бизнес внедряет ИИ-агентов, на данных платформы. Обновлено 22 сентября 2026.
BLOG500
Собрать агента