Чем модели отличаются в работе агента: точность вызова функций, длина ответа, расход токенов и страна обработки данных. Когда нужен режим рассуждений, а когда хватит nano.
Модель определяет качество и стабильность ответов, скорость, точность вызова функций, расход токенов и страну обработки данных. По умолчанию новым агентам ставится GPT-4.1, и большинству сценариев её достаточно. Переходить на старшие или рассуждающие модели имеет смысл при сложных сценариях с множеством условий, на дешёвые mini и nano — на коротких FAQ и маршрутизации. После любой смены модели инструкцию проверяют заново.
Выбор модели выглядит как выбор из выпадающего списка, в котором любой вариант «вроде работает». Поэтому его обычно и не делают: агент живёт на том, что поставилось при создании.
Разница между вариантами в этом списке при этом измеримая — она видна в стоимости диалога и в том, доходит ли агент до вызова функции.
У каждой модели в кабинете есть три пометки, и по ним принимается решение.
Размещение — где физически обрабатываются данные: США, РФ или Китай. Стоимость — относительный расход токенов: $ низкий, $$ средний, $$$ высокий; это порядок величины, а не цена в рублях. Reasoning в названии — режим рассуждений: точнее на сложном, дороже и медленнее на простом.
| Задача агента | Что брать | Почему |
|---|---|---|
| Продажи и поддержка, обычный поток | GPT-4.1 | ставится по умолчанию, предсказуема, стабильно вызывает функции |
| Много условий, ветвлений, функций | GPT-5.4 или Claude Sonnet 4.6 | держат длинную инструкцию и не путают шаги |
| Короткие FAQ, приветствие, маршрутизация | GPT-4.1 nano, GPT-5 nano | простейшие задачи по низкому уровню стоимости |
| Большой поток при ограниченном бюджете | GPT-4.1 mini, Gemini 3 Flash Preview, Claude Haiku 4.5, DeepSeek-V4-Flash | качество при уровне стоимости $ |
| Данные не должны покидать РФ | YandexGPT, Alice AI LLM, GigaChat-2-Max | размещение в России |
| Клиент присылает фото | OpenAI, Anthropic, Google, xAI | остальные изображения не читают |
Проверьте на своих диалогах.Регистрация без карты, 500 ₽ на тест по промокоду BLOG500
Собрать агентаGPT-4o — модель, на которой Савви прожил самый большой объём реальных диалогов. Значительная часть проектов запущена и отлажена именно на ней: она мягко ведёт разговор, спокойно относится к разговорному стилю клиента и почти не спорит с инструкцией. Если проект давно работает на ней и вас всё устраивает, менять модель ради обновления смысла нет.
GPT-4.1 ставится новым агентам. По сравнению с предшественницей она точнее следует инструкции, аккуратнее работает с функциями, держит вдвое больший объём ответа и обходится дешевле.
Ни одна из них не рассуждает перед ответом, и в поддержке это плюс: ответ приходит сразу, токены не тратятся на скрытый ход мыслей.
Смена почти всегда снижает стоимость диалога, но требует проверки промпта: GPT-4.1 понимает инструкцию буквальнее. Формулировку «постарайся уточнить» она может выполнить иначе, чем привыкли. Порядок: переключить, прогнать 5–10 типовых диалогов с вызовами функций, сравнить ответы, при расхождениях править инструкцию — а не возвращать старую модель.
Рассуждающие модели берут за то, чего клиент не увидит: размышления тарифицируются наравне с ответом.
Окупается это там, где агент должен разбираться в длинных условиях, считать, сопоставлять данные из нескольких источников или вести переговорный диалог. На коротком «а сколько стоит доставка» режим рассуждений добавляет к счёту и к паузе перед ответом, не добавляя ничего к качеству.
DeepSeek не вызывает несколько функций за один ход — агент делает это последовательно, что чуть медленнее. Плюс данные обрабатываются в Китае.
Perplexity Sonar Deep Research вообще не поддерживает вызов функций. Агент на ней не сможет пользоваться действиями, интеграциями с CRM и таблицами. Это поисковый инструмент для одного развёрнутого ответа со ссылками, а не диалоговая модель.
Модели со статусом Preview у Google вендор может менять без предупреждения, поэтому агента на такой модели стоит перепроверять в тестовом чате после каждого крупного изменения инструкции.
Suvvy-GPT — модель платформы под собственным брендом: качество на уровне старших при средней стоимости, но без чтения изображений и с обработкой в Китае.
Уровни $ и $$$ в кабинете — относительная шкала, а платите вы по токенам: тысяча токенов стоит 1 ₽, диалог обходится примерно в 15 ₽.
Поэтому проверять экономию модели удобнее всего прямо в тестовом чате: там есть флаг «Отображать стоимость диалога». Один и тот же сценарий, прогнанный на двух моделях, сразу показывает разницу в рублях — и часто оказывается, что дорогая модель дороже не втрое, а на пару рублей за диалог, потому что отвечает короче.
Откройте дополнительные настройки и посмотрите, какая модель стоит у вашего агента сейчас.
Если это GPT-4o и агент работает нормально — оставьте. Если сценарий разросся и агент стал путать шаги, переключитесь на GPT-5.4 и прогоните десять диалогов с вызовами функций, сверяя ответы со старыми. Правило, которое экономит больше всего времени: модель меняют по одной штуке за раз, иначе непонятно, что именно улучшилось.
GPT-4.1. Она быстрая, предсказуемая, аккуратно следует инструкции и стабильно вызывает функции — этого хватает большинству сценариев продаж и поддержки. Если не знаете, с чего начать, оставляйте её.
Это та же модель в режиме рассуждений: перед ответом она отдельно «думает». На сложных задачах точнее, но отвечает медленнее и расходует больше токенов, потому что размышления тоже тарифицируются. У части моделей глубину рассуждений можно настроить.
GPT-4.1 точнее следует инструкции и меньше додумывает шаги, аккуратнее работает с функциями, держит вдвое больший объём ответа — 32 768 токенов против 16 384 — и обходится дешевле: уровень стоимости в кабинете $$ против $$$.
Прежде чем модель появится в кабинете, её отлаживают: проверяют, как она держит длинную инструкцию, вызывает функции, работает с базой знаний и не выдумывает. Не прошедшие отладку модели в кабинет не выгружаются, поэтому список не повторяет анонсы вендоров.
YandexGPT, Alice AI LLM, GigaChat, Suvvy-GPT, DeepSeek и o3-mini. Понимают изображения модели OpenAI, Anthropic, Google и xAI.
Прогнать 5–10 типовых диалогов в тестовом чате, обязательно включая те, где агент вызывает функции и обращается к базе знаний, сравнить ответы с прежними и при расхождениях править инструкцию под новую модель. Возвращаться к старой модели — тупиковый путь.