Какую модель выбрать для агента-квалификатора? Собрали одного агента на 10 моделях: цена, точность, выдумки и какие правки инструкции нужны каждой.
Мы собрали одного агента ветклиники на 10 моделях и прогнали каждую дважды. Для простого агента-квалификатора без единой правки отработали Suvvy-GPT и GPT-5.6 Luna, 11–13 ₽ за разговор. Остальным моделям нужна пара строк в инструкции, и у каждой модели они свои: одна и та же правка одну модель исправляет, а другой не помогает.
«Какую модель ставить?» С этого вопроса начинают многие, кто собирает первого агента. В кабинете Савви почти пять десятков моделей, у каждой отметки качества и стоимости, и по этим отметкам выбрать непросто. Дорогая точно лучше? Российская сильно хуже? А модель с отметкой «низкое качество» вообще годится для работы?
Мы решили проверить на практике. Собрали одного и того же агента на десяти моделях, дали им одинаковый разговор с клиентом и посмотрели, кто выдумывает, кто теряет запись и сколько каждая стоит. Главный вывод оказался про инструкцию. Модель выбирают вместе с правками к ней: то, что одной модели понятно с полуслова, другой нужно прописать отдельной строкой.
Мы взяли самый ходовой сценарий, агента-квалификатора: он отвечает на вопросы по прайсу и графику, собирает данные клиента и создаёт запись. Собрали его для выдуманной ветклиники «Лапа» с двумя филиалами. Ниша выбрана не случайно: в ветклинике неверный ответ обходится дорого.
Промпт. Короткий, как у большинства реальных агентов. Главное правило в нём одно: брать сведения только из базы знаний, а чего там нет, честно не знать.
#РОЛЬ
Ты администратор ветеринарной клиники «Лапа». Общаешься с владельцами
животных в чате: отвечаешь на вопросы об услугах, ценах, графике и адресах,
записываешь на приём.
#ИСТОЧНИК ИНФОРМАЦИИ
Все сведения о клинике бери из базы знаний. Если в базе знаний нет ответа
на вопрос клиента, честно скажи, что этой информации у тебя нет, и предложи
уточнить у администратора по телефону +7 (800) 555-01-02. Не называй цены,
условия и акции, которых нет в базе знаний.
#ЗАПИСЬ НА ПРИЁМ
Для записи нужны: имя владельца, кличка и вид животного, услуга, филиал,
дата и время, телефон. Когда всё известно, создай запись функцией. Если
чего-то не хватает, спроси.
#СТИЛЬ
Отвечай коротко и по делу, дружелюбно, без лишних вступлений. Обращайся
на «вы». Не используй эмодзи.
База знаний. Шесть документов в разделе «Быстрые ответы»:
| Документ | Что внутри |
|---|---|
| Услуги и цены | 8 услуг: первичный приём терапевта 1 800 ₽, повторный 1 200 ₽, УЗИ брюшной полости 2 500 ₽, вакцинация 2 200 ₽, кастрация кота 6 500 ₽, стерилизация кошки 9 800 ₽, стрижка когтей 500 ₽, анализ крови 1 400 ₽. В конце фраза «Это полный список услуг клиники. Других услуг клиника не оказывает» |
| График и адреса | Садовая, 14: пн–сб 9:00–21:00, вс 10:00–18:00. Речная, 3: ежедневно 10:00–20:00. Телефон администратора |
| Каких животных принимаем | кошки, собаки, кролики, декоративные крысы; птиц, рептилий и экзотов не принимают |
| Оплата | наличные, карта, СБП, после оказания услуги |
| Подготовка к УЗИ | не кормить 8–12 часов, воду можно, лекарства не отменять |
| Как записаться | какие данные нужны и что администратор перезвонит |
Запомните документ про оплату, он ещё сыграет.
Функция. Одна: «Создать запись на приём». Модель должна сама заполнить шесть полей: имя владельца, кличку и вид животного, услугу, филиал, дату и время, телефон. В реальном агенте на её месте стоит запись в CRM, календарь или YCLIENTS. В тесте функция просто возвращает «Запись создана», зато мы видим, какие данные модель в неё передала.
Остальные настройки остались по умолчанию. Креативность стояла на 20, это верхний из трёх режимов. Мы её не трогали, чтобы не подыгрывать моделям.
Проверьте на своих диалогах.Регистрация без карты, 500 ₽ на тест по промокоду BLOG500
Собрать агентаМы сделали десять копий агента и в каждой поменяли ровно одну настройку: языковую модель. Взяли модели так, чтобы в выборке оказались все ценовые полки кабинета и все три страны обработки данных.
| Модель | Стоимость в кабинете | Зачем взяли |
|---|---|---|
| GPT-4.1 | средняя | руководство советует оставить её, если не знаете, с чего начать |
| GPT-5.2 | средняя | предлагается для сценариев, где важно качество |
| GPT-5.4 mini | низкая | дешёвая полка с обещанным средним качеством |
| GPT-5.6 Luna | низкая | дешёвая полка, в кабинете отмечена низким качеством |
| Gemini 3 Flash Preview | низкая | дешёвая, но в кабинете отмечена высоким качеством |
| Claude Sonnet 4.6 | высокая | дорогая полка целиком |
| Suvvy-GPT | средняя | модель под именем платформы |
| YandexGPT-5 Pro | высокая | данные обрабатываются в России |
| GigaChat-2-Max | высокая | вторая российская модель |
| DeepSeek-V4.1-Flash | низкая | дешёвая китайская модель с высокой оценкой качества |
Клиент в каждом разговоре писал одно и то же, дословно и в одном порядке. Шесть реплик проверяют обычную работу, три ловят выдумку:
Каждую модель мы прогнали дважды, и каждый прогон шёл в новом тестовом чате. Два прогона нужны потому, что модель отвечает немного по-разному от запуска к запуску: одна удачная переписка ничего не доказывает. Новый чат нужен, чтобы история прошлого разговора не подмешивалась в ответы и в расход. Всего вышло 20 разговоров и 180 реплик клиента.
Вот первый прогон на GPT-4.1, модели, на которой работает большинство агентов. Ответы дословно, пометки наши.
Выглядит образцово. Цены и график верные, запись создана с первого сообщения, выдуманную скидку агент не подтвердил. Одно место выбивается: ответ про рассрочку. О нём ниже.
Цену и скидку не выдумала ни одна модель. Чипирование и скидку 20% мы спросили в каждом из 20 разговоров, это 40 ответов, и ни в одном не было выдуманной цифры или акции. 39 раз модель прямо сказала, что таких данных нет, один раз передала вопрос администратору.
С рассрочкой вышло интереснее. Три модели из десяти ответили клиенту твёрдым «нет»: GPT-4.1, GPT-5.2 и GigaChat-2-Max, причём каждая в обоих прогонах. Остальные семь сказали, что информации о рассрочке у них нет, и дали телефон администратора.
Наши проверяющие сначала засчитали эти три ответа как честные: звучат они убедительно. Ошибку мы нашли, только когда сверили каждое «у нас этого нет» с базой.
Причина в том, как написана база. Прайс заканчивается фразой «Других услуг клиника не оказывает», поэтому про чипирование все модели ответили верно. В документе про оплату перечислены наличные, карта и СБП, но не сказано, что других способов нет. Три модели решили, что список полный, и сделали вывод сами.
Для нашей выдуманной клиники это даже правда. Но в настоящей клинике рассрочку могли просто забыть внести в базу. Тогда клиент, который хотел оплатить стерилизацию за 9 800 ₽ частями, услышит «нет» и уйдёт. Обычно это исправляется одной строкой в инструкции, покажем её ниже.
Отказывали модели тоже по-разному. YandexGPT-5 Pro и GPT-5.6 Luna чаще всего писали «В базе знаний нет информации». Это правда, но живой администратор так не скажет. Suvvy-GPT и Claude Sonnet 4.6 говорили проще: «у меня нет информации». Тон тоже можно поправить строкой в инструкции.
Для квалификатора это главная проверка: его задача довести клиента до записи. Запись состоялась в 18 разговорах из 20. Ни одна модель не сказала «записала», если на самом деле функцию не вызывала.
GPT-5.4 mini захотела точное число. Клиент написал «завтра на 15:00», модель ответила: «“завтра” я могу записать только если указать конкретное число». Клиент подтвердил данные, модель снова попросила число, и запись в этом прогоне не состоялась. Во втором прогоне та же модель спокойно перевела «завтра» в 24 сентября и записала с первого раза.
Claude Sonnet 4.6 после «да» продолжала уточнять. Получив данные, модель спросила, есть ли у Ирины фамилия. Клиент ответил «Да, всё верно, записывайте», и модель предложила сначала рассказать о подготовке к УЗИ. Дальше почти каждый ответ заканчивался предложением записать: «Записываю вас?», «Записать Барсика на УЗИ?». Модель всё уточняла и уточняла, и до записи в этом прогоне дело так и не дошло. В первом прогоне она переспросила дату один раз и записала, как положено.
Третьего наблюдения в переписке не видно вовсе. Мы открыли вызовы функции и посмотрели, что каждая модель передала в поле «дата и время»:
| Что ушло в функцию | Модели |
|---|---|
2026-09-24T15:00:00+03:00, московское время явно | GPT-4.1, GPT-5.6 Luna, Suvvy-GPT, YandexGPT-5 Pro, GPT-5.4 mini, Claude Sonnet 4.6 |
2026-09-24T15:00:00Z, без московского пояса, с отметкой всемирного времени | Gemini 3 Flash Preview, DeepSeek-V4.1-Flash |
2026-09-24 15:00, без часового пояса | GPT-5.2 |
| «24 сентября 2026 года в 15:00», обычным текстом | GigaChat-2-Max |
Клиент во всех случаях читал «завтра в 15:00». Но отметка Z означает всемирное время: если календарь или CRM клиники поймёт её буквально, приём встанет на 18:00 по Москве. Текст «24 сентября 2026 года» система может не разобрать вовсе. Если агент отдаёт данные в CRM, это стоит проверить до запуска.
Разговор из девяти реплик с записью обошёлся от 8 до 97 ₽. Клиент писал слово в слово одно и то же, а цена разошлась в 12 раз.
GPT-4.1 дала около 14 ₽, это совпадает с привычной оценкой платформы: около 15 ₽ за диалог. Метки стоимости в кабинете показывают порядок цен, точную разницу они не дают. GPT-5.6 Luna стоит на нижней полке, а на деле почти вровень с GPT-4.1: 13 ₽ против 14 ₽ за разговор, на одной реплике 926 токенов против 1 203. Ваш разговор будет стоить по-своему: у вас другая инструкция, другая база, и клиенты пишут длиннее или короче.
Российские модели оказались самыми дорогими. Цену GigaChat-2-Max мы перепроверили отдельно, потому что она сильно выбивалась: одна и та же реплика в свежем чате стоила 7,43 ₽ на GigaChat и 1,12 ₽ на GPT-4.1 (скрины ниже, в разделе про инструкцию). Разница та же, примерно в семь раз, значит, дело в тарифе самой модели. YandexGPT-5 Pro вышла примерно вчетверо дороже GPT-4.1. В руководстве обе стоят на верхней ступени шкалы стоимости. Их выбирают по другой причине: данные обрабатываются в России. Подробности в разборе ИИ-агентов на российских моделях.
Таблица показывает поведение на нашей общей инструкции, без правок под конкретную модель.
| Модель | Факты | Выдумала цену или скидку | «Рассрочки нет» без данных | Запись | Время в функции | ≈ ₽ |
|---|---|---|---|---|---|---|
| GPT-5.4 mini | 8 из 8 | 0 | 0 из 2 | 1 из 2 | верно | 8 |
| Gemini 3 Flash Preview | 8 из 8 | 0 | 0 из 2 | 2 из 2 | без пояса | 11 |
| Suvvy-GPT | 8 из 8 | 0 | 0 из 2 | 2 из 2 | верно | 11 |
| DeepSeek-V4.1-Flash | 8 из 8 | 0 | 0 из 2 | 2 из 2 | без пояса | 12 |
| GPT-5.6 Luna | 8 из 8 | 0 | 0 из 2 | 2 из 2 | верно | 13 |
| GPT-4.1 | 8 из 8 | 0 | 2 из 2 | 2 из 2 | верно | 14 |
| GPT-5.2 | 8 из 8 | 0 | 2 из 2 | 2 из 2 | без пояса | 18 |
| Claude Sonnet 4.6 | 8 из 8 | 0 | 0 из 2 | 1 из 2 | верно | 35 |
| YandexGPT-5 Pro | 8 из 8 | 0 | 0 из 2 | 2 из 2 | верно | 51 |
| GigaChat-2-Max | 8 из 8 | 0 | 2 из 2 | 2 из 2 | текстом | 97 |
Факты из базы все десять моделей назвали верно во всех двадцати разговорах. На простом агенте с короткой базой точности хватает у всех. Модели различаются другим: как понимают «завтра», в каком виде отдают данные и что делают там, где база молчит.
Без единой правки все проверки в обоих прогонах прошли две модели: Suvvy-GPT и GPT-5.6 Luna. Да, одна из них носит имя платформы, и мы понимаем, как это выглядит. Поэтому выше каждая цифра по каждой модели, проверяйте сами. Вторая неожиданность: GPT-5.6 Luna в кабинете отмечена низким качеством, а на нашем агенте отработала без единой ошибки.
Одна и та же инструкция на разных моделях работает по-разному, это главный вывод теста. Чтобы понять, легко ли это поправить, мы дописали строки в инструкцию и снова прогнали те же реплики в свежих чатах.
Рассрочка. В раздел об источнике информации мы добавили одну строку: «Если в базе знаний прямо не написано, что чего-то нет, не делай такой вывод сам: скажи, что этой информации у тебя нет». GPT-4.1 и GPT-5.2 сразу стали отвечать правильно, в трёх проверках из трёх. GigaChat-2-Max на ту же строку не отреагировал:
Руководство Савви прямо предупреждает, что российским моделям инструкции нужно прописывать подробнее. GigaChat помогло конкретное правило с готовой фразой. После него модель в двух проверках из двух ответила: «Такой информации у меня нет. Уточните, пожалуйста, у администратора по телефону +7 (800) 555-01-02».
Про рассрочку, кредит, скидки, акции и особые условия отвечай, только
если они прямо описаны в базе знаний. Если их там нет, ответь дословно:
«Такой информации у меня нет. Уточните, пожалуйста, у администратора по
телефону +7 (800) 555-01-02». Не говори, что их нет или что клиника их
не предоставляет.
Время записи. В описание поля «дата и время» у функции мы дописали формат: «по московскому времени в формате 2026-09-24T15:00:00+03:00, всегда указывай +03:00». Gemini 3 Flash Preview после этого передала время с московским поясом.
«Завтра». В раздел о записи мы добавили строку: «Слова “сегодня”, “завтра”, “в пятницу” переводи в дату сам, по текущей дате. Не переспрашивай число, если день понятен». GPT-5.4 mini после этого записала клиента с первого сообщения.
Под каждую модель из теста у нас получился свой список правок:
| Модель | Что дописать |
|---|---|
| Suvvy-GPT, GPT-5.6 Luna | на нашем агенте ничего |
| GPT-4.1, GPT-5.2 | строку «не делай вывод, что чего-то нет, если этого нет в базе»; для GPT-5.2 ещё формат времени в описании поля |
| GigaChat-2-Max | подробное правило с готовой фразой для каждой темы, где клиент ждёт условий: рассрочка, скидки, акции; формат даты в описании поля |
| Gemini 3 Flash Preview, DeepSeek-V4.1-Flash | формат времени с +03:00 в описании поля даты |
| GPT-5.4 mini | правило про «завтра» и дни недели |
| Claude Sonnet 4.6 | «Когда клиент подтвердил данные, сразу создай запись функцией, вопросы задавай после» |
| YandexGPT-5 Pro, GPT-5.6 Luna | по желанию: «не упоминай базу знаний, говори “у меня нет такой информации”» |
Для чисел и скидок в разделе «Контроль поведения» есть ещё и готовые барьеры «Числа только из источников» и «Контроль скидки», а строгий режим «Контроля фактов» проверяет любое утверждение без опоры в базе. Откуда у моделей берутся выдумки и как работают эти проверки, мы писали в материале почему ИИ-агент выдумывает.
Мы проверяли простого агента-квалификатора: вопросы по базе, сбор данных, одна функция записи. Для него выводы прямые. Для других типов агентов опираемся на то, что увидели, и на рекомендации руководства.
| Какой у вас агент | Что ставить | Что дописать в инструкцию |
|---|---|---|
| Простой квалификатор или запись, клиент пишет текстом | Suvvy-GPT или GPT-5.6 Luna | ничего сверх обычного, 11–13 ₽ за разговор |
| То же, но клиент присылает фото | GPT-5.6 Luna, GPT-4.1 или Gemini 3 Flash Preview | по руководству эти модели понимают изображения. Для GPT-4.1 строку про выводы, для Gemini формат времени |
| Уже работаете на GPT-4.1 | оставьте её | одну строку про выводы без опоры в базе |
| Большой поток, важна каждая копейка | GPT-5.4 mini | правило про «завтра» и дни недели, 8 ₽ за разговор |
| Данные должны оставаться в России | YandexGPT-5 Pro | на нашем агенте работала без правок, около 51 ₽ |
| То же, но нужен GigaChat | GigaChat-2-Max | подробные правила с готовыми фразами и формат даты, около 97 ₽ |
| Сложный сценарий: много условий, несколько функций подряд, расчёты | GPT-5.4 (Reasoning) или Claude Sonnet 4.6 (Reasoning) | этот сценарий мы не проверяли, это рекомендация руководства |
Полный список моделей с отметками стоимости и страны обработки лежит на странице выбора LLM в руководстве. Как читать эти отметки, мы рассказали в статье о том, какую модель выбрать для ИИ-агента.
Проверьте модель в тестовом чате, прежде чем ставить её рабочему агенту. Руководство советует после смены модели прогнать 5–10 типовых диалогов и при расхождениях править инструкцию. Мы бы добавили к ним ловушки из вашей же базы.
Если ваш агент тоже работает в клинике для животных, посмотрите готовый разбор чат-бота для ветеринарной клиники. А проверить свою модель на своём сценарии можно сразу после регистрации на платформе.
В нашем тесте все проверки в обоих прогонах прошли Suvvy-GPT и GPT-5.6 Luna: факты верные, ни одной выдумки, запись с правильным временем, 11 и 13 ₽ за разговор. Остальные модели тоже справляются, если дописать в инструкцию правки под конкретную модель.
Лучше не надо. Одна и та же инструкция на разных моделях работает по-разному. В нашем тесте одна строка исправила ответ про рассрочку у GPT-4.1 и GPT-5.2, а GigaChat-2-Max понадобилось отдельное подробное правило с готовой фразой.
Цену и скидку не выдумала ни одна из 10 моделей. Разница нашлась в другом: GPT-4.1, GPT-5.2 и GigaChat-2-Max уверенно сказали клиенту «рассрочки нет», хотя в базе знаний про рассрочку не было ни слова. После правки инструкции все три стали отвечать, что такой информации у них нет.
Разговор из 9 реплик с записью на приём обошёлся от 8 ₽ на GPT-5.4 mini до 97 ₽ на GigaChat-2-Max по тарифу 1 ₽ за 1000 токенов. На GPT-4.1 вышло около 14 ₽, это близко к привычным 15 ₽ за диалог.
Из двух российских моделей в нашем тесте без правок отработала YandexGPT-5 Pro, около 51 ₽ за разговор. GigaChat-2-Max тоже справляется, но ему нужны более подробные правила в инструкции, и разговор на нём обходится почти вдвое дороже.
Да. В дополнительных настройках есть флаг «Указать языковую модель для тестового чата»: клиенты продолжают общаться с прежней моделью, а в тестовом чате отвечает та, которую вы проверяете.
Хотите сразу к продукту: Конструктор чат-ботов консультант