Что нейросеть делает с картинками в переписке с клиентом: рисует изображение, отправляет готовое фото и распознаёт снимок, который прислал клиент.
Нейросеть для работы с изображениями в переписке с клиентом решает три разные задачи: рисует картинку по текстовому запросу, достаёт из базы или таблицы уже готовое фото и понимает, что изображено на снимке, который прислал сам клиент. Это три отдельные настройки агента, и путать их не стоит.
Клиент присылает в переписку фото погнутого кронштейна от старой полки и спрашивает: подойдёт ли новый такой же формы. Час ночи, оператор давно ушёл, а в базе знаний такого вопроса нет — тут нужен взгляд на конкретную деталь на снимке. Агент открывает фото, сверяет его с каталогом и решает, что показать клиенту дальше: карточку похожей модели или уточняющий вопрос про размер креплений.
Нейросеть для работы с изображениями в чат-боте занимается тремя разными вещами: создаёт картинку с нуля по описанию, забирает готовое фото из базы или таблицы и распознаёт снимок, который прислал клиент. Каждая задача — отдельная настройка агента, и генерация не поможет отправить фото конкретного товара со склада точно так же, как распознавание не нарисует открытку с днём рождения.
| Сторона переписки | Что делает агент | Где настраивается |
|---|---|---|
| Агент рисует картинку | Создаёт изображение по текстовому промпту — открытку, иллюстрацию, карточку товара | действие «Сгенерировать изображение» |
| Агент отправляет готовое фото | Достаёт снимок из файла базы знаний или по ссылке из таблицы и присылает клиенту | файл в Прямых вопросах, либо таблица с вебхуком |
| Агент читает фото клиента | Распознаёт содержимое присланного снимка и отвечает с его учётом | настройка «Распознавание изображений» |
Дальше разберём каждую сторону по отдельности: что именно происходит внутри и на какую настройку смотреть.
Проверьте на своих диалогах.Регистрация без карты, 500 ₽ на тест по промокоду BLOG500
Собрать агентаАгент создаёт картинку действием «Сгенерировать изображение»: внутри шага задаются промпт, модель генерации, соотношение сторон, разрешение и имя готового файла. Отдельный флаг «Отправлять изображения перед ответом бота» решает, что клиент увидит раньше — текст или саму картинку.
Разбор каждого поля этой настройки по шагам — в статье как агент генерирует картинки: там же примеры промптов и готовых результатов.
У этого же действия есть второй режим — «Изменение изображения». Вместо рисования с нуля агент берёт уже загруженное клиентом фото как референс и генерирует новую картинку на его основе: клиент присылает эскиз или старое фото товара, а получает готовую визуализацию в похожем стиле.
Здесь агент достаёт существующий снимок и присылает его целиком, ничего не дорисовывая. Работает это двумя способами.
Первый — файл в разделе Прямых вопросов с прикреплённой фотографией: прайс с фото размеров, образец готовой работы, схема проезда. В промпте прописывается условие, при котором агент вызывает этот файл по имени, и снимок уходит в чат вместе с текстом или инструкцией из содержимого файла.
Второй — таблица, где у каждой позиции каталога своя ссылка на изображение, а превращает её в снимок действие-вебхук на аргументе url_photo. Требование к формату ссылки и разница между каналами — в статье как чат-бот отправляет клиенту фото товара.
За чтение присланного клиентом снимка отвечает настройка «Распознавание изображений» в дополнительных настройках агента. У неё четыре режима:
С документами, которые вместе с фото присылает клиент, агент работает похожим образом: подробности в статье клиент прислал фото и документ.
Флаг «Передавать медиа в LLM» в разделе «Безопасность» отвечает за то, уходят ли фото и другие файлы в модель вообще. Он старше настройки «Распознавание изображений»: при выключенном флаге распознавание не сработает ни в одном из четырёх режимов, даже если оно включено отдельно.
Одна картинка на модели Nano Banana Pro обошлась в 1,4 ₽, когда модель генерации была задана моделью самого агента. Это наш замер на своём аккаунте: на другом тарифе цифра будет своя.
Тот же промпт на трёх моделях генерации даёт заметно разный результат по форме и фону — разбор с приложенными файлами в статье сравнение моделей генерации.
Сверьте переписку за последнюю неделю: посчитайте, сколько раз клиент присылал фото и ждал ответа, и сколько раз менеджер вручную искал похожий снимок в галерее телефона вместо того, чтобы агент нашёл его сам. Отдельно выпишите случаи, где клиенту нужна была картинка, которой в каталоге ещё нет, — под неё годится генерация.
По итогам обычно видна одна задача, которая закрывает основной поток обращений: чаще всего это отправка готового фото товара, реже — чтение присланных клиентом снимков. Включите в настройках агента сначала её, а к оставшимся двум возвращайтесь по мере роста числа таких обращений. Полный список режимов и флагов — в руководстве Савви.
Да, это один и тот же агент, но три разные настройки: действие «Сгенерировать изображение» для рисования, файл базы знаний или таблица со ссылками для готового фото и режим «Распознавание изображений» для чтения снимка клиента. Включать можно любую комбинацию, необязательно сразу все три.
За это отвечает настройка «Распознавание изображений»: в режиме «Передавать в модель напрямую» модель считывает смысл снимка сразу, без промежуточного текстового описания, а в режимах «Всегда» и «Если не найдено в БЗ» агент дополнительно сверяется с прописанной инструкцией. В любом из режимов ответ строится с учётом содержимого фото.
Да, флагом «Передавать медиа в LLM» в разделе «Безопасность». Этот флаг старше настройки распознавания: если он выключен, ни один из режимов распознавания не сработает, даже включённый отдельно.
Около 1,4 ₽ на модели Nano Banana Pro по нашему замеру, когда модель генерации задана моделью самого агента. Это ориентир: на другом тарифе цифра будет своя.
Из одного из двух источников: файла в разделе Прямых вопросов с прикреплённым снимком, который агент вызывает по имени, или колонки таблицы с прямой ссылкой на изображение, обработанной действием-вебхуком. Оба способа отдают клиенту полноразмерную картинку, а не текстовую ссылку на неё.
Да, действием «Изменение изображения»: агент берёт загруженный клиентом снимок как референс и генерирует на его основе новую картинку. Промпт в этом случае описывает, что именно изменить, а модель, разрешение и соотношение сторон настраиваются так же, как при обычной генерации.
Хотите сразу к продукту: Разработка чат-ботов для бизнеса