Наименование организации:
ООО «Мой Софт»
40702810310000021416
Расчетный счет:
АО «ТИНЬКОФФ БАНК»
Банк:
044525974
БИК:
781101001
Корреспондентский счет:
7811616280
ИНН:
781101001
КПП:
1167847299410
ОГРН:
ОКПО:
03614300
Бесщетников Антон Игоревич
Генеральный директор:
192019, г. Санкт-Петербург, ул. Мельничная, д. 18, литер А, пом. 18-H 10, оф. 805
Юридический адрес:
Почтовый адрес:
192019, г. Санкт-Петербург, а/я 2
Реквизиты компании ООО «Мой Софт»
Чат-боты для бизнеса

Клиент прислал фото и документ: что с ними делает агент

ИИ-агент читает файлы, которые присылают клиенты: фото товара, скан документа, счёт, справку, скриншот. Рассказываем, как это работает, что нужно включить и сколько это стоит.

Команда платформы СаввиОбновлено 15 сентября 20265 мин чтения
Пластилиновая папка с листом документа, рядом оранжевое письмо
Коротко

ИИ-агент читает файлы, которые присылают клиенты: фото товара, скан документа, счёт, справку, скриншот ошибки. Текст извлекается действием «Обработка файлов». Для сканов и фото включают распознавание текста за 0,5 ₽ за страницу. Отдельно настраивается, видит ли модель изображения и медиафайлы.

Клиент присылает фотографию экрана, снятую под углом, вместо того чтобы описать проблему. Менеджер пересказывает то, что видно на картинке, или просит описание текстом. Время теряется, хотя агент мог бы прочитать файл сам и ответить по фактам.

Что делает действие обработки файлов

«Обработка файлов» — это действие, которое читает любой файл, присланный клиентом. PDF, DOCX, RTF, TXT и другие форматы. Текст извлекается в переменную, и дальше его можно отправить клиенту, передать в следующее действие, или использовать в ответе агента.

На практике это выглядит так: клиент присылает счёт, агент видит номер документа, дату и сумму прямо из файла и отвечает по фактам, а не по пересказу. В интернет-магазине клиент присылает скриншот ошибки: агент знает её номер и может дать рабочий совет.

Проверьте на своих диалогах.Регистрация без карты, 500 ₽ на тест по промокоду BLOG500

Собрать агента

Три режима распознавания текста на изображениях

По умолчанию агент читает только текст, который уже в файле, например текст в DOCX или обычный PDF. Если клиент прислал скан документа или сфотографировал справку, это изображение текста, и обычное чтение здесь не работает. Этого хватает для большинства — но если текст нужен в базе знаний, придётся вводить вручную.

Для сканов и фото есть три режима распознавания:

1 Не использовать распознавание Агент прочитает только текстовый слой. Скан, фото и картинки останутся невидимыми. Подходит, если клиент всегда присылает документы в цифровом виде или если распознавание нежелательно по политике.
2 Использовать если файл PDF с картинками Распознавание сработает, только если это PDF, и в нём есть хотя бы одно изображение. Экономит расходы: чистый PDF с текстом не распознаётся, а смешанные документы читаются полностью.
3 Всегда распознавать Любое изображение текста, в любом файле, будет прочитано. Самый полный режим — используйте его, если клиенты часто присылают фото документов и сканы.

Распознавание стоит 0,5 ₽ за страницу — по руководству платформы Савви. Это отдельная плата, помимо стоимости самого диалога.

Видит ли модель то, что на картинке

Когда вы включаете распознавание текста, агент читает буквы и цифры. Но видит ли он саму картинку — пустую клетку, красный флаг, диаграмму?

Это зависит от двух настроек. Первая — сама по себе обработка файлов просто извлекает текст, не анализируя визуально. Вторая — если нужно, чтобы модель понимала смысл изображения целиком (цвет, расположение элементов, диаграммы), есть отдельная настройка «Передавать медиа в LLM» во вкладке «Безопасность» дополнительных настроек.

Эта настройка имеет приоритет над распознаванием: даже если распознавание включено, но передача медиа выключена, изображения в модель не пойдут. Такой флаг поднимают компании, которые хотят исключить визуальный анализ картинок по политике безопасности.

!
Какие модели видят изображения

Модели OpenAI (GPT-серия), Anthropic (Claude) и Google (Gemini) читают и анализируют изображения. Российские модели YandexGPT, GigaChat и Alice AI LLM работают только с текстом: изображения они не распознают, даже если их передать в модель. Подробнее о том, как выбирать между ними под вашу задачу, в статье про выбор языковой модели для ИИ-агента. Если ваша компания требует размещения данных в России, придётся вкладывать визуальную информацию в инструкцию текстом.

Как настроить обработку файлов

Действие создаётся как остальные — в разделе «Действия» выбираете тип «Извлечь текст из файла» и заполняете параметры:

  • Аргумент файла: по умолчанию {file} — переменная, в которую клиент кладёт вложение
  • Режим экспорта: Markdown или HTML — формат текста, который достанется агенту
  • Режим распознавания: один из трёх, о которых выше
  • Переменная результата: где хранить извлечённый текст для передачи в следующие шаги

Остальное делается автоматически. Когда клиент пришлёт файл, агент вызовет это действие: либо потому что вы указали это в инструкции, либо потому что сам понял, что файл нужно прочитать.

0,5 стоимость распознавания одной страницы
3 режима распознавания текста на изображениях
~15 стоимость одного диалога в целом
Источник: Цена распознавания — по руководству платформы Савви. Стоимость диалога — при оплате по токенам, 1000 токенов = 1 ₽.

Где лежат данные из файлов

Когда агент обрабатывает файл клиента, текст проходит через облачный сервис. Если это чувствительные данные (медицинская справка, паспортные данные, финансовые документы), нужно знать, где они остаются.

По умолчанию переписка хранится 45 дней, сроки настраиваются отдельно в разделе «Безопасность». Если нужны дополнительные меры — маскирование персональных данных перед отправкой в модель, ограничение срока хранения, запрет на передачу медиа — это настраивается отдельно. Подробно о том, что происходит с данными клиентов и где они живут, разобрано в статье про ИИ-агента и персональные данные.

Оцените, нужна ли вам эта настройка

Включить обработку файлов стоит, если клиенты присылают счета, акты, фото товара, справки и заявления. Если работаете с текстовыми запросами — функция просто не будет использоваться.

Проверьте переписку за неделю. Посчитайте, сколько раз клиент вместо описания прислал файл. Если это чаще пары раз в неделю — функция окупится сразу. Если редко — не нужно усложнять.

Со своим режимом распознавания проще. Если клиенты шлют чистые PDF и DOCX, используйте режим «если PDF с картинками» — он включается только при нужде, экономит на обычном. Если много фото и сканов документов — сразу переходите на «всегда распознавать».

Частые вопросы

Может ли агент читать отсканированные документы

Да, если включить распознавание текста в режиме обработки файлов. Агент прочитает текст со сканов PDF и фотографий документов. Это стоит 0,5 ₽ за страницу и работает для любых изображений текста.

Что происходит, если клиент пришлёт файл большого размера

Агент обработает его, если он в поддерживаемых форматах (PDF, DOCX, RTF, TXT и другие). Размер файла не ограничен в документации, но имеет смысл следить за расходом токенов при обработке больших объёмов текста.

Видит ли агент картинки в базе знаний

Нет, агент видит только ссылки на картинки, но не их содержимое. Картинки из базы он может отправлять клиентам, но анализировать их не может. Если нужно, чтобы агент понимал содержимое изображений, используйте действие обработки файлов с распознаванием.

Какие модели умеют читать изображения из файлов

Модели OpenAI (GPT), Anthropic (Claude) и Google (Gemini) читают изображения. Российские модели YandexGPT, GigaChat и Alice AI LLM изображения не распознают: они работают только с текстом из файлов.

Можно ли запретить агенту отправлять файлы в языковую модель

Да, флаг «Передавать медиа в LLM» во вкладке «Безопасность» дополнительных настроек. Если его отключить, то даже при включённом распознавании изображения в модель не уйдут: эта настройка имеет приоритет.

Сколько стоит обработка одного файла агентом

Оплата идёт за токены текста, который извлекается из файла. Распознавание текста на изображениях стоит отдельно — 0,5 ₽ за страницу. Весь остальной функционал обработки файлов входит в общую стоимость диалога.

Команда платформы СаввиПишем о том, как бизнес внедряет ИИ-агентов, на данных платформы. Обновлено 15 сентября 2026.
BLOG500
Собрать агента