ИИ-агент читает файлы, которые присылают клиенты: фото товара, скан документа, счёт, справку, скриншот. Рассказываем, как это работает, что нужно включить и сколько это стоит.
ИИ-агент читает файлы, которые присылают клиенты: фото товара, скан документа, счёт, справку, скриншот ошибки. Текст извлекается действием «Обработка файлов». Для сканов и фото включают распознавание текста за 0,5 ₽ за страницу. Отдельно настраивается, видит ли модель изображения и медиафайлы.
Клиент присылает фотографию экрана, снятую под углом, вместо того чтобы описать проблему. Менеджер пересказывает то, что видно на картинке, или просит описание текстом. Время теряется, хотя агент мог бы прочитать файл сам и ответить по фактам.
«Обработка файлов» — это действие, которое читает любой файл, присланный клиентом. PDF, DOCX, RTF, TXT и другие форматы. Текст извлекается в переменную, и дальше его можно отправить клиенту, передать в следующее действие, или использовать в ответе агента.
На практике это выглядит так: клиент присылает счёт, агент видит номер документа, дату и сумму прямо из файла и отвечает по фактам, а не по пересказу. В интернет-магазине клиент присылает скриншот ошибки: агент знает её номер и может дать рабочий совет.
Проверьте на своих диалогах.Регистрация без карты, 500 ₽ на тест по промокоду BLOG500
Собрать агентаПо умолчанию агент читает только текст, который уже в файле, например текст в DOCX или обычный PDF. Если клиент прислал скан документа или сфотографировал справку, это изображение текста, и обычное чтение здесь не работает. Этого хватает для большинства — но если текст нужен в базе знаний, придётся вводить вручную.
Для сканов и фото есть три режима распознавания:
Распознавание стоит 0,5 ₽ за страницу — по руководству платформы Савви. Это отдельная плата, помимо стоимости самого диалога.
Когда вы включаете распознавание текста, агент читает буквы и цифры. Но видит ли он саму картинку — пустую клетку, красный флаг, диаграмму?
Это зависит от двух настроек. Первая — сама по себе обработка файлов просто извлекает текст, не анализируя визуально. Вторая — если нужно, чтобы модель понимала смысл изображения целиком (цвет, расположение элементов, диаграммы), есть отдельная настройка «Передавать медиа в LLM» во вкладке «Безопасность» дополнительных настроек.
Эта настройка имеет приоритет над распознаванием: даже если распознавание включено, но передача медиа выключена, изображения в модель не пойдут. Такой флаг поднимают компании, которые хотят исключить визуальный анализ картинок по политике безопасности.
Модели OpenAI (GPT-серия), Anthropic (Claude) и Google (Gemini) читают и анализируют изображения. Российские модели YandexGPT, GigaChat и Alice AI LLM работают только с текстом: изображения они не распознают, даже если их передать в модель. Подробнее о том, как выбирать между ними под вашу задачу, в статье про выбор языковой модели для ИИ-агента. Если ваша компания требует размещения данных в России, придётся вкладывать визуальную информацию в инструкцию текстом.
Действие создаётся как остальные — в разделе «Действия» выбираете тип «Извлечь текст из файла» и заполняете параметры:
{file} — переменная, в которую клиент кладёт вложениеОстальное делается автоматически. Когда клиент пришлёт файл, агент вызовет это действие: либо потому что вы указали это в инструкции, либо потому что сам понял, что файл нужно прочитать.
Когда агент обрабатывает файл клиента, текст проходит через облачный сервис. Если это чувствительные данные (медицинская справка, паспортные данные, финансовые документы), нужно знать, где они остаются.
По умолчанию переписка хранится 45 дней, сроки настраиваются отдельно в разделе «Безопасность». Если нужны дополнительные меры — маскирование персональных данных перед отправкой в модель, ограничение срока хранения, запрет на передачу медиа — это настраивается отдельно. Подробно о том, что происходит с данными клиентов и где они живут, разобрано в статье про ИИ-агента и персональные данные.
Включить обработку файлов стоит, если клиенты присылают счета, акты, фото товара, справки и заявления. Если работаете с текстовыми запросами — функция просто не будет использоваться.
Проверьте переписку за неделю. Посчитайте, сколько раз клиент вместо описания прислал файл. Если это чаще пары раз в неделю — функция окупится сразу. Если редко — не нужно усложнять.
Со своим режимом распознавания проще. Если клиенты шлют чистые PDF и DOCX, используйте режим «если PDF с картинками» — он включается только при нужде, экономит на обычном. Если много фото и сканов документов — сразу переходите на «всегда распознавать».
Да, если включить распознавание текста в режиме обработки файлов. Агент прочитает текст со сканов PDF и фотографий документов. Это стоит 0,5 ₽ за страницу и работает для любых изображений текста.
Агент обработает его, если он в поддерживаемых форматах (PDF, DOCX, RTF, TXT и другие). Размер файла не ограничен в документации, но имеет смысл следить за расходом токенов при обработке больших объёмов текста.
Нет, агент видит только ссылки на картинки, но не их содержимое. Картинки из базы он может отправлять клиентам, но анализировать их не может. Если нужно, чтобы агент понимал содержимое изображений, используйте действие обработки файлов с распознаванием.
Модели OpenAI (GPT), Anthropic (Claude) и Google (Gemini) читают изображения. Российские модели YandexGPT, GigaChat и Alice AI LLM изображения не распознают: они работают только с текстом из файлов.
Да, флаг «Передавать медиа в LLM» во вкладке «Безопасность» дополнительных настроек. Если его отключить, то даже при включённом распознавании изображения в модель не уйдут: эта настройка имеет приоритет.
Оплата идёт за токены текста, который извлекается из файла. Распознавание текста на изображениях стоит отдельно — 0,5 ₽ за страницу. Весь остальной функционал обработки файлов входит в общую стоимость диалога.