Наименование организации:
ООО «Мой Софт»
40702810310000021416
Расчетный счет:
АО «ТИНЬКОФФ БАНК»
Банк:
044525974
БИК:
781101001
Корреспондентский счет:
7811616280
ИНН:
781101001
КПП:
1167847299410
ОГРН:
ОКПО:
03614300
Бесщетников Антон Игоревич
Генеральный директор:
192019, г. Санкт-Петербург, ул. Мельничная, д. 18, литер А, пом. 18-H 10, оф. 805
Юридический адрес:
Почтовый адрес:
192019, г. Санкт-Петербург, а/я 2
Реквизиты компании ООО «Мой Софт»
Чат-боты для бизнеса

ИИ-агент и документы: ответы из ваших файлов

Как ИИ-агент отвечает по регламенту, прайсу в PDF или договору: разбивка на куски, поиск по смыслу, форматы файлов и переделка плохого документа в хороший.

Команда платформы СаввиОбновлено 15 сентября 20266 мин чтения
Пластилиновая книга регламента веером страниц, один корешок коралловый среди серых
Коротко

Регламент, прайс в PDF, описание услуги — любой документ компании агент режет на смысловые куски и ищет среди них тот, что ближе всего к вопросу клиента. Принимаются PDF, DOCX и TXT до 10 Мб. Точность зависит от разметки текста на абзацы и заголовки: без неё агент цитирует случайный кусок, включая оглавление.

Регламент на восемьдесят страниц загрузили в базу знаний целиком, обрадовались, что теперь агент «знает всё», и через день удивились: на вопрос про условия возврата агент процитировал оглавление. Файл был на месте, размер укладывался в лимит, а ответ выходил случайным, как будто документ прочитали по диагонали и открыли не ту страницу.

Дело не в объёме документа. Файл на восемьдесят страниц агент разберёт так же ровно, как файл на две, если текст подготовлен для разбивки. Дальше: что происходит с документом внутри базы знаний, почему разбивка решает всё и как один плохой файл превратить в рабочий.

Что происходит с документом компании в базе знаний

Документ — раздел базы знаний для больших связных текстов: регламентов, договоров, описаний услуг, инструкций. В отличие от быстрых ответов, рассчитанных на короткий точный ответ по названию файла, документ отдаёт агенту целый смысловой кусок, и агент сам собирает из него формулировку, поэтому ответы получаются живее и не повторяются слово в слово.

Принимаются файлы PDF, DOCX и TXT размером до 10 Мб, для Word это больше пяти тысяч страниц двенадцатым шрифтом, так что в лимит упираются редко. Загрузить документ можно с диска или подключить через аккаунт Google. Формат этого раздела не подходит для прайса на триста позиций: агент найдёт похожий по смыслу кусок текста, но не гарантирует, что это именно нужная строка. Для точных значений существует отдельный раздел с таблицами.

Проверьте на своих диалогах.Регистрация без карты, 500 ₽ на тест по промокоду BLOG500

Собрать агента

Как документ режется на куски и как агент находит нужный

Загруженный файл система режет на смысловые куски (чанки) и запоминает каждый в отдельном виде, пригодном для поиска по смыслу. Когда клиент задаёт вопрос, агент переводит его в тот же формат и получает куски, ближайшие по смыслу к запросу, а уже на их основе формулирует ответ.

Размер одного куска ограничен 2048 знаками, тип разбивки выбирается при загрузке, а лучшей практикой остаётся деление по абзацам: разделителем система считает два переноса строки подряд. Чем ближе документ к этому формату исходно, тем чище получится разбивка. Если файл не был подготовлен, есть предобработка нейромоделью — она расставит заголовки и абзацы автоматически, за небольшую плату токенами.

Точность поиска задаётся порогом срабатывания: строгий — 0,7, средний 0,5 (значение по умолчанию), гибкий 0,3. Чем выше порог, тем реже агент притягивает случайный кусок и тем чаще честно отвечает «не нашёл» вместо приблизительного попадания. Полный список этих настроек и лимитов держит руководство платформы — там же описаны служебные параметры вроде количества чанков в одном ответе.

10 Мб максимальный размер одного документа
2048 знаков предельный размер одного куска текста
0,5 порог поиска по умолчанию
Источник: Ограничения и настройки раздела «Документы» — по руководству платформы Савви, сентябрь 2026.

Почему регламент на восемьдесят страниц отвечает не то

Причина почти всегда одна: документ не был подготовлен под разбивку. Заголовок раздела слился с текстом под ним в один абзац, оглавление стоит вплотную к содержательной части, а таблица внутри PDF превратилась при экспорте в строку цифр без структуры. Система режет файл по формальному признаку, двойному переносу строки: если абзацы не расставлены, кусок получается либо слишком большим и мутным, либо обрывается на середине мысли.

Перед тем как документ начнёт отвечать клиентам, разбивку стоит увидеть глазами: кнопка «Показать чанки» выводит куски именно в том виде, в каком их найдёт агент. Если среди них попадается фрагмент оглавления или обрывок предложения без начала, документ стоит переразметить: заново загружать файл ради этого не обязательно. Агент, который не находит опору в разметке документа, начинает достраивать ответ сам — а это уже территория выдуманных ответов, которых проще избежать хорошей подготовкой файла, чем ловить потом в диалогах.

Документ, таблица или быстрый ответ

Граница проходит по типу материала и по тому, как именно нужен ответ.

ФорматКогда выбиратьПример
Быстрый ответвопрос типовой, ответ короткий и не меняетсяадрес офиса, график работы
Документтекст длинный, ответ собирается своими словами из смысларегламент, договор, описание услуги
Таблицанужна точная цифра по конкретной позициипрайс, остатки, расписание

Прайс на несколько строк можно развернуть в связный текст и держать документом: тогда агент продаёт по смыслу описания, без точного значения в колонке. Прайс на сто позиций так не работает: развёрнутый в прозу, он превращается в те же восемьдесят страниц с той же проблемой разметки. Разница между документом и таблицей разобрана подробнее в статье про работу агента с таблицами — она же объясняет, почему точный поиск и поиск по смыслу устроены по-разному внутри платформы.

Как переделать один плохой документ в хороший

Правка обычно занимает меньше времени, чем повторная загрузка файла и разбор жалоб клиентов на неточные ответы.

1 Уберите то, о чём не спрашивают Служебные пометки, устаревшие версии пунктов, внутренние комментарии — всё это попадает в куски наравне с содержательным текстом и иногда побеждает его в поиске по смыслу.
2 Расставьте заголовки и абзацы Каждый смысловой блок — отдельный абзац с двойным переносом строки перед ним. Заголовок раздела не должен стоять слитно с первым предложением под ним.
3 Разделите оглавление и содержание Оглавление — не источник ответов, а навигация по документу. Если оно остаётся в файле, его стоит вынести в самое начало и явно отделить от текста разделов.
4 Замените таблицу внутри PDF на настоящую таблицу Прайс или график, вставленный в документ картинкой или сеткой ячеек, при экспорте в текст превращается в кашу из цифр. Такие данные переносятся в раздел «Таблицы» — там для них есть точный поиск по значению.
5 Проверьте разбивку кнопкой «Показать чанки» Прежде чем документ начнёт отвечать клиентам, стоит увидеть куски своими глазами и поправить те, что обрываются на середине мысли.
!
Про сканы и картинки в документе

Если регламент существует только как скан или содержит текст на изображениях, при подготовке документа включается режим распознавания изображений как текста — он переводит картинки в обычный текст перед разбивкой на куски. Это отдельный механизм от действия «Обработка файлов», которое извлекает текст из файлов, присланных клиентом в диалоге, по цене 0,5 ₽ за страницу.

С чего начать переделку документа

Выберите один документ, который сейчас работает хуже остальных — тот, по которому чаще всего приходят жалобы на неточный ответ или который отвечает случайным куском вместо нужного раздела. Не бросайтесь переразмечать всю базу знаний сразу: один документ, доведённый до порядка, покажет, какие правки дают эффект, а какие нет.

Откройте файл, расставьте заголовки и абзацы по правилам выше, сохраните и посмотрите куски кнопкой «Показать чанки». Если разбивка стала чище — переходите к следующему документу по тому же чек-листу. База знаний, собранная из десятка аккуратно размеченных файлов, отвечает точнее, чем один регламент на восемьдесят страниц, загруженный как есть.

Частые вопросы

Какие форматы файлов принимает раздел «Документы» в базе знаний

PDF, DOCX и TXT, размером до 10 Мб — это больше пяти тысяч страниц Word двенадцатым шрифтом. Файл можно загрузить с диска компьютера или подключить через аккаунт Google.

Как документ превращается в ответы агента

Система режет файл на смысловые куски — чанки, — переводит их и вопрос клиента в единый формат и находит куски, ближайшие по смыслу к запросу. Модель получает эти куски и формулирует ответ на их основе, поэтому ответ звучит своими словами, а не пересказом документа.

Можно ли загрузить в базу знаний скан регламента или договора

Да, при подготовке документа есть режим распознавания изображений как текста: он превращает картинки со сканированным текстом в обычный текст перед разбивкой на куски. Отдельное действие «Обработка файлов» для входящих сканов от клиентов работает иначе и по другой цене.

Чем документ отличается от таблицы, если нужен прайс

Таблица даёт точный поиск по значению в колонке: артикул, цена, остаток. Документ ищет по смыслу и годится для описательного текста — условий, регламентов, описаний услуг. Прайс, вписанный в документ прозой, агент найдёт с некоторой вероятностью — точное совпадение строки раздел не гарантирует.

Почему агент цитирует не тот раздел регламента, который нужен клиенту

Чаще всего документ не был подготовлен под разбивку: заголовки не отделены абзацами, оглавление и содержательный текст слиты в один блок. Проверить разбивку можно кнопкой «Показать чанки» в интерфейсе — она показывает получившиеся куски до того, как документ начнёт отвечать клиентам.

Как обновить документ, если в регламенте изменился один пункт

Отредактировать файл и сохранить заново: старые куски и их представления пересчитываются только при повторном сохранении. Для данных, которые меняются каждую неделю, вроде цен, лучше подходит таблица — там достаточно поправить сам источник данных, документ целиком перезагружать не придётся.

Команда платформы СаввиПишем о том, как бизнес внедряет ИИ-агентов, на данных платформы. Обновлено 15 сентября 2026.
BLOG500
Собрать агента