Как ИИ-агент отвечает по регламенту, прайсу в PDF или договору: разбивка на куски, поиск по смыслу, форматы файлов и переделка плохого документа в хороший.
Регламент, прайс в PDF, описание услуги — любой документ компании агент режет на смысловые куски и ищет среди них тот, что ближе всего к вопросу клиента. Принимаются PDF, DOCX и TXT до 10 Мб. Точность зависит от разметки текста на абзацы и заголовки: без неё агент цитирует случайный кусок, включая оглавление.
Регламент на восемьдесят страниц загрузили в базу знаний целиком, обрадовались, что теперь агент «знает всё», и через день удивились: на вопрос про условия возврата агент процитировал оглавление. Файл был на месте, размер укладывался в лимит, а ответ выходил случайным, как будто документ прочитали по диагонали и открыли не ту страницу.
Дело не в объёме документа. Файл на восемьдесят страниц агент разберёт так же ровно, как файл на две, если текст подготовлен для разбивки. Дальше: что происходит с документом внутри базы знаний, почему разбивка решает всё и как один плохой файл превратить в рабочий.
Документ — раздел базы знаний для больших связных текстов: регламентов, договоров, описаний услуг, инструкций. В отличие от быстрых ответов, рассчитанных на короткий точный ответ по названию файла, документ отдаёт агенту целый смысловой кусок, и агент сам собирает из него формулировку, поэтому ответы получаются живее и не повторяются слово в слово.
Принимаются файлы PDF, DOCX и TXT размером до 10 Мб, для Word это больше пяти тысяч страниц двенадцатым шрифтом, так что в лимит упираются редко. Загрузить документ можно с диска или подключить через аккаунт Google. Формат этого раздела не подходит для прайса на триста позиций: агент найдёт похожий по смыслу кусок текста, но не гарантирует, что это именно нужная строка. Для точных значений существует отдельный раздел с таблицами.
Проверьте на своих диалогах.Регистрация без карты, 500 ₽ на тест по промокоду BLOG500
Собрать агентаЗагруженный файл система режет на смысловые куски (чанки) и запоминает каждый в отдельном виде, пригодном для поиска по смыслу. Когда клиент задаёт вопрос, агент переводит его в тот же формат и получает куски, ближайшие по смыслу к запросу, а уже на их основе формулирует ответ.
Размер одного куска ограничен 2048 знаками, тип разбивки выбирается при загрузке, а лучшей практикой остаётся деление по абзацам: разделителем система считает два переноса строки подряд. Чем ближе документ к этому формату исходно, тем чище получится разбивка. Если файл не был подготовлен, есть предобработка нейромоделью — она расставит заголовки и абзацы автоматически, за небольшую плату токенами.
Точность поиска задаётся порогом срабатывания: строгий — 0,7, средний 0,5 (значение по умолчанию), гибкий 0,3. Чем выше порог, тем реже агент притягивает случайный кусок и тем чаще честно отвечает «не нашёл» вместо приблизительного попадания. Полный список этих настроек и лимитов держит руководство платформы — там же описаны служебные параметры вроде количества чанков в одном ответе.
Причина почти всегда одна: документ не был подготовлен под разбивку. Заголовок раздела слился с текстом под ним в один абзац, оглавление стоит вплотную к содержательной части, а таблица внутри PDF превратилась при экспорте в строку цифр без структуры. Система режет файл по формальному признаку, двойному переносу строки: если абзацы не расставлены, кусок получается либо слишком большим и мутным, либо обрывается на середине мысли.
Перед тем как документ начнёт отвечать клиентам, разбивку стоит увидеть глазами: кнопка «Показать чанки» выводит куски именно в том виде, в каком их найдёт агент. Если среди них попадается фрагмент оглавления или обрывок предложения без начала, документ стоит переразметить: заново загружать файл ради этого не обязательно. Агент, который не находит опору в разметке документа, начинает достраивать ответ сам — а это уже территория выдуманных ответов, которых проще избежать хорошей подготовкой файла, чем ловить потом в диалогах.
Граница проходит по типу материала и по тому, как именно нужен ответ.
| Формат | Когда выбирать | Пример |
|---|---|---|
| Быстрый ответ | вопрос типовой, ответ короткий и не меняется | адрес офиса, график работы |
| Документ | текст длинный, ответ собирается своими словами из смысла | регламент, договор, описание услуги |
| Таблица | нужна точная цифра по конкретной позиции | прайс, остатки, расписание |
Прайс на несколько строк можно развернуть в связный текст и держать документом: тогда агент продаёт по смыслу описания, без точного значения в колонке. Прайс на сто позиций так не работает: развёрнутый в прозу, он превращается в те же восемьдесят страниц с той же проблемой разметки. Разница между документом и таблицей разобрана подробнее в статье про работу агента с таблицами — она же объясняет, почему точный поиск и поиск по смыслу устроены по-разному внутри платформы.
Правка обычно занимает меньше времени, чем повторная загрузка файла и разбор жалоб клиентов на неточные ответы.
Если регламент существует только как скан или содержит текст на изображениях, при подготовке документа включается режим распознавания изображений как текста — он переводит картинки в обычный текст перед разбивкой на куски. Это отдельный механизм от действия «Обработка файлов», которое извлекает текст из файлов, присланных клиентом в диалоге, по цене 0,5 ₽ за страницу.
Выберите один документ, который сейчас работает хуже остальных — тот, по которому чаще всего приходят жалобы на неточный ответ или который отвечает случайным куском вместо нужного раздела. Не бросайтесь переразмечать всю базу знаний сразу: один документ, доведённый до порядка, покажет, какие правки дают эффект, а какие нет.
Откройте файл, расставьте заголовки и абзацы по правилам выше, сохраните и посмотрите куски кнопкой «Показать чанки». Если разбивка стала чище — переходите к следующему документу по тому же чек-листу. База знаний, собранная из десятка аккуратно размеченных файлов, отвечает точнее, чем один регламент на восемьдесят страниц, загруженный как есть.
PDF, DOCX и TXT, размером до 10 Мб — это больше пяти тысяч страниц Word двенадцатым шрифтом. Файл можно загрузить с диска компьютера или подключить через аккаунт Google.
Система режет файл на смысловые куски — чанки, — переводит их и вопрос клиента в единый формат и находит куски, ближайшие по смыслу к запросу. Модель получает эти куски и формулирует ответ на их основе, поэтому ответ звучит своими словами, а не пересказом документа.
Да, при подготовке документа есть режим распознавания изображений как текста: он превращает картинки со сканированным текстом в обычный текст перед разбивкой на куски. Отдельное действие «Обработка файлов» для входящих сканов от клиентов работает иначе и по другой цене.
Таблица даёт точный поиск по значению в колонке: артикул, цена, остаток. Документ ищет по смыслу и годится для описательного текста — условий, регламентов, описаний услуг. Прайс, вписанный в документ прозой, агент найдёт с некоторой вероятностью — точное совпадение строки раздел не гарантирует.
Чаще всего документ не был подготовлен под разбивку: заголовки не отделены абзацами, оглавление и содержательный текст слиты в один блок. Проверить разбивку можно кнопкой «Показать чанки» в интерфейсе — она показывает получившиеся куски до того, как документ начнёт отвечать клиентам.
Отредактировать файл и сохранить заново: старые куски и их представления пересчитываются только при повторном сохранении. Для данных, которые меняются каждую неделю, вроде цен, лучше подходит таблица — там достаточно поправить сам источник данных, документ целиком перезагружать не придётся.