Из чего состоит база знаний ИИ-агента: быстрые ответы, документы и таблицы. Что куда класть, лимиты файлов, настройки поиска и частые ошибки.
База знаний ИИ-агента в Савви состоит из трёх блоков: быстрые ответы под типовые вопросы, документы для больших текстов и таблицы для структурированных данных. Инструкция задаёт логику разговора, база знаний хранит факты. Документ грузится до 10 Мб, быстрых ответов держат до 70–80 файлов, таблицы подключаются из CSV, Excel или Google Таблиц.
Самый частый способ испортить ИИ-агента — сложить всё в инструкцию. Прайс, график, условия возврата, описание пяти тарифов, адреса четырёх филиалов. Инструкция пухнет до десяти тысяч знаков, агент начинает путаться в собственных правилах, а каждый его ответ обходится дороже, потому что весь этот текст уходит в модель на каждую реплику.
Правило, которое снимает проблему, формулируется в одну строку: в инструкции — логика разговора, в базе знаний — факты. Заодно это прямая экономия: инструкция уходит в модель на каждую реплику, а материал из базы — только когда он понадобился. Дальше остаётся понять, в какой из трёх блоков базы положить конкретный факт.
База знаний ИИ-агента — это набор ваших материалов, к которым агент обращается по ходу диалога, чтобы ответить фактами компании, а не общими словами. Она вспомогательная: при расхождении с инструкцией приоритет остаётся за инструкцией.
Работает это не как подстановка готового текста. Агент решает, что ему нужно заглянуть в базу, формулирует запрос, получает подходящий кусок и уже на его основе пишет ответ клиенту. Поэтому один и тот же факт в двух диалогах прозвучит по-разному, хотя источник будет один.
Блоки различаются не форматом файла, а тем, как в них ищется ответ. Это и есть главный критерий выбора.
| Блок | Что кладём | Как ищется | Когда выбирать |
|---|---|---|---|
| Быстрые ответы | короткие типовые ответы: адрес, график, условия доставки | по названию файла, по смыслу вопроса | вопросов немного и ответы на них почти не меняются |
| Документы | большие связные тексты: регламенты, описания услуг, подробные FAQ | по смыслу, документ режется на куски | материал длинный, ответ надо собрать из середины |
| Таблицы | прайсы, остатки, каталоги, расписания | точный поиск по значению в колонке | нужна конкретная цифра по конкретной позиции |
Ошибка, которую видно чаще других: прайс на триста позиций складывают в документ. Агент находит похожий по смыслу кусок, но не гарантирует, что это именно та строка, которая нужна. Цифры живут в таблицах.
Проверьте на своих диалогах.Регистрация без карты, 500 ₽ на тест по промокоду BLOG500
Собрать агентаБыстрые ответы — это отдельные файлы под конкретные вопросы, аналог FAQ. Формат рассчитан примерно на 70–80 файлов; когда их становится заметно больше, материал пора переносить в документы.
Поиск идёт не по тексту файла, а по отдельному полю «Имя файла для поиска», и работает он по смыслу, а не по совпадению слов. Отсюда единственное правило, от которого зависит, найдётся файл или нет: название должно быть коротким утверждением о содержимом. «Стоимость доставки» находится. «Вопрос про доставку, версия 2» — уже как повезёт.
У каждого файла есть три переключателя, и второй из них важнее, чем выглядит:
Если быстрых ответов сразу много, их можно залить из Excel. Ограничения жёсткие: файл не более 1 Мб и не более 100 строк, при превышении берутся первые сто. Колонки называются Title, Search Title, Content и Used.
Документы нужны, когда материал длинный и ответ приходится собирать из середины текста. Один файл — до 10 Мб; для Word это больше пяти тысяч страниц двенадцатым шрифтом, так что в лимит упираются редко.
Внутри документ режется на смысловые куски. Дальше вопрос клиента переводится в тот же формат, что и куски, и система ищет ближайшие по смыслу. Найденные куски уходят в модель, и уже из них собирается ответ.
Отсюда два параметра, которые стоит знать, даже если вы их не трогаете. Размер куска — не больше 2048 знаков, и лучшая разбивка обычно по абзацам, разделителем служат два переноса строки подряд. Порог срабатывания — насколько близким по смыслу должен быть кусок, чтобы попасть в ответ: 0,7 строгий, 0,5 средний, 0,3 гибкий. Строгий порог даёт меньше мусора и больше ответов «не нашёл», гибкий — наоборот.
Перед сохранением разбивку стоит посмотреть глазами: в интерфейсе есть кнопка, которая показывает получившиеся куски. Если документ порезался по строкам таблицы или посреди предложения, агент будет отвечать обрывками.
Отредактированный документ не попадает в поиск сам. Изменения начинают работать только после повторного сохранения файла, когда куски и их представления пересоздаются заново. Поэтому данные, которые меняются каждую неделю, живут не в документах, а в таблицах.
Таблицы подключаются из CSV, Excel или Google Таблиц и нужны там, где важна точность: артикул, цена, остаток, время сеанса. Запрос агента переводится в запрос к таблице, и он получает конкретные строки.
Требования к файлу простые, но невыполнение каждого ломает поиск: заголовки в первой строке, без объединённых ячеек, даты в формате «год-месяц-день». Дополнительно можно ограничить число строк в результате и задать предварительный фильтр, чтобы агент не тащил в ответ весь каталог.
Порядок разбора такой же, как у любой поисковой задачи: сначала проверяем, что материал вообще есть, потом — как он называется.
Если файл есть и назван осмысленно, а агент всё равно отвечает от себя, в дополнительных настройках есть два рычага. Ключевые слова принудительно отправляют агента в базу знаний, когда в сообщении встретилось нужное слово, даже если по смыслу это не очевидно. Повышенная теплота базы знаний заставляет его чаще обращаться к вашим материалам и реже полагаться на собственные представления о мире.
Отдельный приём для тех, у кого поддержка уже работает: платформа умеет пополнять базу знаний по ответам сотрудников. Механизм так и называется — самообучение. Оператор разобрал нестандартный случай, ответ попал в базу, и в следующий раз агент справляется сам. Правило при этом остаётся тем же, что и для всей базы: документы не выдумываются, источником служит реальный ответ человека.
Не с регламента на сорок страниц. Откройте переписку за последнюю неделю и выпишите двадцать вопросов, которые повторяются чаще всего. Это и будет первая версия базы: двадцать быстрых ответов, каждый на две-три фразы.
Дальше добавляйте по мере появления вопросов, на которые агент ответил плохо. Через месяц такой работы у вас будет база, собранная по реальным диалогам, а не по представлениям о том, что клиенты должны спрашивать.
Инструкция при этом останется короткой, и это её нормальное состояние: семь правил, которые делают инструкцию рабочей, разобраны в отдельной статье «Инструкция для ИИ-агента». А актуальные лимиты, форматы и названия полей держит руководство платформы — оно меняется чаще, чем любой пересказ.
Инструкция задаёт логику разговора: роль, задачи, правила поведения. База знаний хранит факты: прайс, условия, график, описания услуг. При расхождении приоритет у инструкции — база знаний работает как вспомогательный источник, к которому агент обращается по ходу диалога.
Из трёх блоков. Быстрые ответы — короткие файлы под типовые вопросы, аналог FAQ. Документы — большие тексты, разбитые на смысловые куски и найденные по смыслу. Таблицы — структурированные данные из CSV, Excel или Google Таблиц, где нужен точный поиск по значению.
Один документ — до 10 Мб, это более пяти тысяч страниц Word двенадцатым шрифтом. Разовая загрузка быстрых ответов из Excel ограничена жёстче: файл не более 1 Мб и не более 100 строк, при превышении берутся только первые сто.
Чаще всего дело в названии файла быстрых ответов: поиск идёт по полю «Имя файла для поиска» и работает по смыслу. Название вроде «Документ 3» агенту ни о чём не говорит. Помогает лаконичное утверждение — «Стоимость доставки», «Адрес офиса» — либо ключевые слова в дополнительных настройках, которые принудительно отправляют агента в базу.
Отредактировать документ и сохранить его заново: изменения попадают в поиск только после повторной подготовки файла, когда пересоздаются эмбеддинги. Для часто меняющихся данных вроде прайса удобнее таблица — там обновляется сам источник.
Таблица, если нужен точный поиск по артикулу, цене или остатку и данные регулярно обновляются. Документ, если продавать нужно по смыслу описания: тогда строку с названием, описанием и ценой лучше развернуть в связный текст, который агент сможет процитировать.