Как автогенерация собирает базу знаний из сайта компании, что в черновике придётся переписать руками и сколько это стоит в токенах.
Автогенерация читает сайт компании и за несколько минут собирает черновик инструкции, файлы базы знаний или то и другое сразу — есть отдельный режим, который трогает только базу знаний. Парсинг страниц и сама генерация списываются токенами по обычному тарифу платформы. Черновик пригоден к работе только после ручной сверки: он переносит на страницу агента ровно то, что было на сайте в момент запуска, включая устаревшие цифры.
Сайт компании на сорок с лишним страниц — это готовый источник фактов: услуги, условия доставки, ответы на частые вопросы, страница «О компании» с адресами филиалов. Раньше всё это переносили в базу знаний руками: открывали каждую страницу, вычленяли суть, оформляли файлом. На сорок страниц уходил рабочий день, если не два.
Автогенерация делает тот же проход за минуты. В этом её настоящая польза. Вопрос в другом: что именно оказывается на выходе и что с этим выходом придётся делать дальше.
Платформа предлагает четыре разных режима, и каждый решает свою задачу.
Первый режим ничего не парсит: вы описываете роль агента текстом, платформа собирает по описанию черновик инструкции. Второй добавляет к описанию ссылку на сайт: Савви разбирает указанную страницу, вставляет найденные факты в инструкцию и отдельным блоком помечает, что из этого лучше вынести в базу знаний. Третий режим парсит уже корневую страницу вместе со связанными разделами и отдаёт сразу два результата, инструкцию и набор файлов базы знаний. Четвёртый режим живёт в разделе «База знаний» → «Быстрые ответы» → «Автоматическая генерация» и системную инструкцию не открывает вообще: он читает сайт и складывает из него только файлы базы знаний.
Если промпт агента уже настроен и работает, режим «только база знаний» остаётся единственным безопасным выбором: он не переписывает системную инструкцию и не рискует сломать логику, которую вы уже отладили на реальных диалогах.
Проверьте на своих диалогах.Регистрация без карты, 500 ₽ на тест по промокоду BLOG500
Собрать агентаНа выходе — черновик: набор файлов, которые ещё не сохранены и ждут решения по каждому, прежде чем стать рабочей базой знаний.
В режимах с генерацией инструкции результат размечен структурой: разделы через #, чтобы модели было проще держать границы смысловых блоков. Рядом появляется отдельный список «рекомендуется вынести в файлы БЗ» — платформа сама отмечает куски текста, которые уместнее в базе знаний, чем в теле инструкции, и окончательное решение остаётся за вами.
В режиме генерации только базы знаний результат — набор карточек по разделам сайта: услуги отдельно, условия доставки отдельно, гарантии отдельно. Названия файлов система придумывает по содержимому страницы, и здесь начинается первая проблема черновика.
Парсинг переносит на карточку ровно то, что написано на сайте в момент запуска, без проверки, актуально ли это.
Если на странице услуг висит цена, которую полгода назад подняли только в прайсе у менеджеров, файл базы знаний унаследует старую цифру. Агент не станет её сомневаться: он прочитал факт из документа компании и процитирует его так же уверенно, как правильную дату работы офиса на соседней странице. Для парсера разница между актуальным и устаревшим фактом не существует. Её видит только человек, который сверяет черновик с реальностью.
То же самое с адресами филиалов, номерами акций «до 31 августа» и разделами «скоро откроем второй склад», которые провисели на сайте дольше, чем планировалось. Автогенерация честно перенесёт их все: она читает страницу и не сверяется с отделом продаж, что из написанного там ещё правда.
Руководство платформы прямо советует не включать сгенерированные файлы в работу без проверки, и на практике правки укладываются в короткий список.
| Что смотреть | Типичная проблема | Что сделать |
|---|---|---|
| Названия файлов | «Услуга 2», «Раздел с сайта» — по такому названию поиск быстрых ответов не сработает | Переименовать в короткое утверждение о содержимом |
| Дубли между файлами | одна услуга описана дважды: на странице «Услуги» и в блоке «О нас» | Оставить один файл, второй удалить или свести к ссылке на первый |
| Фактура в инструкции | режимы с генерацией инструкции иногда оставляют цены и условия прямо в системном промпте | Перенести в базу знаний, в инструкции — только логика поведения |
| Тон текста | сайт пишет для посетителя лендинга, реплике в переписке нужен более сухой тон | Сократить рекламные обороты, оставить факт |
| Актуальность | цена, акция или адрес могли устареть с момента последнего обновления сайта | Сверить с текущим прайсом и открытыми точками, прежде чем сохранять |
Отдельно стоит вопрос формата: страница сайта — это связный текст, и он не всегда лучший формат для конкретного факта. Прайс, вынесенный автогенерацией в текстовый файл, отвечает по смыслу, но не гарантирует, что агент процитирует именно нужную строку: для точного числа по позиции нужна таблица. Разобраться, какой формат выбрать для каждого куска черновика, помогает чек-лист из трёх вопросов о базе знаний: структурированные данные, которые меняются часто, идут в таблицу, связный текст, который меняется редко, в документ или быстрый ответ.
Отдельного бесплатного лимита на парсинг сайта нет: разбор страниц и сама генерация текста списываются токенами по той же ставке, что обычные ответы агента, тысяча токенов равна 1 ₽. Чем больше страниц сайта попадает под парсинг и чем длиннее итоговый черновик, тем выше счёт за один запуск.
Здесь работает та же логика, что и с обычной перепиской: длинный текст, который потом целиком уходит в модель на каждую реплику, обходится дороже короткого. Инструкция на две тысячи знаков и на десять тысяч по-разному сказывается на стоимости каждого следующего ответа агента, и это долгосрочный эффект куда весомее разовой цены самой генерации, подробнее о том, из чего складывается счёт за диалог, рассказано в материале про стоимость чат-бота. Экономнее запускать генерацию по частям: сначала прогнать основную страницу сайта, оценить качество черновика, а дальше добавлять остальные разделы по одному, с оглядкой на счёт.
На Wildberries автогенерация решает похожую задачу иначе: источником служит история вопросов и отзывов покупателей по товарам, сайт компании здесь ни при чём. В тестовый период после регистрации доступны 100 пар вопрос-ответ или отзыв-ответ бесплатно. Система скачивает вопросы и отзывы с площадки, обрабатывает их и объединяет похожие по смыслу, поэтому в итоговую базу обычно попадает меньше карточек, чем было проанализировано изначально. Перед каждым следующим запуском платформа показывает среднюю стоимость генерации и текущий баланс, досчитать дополнительные 500 вопросов можно в любой момент, пока хватает средств. Результат требует той же проверки, что и версия с сайта: система собирает готовые ответы по товару и не знает, что часть из них относится к позиции, снятой с продажи на прошлой неделе.
Вычтите из сорокастраничного сайта разделы, которые устаревают быстрее остальных: акции с датой окончания, цены, статусы «скоро открытие», и проверьте их вручную в первую очередь, до всего остального черновика.
Дальше пройдите по списку файлов так, как советует само руководство: названия отражают содержимое, дублей нет, факты собраны в базе знаний, а логика разговора осталась в инструкции. Разовая автогенерация даёт стартовый набор карточек, а живой базой знаний он становится позже, когда начинает пополняться реальными ответами на реальные вопросы клиентов, — этот процесс устроен иначе, и о нём рассказывает материал о самообучении агента. Длинные документы из черновика, если они прошли проверку и остались связным текстом, режутся на куски так же, как любой другой файл базы знаний, по тем же правилам, что разобраны в статье про документы и чанки. Полный список настроек парсинга и лимитов по каждому режиму держит руководство платформы: оно точнее любого пересказа, потому что обновляется вместе с продуктом.
Она берёт ссылку на сайт компании, разбирает корневую страницу и связанные с ней разделы, и собирает из найденного текста черновик инструкции, файлы базы знаний или то и другое сразу. Итоговый список файлов открывается на просмотр, каждый можно поправить до сохранения.
Да, для этого есть отдельный режим в разделе «База знаний» → «Быстрые ответы» → «Автоматическая генерация». Он читает сайт и создаёт файлы базы знаний, системную инструкцию агента он вообще не открывает.
Да, оба этапа списываются по обычному тарифу платформы: тысяча токенов стоит 1 ₽. Отдельной бесплатной квоты на парсинг сайта нет, счёт идёт с первого запуска.
В тестовый период после регистрации аккаунта доступны 100 пар вопрос-ответ или отзыв-ответ бесплатно. Дальше система показывает среднюю стоимость генерации и списывает её с баланса при каждом следующем запуске.
Не больше ста. Файл должен весить до 1 Мб, и даже если строк в нём больше сотни, система возьмёт только первые сто, остальные останутся не загруженными.
Открыть каждый файл и свериться с реальным состоянием дел на сайте, убрать дубли между файлами, переименовать те, чьи заголовки не отражают содержимое, и вынести в базу знаний всё, что автогенерация оставила в теле инструкции.