Dify · Курс
0 / 8 уроков
05

База знаний и RAG

Главная причина, по которой компании выбирают Dify: научить ИИ отвечать по вашим документам, а не выдумывать. Разбираемся, как это устроено.

Проблема, которую решает RAG

Модель ИИ не знает ваших регламентов, тарифов и содержания курсов. Спросите её про правила вашей школы — она уверенно сочинит правдоподобный, но неверный ответ. Это называют галлюцинацией.

RAG (Retrieval-Augmented Generation, «генерация с поиском») решает проблему просто: перед ответом система находит подходящие фрагменты в ваших документах и подкладывает их модели со словами «отвечай на основе этого».

ПОДГОТОВКА (один раз) Документы PDF, Notion, FAQ Нарезка на фрагменты-чанки Индекс поиск по смыслу КАЖДЫЙ ВОПРОС Вопрос «какие тарифы?» Поиск в индексе 3–5 лучших фрагментов LLM + фрагменты «отвечай по этому» Ответ точный, по фактам
RAG в двух строках: подготовили индекс — дальше каждый вопрос ищет и отвечает по фактам

Что умеет база знаний Dify

📄 Любые источники

PDF, Word, Markdown, TXT, таблицы, страницы Notion, веб-страницы по ссылке. Загрузили — Dify сам разберёт и проиндексирует.

✂️ Умная нарезка

Документы режутся на чанки. Режимы: обычный, «родитель-потомок» (точный поиск + широкий контекст) и «вопрос-ответ» для FAQ.

🔍 Три вида поиска

Векторный (по смыслу), полнотекстовый (по словам) и гибридный. Гибридный + переранжирование — лучший выбор по умолчанию.

🧪 Проверка до боя

Вкладка тестирования: вводите вопрос — видите, какие фрагменты нашлись и с каким баллом релевантности. Настраиваете до подключения к боту.

🔗 Источники в ответах

Бот может показывать, из какого документа взят ответ — доверие пользователей заметно выше.

🔁 Обновление без боли

Заменили документ — индекс пересобрался, все подключённые приложения сразу отвечают по-новому.

Настройки, которые реально влияют на качество

НастройкаСовет для старта
ИндексацияHigh Quality (векторная). Economy дешевле, но заметно слабее в поиске по смыслу
Метод поискаГибридный (Hybrid) с переранжированием — сочетает точность по словам и по смыслу
Top KСколько фрагментов отдавать модели: начните с 3–5
Порог релевантностиОтсекает мусор: если ничего похожего нет, боту лучше честно сказать «не знаю», чем фантазировать
⚠️
Качество базы важнее настроек

Главная причина плохих ответов — не алгоритмы, а бардак в документах: устаревшие версии, противоречия, простыни без структуры. Час наведения порядка в FAQ даёт больше, чем день кручения параметров.

🛠
Практика: бот отвечает по вашим документам
  1. Соберите в один документ 10–15 реальных вопросов-ответов вашей школы (доступы, тарифы, форматы обучения).
  2. В Dify Cloud откройте Knowledge → Create Knowledge и загрузите файл. Индексация — High Quality.
  3. Во вкладке Retrieval Testing задайте 3 вопроса разными словами, не как в документе, — убедитесь, что находятся нужные фрагменты.
  4. Откройте бота из урока 1, в разделе Context подключите базу знаний.
  5. Спросите бота о том, что есть в документе, и о том, чего нет. Сравните поведение.

Запомнить из урока

  • RAG = поиск по вашим документам + ответ на их основе. Лекарство от галлюцинаций.
  • Схема: документы → чанки → индекс → поиск → ответ с фактами.
  • Старт: High Quality + гибридный поиск + Top K 3–5.
  • Порядок в документах влияет на качество сильнее любых настроек.

Проверьте себя

3 вопроса · выберите один ответ в каждом

1. Как RAG борется с выдумками модели?
2. Что такое «чанк»?
3. Как проверить качество поиска ДО подключения базы к боту?
💬
Остались вопросы?

Этот курс ведёт Claude. Могу помочь структурировать ваш FAQ перед загрузкой — пришлите черновик в чат.