Vector DB & RAG DeveloperОткрытые материалыЧто такое RAG и как устроена RAG-система

Что такое RAG и как устроена RAG-система

Уроки курсаЧто такое RAG и как устроена RAG-система

RAG, или Retrieval-Augmented Generation, — архитектура, в которой перед генерацией ответа система находит релевантные фрагменты документов и передаёт их языковой модели. Это позволяет отвечать по внутренней базе знаний и свежим данным без дообучения LLM.

Два контура RAG

Офлайн-индексация готовит документы к поиску:

  1. файлы загружаются и очищаются;
  2. текст делится на чанки;
  3. для чанков вычисляются эмбеддинги;
  4. векторы, текст и метаданные записываются в хранилище.

Онлайн-запрос выполняется для каждого вопроса:

  1. вопрос превращается в эмбеддинг;
  2. поиск возвращает top-k похожих чанков;
  3. при необходимости результаты фильтруются или rerank-моделью меняется их порядок;
  4. найденный контекст вместе с вопросом передаётся LLM;
  5. модель формирует ответ со ссылками на источники.

RAG не делает модель всезнающей: он лишь даёт ей выбранные системой доказательства.