Метрики качества RAG: Recall, MRR и Faithfulness
Уроки курсаМетрики качества RAG: Recall, MRR и Faithfulness
RAG состоит минимум из поиска и генерации, поэтому одна субъективная оценка ответа не показывает причину сбоя. Сначала проверяют retrieval: попал ли релевантный документ в top-k. Recall@k измеряет долю нужных документов, найденных среди k результатов; Precision@k — долю релевантных среди выданных.
MRR учитывает позицию первого релевантного результата: чем он выше, тем лучше. Для вопросов с несколькими полезными фрагментами применяют nDCG или полноту по наборам evidence. Метрика требует размеченных запросов и релевантных документов, причём разметка должна учитывать права и актуальную версию данных.
Если нужного evidence нет в top-k, промпт генератора обычно не исправит систему.
0 / 0
К странице курса0 / 0
К странице курса