Vector DB & RAG DeveloperОткрытые материалыСемантический поиск и эмбеддинги: как это работает

Семантический поиск и эмбеддинги: как это работает

Уроки курсаСемантический поиск и эмбеддинги: как это работает

Семантический поиск пытается найти совпадение по смыслу, даже если вопрос и документ используют разные слова. Запрос «как вернуть деньги за заказ» должен находить раздел «условия оформления возврата», хотя точного совпадения фраз нет.

Что такое эмбеддинг

Embedding-модель превращает текст в вектор фиксированной длины — набор чисел, описывающий его положение в многомерном пространстве. Тексты с похожим смыслом обычно получают близкие векторы.

Для поиска заранее вычисляют эмбеддинги документов. При запросе той же моделью строят вектор вопроса и сравнивают его с индексом. Популярная мера — cosine similarity:

cosine(a, b) = (a · b) / (||a|| × ||b||)

Чем ближе направление векторов, тем выше сходство. Сам вектор человеку не объясняет смысл; интерпретация появляется только через сравнение и тестовый набор.