Переранжирование результатов
Переупорядочить кандидатов по истинной релевантности
Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО ЗА ВОЗМОЖНОСТЬ
Takes a query and a short list of recalled candidates, and returns a reordered ranking with relevance scores. Its division of labour differs from embedding retrieval: retrieval uses cheap vector neighbours to pull dozens from tens of thousands, whereas reranking applies a costlier model to score those dozens carefully, so it only runs over the candidate set.
Как это устроено
The typical approach is a cross-encoder: query and candidate are concatenated into one sequence and a single model outputs a relevance score; seeing both at once is more accurate than two-tower encoders, but it cannot be pre-computed and must run per pair. To control latency, a common pattern truncates with a small model first and reranks with a larger one — or simply prompts a large model to score.
Примеры продуктов
4Pinecone
2019Управляемая векторная БД для поиска по сходству
Together API
2022API вывода для открытых моделей
Replicate
2019Запуск моделей сообщества через API
Hugging Face Hub
2016Открытый узел моделей и наборов данных
Связанные организации
Типичное применение
- Improving evidence quality after RAG retrieval
- Final ranking in e-commerce and content search
- Selecting the most relevant passages for a QA system
- Deduplicating and choosing among candidate answers
Как её оценивают
- nDCG@k
- Discounted gain in the top-k after reranking, rewarding better placement
- MAP
- Mean of average precision over all relevant items
- MRR
- Quality of the position of the first relevant result
Границы и трудности
- Cross-encoders score each candidate separately, so latency climbs steeply with candidate count
- Judgements are unstable on out-of-distribution queries, and truncating long documents causes errors
- It can only reorder what was recalled; anything retrieval missed cannot be recovered
Концепции в основе
Генерация с дополнением из поиска
Вместо того чтобы втискивать знания в параметры, держать их снаружи и обращаться по мере надобности — как экзамен с открытой книгой
Механизм внимания
Каждая позиция может напрямую «видеть» все остальные и динамически распределять внимание по релевантности
Оценка модели и кросс-валидация
Точность — самый обманчивый показатель: ошибётесь в оценке, и рухнет всё остальное