Réordonnancement des résultats
Réordonner les candidats selon leur pertinence réelle
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE DÉSIGNE CETTE CAPACITÉ
Takes a query and a short list of recalled candidates, and returns a reordered ranking with relevance scores. Its division of labour differs from embedding retrieval: retrieval uses cheap vector neighbours to pull dozens from tens of thousands, whereas reranking applies a costlier model to score those dozens carefully, so it only runs over the candidate set.
Comment c'est fait
The typical approach is a cross-encoder: query and candidate are concatenated into one sequence and a single model outputs a relevance score; seeing both at once is more accurate than two-tower encoders, but it cannot be pre-computed and must run per pair. To control latency, a common pattern truncates with a small model first and reranks with a larger one — or simply prompts a large model to score.
Produits représentatifs
4Pinecone
2019Base vectorielle managée pour la recherche de similarité
Together API
2022Une API d’inférence pour les modèles ouverts
Replicate
2019Exécuter des modèles de la communauté via une API
Hugging Face Hub
2016Le carrefour des modèles et jeux de données ouverts
Organisations concernées
Usages typiques
- Improving evidence quality after RAG retrieval
- Final ranking in e-commerce and content search
- Selecting the most relevant passages for a QA system
- Deduplicating and choosing among candidate answers
Comment on l'évalue
- nDCG@k
- Discounted gain in the top-k after reranking, rewarding better placement
- MAP
- Mean of average precision over all relevant items
- MRR
- Quality of the position of the first relevant result
Limites et points difficiles
- Cross-encoders score each candidate separately, so latency climbs steeply with candidate count
- Judgements are unstable on out-of-distribution queries, and truncating long documents causes errors
- It can only reorder what was recalled; anything retrieval missed cannot be recovered
Concepts sous-jacents
Génération augmentée par récupération
Plutôt que de fourrer le savoir dans les paramètres, le laisser dehors et le consulter à la demande — comme un examen à livre ouvert
Mécanisme d’attention
Chaque position peut regarder directement toutes les autres et répartir dynamiquement son attention selon la pertinence
Évaluation de modèle et validation croisée
L’exactitude est la métrique la plus trompeuse — une évaluation erronée fait tout s’effondrer