Reordenación de resultados
Reordenar los candidatos por relevancia real
El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ SIGNIFICA ESTA CAPACIDAD
Takes a query and a short list of recalled candidates, and returns a reordered ranking with relevance scores. Its division of labour differs from embedding retrieval: retrieval uses cheap vector neighbours to pull dozens from tens of thousands, whereas reranking applies a costlier model to score those dozens carefully, so it only runs over the candidate set.
Cómo se consigue técnicamente
The typical approach is a cross-encoder: query and candidate are concatenated into one sequence and a single model outputs a relevance score; seeing both at once is more accurate than two-tower encoders, but it cannot be pre-computed and must run per pair. To control latency, a common pattern truncates with a small model first and reranks with a larger one — or simply prompts a large model to score.
Productos representativos
4Pinecone
2019Base de datos vectorial gestionada para búsqueda por similitud
Together API
2022Una API de inferencia para modelos abiertos
Replicate
2019Ejecuta modelos de la comunidad mediante una API
Hugging Face Hub
2016El punto de encuentro de modelos y datos abiertos
Organizaciones relacionadas
Usos típicos
- Improving evidence quality after RAG retrieval
- Final ranking in e-commerce and content search
- Selecting the most relevant passages for a QA system
- Deduplicating and choosing among candidate answers
Cómo se evalúa
- nDCG@k
- Discounted gain in the top-k after reranking, rewarding better placement
- MAP
- Mean of average precision over all relevant items
- MRR
- Quality of the position of the first relevant result
Límites y dificultades
- Cross-encoders score each candidate separately, so latency climbs steeply with candidate count
- Judgements are unstable on out-of-distribution queries, and truncating long documents causes errors
- It can only reorder what was recalled; anything retrieval missed cannot be recovered
Conceptos detrás
Generación aumentada por recuperación
En lugar de meter el conocimiento en los parámetros, dejarlo fuera y consultarlo cuando haga falta: como un examen a libro abierto
Mecanismo de atención
Cada posición puede mirar directamente a todas las demás y repartir su atención según la relevancia
Evaluación de modelos y validación cruzada
La exactitud es la métrica más fácil de engañar — si evalúas mal, todo lo demás cae