Reordenação de resultados
Reordenar candidatos pela relevância real
O texto completo é apresentado em inglês; o título e o resumo estão traduzidos.
O QUE ESTA CAPACIDADE SIGNIFICA
Takes a query and a short list of recalled candidates, and returns a reordered ranking with relevance scores. Its division of labour differs from embedding retrieval: retrieval uses cheap vector neighbours to pull dozens from tens of thousands, whereas reranking applies a costlier model to score those dozens carefully, so it only runs over the candidate set.
Como é feita tecnicamente
The typical approach is a cross-encoder: query and candidate are concatenated into one sequence and a single model outputs a relevance score; seeing both at once is more accurate than two-tower encoders, but it cannot be pre-computed and must run per pair. To control latency, a common pattern truncates with a small model first and reranks with a larger one — or simply prompts a large model to score.
Produtos representativos
4Pinecone
2019Banco vetorial gerenciado para busca por similaridade
Together API
2022Uma API de inferência para modelos abertos
Replicate
2019Rode modelos da comunidade via API
Hugging Face Hub
2016O ponto de encontro de modelos e dados abertos
Organizações relacionadas
Usos típicos
- Improving evidence quality after RAG retrieval
- Final ranking in e-commerce and content search
- Selecting the most relevant passages for a QA system
- Deduplicating and choosing among candidate answers
Como avaliar se funciona bem
- nDCG@k
- Discounted gain in the top-k after reranking, rewarding better placement
- MAP
- Mean of average precision over all relevant items
- MRR
- Quality of the position of the first relevant result
Limites e dificuldades
- Cross-encoders score each candidate separately, so latency climbs steeply with candidate count
- Judgements are unstable on out-of-distribution queries, and truncating long documents causes errors
- It can only reorder what was recalled; anything retrieval missed cannot be recovered
Conceitos por trás
Geração aumentada por recuperação
Em vez de espremer o conhecimento nos parâmetros, deixá-lo fora e consultá-lo sob demanda — como um exame com livro aberto
Mecanismo de atenção
Cada posição pode olhar diretamente para todas as outras e distribuir atenção conforme a relevância
Avaliação de modelos e validação cruzada
A acurácia é a métrica mais fácil de enganar — erre na avaliação e tudo o mais desmorona