Questions-réponses et RAG
Récupère d’abord les preuves, puis répond à partir d’elles
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE DÉSIGNE CETTE CAPACITÉ
Takes a question and returns an answer. It has two forms: closed-book, answering from parameters alone, and open-book, retrieving relevant passages from an external corpus first. Retrieval-augmented generation belongs to the latter, keeping knowledge in an updatable external store and usually attaching citations. It differs from free generation by having an explicit question and a verifiable target answer.
Comment c'est fait
A RAG pipeline chunks documents into vectors in an index, encodes the question the same way and takes nearest neighbours, then pastes the retrieved passages with the question into a prompt so the model can answer with citations. Refinements include hybrid dense-plus-sparse retrieval, query rewriting before retrieval, and a reranker to pick the best passages. Closed-book answering relies purely on knowledge compressed during pre-training.
Produits représentatifs
14Perplexity
2022Répond en cherchant, chaque réponse appuyée par des sources
NotebookLM
2023Ne répond qu’à partir de vos sources, citations à l’appui
ChatGPT
2022La fenêtre de discussion qui a mis un grand modèle de langage entre toutes les mains
GPT-4o
2024Un modèle général nativement multimodal : texte, image et audio par une même entrée
Gemini
2024Une entrée de discussion qui réunit recherche, bureautique et modèle multimodal
Command R
2024Un modèle commercial conçu pour la recherche augmentée et l’usage d’outils
Jamba
2024Un modèle à poids ouverts mêlant un modèle d’espace d’états à un Transformer
Kimi
2023Un assistant de conversation chinois réputé pour les longs contextes
Hunyuan
2023La famille de modèles généraux de Tencent, avec des versions à poids ouverts
Microsoft Copilot
2023Une IA conversationnelle intégrée au système d’exploitation et à la bureautique
Doubao
2023Le modèle de conversation général et l’application de ByteDance
LangChain
2022Enchaîner modèles, outils et recherche
ERNIE
2019Un modèle chinois parti d’un préentraînement enrichi par la connaissance, version phare précoce
Pinecone
2019Base vectorielle managée pour la recherche de similarité
Organisations concernées
Usages typiques
- Enterprise knowledge bases and internal Q&A
- Web-search assistants with citations
- Document and contract interrogation
- Support and technical self-service
Comment on l'évalue
- Exact Match
- Share of answers identical to the reference
- Answer F1
- Token overlap with the reference, allowing partial credit
- Retrieval hit rate and citation accuracy
- Whether evidence was retrieved and citations actually support the claim
Limites et points difficiles
- When the right passage is not retrieved, the model still answers confidently — hallucination in disguise
- Multi-hop questions needing several documents break, answering only one link
- Key evidence in the middle of a long context is the most likely to be ignored
Concepts sous-jacents
Génération augmentée par récupération
Plutôt que de fourrer le savoir dans les paramètres, le laisser dehors et le consulter à la demande — comme un examen à livre ouvert
Mécanisme d’attention
Chaque position peut regarder directement toutes les autres et répartir dynamiquement son attention selon la pertinence
Ingénierie des prompts et alignement
Rendre un modèle utile, honnête et inoffensif est plus difficile que de simplement l’agrandir