Génération de code
Écrire du code exécutable à partir d’une description
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE DÉSIGNE CETTE CAPACITÉ
Takes a description — write a function that reads a CSV into a list of dicts and skips blank lines — and outputs the corresponding source. Unlike code completion it targets a new feature or a whole piece of logic, usually written from scratch; unlike reasoning the deliverable is compilable, runnable code rather than a textual conclusion.
Comment c'est fait
The base is a language model pre-trained on large code corpora; strict syntax makes code easier to verify by execution than prose, so unit-test pass signals work well as reward for reinforcement learning or rejection-sampling fine-tuning. Training and evaluation use problems with test cases such as HumanEval and MBPP, and generation can sample several candidates and discard the ones that fail.
Produits représentatifs
11GPT-4o
2024Un modèle général nativement multimodal : texte, image et audio par une même entrée
Claude
2023Un modèle de conversation général réputé pour son long contexte et son alignement sécurisé
DeepSeek-V3
2024Un MoE à poids ouverts de 671B paramètres, activant 37B par token
Qwen
2023Une famille à poids ouverts couvrant de nombreuses tailles, avec des versions multimodales
Gemini
2023Un modèle général nativement multimodal, conçu pour de très longs contextes
GitHub Copilot
2021Complète et réécrit du code dans l’éditeur selon le contexte
o3
2025Il raisonne longuement avant de répondre : du calcul à l’inférence contre plus de justesse
Claude Code
2025Un agent de code qui mène des tâches en plusieurs étapes depuis le terminal
DeepSeek-R1
2025Un modèle de raisonnement entraîné par RL sur des chaînes de pensée, à poids ouverts sous licence MIT
Devin
2024Un agent de code autonome doté de son propre shell, éditeur et navigateur
Cursor
2023Un éditeur de code de bureau qui prend tout le dépôt comme contexte
Organisations concernées
Usages typiques
- New features and utility scripts
- Data cleaning and transformation scripts
- Test cases and project scaffolding
- Porting code across languages and frameworks
Comment on l'évalue
- pass@k
- Share of problems with at least one sample passing all tests out of k
- Benchmark pass rate
- Pass rate on fixed sets such as HumanEval
- Compile and lint pass rate
- Whether generated code passes the compiler and type checks as-is
Limites et points difficiles
- It invents libraries or methods, producing plausible interfaces that do not exist
- Code can pass unit tests yet leave holes in edge cases, error handling and security
- Multi-file changes are inconsistent, with call sites disagreeing with definitions
Concepts sous-jacents
Architecture Transformer
Remplacer le relais mot à mot par une salle où tous parlent en même temps, pour que les dépendances lointaines soient à un saut
Pré-entraînement et affinage
Apprendre d’abord la langue sur d’immenses corpus non annotés, puis se spécialiser avec peu de données : le paradigme le plus économe en données
Ingénierie des prompts et alignement
Rendre un modèle utile, honnête et inoffensif est plus difficile que de simplement l’agrandir