Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE C'EST
CUDA is the parallel computing platform and programming model introduced by NVIDIA in 2007 that lets developers use GPUs for general-purpose computing. It provides language extensions, a compiler, and acceleration libraries such as cuDNN and cuBLAS. It addresses efficiently mapping highly parallel computation such as neural-network training and inference onto GPUs.
Pourquoi il compte
It has been the practical programming interface for AI compute for over a decade; the libraries and tools built around it form NVIDIA’s deepest ecosystem moat.
Caractéristiques clés
- First release
- 2007
- Positioning
- GPU general-purpose parallel computing platform and programming model
- Companion libraries
- cuDNN, cuBLAS and others
Concepts liés
Infrastructure d’entraînement et d’inférence
La mémoire décide de la taille du modèle entraînable, la communication de la durée — le calcul brut est rarement le goulot
Optimisation et service d’inférence
L’entraînement a lieu une fois, l’inférence des milliards de fois par jour — et le premier token s’oppose souvent au débit