Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE C'EST
Datasets is an open-source library from Hugging Face, released in 2020, for loading, processing and sharing datasets. It uses Apache Arrow as its underlying format and supports memory mapping and streaming, so datasets larger than memory can still be iterated batch by batch. It addresses the difficulty of reusing the download, parsing and preprocessing pipelines that precede training.
Pourquoi il compte
It made "getting the data" a cacheable, streamable standard step, so preprocessing code travels and reproduces alongside the dataset.
Caractéristiques clés
- Backing format
- Apache Arrow
- Reading
- Memory mapping and streaming
Concepts liés
Infrastructure d’entraînement et d’inférence
La mémoire décide de la taille du modèle entraînable, la communication de la durée — le calcul brut est rarement le goulot
Pré-entraînement et affinage
Apprendre d’abord la langue sur d’immenses corpus non annotés, puis se spécialiser avec peu de données : le paradigme le plus économe en données
Produits comparables
Transformers
2018Une API pour charger et entraîner des modèles pré-entraînés
Diffusers
2022Implémentation et planificateur unifiés des modèles de diffusion
Pinecone
2019Base vectorielle managée pour la recherche de similarité