El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ ES
Datasets is an open-source library from Hugging Face, released in 2020, for loading, processing and sharing datasets. It uses Apache Arrow as its underlying format and supports memory mapping and streaming, so datasets larger than memory can still be iterated batch by batch. It addresses the difficulty of reusing the download, parsing and preprocessing pipelines that precede training.
Por qué merece la pena recordarlo
It made "getting the data" a cacheable, streamable standard step, so preprocessing code travels and reproduces alongside the dataset.
Especificaciones clave
- Backing format
- Apache Arrow
- Reading
- Memory mapping and streaming
Conceptos relacionados
Infraestructura de entrenamiento e inferencia
La memoria decide qué tan grande es el modelo que puedes entrenar; la comunicación, cuánto tarda
Preentrenamiento y ajuste fino
Aprender el lenguaje primero con texto sin etiquetas y luego especializarse con pocos datos: el paradigma más eficiente en datos de la IA moderna
Productos similares
Transformers
2018Una API para cargar y entrenar modelos preentrenados
Diffusers
2022Implementación y planificador unificados para modelos de difusión
Pinecone
2019Base de datos vectorial gestionada para búsqueda por similitud