O texto completo é apresentado em inglês; o título e o resumo estão traduzidos.
O QUE É
Datasets is an open-source library from Hugging Face, released in 2020, for loading, processing and sharing datasets. It uses Apache Arrow as its underlying format and supports memory mapping and streaming, so datasets larger than memory can still be iterated batch by batch. It addresses the difficulty of reusing the download, parsing and preprocessing pipelines that precede training.
Por que vale a pena lembrar
It made "getting the data" a cacheable, streamable standard step, so preprocessing code travels and reproduces alongside the dataset.
Especificações-chave
- Backing format
- Apache Arrow
- Reading
- Memory mapping and streaming
Conceitos relacionados
Infraestrutura de treinamento e inferência
A memória decide o tamanho do modelo treinável; a comunicação, quanto tempo leva
Pré-treinamento e ajuste fino
Aprender a língua primeiro com texto não rotulado e depois especializar com poucos dados: o paradigma mais eficiente em dados da IA moderna
Produtos semelhantes
Transformers
2018Uma API para carregar e treinar modelos pré-treinados
Diffusers
2022Implementação e agendador unificados para modelos de difusão
Pinecone
2019Banco vetorial gerenciado para busca por similaridade