Toàn văn của trang này được trình bày bằng tiếng Anh; tiêu đề và phần dẫn đã được bản địa hóa.
NÓ LÀ GÌ
Datasets is an open-source library from Hugging Face, released in 2020, for loading, processing and sharing datasets. It uses Apache Arrow as its underlying format and supports memory mapping and streaming, so datasets larger than memory can still be iterated batch by batch. It addresses the difficulty of reusing the download, parsing and preprocessing pipelines that precede training.
Vì sao đáng ghi nhớ
It made "getting the data" a cacheable, streamable standard step, so preprocessing code travels and reproduces alongside the dataset.
Thông số chính
- Backing format
- Apache Arrow
- Reading
- Memory mapping and streaming
Khái niệm liên quan
Hạ tầng huấn luyện và suy luận
Bộ nhớ quyết định mô hình lớn đến đâu, còn truyền thông quyết định mất bao lâu
Tiền huấn luyện và tinh chỉnh
Học ngôn ngữ trước từ lượng lớn văn bản không nhãn, rồi chuyên biệt hóa với ít dữ liệu — mô hình tiết kiệm dữ liệu nhất của AI hiện đại