Jamba
Mô hình trọng số mở kết hợp mô hình không gian trạng thái với Transformer
Toàn văn của trang này được trình bày bằng tiếng Anh; tiêu đề và phần dẫn đã được bản địa hóa.
NÓ LÀ GÌ
Jamba is an open-weight model AI21 Labs released in March 2024, interleaving Mamba state-space layers with Transformer attention layers inside one mixture-of-experts architecture. AI21 Labs was founded in Tel Aviv in 2017 by Amnon Shashua and others. This hybrid design holds long context while cutting memory and compute relative to a pure-attention model. Jamba ships as a 52B-parameter MoE that activates about 12B per token, with a context window in the 256K range.
Vì sao đáng ghi nhớ
It replaced most attention layers with state-space layers, testing whether a non-pure-Transformer architecture can save compute at long context — a concrete instance of hybrid architectures entering open-weight models.
Thông số chính
- Parameters
- 52B (MoE, ~12B active)
- Context window
- 256K tokens
- Architecture
- Mamba state-space layers interleaved with Transformer layers
- Open weights
- Yes
Năng lực liên quan
Sinh văn bản
Viết tiếp văn bản từng từ một
Hội thoại và tuân thủ chỉ dẫn
Hiểu ý định qua các lượt hội thoại và thực hiện
Hỏi đáp và tăng cường truy hồi
Truy hồi bằng chứng trước, rồi trả lời dựa trên đó
Suy luận và chuỗi tư duy
Chia bài toán khó thành các bước trung gian
Khái niệm liên quan
Kiến trúc Transformer
Thay cách truyền từng từ bằng một phòng họp nơi mọi từ cùng lên tiếng, để phụ thuộc xa chỉ còn cách một bước
Cơ chế chú ý (Attention)
Mọi vị trí đều có thể nhìn thẳng vào mọi vị trí khác và phân bổ chú ý theo mức liên quan
Tiền huấn luyện và tinh chỉnh
Học ngôn ngữ trước từ lượng lớn văn bản không nhãn, rồi chuyên biệt hóa với ít dữ liệu — mô hình tiết kiệm dữ liệu nhất của AI hiện đại
Sản phẩm cùng loại
Command R
2024Mô hình thương mại dành cho tăng cường truy hồi và gọi công cụ
Llama
2023Dòng mô hình đưa trọng số mở trở thành xu hướng chính
Mistral Large
2024Mô hình thương mại chủ lực của phòng lab trọng số mở châu Âu