यह पृष्ठ अंग्रेज़ी में प्रस्तुत है; शीर्षक और सारांश का स्थानीयकरण किया गया है।
यह क्या है
Jamba is an open-weight model AI21 Labs released in March 2024, interleaving Mamba state-space layers with Transformer attention layers inside one mixture-of-experts architecture. AI21 Labs was founded in Tel Aviv in 2017 by Amnon Shashua and others. This hybrid design holds long context while cutting memory and compute relative to a pure-attention model. Jamba ships as a 52B-parameter MoE that activates about 12B per token, with a context window in the 256K range.
यह क्यों महत्वपूर्ण है
It replaced most attention layers with state-space layers, testing whether a non-pure-Transformer architecture can save compute at long context — a concrete instance of hybrid architectures entering open-weight models.
मुख्य विशिष्टताएँ
- Parameters
- 52B (MoE, ~12B active)
- Context window
- 256K tokens
- Architecture
- Mamba state-space layers interleaved with Transformer layers
- Open weights
- Yes
संबंधित क्षमताएँ
टेक्स्ट जनरेशन
पहले के पाठ को शब्द-दर-शब्द आगे बढ़ाता है
संवाद और निर्देश-पालन
बातचीत में मंशा समझकर उस पर अमल करना
प्रश्नोत्तर और रिट्रीवल-संवर्धित जनरेशन
पहले प्रमाण खोजता है, फिर उसी के आधार पर उत्तर देता है
तर्क और विचार-शृंखला
कठिन समस्या को मध्यवर्ती चरणों में बाँटकर हल करना
संबंधित अवधारणाएँ
Transformer आर्किटेक्चर
शब्द-दर-शब्द relay की जगह वह कक्ष जहाँ सब एक साथ बोलते हैं, जिससे दूर की निर्भरताएँ एक कदम पर आ जाती हैं
अटेंशन तंत्र
हर स्थान बाकी सभी स्थानों को सीधे देख सकता है और प्रासंगिकता के अनुसार ध्यान बाँट सकता है
प्री-ट्रेनिंग और फाइन-ट्यूनिंग
पहले विशाल अलेबल पाठ से भाषा सीखना, फिर थोड़े डेटा से विशेषज्ञ बनना — आधुनिक एआई का सबसे डेटा-कुशल प्रतिमान
समान उत्पाद
Command R
2024पुनर्प्राप्ति-संवर्धन और टूल उपयोग के लिए बना वाणिज्यिक मॉडल
Llama
2023खुले भार के रास्ते को मुख्यधारा बनाने वाला मॉडल परिवार
Mistral Large
2024यूरोपीय ओपन-वेट लैब का फ़्लैगशिप वाणिज्यिक मॉडल