Toàn văn của trang này được trình bày bằng tiếng Anh; tiêu đề và phần dẫn đã được bản địa hóa.
NÓ LÀ GÌ
Mistral Large is the flagship model that France’s Mistral AI released in February 2024, offered under a commercial licence rather than open weights, complementing its open small models. Mistral AI was founded in 2023 in Paris by former DeepMind and Meta researchers. The model targets reasoning, multilingual work and function calling, with a context window in the 128K range. Mistral builds a community with a handful of open models, then serves enterprise needs with commercial ones such as Large.
Vì sao đáng ghi nhớ
It represents the dual-track strategy of open-sourcing small models to win a community and selling flagship models commercially, letting a non-US lab hold ground on both the open-weight and commercial sides.
Thông số chính
- Parameters
- 123B (Mistral Large 2)
- Context window
- 128K tokens
- Open weights
- No (commercial licence)
- Released
- 2024-02
Năng lực liên quan
Sinh văn bản
Viết tiếp văn bản từng từ một
Hội thoại và tuân thủ chỉ dẫn
Hiểu ý định qua các lượt hội thoại và thực hiện
Suy luận và chuỗi tư duy
Chia bài toán khó thành các bước trung gian
Gọi công cụ và gọi hàm
Để mô hình chọn API và điền tham số
Khái niệm liên quan
Kiến trúc Transformer
Thay cách truyền từng từ bằng một phòng họp nơi mọi từ cùng lên tiếng, để phụ thuộc xa chỉ còn cách một bước
Cơ chế chú ý (Attention)
Mọi vị trí đều có thể nhìn thẳng vào mọi vị trí khác và phân bổ chú ý theo mức liên quan
Tiền huấn luyện và tinh chỉnh
Học ngôn ngữ trước từ lượng lớn văn bản không nhãn, rồi chuyên biệt hóa với ít dữ liệu — mô hình tiết kiệm dữ liệu nhất của AI hiện đại
Sản phẩm cùng loại
Llama
2023Dòng mô hình đưa trọng số mở trở thành xu hướng chính
GPT-4o
2024Mô hình đa phương thức gốc, xử lý văn bản, hình ảnh và âm thanh qua một cửa vào
Qwen
2023Dòng trọng số mở với nhiều kích cỡ và bản đa phương thức
Command R
2024Mô hình thương mại dành cho tăng cường truy hồi và gọi công cụ
Phi
2023Mô hình nhỏ, hiệu quả, xây từ dữ liệu chọn lọc
Jamba
2024Mô hình trọng số mở kết hợp mô hình không gian trạng thái với Transformer
DeepSeek-V3
2024MoE trọng số mở 671B tham số, chỉ kích hoạt 37B mỗi token
Yi
2023Mô hình trọng số mở song ngữ Trung–Anh, có bản ngữ cảnh siêu dài
DBRX
2024Mô hình ngôn ngữ MoE trọng số mở của Databricks