Sinh văn bản
Viết tiếp văn bản từng từ một
Toàn văn của trang này được trình bày bằng tiếng Anh; tiêu đề và phần dẫn đã được bản địa hóa.
NĂNG LỰC NÀY NGHĨA LÀ GÌ
Given a passage as context, the model writes what comes next. Both input and output are text and no particular transformation is targeted: it can continue a story, finish an explanation or draft an email. It differs from conversation in that no instruction format is required, and from summarisation or translation in that neither compression nor a language switch is the goal — both ends stay in the same modality.
Làm ra sao về mặt kỹ thuật
The dominant route is an autoregressive Transformer language model: text is split into tokens, the model predicts the probability of the next token position by position, and training maximises likelihood over the corpus. GPT, Llama and Qwen all follow it, differing in scale, data and post-training recipe. At inference, temperature, top-k and top-p shape diversity, while long outputs reuse cached keys and values to cut cost.
Sản phẩm tiêu biểu
27GPT-4o
2024Mô hình đa phương thức gốc, xử lý văn bản, hình ảnh và âm thanh qua một cửa vào
Llama
2023Dòng mô hình đưa trọng số mở trở thành xu hướng chính
Qwen
2023Dòng trọng số mở với nhiều kích cỡ và bản đa phương thức
DeepSeek-V3
2024MoE trọng số mở 671B tham số, chỉ kích hoạt 37B mỗi token
Mistral Large
2024Mô hình thương mại chủ lực của phòng lab trọng số mở châu Âu
Gemini
2023Mô hình đa phương thức gốc, xử lý ngữ cảnh siêu dài
Claude
2023Mô hình hội thoại phổ thông nổi bật với ngữ cảnh dài và căn chỉnh an toàn
MiniMax-M
2025Mô hình suy luận trọng số mở với attention lai và ngữ cảnh một triệu token
DeepSeek-R1
2025Mô hình suy luận huấn luyện bằng RL trên chuỗi suy nghĩ, trọng số mở theo giấy phép MIT
Apple Intelligence
2024AI cấp hệ thống chia việc giữa thiết bị và đám mây riêng
Command R
2024Mô hình thương mại dành cho tăng cường truy hồi và gọi công cụ
Jamba
2024Mô hình trọng số mở kết hợp mô hình không gian trạng thái với Transformer
DBRX
2024Mô hình ngôn ngữ MoE trọng số mở của Databricks
Gemini
2024Một cửa vào trò chuyện gom tìm kiếm, ứng dụng văn phòng và mô hình đa phương thức
Grok
2023Mô hình hội thoại gắn với dữ liệu mạng xã hội
Yi
2023Mô hình trọng số mở song ngữ Trung–Anh, có bản ngữ cảnh siêu dài
Kimi
2023Trợ lý hội thoại tiếng Trung nổi bật với xử lý ngữ cảnh dài
Hunyuan
2023Dòng mô hình phổ thông của Tencent, có bản trọng số mở
Microsoft Copilot
2023AI hội thoại gắn thẳng vào hệ điều hành và ứng dụng văn phòng
Doubao
2023Mô hình hội thoại phổ thông và ứng dụng của ByteDance
Phi
2023Mô hình nhỏ, hiệu quả, xây từ dữ liệu chọn lọc
Step
2023Dòng mô hình phổ thông hướng tới đa phương thức và chạy trên thiết bị
Baichuan
2023Mô hình phổ thông trọng số mở hướng tới tiếng Trung
GLM
2023Mô hình phổ thông tiếng Trung khởi đầu bằng tiền huấn luyện điền khuyết tự hồi quy
ChatGPT
2022Cửa sổ trò chuyện đưa mô hình ngôn ngữ lớn đến tay mọi người
Character.AI
2022Trò chuyện nhập vai với nhân vật bạn tự tạo và trò chuyện lâu dài
ERNIE
2019Mô hình tiếng Trung khởi đầu bằng tiền huấn luyện tăng cường tri thức, bản đầu tiên tiêu biểu
Tổ chức liên quan
Cách dùng tiêu biểu
- First drafts and rewriting
- Drafting email, documents and copy
- Code comments and API docs
- Test data and synthetic corpora
Đánh giá nó tốt hay không thế nào
- Perplexity
- Predictive uncertainty on held-out text; lower is better
- Human-preference Elo
- Preference ranking from pairwise comparison
- ROUGE/BLEU on constrained tasks
- Reference overlap when an answer key exists
Ranh giới và điểm khó
- Fluency is not truth: the model states wrong facts with confidence — hallucination
- Over long outputs, earlier setup drifts and the text contradicts itself
- Poor sampling settings can trap the model in repetitive or degenerate loops
Các khái niệm đằng sau
Kiến trúc Transformer
Thay cách truyền từng từ bằng một phòng họp nơi mọi từ cùng lên tiếng, để phụ thuộc xa chỉ còn cách một bước
Tiền huấn luyện và tinh chỉnh
Học ngôn ngữ trước từ lượng lớn văn bản không nhãn, rồi chuyên biệt hóa với ít dữ liệu — mô hình tiết kiệm dữ liệu nhất của AI hiện đại
Kỹ thuật prompt và căn chỉnh
Làm cho mô hình hữu ích, trung thực và vô hại khó hơn việc chỉ phóng to nó