Hội thoại và tuân thủ chỉ dẫn
Hiểu ý định qua các lượt hội thoại và thực hiện
Toàn văn của trang này được trình bày bằng tiếng Anh; tiêu đề và phần dẫn đã được bản địa hóa.
NĂNG LỰC NÀY NGHĨA LÀ GÌ
Takes a multi-turn message sequence with roles (system, user, assistant) and outputs the next assistant turn. It is not merely continuation: the model must hold a persona across turns, remember earlier constraints, and obey format and tone instructions. It differs from plain text generation by its explicit role structure and the demand to follow instructions.
Làm ra sao về mặt kỹ thuật
The base is the same autoregressive language model; the difference lies in chat templates and post-training. System prompts and history are concatenated into a fixed sequence of special tokens, then instruction tuning teaches the model to answer rather than continue a web page. Preference data then shapes it through RLHF or a direct-preference method to favour helpful, harmless and honest behaviour. Tools and memory are injected into the prompt by external systems.
Sản phẩm tiêu biểu
30ChatGPT
2022Cửa sổ trò chuyện đưa mô hình ngôn ngữ lớn đến tay mọi người
Claude
2023Mô hình hội thoại phổ thông nổi bật với ngữ cảnh dài và căn chỉnh an toàn
Gemini
2024Một cửa vào trò chuyện gom tìm kiếm, ứng dụng văn phòng và mô hình đa phương thức
Kimi
2023Trợ lý hội thoại tiếng Trung nổi bật với xử lý ngữ cảnh dài
Doubao
2023Mô hình hội thoại phổ thông và ứng dụng của ByteDance
Character.AI
2022Trò chuyện nhập vai với nhân vật bạn tự tạo và trò chuyện lâu dài
Microsoft Copilot
2023AI hội thoại gắn thẳng vào hệ điều hành và ứng dụng văn phòng
MiniMax-M
2025Mô hình suy luận trọng số mở với attention lai và ngữ cảnh một triệu token
o3
2025Suy luận dài trước khi trả lời, đổi tính toán lúc suy luận lấy độ chính xác ổn định hơn
DeepSeek-R1
2025Mô hình suy luận huấn luyện bằng RL trên chuỗi suy nghĩ, trọng số mở theo giấy phép MIT
DeepSeek-V3
2024MoE trọng số mở 671B tham số, chỉ kích hoạt 37B mỗi token
Apple Intelligence
2024AI cấp hệ thống chia việc giữa thiết bị và đám mây riêng
GPT-4o
2024Mô hình đa phương thức gốc, xử lý văn bản, hình ảnh và âm thanh qua một cửa vào
Command R
2024Mô hình thương mại dành cho tăng cường truy hồi và gọi công cụ
Jamba
2024Mô hình trọng số mở kết hợp mô hình không gian trạng thái với Transformer
DBRX
2024Mô hình ngôn ngữ MoE trọng số mở của Databricks
Mistral Large
2024Mô hình thương mại chủ lực của phòng lab trọng số mở châu Âu
Gemini
2023Mô hình đa phương thức gốc, xử lý ngữ cảnh siêu dài
Grok
2023Mô hình hội thoại gắn với dữ liệu mạng xã hội
Yi
2023Mô hình trọng số mở song ngữ Trung–Anh, có bản ngữ cảnh siêu dài
Hunyuan
2023Dòng mô hình phổ thông của Tencent, có bản trọng số mở
Qwen
2023Dòng trọng số mở với nhiều kích cỡ và bản đa phương thức
Phi
2023Mô hình nhỏ, hiệu quả, xây từ dữ liệu chọn lọc
Step
2023Dòng mô hình phổ thông hướng tới đa phương thức và chạy trên thiết bị
Baichuan
2023Mô hình phổ thông trọng số mở hướng tới tiếng Trung
GLM
2023Mô hình phổ thông tiếng Trung khởi đầu bằng tiền huấn luyện điền khuyết tự hồi quy
Llama
2023Dòng mô hình đưa trọng số mở trở thành xu hướng chính
Pangu
2020Họ mô hình nền tảng Pangu của Huawei
ERNIE
2019Mô hình tiếng Trung khởi đầu bằng tiền huấn luyện tăng cường tri thức, bản đầu tiên tiêu biểu
Siri
2011Trợ lý giọng nói sớm đưa điều khiển bằng lời nói vào điện thoại phổ thông
Tổ chức liên quan
Cách dùng tiêu biểu
- General assistants and support bots
- Coding and study tutoring
- Role-play and companion apps
- Internal knowledge-helpdesk entry points
Đánh giá nó tốt hay không thế nào
- Human-preference Elo
- Ranking by blind pairwise win rate
- Instruction-following rate
- Share of verifiable constraints (format, length, banned words) satisfied
- Safety violation rate
- Rate of violations under red-team prompts
Ranh giới và điểm khó
- Constraints from early turns, especially format rules, are forgotten or softened in long chats
- It tends to agree with the user even when the premise is wrong — sycophancy
- Carefully crafted prompts can bypass safety policy; jailbreaks are hard to eliminate
Các khái niệm đằng sau
Kỹ thuật prompt và căn chỉnh
Làm cho mô hình hữu ích, trung thực và vô hại khó hơn việc chỉ phóng to nó
Học tăng cường từ phản hồi của con người
Khi «câu trả lời tốt» không viết được thành công thức, hãy để con người đóng vai hàm thưởng
Kiến trúc Transformer
Thay cách truyền từng từ bằng một phòng họp nơi mọi từ cùng lên tiếng, để phụ thuộc xa chỉ còn cách một bước