Suy luận và chuỗi tư duy
Chia bài toán khó thành các bước trung gian
Toàn văn của trang này được trình bày bằng tiếng Anh; tiêu đề và phần dẫn đã được bản địa hóa.
NĂNG LỰC NÀY NGHĨA LÀ GÌ
Takes a problem requiring several steps — a maths problem, a logic puzzle, a task needing a plan — and returns the answer together with intermediate steps. Unlike free generation the goal is correctness rather than fluency, and unlike ordinary conversation it spends much of its compute on an internal scratchpad, showing the user mainly the result and a short rationale.
Làm ra sao về mặt kỹ thuật
One family relies on prompting: examples or instructions ask the model to think before answering, writing steps out explicitly — chain-of-thought. Another relies on training: large-scale reinforcement learning on verifiable problems such as maths and code teaches the model to generate a longer deliberation before committing. Self-consistency voting over several sampled chains, and combining deliberation with tool calls or search, are now common too.
Sản phẩm tiêu biểu
23o3
2025Suy luận dài trước khi trả lời, đổi tính toán lúc suy luận lấy độ chính xác ổn định hơn
DeepSeek-R1
2025Mô hình suy luận huấn luyện bằng RL trên chuỗi suy nghĩ, trọng số mở theo giấy phép MIT
Gemini
2023Mô hình đa phương thức gốc, xử lý ngữ cảnh siêu dài
Claude
2023Mô hình hội thoại phổ thông nổi bật với ngữ cảnh dài và căn chỉnh an toàn
Qwen
2023Dòng trọng số mở với nhiều kích cỡ và bản đa phương thức
MiniMax-M
2025Mô hình suy luận trọng số mở với attention lai và ngữ cảnh một triệu token
DeepSeek-V3
2024MoE trọng số mở 671B tham số, chỉ kích hoạt 37B mỗi token
GPT-4o
2024Mô hình đa phương thức gốc, xử lý văn bản, hình ảnh và âm thanh qua một cửa vào
Jamba
2024Mô hình trọng số mở kết hợp mô hình không gian trạng thái với Transformer
DBRX
2024Mô hình ngôn ngữ MoE trọng số mở của Databricks
Mistral Large
2024Mô hình thương mại chủ lực của phòng lab trọng số mở châu Âu
Gemini
2024Một cửa vào trò chuyện gom tìm kiếm, ứng dụng văn phòng và mô hình đa phương thức
Grok
2023Mô hình hội thoại gắn với dữ liệu mạng xã hội
Yi
2023Mô hình trọng số mở song ngữ Trung–Anh, có bản ngữ cảnh siêu dài
Hunyuan
2023Dòng mô hình phổ thông của Tencent, có bản trọng số mở
Doubao
2023Mô hình hội thoại phổ thông và ứng dụng của ByteDance
Phi
2023Mô hình nhỏ, hiệu quả, xây từ dữ liệu chọn lọc
Step
2023Dòng mô hình phổ thông hướng tới đa phương thức và chạy trên thiết bị
Baichuan
2023Mô hình phổ thông trọng số mở hướng tới tiếng Trung
GLM
2023Mô hình phổ thông tiếng Trung khởi đầu bằng tiền huấn luyện điền khuyết tự hồi quy
Llama
2023Dòng mô hình đưa trọng số mở trở thành xu hướng chính
ChatGPT
2022Cửa sổ trò chuyện đưa mô hình ngôn ngữ lớn đến tay mọi người
Pangu
2020Họ mô hình nền tảng Pangu của Huawei
Tổ chức liên quan
Cách dùng tiêu biểu
- Solving maths and physics problems
- Multi-step planning and scheduling
- Code and data problems needing derivation
- Reasoned choices under constraints
Đánh giá nó tốt hay không thế nào
- Math benchmark accuracy
- Correct-answer rate on sets such as GSM8K, MATH, AIME
- pass@k
- Share of problems solved by at least one of k samples
- Chain-of-thought faithfulness
- Whether the written steps actually reflect how the answer was reached
Ranh giới và điểm khó
- The written reasoning can be unfaithful: the answer comes first and a plausible rationale is added after
- In long chains an early misstep propagates, yet the final answer still sounds assured
- Deliberating at length on trivial questions inflates latency and cost
Các khái niệm đằng sau
Kỹ thuật prompt và căn chỉnh
Làm cho mô hình hữu ích, trung thực và vô hại khó hơn việc chỉ phóng to nó
Học tăng cường từ phản hồi của con người
Khi «câu trả lời tốt» không viết được thành công thức, hãy để con người đóng vai hàm thưởng
Kiến trúc Transformer
Thay cách truyền từng từ bằng một phòng họp nơi mọi từ cùng lên tiếng, để phụ thuộc xa chỉ còn cách một bước