Anthropic
以 Claude 与可解释性研究著称的实验室
美国 前沿实验室 闭源
它是什么
Anthropic 成立于 2021 年,创始团队多来自 OpenAI,把 AI 安全与可解释性作为公司主线。它训练 Claude 系列模型,并较早把「宪法式 AI」引入对齐流程:用一份书面原则让模型自我批评与修正,而非只依赖人工标注。公司同时发表可解释性研究,尝试辨认模型内部的特征与回路。
它为什么重要
它把「宪法式 AI」带进主流对齐实践,让「用一套书面原则约束模型」成为与 RLHF 并列的一条路线;同时把可解释性研究从边缘推到前沿实验室的正式议程上。
关键里程碑
- 2021
由前 OpenAI 成员创立
- 2023
发布 Claude 模型
- 2025
发布编程工具 Claude Code