跳到正文
AI 图鉴

PRODUCTS

产品图鉴

把能力落成具体产品的那一层。可以按能力、类型与开放程度筛选——尤其值得先问一句:它能不能自己部署。

能力族
产品类型
开放程度

共 82 条

GPT-4o

2024
OpenAI

原生多模态的通用模型,文本、图像与音频走同一个入口

模型 闭源
文本图像音频文本音频

o3

2025
OpenAI

回答前先生成长的推理链,用推理时的算力换更稳的正确率

模型 闭源
文本图像文本

Claude

2023
Anthropic

以长上下文与安全对齐见长的通用对话模型

模型 闭源
文本图像文本

Gemini

2023
Google DeepMind

原生多模态、可处理超长上下文的通用模型

模型 闭源
文本图像音频视频文本

Llama

2023
Meta AI (FAIR)

把开放权重路线做成主流的通用模型家族

模型 开放权重
文本文本

Grok

2023
xAI

与社交平台数据绑定的对话模型

模型 闭源
文本图像文本

Phi

2023
Microsoft

用小体量和精选数据做成的高效小模型

模型 开放权重
文本文本

Mistral Large

2024
Mistral AI

欧洲开源实验室的旗舰商用模型

模型 闭源
文本文本

Command R

2024
Cohere

为检索增强与工具调用设计的商用模型

模型 开放权重
文本文本

Jamba

2024
AI21 Labs

把状态空间模型与 Transformer 混合的开放权重模型

模型 开放权重
文本文本

DeepSeek-V3

2024
DeepSeek

671B 总参数、每 token 只激活 37B 的开放权重 MoE 模型

模型 开放权重
文本文本

DeepSeek-R1

2025
DeepSeek

用强化学习训练推理链、权重以 MIT 许可开放的推理模型

模型 开放权重
文本文本

Qwen

2023
Alibaba (Qwen)

覆盖多规格、含多模态版本的开放权重模型家族

模型 开放权重
文本图像文本

Kimi

2023
Moonshot AI

以长上下文处理见长的中文对话助手

模型 闭源
文本文本

GLM

2023
Zhipu AI

以自回归填空预训练起步的中文通用模型

模型 闭源
文本文本

ERNIE

2019
Baidu

以知识增强预训练起步的中文模型,早期的代表版本

模型 闭源
文本文本

Hunyuan

2023
Tencent (Hunyuan)

腾讯的通用模型家族,含开放权重版本

模型 开放权重
文本图像文本

Doubao

2023
ByteDance (Seed)

字节跳动的通用对话模型与应用

模型 闭源
文本图像文本

MiniMax-M

2025
MiniMax

采用混合注意力、上下文达百万 token 的开放权重推理模型

模型 开放权重
文本文本

Step

2023
StepFun

面向多模态与端侧的通用模型系列

模型 闭源
文本图像文本

Yi

2023
01.AI

中英双语、提供超长上下文版本的开放权重模型

模型 开放权重
文本文本

Baichuan

2023
Baichuan AI

面向中文场景的开放权重通用模型

模型 开放权重
文本文本

DALL·E 3

2023
OpenAI

把长提示词先改写成详细描述,再据此生成图像

模型 闭源
文本图像

Sora

2024
OpenAI

从一句描述生成最长约一分钟的连贯视频

模型 闭源
文本图像视频

Whisper

2022
OpenAI

把多语种语音转写成文字,并翻译成英文

模型 开放权重
音频文本

Imagen

2022
Google DeepMind

用级联扩散与大型文本编码器生成写实图像

模型 闭源
文本图像

Veo

2024
Google DeepMind

生成 1080p、镜头连贯的视频片段

模型 闭源
文本图像视频

Lyria

2023
Google DeepMind

根据文字提示生成器乐与人声音乐

模型 闭源
文本音频

AlphaFold

2020
Google DeepMind

从氨基酸序列预测蛋白质的三维结构

模型 开源

Stable Diffusion

2022
Stability AI

把文生图权重开源,并压到消费级显卡可运行

模型 开放权重
文本图像图像

Stable Video Diffusion

2023
Stability AI

用扩散模型把一张静态图变成一段短视频

模型 开放权重
图像视频

Stable Video 3D

2024
Stability AI

从单张图片重建物体的多视角与三维形状

模型 开放权重
图像三维

FLUX

2024
Black Forest Labs

用整流流 Transformer 生成高分辨率图像

模型 开放权重
文本图像图像

Midjourney

2022
Midjourney

以审美风格见长的文生图服务

应用 闭源
文本图像图像

Firefly

2023
Adobe

面向创作者的图像生成与编辑工具

应用 闭源
图像文本图像

Gen-3 Alpha

2024
Runway

面向影视与广告的高可控文生视频模型

模型 闭源
文本图像视频

Dream Machine

2024
Luma AI

从文字或图片生成带运动的短视频

模型 闭源
文本图像视频

Genie

2023
Luma AI

在数秒内从文字生成带纹理的三维模型

API 闭源
文本图像三维

Kling

2024
Kuaishou (Kling)

可文生视频也可图生视频的短视频模型

模型 闭源
文本图像视频

Hailuo

2024
MiniMax

主打指令遵循与镜头语言的短视频模型

模型 闭源
文本图像视频

Seedance

2024
ByteDance (Seed)

面向多镜头叙事的视频生成模型

模型 闭源
文本图像视频

Seedream

2024
ByteDance (Seed)

原生高分辨率、擅长文字排版的文生图模型

模型 闭源
文本图像

ElevenLabs

2022
ElevenLabs

自然、可克隆声音的多语种语音合成服务

API 闭源
文本音频

Suno

2023
Suno

用一句话生成带人声的完整歌曲

应用 闭源
文本音频

SparkTTS

2023
iFlytek

面向中文场景的语音合成接口

API 闭源
文本音频

H100

2022
NVIDIA

面向大模型训练的 Hopper 架构数据中心 GPU

硬件 闭源

B200 (Blackwell)

2024
NVIDIA

面向万亿参数模型的 Blackwell 架构 GPU

硬件 闭源

SenseAvatar

2022
SenseTime

从一张人像与一段语音生成口型同步的数字人视频

API 闭源
图像音频视频

ChatGPT

2022
OpenAI

把大模型变成一个人人可用的对话窗口

应用 免费增值
文本图像音频文本图像音频

Claude Code

2025
Anthropic

在终端里自主完成多步编码任务的智能体

工具 闭源
文本代码代码

Gemini

2024
Google DeepMind

把搜索、办公与多模态模型收进一个对话入口

应用 免费增值
文本图像音频文本图像音频

GitHub Copilot

2021
Microsoft

在编辑器里根据上下文续写与改写代码

工具 免费增值
文本代码代码

Microsoft Copilot

2023
Microsoft

把对话式 AI 嵌进操作系统与办公软件

应用 免费增值
文本图像音频文本图像

NotebookLM

2023
Google DeepMind

只用你给它的资料作答,并逐条给出出处

应用 免费增值
文本表格音频文本音频

Cursor

2023
Anysphere (Cursor)

以整仓库为上下文的桌面代码编辑器

应用 免费增值
文本代码代码

Devin

2024
Cognition (Devin)

自带命令行、编辑器与浏览器的自主编程智能体

应用 闭源
文本代码代码

Perplexity

2022
Perplexity AI

边检索边作答、每条答案都带出处

应用 免费增值
文本文本

Apple Intelligence

2024
Apple

端侧与私有云协同的系统级 AI 功能

应用 闭源
文本图像音频文本图像

Siri

2011
Apple

把语音助手带进主流手机的早期产品

应用 闭源
音频音频文本

Character.AI

2022
Character.AI

自定角色、可以长期聊下去的角色扮演式对话

应用 免费增值
文本音频文本音频

DeepL Translator

2017
DeepL

以译文质量为卖点的神经机器翻译服务

应用 免费增值
文本文本

Synthesia

2019
Synthesia

输入文字即可生成数字人口播视频

应用 闭源
文本视频

Waymo Driver

2009
Waymo

无安全员的商业 Robotaxi 自动驾驶系统

模型 闭源

Full Self-Driving

2020
Tesla

只用摄像头的端到端驾驶网络

模型 闭源

Optimus

2022
Tesla

复用自动驾驶感知的人形机器人项目

硬件 闭源

Figure 02

2024
Figure AI

用视觉-语言-动作模型驱动的二代人形机器人

硬件 闭源

Hugging Face Hub

2016
Hugging Face

开放模型与数据集的集散地

平台 开源

Transformers

2018
Hugging Face

一套接口加载与训练预训练模型

工具 开源

Diffusers

2022
Hugging Face

扩散模型的统一实现与调度

工具 开源

Datasets

2020
Hugging Face

一行代码加载与流式读取数据集

工具 开源

Spaces

2021
Hugging Face

把模型演示托管成可访问的网页

平台 免费增值

Ollama

2023
Ollama

在本机一条命令跑起开源模型

工具 开源

Together API

2022
Together AI

托管开源模型的推理接口

API 闭源

Replicate

2019
Replicate

用 API 运行社区上传的模型

平台 闭源

LangChain

2022
LangChain

把模型、工具与检索串成链

工具 开源

Pinecone

2019
Pinecone

托管式向量数据库与相似度检索

基础设施 闭源

vLLM

2023
UC Berkeley (LMSYS)

高吞吐的 LLM 推理与服务引擎

工具 开源

DBRX

2024
Databricks

Databricks 的开放权重 MoE 语言模型

模型 开放权重
文本文本

NeMo

2019
NVIDIA

训练与定制大模型的框架工具集

工具 开源

CUDA

2007
NVIDIA

在 NVIDIA GPU 上做通用计算的编程平台

工具 闭源

Ascend

2018
Huawei

华为的昇腾 AI 处理器与计算架构

硬件 闭源

Pangu

2020
Huawei

华为的盘古系列基础模型

模型 闭源
文本文本