跳到正文
AI 图鉴

CAPABILITIES

AI 能做什么

四十项能力,按处理对象聚成九个能力族。每一项都讲清楚它指什么、技术上怎么做到、用在哪里、以及现在已经有哪些产品做到了。

模态矩阵横轴是输出、纵轴是输入,格子里是落在该组合上的能力数。
文本图像视频音频三维表格代码动作输入 ↓文本102231323图像35114视频11音频111表格1代码1

点击任一方格,查看落在该「输入 → 输出」组合下的能力。

语言与知识

10 项能力

从「写下第一个词」到「读懂一整篇文章」:这一族处理的是符号序列本身——生成、改写、翻译、摘要、抽取、检索与推理。

视觉理解

7 项能力

让模型看懂一张图。从最基础的分类,到框出物体、逐像素分割、识别文字与人脸,再到回答关于图像的问题。

图像生成与编辑

5 项能力

从一段描述或一张草图出发,直接生成、修改与修复图像。这是生成式 AI 中最先被大众直接感知的一族。

视频

4 项能力

视频是「会动的图像」加时间维度。这一族要同时处理空间与时间:生成短片、理解动作、编辑画面与对齐口型。

语音与音乐

4 项能力

声音既是波形也是时间序列。语音识别把声音变成文字,语音合成反过来;音乐与音效生成则直接产出可听的素材。

三维

2 项能力

把二维输入升维成三维资产:网格、点云与可渲染场景。它是游戏、影视与机器人仿真的上游。

代码与软件

2 项能力

代码是一种有严格语法的语言。这一族不只补全下一行,还要理解整个仓库、运行命令、定位并修复报错。

智能体与工具调用

3 项能力

当模型能调用工具、读写文件、操作浏览器,它就从「回答问题」变成了「完成任务」。这一族关注的是把动作串成可靠的流程。

数据与文档

3 项能力

把混乱的表格、文档与版面变成结构化的字段。这是把 AI 接进真实业务流程时最先要跨过的一道坎。