CAPABILITIES
AI 能做什么
四十项能力,按处理对象聚成九个能力族。每一项都讲清楚它指什么、技术上怎么做到、用在哪里、以及现在已经有哪些产品做到了。
点击任一方格,查看落在该「输入 → 输出」组合下的能力。
语言与知识
10 项能力从「写下第一个词」到「读懂一整篇文章」:这一族处理的是符号序列本身——生成、改写、翻译、摘要、抽取、检索与推理。
视觉理解
7 项能力让模型看懂一张图。从最基础的分类,到框出物体、逐像素分割、识别文字与人脸,再到回答关于图像的问题。
图像生成与编辑
5 项能力从一段描述或一张草图出发,直接生成、修改与修复图像。这是生成式 AI 中最先被大众直接感知的一族。
视频
4 项能力视频是「会动的图像」加时间维度。这一族要同时处理空间与时间:生成短片、理解动作、编辑画面与对齐口型。
语音与音乐
4 项能力声音既是波形也是时间序列。语音识别把声音变成文字,语音合成反过来;音乐与音效生成则直接产出可听的素材。
三维
2 项能力把二维输入升维成三维资产:网格、点云与可渲染场景。它是游戏、影视与机器人仿真的上游。
代码与软件
2 项能力代码是一种有严格语法的语言。这一族不只补全下一行,还要理解整个仓库、运行命令、定位并修复报错。
智能体与工具调用
3 项能力当模型能调用工具、读写文件、操作浏览器,它就从「回答问题」变成了「完成任务」。这一族关注的是把动作串成可靠的流程。
数据与文档
3 项能力把混乱的表格、文档与版面变成结构化的字段。这是把 AI 接进真实业务流程时最先要跨过的一道坎。