本文へスキップ
AI図鑑

CAPABILITIES

AI にできること

40 の能力を、扱う対象ごとに 9 つのファミリーへまとめました。それぞれが何を指し、技術的にどう実現し、どこで使われ、すでにどの製品が実現しているかを解説します。

モダリティマトリクス横軸が出力、縦軸が入力で、各マスにはその組み合わせに当てはまる能力の数を示します。
テキスト画像動画音声3D表コード動作入力 ↓テキスト102231323画像35114動画11音声111表1コード1

任意のマスをクリックすると、その「入力 → 出力」の組み合わせに当てはまる能力を確認できます。

言語と知識

10 能力

最初の一語を書くことから、一篇文章を読み解くことまで。このファミリーが扱うのは記号の並びそのもので、生成・書き換え・翻訳・要約・抽出・検索・推論を含みます。

視覚理解

7 能力

モデルに画像を読ませるためのファミリーです。もっとも基本的な分類から、物体の枠取り、画素単位のセグメンテーション、文字や顔の認識、そして画像についての問いへの回答までを扱います。

画像の生成と編集

5 能力

文章やスケッチをもとに、画像を直接生成・修正・復元します。生成 AI のなかで、一般の人々が最初にその存在を実感したファミリーです。

動画

4 能力

動画は「動く画像」に時間軸を加えたものです。このファミリーは空間と時間を同時に扱い、短い映像の生成、動作の理解、映像の編集、口の動きの同期などを行います。

音声と音楽

4 能力

音は波形であり、時系列でもあります。音声認識は音を文字に、音声合成はその逆を行い、音楽や効果音の生成は聴ける素材をそのまま生み出します。

3D

2 能力

2 次元の入力を 3 次元のアセットへと引き上げます。メッシュ、点群、レンダリング可能なシーンなどです。ゲームや映像、ロボットシミュレーションの上流に位置します。

コードとソフトウェア

2 能力

コードは厳密な文法をもつ言語です。このファミリーは次の一行を補完するだけでなく、リポジトリ全体を理解し、コマンドを実行し、エラーを特定して修正します。

エージェントとツール呼び出し

3 能力

モデルがツールを呼び出し、ファイルを読み書きし、ブラウザを操作できるようになると、「問いに答える」ことから「タスクを完遂する」ことへと変わります。このファミリーは、動作を信頼できる流れへと組み上げることを扱います。

データとドキュメント

3 能力

乱雑な表や文書、レイアウトを構造化されたフィールドへと変えます。AI を実際の業務フローに組み込むときに、まず越えなければならない関門です。