CAPABILITIES
AI にできること
40 の能力を、扱う対象ごとに 9 つのファミリーへまとめました。それぞれが何を指し、技術的にどう実現し、どこで使われ、すでにどの製品が実現しているかを解説します。
任意のマスをクリックすると、その「入力 → 出力」の組み合わせに当てはまる能力を確認できます。
言語と知識
10 能力最初の一語を書くことから、一篇文章を読み解くことまで。このファミリーが扱うのは記号の並びそのもので、生成・書き換え・翻訳・要約・抽出・検索・推論を含みます。
テキスト生成と続き書き
前の文脈を受けて一語ずつ書き進める
対話と指示への追従
やり取りの中で意図を汲み、指示どおりに動く
機械翻訳
ある言語の文を別の言語へ置き換える
テキスト要約
長文をより短く、かつ正確な形に縮める
テキスト分類と感情分析
テキストに既定のラベルを付ける
情報抽出と固有表現認識
自由文から人名・地名・関係を取り出す
質問応答と検索拡張
まず根拠を検索し、それに基づいて答える
推論と思考の連鎖
難問を中間ステップに分解して解く
テキスト埋め込みと意味検索
文をベクトルにし、意味が近いものを取る
検索結果の再ランキング
候補を関連度で並べ直す
視覚理解
7 能力モデルに画像を読ませるためのファミリーです。もっとも基本的な分類から、物体の枠取り、画素単位のセグメンテーション、文字や顔の認識、そして画像についての問いへの回答までを扱います。
画像の生成と編集
5 能力文章やスケッチをもとに、画像を直接生成・修正・復元します。生成 AI のなかで、一般の人々が最初にその存在を実感したファミリーです。
動画
4 能力動画は「動く画像」に時間軸を加えたものです。このファミリーは空間と時間を同時に扱い、短い映像の生成、動作の理解、映像の編集、口の動きの同期などを行います。
音声と音楽
4 能力音は波形であり、時系列でもあります。音声認識は音を文字に、音声合成はその逆を行い、音楽や効果音の生成は聴ける素材をそのまま生み出します。
3D
2 能力2 次元の入力を 3 次元のアセットへと引き上げます。メッシュ、点群、レンダリング可能なシーンなどです。ゲームや映像、ロボットシミュレーションの上流に位置します。
コードとソフトウェア
2 能力コードは厳密な文法をもつ言語です。このファミリーは次の一行を補完するだけでなく、リポジトリ全体を理解し、コマンドを実行し、エラーを特定して修正します。
エージェントとツール呼び出し
3 能力モデルがツールを呼び出し、ファイルを読み書きし、ブラウザを操作できるようになると、「問いに答える」ことから「タスクを完遂する」ことへと変わります。このファミリーは、動作を信頼できる流れへと組み上げることを扱います。
データとドキュメント
3 能力乱雑な表や文書、レイアウトを構造化されたフィールドへと変えます。AI を実際の業務フローに組み込むときに、まず越えなければならない関門です。