본문으로 건너뛰기
AI 도감

CAPABILITIES

AI가 할 수 있는 일

40개의 능력을 다루는 대상에 따라 9개의 능력 계보로 묶었습니다. 각 항목은 그것이 무엇을 뜻하는지, 기술적으로 어떻게 구현하는지, 어디에 쓰이는지, 그리고 이미 어떤 제품이 그것을 해내고 있는지를 분명히 밝힙니다.

모달리티 행렬가로축은 출력, 세로축은 입력이며, 각 칸은 그 조합에 속하는 능력의 수입니다.
텍스트이미지영상오디오3D표코드동작입력 ↓텍스트102231323이미지35114영상11오디오111표1코드1

아무 칸이나 클릭하면 그 “입력 → 출력” 조합에 속하는 능력을 볼 수 있습니다.

언어와 지식

10개 능력

첫 단어를 쓰는 일부터 한 편의 글 전체를 이해하는 일까지. 이 계보는 기호 열 자체를 다룹니다. 생성, 재작성, 번역, 요약, 추출, 검색, 추론.

시각 이해

7개 능력

모델이 한 장의 그림을 읽게 만듭니다. 가장 기본적인 분류부터 물체를 상자로 표시하기, 픽셀 단위 분할, 문자와 얼굴 인식, 그리고 이미지에 관한 질문에 답하기까지.

이미지 생성과 편집

5개 능력

한 줄의 설명이나 스케치에서 출발해 이미지를 곧바로 생성하고, 수정하고, 복원합니다. 생성형 AI 가운데 대중이 가장 먼저 직접 체감한 계보입니다.

영상

4개 능력

영상은 “움직이는 이미지”에 시간 축을 더한 것입니다. 이 계보는 공간과 시간을 함께 다룹니다. 짧은 영상 생성, 동작 이해, 화면 편집, 입모양 정합.

음성과 음악

4개 능력

소리는 파형이자 시계열입니다. 음성 인식은 소리를 문자로 바꾸고, 음성 합성은 그 반대입니다. 음악과 효과음 생성은 들을 수 있는 소재를 곧바로 만들어 냅니다.

3D

2개 능력

2차원 입력을 3차원 자산으로 끌어올립니다. 메시, 포인트 클라우드, 렌더링 가능한 장면입니다. 게임, 영상, 로봇 시뮬레이션의 상류에 있습니다.

코드와 소프트웨어

2개 능력

코드는 엄격한 문법을 지닌 언어입니다. 이 계보는 다음 줄을 채우는 데 그치지 않고 저장소 전체를 이해하고, 명령을 실행하고, 오류를 찾아 고칩니다.

에이전트와 도구 호출

3개 능력

모델이 도구를 호출하고, 파일을 읽고 쓰고, 브라우저를 조작할 수 있게 되면 “질문에 답하기”에서 “작업 완수하기”로 넘어갑니다. 이 계보는 동작을 신뢰할 수 있는 흐름으로 엮는 데 주목합니다.

데이터와 문서

3개 능력

어수선한 표, 문서, 레이아웃을 구조화된 필드로 바꿉니다. AI를 실제 업무 프로세스에 연결할 때 가장 먼저 넘어야 할 고비입니다.