CAPABILITIES
AI가 할 수 있는 일
40개의 능력을 다루는 대상에 따라 9개의 능력 계보로 묶었습니다. 각 항목은 그것이 무엇을 뜻하는지, 기술적으로 어떻게 구현하는지, 어디에 쓰이는지, 그리고 이미 어떤 제품이 그것을 해내고 있는지를 분명히 밝힙니다.
아무 칸이나 클릭하면 그 “입력 → 출력” 조합에 속하는 능력을 볼 수 있습니다.
언어와 지식
10개 능력첫 단어를 쓰는 일부터 한 편의 글 전체를 이해하는 일까지. 이 계보는 기호 열 자체를 다룹니다. 생성, 재작성, 번역, 요약, 추출, 검색, 추론.
텍스트 생성과 이어쓰기
앞선 문맥을 이어 한 단어씩 써 내려간다
대화와 지시 따르기
주고받는 대화 속에서 의도를 파악해 수행한다
기계 번역
한 언어의 글을 다른 언어로 옮긴다
텍스트 요약
긴 글을 더 짧고 정확한 형태로 줄인다
텍스트 분류와 감정 분석
글에 미리 정한 라벨을 붙인다
정보 추출과 개체명 인식
자유 텍스트에서 인명·지명·관계를 뽑아낸다
질의응답과 검색 증강
먼저 근거를 검색한 뒤 그것에 근거해 답한다
추론과 사고 연쇄
어려운 문제를 중간 단계로 나눠 푼다
텍스트 임베딩과 의미 검색
문장을 벡터로 바꿔 의미가 가까운 것을 찾는다
검색 결과 재정렬
후보를 관련도 순으로 다시 정렬한다
시각 이해
7개 능력모델이 한 장의 그림을 읽게 만듭니다. 가장 기본적인 분류부터 물체를 상자로 표시하기, 픽셀 단위 분할, 문자와 얼굴 인식, 그리고 이미지에 관한 질문에 답하기까지.
이미지 생성과 편집
5개 능력한 줄의 설명이나 스케치에서 출발해 이미지를 곧바로 생성하고, 수정하고, 복원합니다. 생성형 AI 가운데 대중이 가장 먼저 직접 체감한 계보입니다.
영상
4개 능력영상은 “움직이는 이미지”에 시간 축을 더한 것입니다. 이 계보는 공간과 시간을 함께 다룹니다. 짧은 영상 생성, 동작 이해, 화면 편집, 입모양 정합.
음성과 음악
4개 능력소리는 파형이자 시계열입니다. 음성 인식은 소리를 문자로 바꾸고, 음성 합성은 그 반대입니다. 음악과 효과음 생성은 들을 수 있는 소재를 곧바로 만들어 냅니다.
3D
2개 능력2차원 입력을 3차원 자산으로 끌어올립니다. 메시, 포인트 클라우드, 렌더링 가능한 장면입니다. 게임, 영상, 로봇 시뮬레이션의 상류에 있습니다.
코드와 소프트웨어
2개 능력코드는 엄격한 문법을 지닌 언어입니다. 이 계보는 다음 줄을 채우는 데 그치지 않고 저장소 전체를 이해하고, 명령을 실행하고, 오류를 찾아 고칩니다.
에이전트와 도구 호출
3개 능력모델이 도구를 호출하고, 파일을 읽고 쓰고, 브라우저를 조작할 수 있게 되면 “질문에 답하기”에서 “작업 완수하기”로 넘어갑니다. 이 계보는 동작을 신뢰할 수 있는 흐름으로 엮는 데 주목합니다.
데이터와 문서
3개 능력어수선한 표, 문서, 레이아웃을 구조화된 필드로 바꿉니다. AI를 실제 업무 프로세스에 연결할 때 가장 먼저 넘어야 할 고비입니다.