CAPABILITIES
Qué puede hacer la IA
Cuarenta capacidades agrupadas en nueve familias según aquello sobre lo que operan. Cada una explica qué significa, cómo se consigue técnicamente, dónde se usa y qué productos ya la ofrecen.
Haga clic en cualquier celda para ver las capacidades que caen en esa combinación de entrada → salida.
Lenguaje y conocimiento
10 capacidadesDe escribir la primera palabra a leer un documento entero: esta familia trabaja sobre las secuencias de símbolos en sí —generar, reescribir, traducir, resumir, extraer, recuperar y razonar.
Generación de texto
Continúa un texto palabra por palabra
Conversación y seguimiento de instrucciones
Entender la intención en el diálogo y actuar en consecuencia
Traducción automática
Verter un texto de un idioma a otro
Resumen de texto
Comprimir un texto largo en uno más corto y fiel
Clasificación de texto y sentimiento
Asignar una etiqueta predefinida a un texto
Extracción de información y NER
Extraer nombres, lugares y relaciones de texto libre
Preguntas y respuestas con recuperación
Recupera la evidencia primero y responde a partir de ella
Razonamiento y cadena de pensamiento
Descomponer un problema difícil en pasos intermedios
Embeddings de texto y búsqueda semántica
Convertir frases en vectores y buscar los más cercanos por significado
Reordenación de resultados
Reordenar los candidatos por relevancia real
Comprensión visual
7 capacidadesHacer que un modelo entienda una imagen. Desde la clasificación más básica hasta dibujar recuadros, segmentar píxel a píxel, reconocer texto y rostros, o responder preguntas sobre lo que ve.
Clasificación de imágenes
Decidir a qué categoría pertenece toda la imagen
Detección de objetos
Dibujar una caja por objeto y nombrarlo
Segmentación de imágenes
Etiquetar cada píxel con su objeto
Estimación de pose y puntos clave
Localizar articulaciones y reconstruir el esqueleto
Reconocimiento óptico de caracteres
Leer el texto de una imagen como caracteres editables
Reconocimiento facial
Decidir si dos rostros son la misma persona
Comprensión de imágenes y VQA
Mirar una imagen y responder preguntas libres
Generación y edición de imágenes
5 capacidadesPartir de una descripción o un boceto y generar, modificar o restaurar una imagen. Es la familia de la IA generativa que el público conoció primero.
Texto a imagen
Convertir una frase en una imagen
Imagen a imagen
Regenerar una imagen similar a partir de otra
Edición de imagen e inpaint
Cambiar una zona de la imagen con una instrucción
Superresolución y restauración
Hacer nítidas imágenes pequeñas, borrosas o antiguas
Recorte y eliminación de fondo
Recortar el sujeto limpiamente de su fondo
Vídeo
4 capacidadesEl vídeo es una imagen en movimiento más una dimensión temporal. Esta familia trata a la vez el espacio y el tiempo: generar clips, entender acciones, editar planos y sincronizar labios.
Texto a vídeo
Convertir una frase en un videoclip
Imagen a vídeo
Poner en movimiento una imagen fija
Comprensión de vídeo
Entender qué ocurre en un vídeo
Edición de vídeo y sincronía labial
Reeditar o cambiar la voz para que los labios coincidan
Voz y música
4 capacidadesEl sonido es tanto una onda como una serie temporal. El reconocimiento de voz lo convierte en texto, la síntesis hace lo contrario y la generación de música y efectos produce material audible directamente.
Reconocimiento de voz
Transcribir audio hablado a texto
Síntesis de voz
Leer texto en voz alta con voz natural
Clonación y conversión de voz
Reproducir una voz a partir de pocos ejemplos
Generación de música y efectos
Generar música o un efecto sonoro a partir de una descripción
3D
2 capacidadesElevar una entrada bidimensional a un recurso tridimensional: mallas, nubes de puntos y escenas renderizables. Está aguas arriba de los videojuegos, el cine y la simulación robótica.
Código y software
2 capacidadesEl código es un lenguaje con una gramática estricta. Esta familia no solo completa la línea siguiente: entiende un repositorio entero, ejecuta comandos y localiza y corrige errores.
Agentes y uso de herramientas
3 capacidadesCuando un modelo puede llamar herramientas, leer y escribir archivos y manejar un navegador, deja de responder preguntas y empieza a completar tareas. Esta familia se centra en encadenar acciones en flujos fiables.
Uso de herramientas y function calling
Que el modelo elija la API y rellene los argumentos
Agentes autónomos
Descomponer un objetivo y actuar hasta completarlo
Agentes que operan computadoras
Ver la pantalla, hacer clic y escribir como una persona
Datos y documentos
3 capacidadesConvertir tablas, documentos y diseños desordenados en campos estructurados. Es el primer obstáculo que hay que salvar al conectar la IA con un proceso de negocio real.