Llama
La familia que llevó la ruta de pesos abiertos a la corriente principal
El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ ES
Llama is Meta’s large language model family, first released in February 2023 and distributed as open weights that can be downloaded and run in one’s own environment. From Llama 2 onward, Meta permitted commercial use and offered several sizes such as 7B, 13B and 70B; Llama 3.1 extended the largest version to 405B parameters. It is a pretrained base on which the community performs extensive instruction tuning and domain adaptation. Its open weights made it a default starting point for many open-source projects.
Por qué merece la pena recordarlo
By releasing large models as open weights under a commercially usable licence, it made “download a base model and fine-tune it yourself” common practice and opened the open-weight camp’s direct competition with the closed frontier.
Especificaciones clave
- Parameters
- 8B / 70B / 405B (Llama 3.1 family)
- Context window
- 128K tokens (Llama 3.1)
- Open weights
- Yes
- Released
- 2023-02
Capacidades
Generación de texto
Continúa un texto palabra por palabra
Conversación y seguimiento de instrucciones
Entender la intención en el diálogo y actuar en consecuencia
Razonamiento y cadena de pensamiento
Descomponer un problema difícil en pasos intermedios
Uso de herramientas y function calling
Que el modelo elija la API y rellene los argumentos
Conceptos relacionados
Arquitectura Transformer
Sustituir el relé palabra a palabra por una sala donde todos hablan a la vez, para que las dependencias lejanas estén a un salto
Preentrenamiento y ajuste fino
Aprender el lenguaje primero con texto sin etiquetas y luego especializarse con pocos datos: el paradigma más eficiente en datos de la IA moderna
Tokenización
Los modelos no leen caracteres, leen tokens; y cómo los dividas decide en silencio capacidad y coste
Productos similares
Mistral Large
2024El modelo comercial insignia de un laboratorio europeo de pesos abiertos
Qwen
2023Una familia de pesos abiertos con muchos tamaños y versiones multimodales
DeepSeek-V3
2024Un MoE de pesos abiertos con 671B parámetros, activando 37B por token
GPT-4o
2024Un modelo general nativamente multimodal: texto, imagen y audio por una misma puerta
Claude
2023Un modelo de chat general conocido por su contexto largo y su alineación de seguridad
Gemini
2023Un modelo general nativamente multimodal, pensado para contextos muy largos
Phi
2023Modelos pequeños y eficientes construidos con datos seleccionados
Command R
2024Un modelo comercial diseñado para recuperación aumentada y uso de herramientas
Jamba
2024Un modelo de pesos abiertos que mezcla un modelo de espacio de estados con un Transformer
Yi
2023Un modelo de pesos abiertos bilingüe chino-inglés, con versiones de contexto muy largo
DBRX
2024Modelo de lenguaje MoE de pesos abiertos de Databricks