O texto completo é apresentado em inglês; o título e o resumo estão traduzidos.
O QUE É
Llama is Meta’s large language model family, first released in February 2023 and distributed as open weights that can be downloaded and run in one’s own environment. From Llama 2 onward, Meta permitted commercial use and offered several sizes such as 7B, 13B and 70B; Llama 3.1 extended the largest version to 405B parameters. It is a pretrained base on which the community performs extensive instruction tuning and domain adaptation. Its open weights made it a default starting point for many open-source projects.
Por que vale a pena lembrar
By releasing large models as open weights under a commercially usable licence, it made “download a base model and fine-tune it yourself” common practice and opened the open-weight camp’s direct competition with the closed frontier.
Especificações-chave
- Parameters
- 8B / 70B / 405B (Llama 3.1 family)
- Context window
- 128K tokens (Llama 3.1)
- Open weights
- Yes
- Released
- 2023-02
Capacidades
Geração de texto
Continua um texto palavra a palavra
Conversa e seguimento de instruções
Entender a intenção ao longo do diálogo e agir
Raciocínio e cadeia de pensamento
Decompor um problema difícil em passos intermediários
Uso de ferramentas e chamada de funções
Deixar o modelo escolher a API e preencher os argumentos
Conceitos relacionados
Arquitetura Transformer
Substituir o revezamento palavra a palavra por uma sala onde todos falam ao mesmo tempo, deixando dependências distantes a um salto
Pré-treinamento e ajuste fino
Aprender a língua primeiro com texto não rotulado e depois especializar com poucos dados: o paradigma mais eficiente em dados da IA moderna
Tokenização
Os modelos não leem caracteres, leem tokens; e como você divide define silenciosamente a capacidade e o custo
Produtos semelhantes
Mistral Large
2024O modelo comercial principal de um laboratório europeu de pesos abertos
Qwen
2023Uma família de pesos abertos com muitos tamanhos e versões multimodais
DeepSeek-V3
2024Um MoE de pesos abertos com 671B parâmetros, ativando 37B por token
GPT-4o
2024Um modelo geral nativamente multimodal: texto, imagem e áudio por uma única porta
Claude
2023Um modelo de conversa geral conhecido por contexto longo e alinhamento de segurança
Gemini
2023Um modelo geral nativamente multimodal, feito para contextos muito longos
Phi
2023Modelos pequenos e eficientes, construídos com dados selecionados
Command R
2024Um modelo comercial feito para recuperação aumentada e uso de ferramentas
Jamba
2024Um modelo de pesos abertos que mistura um modelo de espaço de estados com um Transformer
Yi
2023Um modelo de pesos abertos bilíngue chinês-inglês, com versões de contexto muito longo
DBRX
2024Modelo de linguagem MoE de pesos abertos da Databricks