DeepSeek-V3
Um MoE de pesos abertos com 671B parâmetros, ativando 37B por token
O texto completo é apresentado em inglês; o título e o resumo estão traduzidos.
O QUE É
DeepSeek-V3 is an open-weight model DeepSeek released in December 2024. It uses a mixture-of-experts architecture with 671B total parameters, activating about 37B per token. DeepSeek was founded in Hangzhou in 2023 by Liang Wenfeng and is known for publishing technical details and data openly. V3 approaches the closed frontier of its time on several benchmarks, while the training compute and cost disclosed in its technical report are far below the usual level for models of this size. It supports a context window in the 128K range, with weights downloadable under a permissive licence.
Por que vale a pena lembrar
A 671B-parameter MoE that activates only 37B per token, trained at the low cost reported in its technical report — evidence that open-weight models can approach the closed frontier of the same period.
Especificações-chave
- Parameters
- 671B (MoE, 37B active)
- Context window
- 128K tokens
- Training cost
- About US$5.58M (per the official technical report)
- Open weights
- Yes
Capacidades
Geração de texto
Continua um texto palavra a palavra
Conversa e seguimento de instruções
Entender a intenção ao longo do diálogo e agir
Raciocínio e cadeia de pensamento
Decompor um problema difícil em passos intermediários
Geração de código
Escrever código executável a partir de uma descrição
Conceitos relacionados
Arquitetura Transformer
Substituir o revezamento palavra a palavra por uma sala onde todos falam ao mesmo tempo, deixando dependências distantes a um salto
Pré-treinamento e ajuste fino
Aprender a língua primeiro com texto não rotulado e depois especializar com poucos dados: o paradigma mais eficiente em dados da IA moderna
Mecanismo de atenção
Cada posição pode olhar diretamente para todas as outras e distribuir atenção conforme a relevância
Produtos semelhantes
DeepSeek-R1
2025Um modelo de raciocínio treinado com RL sobre cadeias de pensamento, com pesos abertos sob licença MIT
Llama
2023A família que tornou a rota de pesos abertos mainstream
Qwen
2023Uma família de pesos abertos com muitos tamanhos e versões multimodais
Mistral Large
2024O modelo comercial principal de um laboratório europeu de pesos abertos
Baichuan
2023Um modelo geral de pesos abertos voltado ao uso em chinês