DeepSeek-R1
Um modelo de raciocínio treinado com RL sobre cadeias de pensamento, com pesos abertos sob licença MIT
O texto completo é apresentado em inglês; o título e o resumo estão traduzidos.
O QUE É
DeepSeek-R1 is a reasoning model DeepSeek released in January 2025 that produces a long chain of thought before answering. It trains the model with reinforcement learning to generate reasoning steps on its own, rather than relying on large sets of human-labelled rationales. R1 shares the architecture scale of the V3 family, releases its weights under the MIT licence and publishes a technical report on its training method. After release, many distilled versions of R1 appeared, transferring its reasoning ability into smaller models.
Por que vale a pena lembrar
It fully open-sourced the weights of a frontier reasoning model under the MIT licence and published a reproducible RL training recipe; the wave of distilled versions that followed changed the cost structure of building one’s own reasoning capability.
Especificações-chave
- Parameters
- 671B (MoE, 37B active)
- Context window
- 128K tokens
- Open weights
- Yes (MIT licence)
- Type
- Reasoning model
Capacidades
Raciocínio e cadeia de pensamento
Decompor um problema difícil em passos intermediários
Geração de texto
Continua um texto palavra a palavra
Conversa e seguimento de instruções
Entender a intenção ao longo do diálogo e agir
Geração de código
Escrever código executável a partir de uma descrição
Conceitos relacionados
Aprendizado por reforço a partir de feedback humano
Quando a «boa resposta» não cabe numa fórmula, deixe as pessoas servirem de recompensa
Engenharia de prompts e alinhamento
Tornar um modelo útil, honesto e inofensivo é mais difícil do que apenas torná-lo maior
Arquitetura Transformer
Substituir o revezamento palavra a palavra por uma sala onde todos falam ao mesmo tempo, deixando dependências distantes a um salto
Produtos semelhantes
o3
2025Raciocina longamente antes de responder, trocando computação na inferência por mais acerto
DeepSeek-V3
2024Um MoE de pesos abertos com 671B parâmetros, ativando 37B por token
Qwen
2023Uma família de pesos abertos com muitos tamanhos e versões multimodais
MiniMax-M
2025Um modelo de raciocínio de pesos abertos com atenção híbrida e contexto de um milhão de tokens