DeepSeek-V3
Un MoE de pesos abiertos con 671B parámetros, activando 37B por token
El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ ES
DeepSeek-V3 is an open-weight model DeepSeek released in December 2024. It uses a mixture-of-experts architecture with 671B total parameters, activating about 37B per token. DeepSeek was founded in Hangzhou in 2023 by Liang Wenfeng and is known for publishing technical details and data openly. V3 approaches the closed frontier of its time on several benchmarks, while the training compute and cost disclosed in its technical report are far below the usual level for models of this size. It supports a context window in the 128K range, with weights downloadable under a permissive licence.
Por qué merece la pena recordarlo
A 671B-parameter MoE that activates only 37B per token, trained at the low cost reported in its technical report — evidence that open-weight models can approach the closed frontier of the same period.
Especificaciones clave
- Parameters
- 671B (MoE, 37B active)
- Context window
- 128K tokens
- Training cost
- About US$5.58M (per the official technical report)
- Open weights
- Yes
Capacidades
Generación de texto
Continúa un texto palabra por palabra
Conversación y seguimiento de instrucciones
Entender la intención en el diálogo y actuar en consecuencia
Razonamiento y cadena de pensamiento
Descomponer un problema difícil en pasos intermedios
Generación de código
Escribir código ejecutable a partir de una descripción
Conceptos relacionados
Arquitectura Transformer
Sustituir el relé palabra a palabra por una sala donde todos hablan a la vez, para que las dependencias lejanas estén a un salto
Preentrenamiento y ajuste fino
Aprender el lenguaje primero con texto sin etiquetas y luego especializarse con pocos datos: el paradigma más eficiente en datos de la IA moderna
Mecanismo de atención
Cada posición puede mirar directamente a todas las demás y repartir su atención según la relevancia
Productos similares
DeepSeek-R1
2025Un modelo de razonamiento entrenado con RL sobre cadenas de pensamiento, con pesos abiertos bajo licencia MIT
Llama
2023La familia que llevó la ruta de pesos abiertos a la corriente principal
Qwen
2023Una familia de pesos abiertos con muchos tamaños y versiones multimodales
Mistral Large
2024El modelo comercial insignia de un laboratorio europeo de pesos abiertos
Baichuan
2023Un modelo general de pesos abiertos orientado al uso en chino