Baichuan
Un modelo general de pesos abiertos orientado al uso en chino
El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ ES
Baichuan is an open-weight model series Baichuan AI has released since April 2023. The company was founded in Beijing in 2023 by Wang Xiaochuan. Baichuan 2 ships in sizes such as 7B and 13B, pretrained mainly bilingually for Chinese and English and aimed at Chinese question answering, writing and knowledge tasks. Base models and chat versions are both released, with weights offered under an open licence. The series targets Chinese long-tail scenarios and is widely used by domestic developers for secondary training and local deployment.
Por qué merece la pena recordarlo
It centred its open-weight models on Chinese long-tail scenarios and used small-to-mid sizes to lower the barrier to local deployment, making it a common Chinese base in domestic developers’ hands.
Especificaciones clave
- Parameters
- 7B / 13B (Baichuan 2)
- Modality
- Text
- Open weights
- Yes
- Released
- 2023-04
Capacidades
Generación de texto
Continúa un texto palabra por palabra
Conversación y seguimiento de instrucciones
Entender la intención en el diálogo y actuar en consecuencia
Razonamiento y cadena de pensamiento
Descomponer un problema difícil en pasos intermedios
Conceptos relacionados
Arquitectura Transformer
Sustituir el relé palabra a palabra por una sala donde todos hablan a la vez, para que las dependencias lejanas estén a un salto
Preentrenamiento y ajuste fino
Aprender el lenguaje primero con texto sin etiquetas y luego especializarse con pocos datos: el paradigma más eficiente en datos de la IA moderna
Tokenización
Los modelos no leen caracteres, leen tokens; y cómo los dividas decide en silencio capacidad y coste
Productos similares
Qwen
2023Una familia de pesos abiertos con muchos tamaños y versiones multimodales
Yi
2023Un modelo de pesos abiertos bilingüe chino-inglés, con versiones de contexto muy largo
GLM
2023Un modelo general chino que comenzó con preentrenamiento de relleno de espacios autorregresivo
DeepSeek-V3
2024Un MoE de pesos abiertos con 671B parámetros, activando 37B por token
ERNIE
2019Un modelo chino que comenzó con preentrenamiento enriquecido con conocimiento, versión temprana representativa