ERNIE
Un modelo chino que comenzó con preentrenamiento enriquecido con conocimiento, versión temprana representativa
El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ ES
ERNIE is Baidu’s large language model series; the earliest, ERNIE 1.0, was released in March 2019 and stands for Enhanced Representation through Knowledge Integration. Its key idea is knowledge-enhanced pretraining: entity- and phrase-level masking during pretraining forces the model to learn knowledge relations between words, not just surface co-occurrence of neighbouring characters. The ERNIE line later grew into a large family spanning retrieval, dialogue and multimodality, and underpins Baidu’s ERNIE Bot product. This entry records the ERNIE starting point as represented by the early 2019 versions.
Por qué merece la pena recordarlo
It introduced entity- and phrase-level masking into pretraining so the model learns knowledge relations rather than mere character co-occurrence — an idea widely borrowed in early Chinese pretraining. These early versions have since been superseded by later ERNIE generations.
Especificaciones clave
- Architecture
- Knowledge-enhanced pretraining (knowledge masking)
- Released
- 2019-03 (ERNIE 1.0)
- Modality
- Text
- Open weights
- No
Capacidades
Generación de texto
Continúa un texto palabra por palabra
Conversación y seguimiento de instrucciones
Entender la intención en el diálogo y actuar en consecuencia
Preguntas y respuestas con recuperación
Recupera la evidencia primero y responde a partir de ella
Conceptos relacionados
Preentrenamiento y ajuste fino
Aprender el lenguaje primero con texto sin etiquetas y luego especializarse con pocos datos: el paradigma más eficiente en datos de la IA moderna
Arquitectura Transformer
Sustituir el relé palabra a palabra por una sala donde todos hablan a la vez, para que las dependencias lejanas estén a un salto
Tokenización
Los modelos no leen caracteres, leen tokens; y cómo los dividas decide en silencio capacidad y coste
Productos similares
GLM
2023Un modelo general chino que comenzó con preentrenamiento de relleno de espacios autorregresivo
Qwen
2023Una familia de pesos abiertos con muchos tamaños y versiones multimodales
Hunyuan
2023La familia de modelos generales de Tencent, con versiones de pesos abiertos
Baichuan
2023Un modelo general de pesos abiertos orientado al uso en chino
Doubao
2023El modelo de chat general y la aplicación de ByteDance
Pangu
2020La familia de modelos base Pangu de Huawei