Step
Una familia de modelos generales orientada a la multimodalidad y el uso en dispositivo
El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ ES
Step is the general model series StepFun has released since April 2023. StepFun was founded in Shanghai in 2023 by Jiang Daxin and others, with multimodality and on-device efficiency as main directions. Step-1 is a model in the hundred-billion-parameter range, and versions such as Step-1V accept image input; later releases add lightweight variants for phones and other devices. The series is offered through cloud interfaces and partly in open form, covering dialogue, image understanding and content generation.
Por qué merece la pena recordarlo
It placed a hundred-billion-parameter general model and a lightweight version fit for phones on the same product line, betting on multimodality and on-device at once — an early, explicit version of that combination among start-up labs.
Especificaciones clave
- Parameters
- Hundred-billion range (Step-1)
- Modality
- Text, image in; text out
- Open weights
- Some versions open
- Released
- 2023-04
Capacidades
Conversación y seguimiento de instrucciones
Entender la intención en el diálogo y actuar en consecuencia
Generación de texto
Continúa un texto palabra por palabra
Razonamiento y cadena de pensamiento
Descomponer un problema difícil en pasos intermedios
Conceptos relacionados
Arquitectura Transformer
Sustituir el relé palabra a palabra por una sala donde todos hablan a la vez, para que las dependencias lejanas estén a un salto
Generación multimodal
Un mismo modelo que aprende a hablar, dibujar, moverse e incluso modelar el mundo 3D
Preentrenamiento y ajuste fino
Aprender el lenguaje primero con texto sin etiquetas y luego especializarse con pocos datos: el paradigma más eficiente en datos de la IA moderna
Productos similares
Doubao
2023El modelo de chat general y la aplicación de ByteDance
GLM
2023Un modelo general chino que comenzó con preentrenamiento de relleno de espacios autorregresivo
Kimi
2023Un asistente de chat chino conocido por manejar contextos largos
MiniMax-M
2025Un modelo de razonamiento de pesos abiertos con atención híbrida y contexto de un millón de tokens