El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ ES
Ollama is an open-source tool released in 2023 that lets a user download and run open language models locally with a single command. It bundles quantized weights, the inference runtime and model management, built on implementations such as llama.cpp. It addresses the fiddly environment and dependency setup of deploying open models on a local machine.
Por qué merece la pena recordarlo
It folded weights, runtime and model management into one command, turning "run a model on my machine" from an engineering task into an everyday action.
Especificaciones clave
- Backend
- Built on implementations such as llama.cpp
- Platforms
- macOS, Linux, Windows
- Distribution
- Quantized weights managed with the model
Conceptos relacionados
Optimización y servicio de inferencia
El entrenamiento ocurre una vez; la inferencia, miles de millones de veces al día — y el primer token y el rendimiento suelen oponerse
Compresión de modelos
Hacer un modelo más pequeño, rápido y barato sin apenas perder precisión — aunque rara vez los tres a la vez
Productos similares
vLLM
2023Motor de inferencia y servicio de alto rendimiento para LLM
Hugging Face Hub
2016El punto de encuentro de modelos y datos abiertos
Together API
2022Una API de inferencia para modelos abiertos
LangChain
2022Encadena modelos, herramientas y recuperación