O texto completo é apresentado em inglês; o título e o resumo estão traduzidos.
O QUE É
Ollama is an open-source tool released in 2023 that lets a user download and run open language models locally with a single command. It bundles quantized weights, the inference runtime and model management, built on implementations such as llama.cpp. It addresses the fiddly environment and dependency setup of deploying open models on a local machine.
Por que vale a pena lembrar
It folded weights, runtime and model management into one command, turning "run a model on my machine" from an engineering task into an everyday action.
Especificações-chave
- Backend
- Built on implementations such as llama.cpp
- Platforms
- macOS, Linux, Windows
- Distribution
- Quantized weights managed with the model
Conceitos relacionados
Otimização e serviço de inferência
O treino ocorre uma vez; a inferência, bilhões de vezes por dia — e o primeiro token e a vazão costumam se opor
Compressão de modelos
Tornar um modelo menor, mais rápido e mais barato quase sem perder precisão — mas raramente os três ao mesmo tempo
Produtos semelhantes
vLLM
2023Motor de inferência e serviço de alta vazão para LLMs
Hugging Face Hub
2016O ponto de encontro de modelos e dados abertos
Together API
2022Uma API de inferência para modelos abertos
LangChain
2022Encadeie modelos, ferramentas e recuperação