Llama
Die Modellfamilie, die offene Gewichte zum Mainstream machte
Der vollständige Artikel liegt auf Englisch vor; Titel und Zusammenfassung sind lokalisiert.
WAS ES IST
Llama is Meta’s large language model family, first released in February 2023 and distributed as open weights that can be downloaded and run in one’s own environment. From Llama 2 onward, Meta permitted commercial use and offered several sizes such as 7B, 13B and 70B; Llama 3.1 extended the largest version to 405B parameters. It is a pretrained base on which the community performs extensive instruction tuning and domain adaptation. Its open weights made it a default starting point for many open-source projects.
Warum es wichtig ist
By releasing large models as open weights under a commercially usable licence, it made “download a base model and fine-tune it yourself” common practice and opened the open-weight camp’s direct competition with the closed frontier.
Wichtige Eckdaten
- Parameters
- 8B / 70B / 405B (Llama 3.1 family)
- Context window
- 128K tokens (Llama 3.1)
- Open weights
- Yes
- Released
- 2023-02
Fähigkeiten
Textgenerierung
Setzt einen Text Wort für Wort fort
Dialog und Instruktionsbefolgung
Absicht über mehrere Züge verstehen und umsetzen
Schlussfolgern und Gedankenkette
Ein schweres Problem in Zwischenschritte zerlegen
Werkzeug- und Funktionsaufruf
Das Modell wählt die API und füllt die Argumente
Verwandte Konzepte
Transformer-Architektur
Statt Wort-für-Wort-Stafette ein Raum, in dem alle zugleich sprechen — und weite Abhängigkeiten sind nur einen Schritt entfernt
Vor- und Feintraining
Erst Sprache aus riesigem ungelabelten Text lernen, dann mit wenig Daten spezialisieren – das dateneffizienteste Paradigma der modernen KI
Tokenisierung
Modelle lesen keine Zeichen, sondern Tokens – und die Zerlegung bestimmt still Fähigkeit wie Kosten
Vergleichbare Produkte
Mistral Large
2024Das kommerzielle Flaggschiffmodell eines europäischen Open-Weights-Labors
Qwen
2023Eine Open-Weights-Familie über viele Größen hinweg, mit multimodalen Versionen
DeepSeek-V3
2024Ein Open-Weights-MoE mit 671B Parametern, das pro Token nur 37B aktiviert
GPT-4o
2024Ein von Grund auf multimodales Allzweckmodell: Text, Bild und Audio über einen Zugang
Claude
2023Ein allgemeines Dialogmodell, bekannt für langen Kontext und Sicherheitsausrichtung
Gemini
2023Ein von Grund auf multimodales Allzweckmodell für sehr langen Kontext
Phi
2023Kleine, effiziente Modelle aus kuratierten Daten
Command R
2024Ein kommerzielles Modell für Retrieval-Augmentierung und Werkzeugnutzung
Jamba
2024Ein Open-Weights-Modell, das ein Zustandsraummodell mit einem Transformer mischt
Yi
2023Ein zweisprachiges (Chinesisch–Englisch) Open-Weights-Modell mit sehr langem Kontext
DBRX
2024Offenes MoE-Sprachmodell von Databricks