Dialog und Instruktionsbefolgung
Absicht über mehrere Züge verstehen und umsetzen
Der vollständige Artikel liegt auf Englisch vor; Titel und Zusammenfassung sind lokalisiert.
WAS DIESE FÄHIGKEIT BEDEUTET
Takes a multi-turn message sequence with roles (system, user, assistant) and outputs the next assistant turn. It is not merely continuation: the model must hold a persona across turns, remember earlier constraints, and obey format and tone instructions. It differs from plain text generation by its explicit role structure and the demand to follow instructions.
Wie sie technisch umgesetzt wird
The base is the same autoregressive language model; the difference lies in chat templates and post-training. System prompts and history are concatenated into a fixed sequence of special tokens, then instruction tuning teaches the model to answer rather than continue a web page. Preference data then shapes it through RLHF or a direct-preference method to favour helpful, harmless and honest behaviour. Tools and memory are injected into the prompt by external systems.
Repräsentative Produkte
30ChatGPT
2022Das Chatfenster, das ein großes Sprachmodell für alle zugänglich machte
Claude
2023Ein allgemeines Dialogmodell, bekannt für langen Kontext und Sicherheitsausrichtung
Gemini
2024Ein Chat-Eingang, der Suche, Office-Apps und ein multimodales Modell bündelt
Kimi
2023Ein chinesischer Chat-Assistent, bekannt für langen Kontext
Doubao
2023ByteDances allgemeines Dialogmodell und App
Character.AI
2022Rollenspiel-Chat mit Figuren, die du selbst festlegst und lange begleitest
Microsoft Copilot
2023Konversations-KI, eingebettet in Betriebssystem und Office-Apps
MiniMax-M
2025Ein Open-Weights-Schlussfolgerungsmodell mit hybridem Attention und einer Million Token Kontext
o3
2025Es denkt lange nach, bevor es antwortet: Rechenzeit bei der Inferenz gegen mehr Treffsicherheit
DeepSeek-R1
2025Ein mit RL auf Gedankenketten trainiertes Schlussfolgerungsmodell, dessen Gewichte unter MIT-Lizenz offen sind
DeepSeek-V3
2024Ein Open-Weights-MoE mit 671B Parametern, das pro Token nur 37B aktiviert
Apple Intelligence
2024System-KI, die Arbeit zwischen Gerät und privater Cloud aufteilt
GPT-4o
2024Ein von Grund auf multimodales Allzweckmodell: Text, Bild und Audio über einen Zugang
Command R
2024Ein kommerzielles Modell für Retrieval-Augmentierung und Werkzeugnutzung
Jamba
2024Ein Open-Weights-Modell, das ein Zustandsraummodell mit einem Transformer mischt
DBRX
2024Offenes MoE-Sprachmodell von Databricks
Mistral Large
2024Das kommerzielle Flaggschiffmodell eines europäischen Open-Weights-Labors
Gemini
2023Ein von Grund auf multimodales Allzweckmodell für sehr langen Kontext
Grok
2023Ein Dialogmodell, an die Daten einer Social-Plattform gekoppelt
Yi
2023Ein zweisprachiges (Chinesisch–Englisch) Open-Weights-Modell mit sehr langem Kontext
Hunyuan
2023Tencent Generalmodell-Familie mit Open-Weights-Versionen
Qwen
2023Eine Open-Weights-Familie über viele Größen hinweg, mit multimodalen Versionen
Phi
2023Kleine, effiziente Modelle aus kuratierten Daten
Step
2023Eine Allzweck-Modellfamilie für Multimodalität und On-Device-Betrieb
Baichuan
2023Ein Open-Weights-Allzweckmodell für den chinesischen Sprachraum
GLM
2023Ein chinesisches Allzweckmodell, das mit autoregressivem Lückenfüllen begann
Llama
2023Die Modellfamilie, die offene Gewichte zum Mainstream machte
Pangu
2020Huaweis Pangu-Familie von Basismodellen
ERNIE
2019Ein chinesisches Modell, das mit wissensverstärktem Vortraining begann – frühe prägende Version
Siri
2011Der frühe Sprachassistent, der Sprachsteuerung auf Massentelefone brachte
Beteiligte Organisationen
Typische Verwendungen
- General assistants and support bots
- Coding and study tutoring
- Role-play and companion apps
- Internal knowledge-helpdesk entry points
Wie sie bewertet wird
- Human-preference Elo
- Ranking by blind pairwise win rate
- Instruction-following rate
- Share of verifiable constraints (format, length, banned words) satisfied
- Safety violation rate
- Rate of violations under red-team prompts
Grenzen und schwierige Punkte
- Constraints from early turns, especially format rules, are forgotten or softened in long chats
- It tends to agree with the user even when the premise is wrong — sycophancy
- Carefully crafted prompts can bypass safety policy; jailbreaks are hard to eliminate
Konzepte dahinter
Prompt-Engineering und Alignment
Ein Modell hilfreich, ehrlich und harmlos zu machen ist schwieriger, als es einfach größer zu machen
Bestärkendes Lernen aus menschlichem Feedback
Wenn die „gute Antwort" keine Formel hat, übernehmen Menschen die Rolle der Belohnungsfunktion
Transformer-Architektur
Statt Wort-für-Wort-Stafette ein Raum, in dem alle zugleich sprechen — und weite Abhängigkeiten sind nur einen Schritt entfernt