Stable Diffusion
Veröffentlichte Text-zu-Bild-Gewichte offen und klein genug für Consumer-GPUs
Der vollständige Artikel liegt auf Englisch vor; Titel und Zusammenfassung sind lokalisiert.
WAS ES IST
Stable Diffusion is an open-source text-to-image model that Stability AI released in August 2022. It runs the diffusion process in the latent space of a pretrained autoencoder, sharply cutting computation so the model can run on consumer GPUs. Text is turned into conditioning vectors by a CLIP text encoder and injected into the denoising network through cross-attention. The first 1.x version natively outputs 512×512, with a U-Net of roughly 860 million parameters and weights released under an open licence.
Warum es wichtig ist
By open-sourcing text-to-image weights and making them runnable on consumer GPUs, it directly spawned the whole open-source image ecosystem of fine-tunes, plugins and local generation, marking the point where generative imagery reached a broad audience.
Wichtige Eckdaten
- Native resolution
- 512×512 (1.x)
- U-Net parameters
- About 860M
- Architecture
- Latent diffusion + CLIP text encoder
- Open weights
- Yes
- Released
- 2022-08
Fähigkeiten
Verwandte Konzepte
Latente Diffusion und konditionale Steuerung
Diffusion nicht über Pixel, sondern in einem komprimierten semantischen Raum
Diffusionsmodelle
Lerne tausend kleine Entrauschungsschritte, und du erzeugst ein Bild aus reinem Rauschen
Autoencoder und VAE
Information durch einen Engpass pressen und daraus wieder entstehen lassen
Multimodale Generierung
Ein Modell, das sprechen, zeichnen, sich bewegen — und sogar die 3D-Welt modellieren lernt
Vergleichbare Produkte
Midjourney
2022Ein Text-zu-Bild-Dienst, bekannt für seinen ästhetischen Stil
DALL·E 3
2023Schreibt eine lange Eingabe in eine detaillierte Beschreibung um und zeichnet dann das Bild
FLUX
2024Erzeugt hochauflösende Bilder mit einem Rectified-Flow-Transformer
Imagen
2022Erzeugt fotorealistische Bilder mit kaskadierter Diffusion und großem Text-Encoder
Firefly
2023Ein Werkzeug zur Bilderzeugung und -bearbeitung für Gestaltende
Seedream
2024Ein Text-zu-Bild-Modell mit nativer Hochauflösung und guter Textdarstellung