Wie man ComfyUI benutzt: Eine praktische Schritt-für-Schritt-Anleitung für Anfänger
Wenn du gehört hast, dass ComfyUI „knotenbasiert und supermächtig“ ist, dich aber von all den Kästchen und Drähten eingeschüchtert fühlst, bist du nicht allein. Die gute Nachricht: Sobald du ein paar Kernkonzepte lernst – Checkpoints, Encoder, Sampler und Decoder – wirst du Bild-Workflows wie ein Profi erstellen. Diese praktische Anleitung führt dich durch die Verwendung von ComfyUI von der Installation bis zu deinen ersten SDXL-Bildern, plus Workflows für ControlNet, LoRAs und Qualitäts-/Performance-Optimierung.
Am Ende wirst du genau wissen, wie du ComfyUI verwenden kannst, um konsistente, wiederholbare und flexible Bilderzeugungen ohne Rätselraten zu erstellen.
Was ist ComfyUI und warum sollte man es verwenden?
ComfyUI ist eine visuelle, knotenbasierte Schnittstelle für Stable Diffusion, mit der du deine Bildpipeline Schritt für Schritt entwerfen kannst. Anstelle einer einzelnen „Generieren“-Schaltfläche verbindest du Knoten – jeder übernimmt eine bestimmte Aufgabe wie das Laden eines Modells, das Codieren von Text, das Sampling von Latents oder das Decodieren des endgültigen Bildes. Es ist schnell, modular und transparent – perfekt zum Lernen, Experimentieren und für Produktions-Workflows.
Schnellstart: ComfyUI installieren und starten
- Windows/macOS/Linux: Folge dem offiziellen Repo und den Installationsanleitungen der Community. Du kannst die manuelle Installation (Python + Abhängigkeiten) oder verpackte Methoden verwenden, abhängig von deiner Plattform und GPU. Das ComfyUI-Wiki bietet eine schrittweise Einrichtung für Windows, macOS (einschließlich Apple Silicon) und Linux.
- Modelle: Platziere deine Stable Diffusion Checkpoints (z. B. SDXL base/refiner oder SD 1.5) im Ordner
models/checkpoints. Lege VAE-Dateien in models/vae, LoRAs in models/loras und ControlNet-Modelle in models/controlnet ab.
- Starten: Führe das Startskript für dein Betriebssystem aus; ComfyUI öffnet sich in deinem Browser. Die Canvas ist der Ort, an dem du Knoten miteinander verbindest.
Tipp: Halte deine GPU-Treiber und das CUDA-Toolkit auf dem neuesten Stand, um die beste Leistung zu erzielen.
Kernkonzept: Der minimale Text-zu-Bild-Workflow
Der grundlegende Text-zu-Bild-Fluss von ComfyUI (SD 1.5-Stil) sieht wie folgt aus:
- Knoten: Checkpoint Loader
- Ausgabe: UNet-, CLIP- und VAE-Komponenten
- Knoten: CLIP Text Encode (Positiv)
- Knoten: CLIP Text Encode (Negativ)
- Ausgabe: Conditioning Embeddings für Guidance
- Eingaben: UNet, positive/negative Conditioning, Seed, Schritte, Sampler (z. B. DPM++ 2M Karras) und CFG-Skala
Dieser grundlegende Graph – Checkpoint → CLIP (pos/neg) → KSampler → VAE Decode → Save – ist die Grundlage für fast alles, was du in ComfyUI tun wirst.
SDXL Workflow: Base + (Optional) Refiner
SDXL verwendet Dual-Text-Encoder und profitiert oft von einem Refiner-Pass.
- SDXL Base laden: Verwende einen SDXL-kompatiblen Checkpoint. Viele SDXL-Vorlagen enthalten zwei CLIP-Encoder (für großen/kleinen Kontext). Gib sowohl positive als auch negative Prompts ein.
- KSampler (Base): Generiere Latents bei 1024×1024 (oder deinem Ziel). Speichere Latents oder decodierte Bilder.
- Optionaler Refiner: Lade den SDXL Refiner Checkpoint und führe einen zusätzlichen KSampler-Pass aus, der auf der Base-Ausgabe basiert, und decodiere dann mit VAE.
Dieser zweistufige Prozess kann Details und Kohärenz bei höheren Auflösungen deutlich verbessern.
Hands-On: Erstelle deinen ersten ComfyUI Graph
- Beginne mit einer Vorlage: Lade in der Seitenleiste ein eingebautes Text-zu-Bild-Beispiel.
- Ersetze den Checkpoint: Wähle dein SDXL- oder SD 1.5-Modell aus.
- Schreibe deinen Prompt: Verwende die positiven und negativen CLIP-Knoten. Beispiel:
- Positiv: „kinematografisches Porträt, weiche Studiobeleuchtung, 85-mm-Objektiv, hochdetailliert, Filmkorn“
- Negativ: „verschwommen, niedrige Auflösung, deformiert, zusätzliche Finger, Wasserzeichen“
- Schritte: 20–35 für Geschwindigkeits-/Qualitätsbalance
- Sampler: DPM++ 2M Karras (zuverlässig) oder Euler a (schnell)
- CFG: 4.5–7.5 (höher drückt den Prompt stärker, kann aber übersättigen)
- Seed: Fixiere ihn für Reproduzierbarkeit; variiere für Exploration
- Auflösung: Für SD 1.5 beginne mit 512×512 oder 768×768. Für SDXL funktioniert 1024×1024 gut.
- Decodieren und Speichern: Füge VAE Decode → Save Image hinzu. Klicke auf Queue Prompt, um zu generieren.
Die wichtigsten Knoten verstehen (in einfachem Deutsch)
- Checkpoint Loader: Lädt dein Diffusionsmodell (UNet), Text-Encoder (CLIP) und VAE. Betrachte es als deinen „Motor + Sprachgehirn + Bildübersetzer“.
- CLIP Text Encode: Wandelt deinen Prompt in numerische Embeddings um, die das Modell versteht. Verwende sowohl positive als auch negative Text-Encoder.
- KSampler: Das Herzstück der Bildsynthese. Er entrauscht latentes Rauschen, das von deinem Prompt und deiner Sampler-Methode über eine Reihe von Schritten geleitet wird.
- VAE Decode: Übersetzt endgültige Latents in ein sichtbares Bild. Das Austauschen von VAEs verändert die Farb-/Kontrasttreue.
- Save Image: Schreibt die Ausgabe mit Metadaten auf die Festplatte, sodass du die Ergebnisse später wiederherstellen kannst.
Für einen tieferen Einblick in diese Bausteine siehe anfängerfreundliche Aufschlüsselungen und Knotenerklärungen.
Power-Ups: LoRA, ControlNet und Image-to-Image
Verwende LoRA zur Steuerung von Stil oder Subjekt
- Füge einen LoRA Loader-Knoten hinzu und verbinde ihn mit deinem Modellzweig.
- Stärke: Beginne bei etwa 0.6–0.8; passe sie basierend auf der Stilintensität oder Überanpassung an.
- Mehrere LoRAs: Verketten oder zusammenführen, aber achte auf Konflikte; niedrigere Stärken beim Stapeln.
Füge ControlNet für präzise Komposition hinzu
- Mit ControlNet-Knoten kannst du die Komposition mithilfe einer Eingabe-Map (Canny, Depth, OpenPose usw.) steuern.
- Typischer Ablauf: ControlNet-Modell laden → Vorverarbeiten deines Leitbildes (z. B. Canny Edge) → ControlNet-Conditioning zusammen mit deinem Text-Conditioning in KSampler einspeisen.
- Gewichtung: 0.5–1.2 ist ein guter Anfang. Zu hoch kann deinen Prompt überlagern.
Image-to-Image oder Inpainting
- Ersetze das anfängliche Rauschen durch ein Bild-Latent über VAE Encode.
- Passe die Denoise-Stärke im KSampler an, um zu steuern, wie viel vom Originalbild erhalten bleibt.
- Verwende für Inpainting eine Maskeneingabe und eine Inpaint-Aware-Sampler-Pipeline.
Qualitätsoptimierung: Prompts, CFG, Sampler und Seeds
- Prompt Engineering: Verwende prägnante Deskriptoren, keine Absätze. Die Reihenfolge ist weniger wichtig als die Klarheit, aber behalte kritische Attribute im Vordergrund.
- Niedrig (3–5): Kreativer, weniger Prompt-Befolgung
- Hoch (9–12): Starke Befolgung, kann Artefakte erzeugen
- DPM++ 2M Karras: Sauber, zuverlässig
- Euler a: Schnell und ausdrucksstark, ideal für Vorschauen
- UniPC / Heun / DDIM: Testen lohnt sich; die Ergebnisse variieren je nach Modell
- Fester Seed = reproduzierbare Ergebnisse
- Variierender Seed = Vielfalt erkunden
Performance-Tipps für reibungslose Renderings
- VRAM-Budgetierung: Reduziere Auflösung, Schritte oder Batch-Größe, wenn du auf OOM triffst. SDXL bei 1024×1024 kann je nach Knoten 8–12 GB VRAM erfordern.
- Halbpräzision: Aktiviere fp16, wo unterstützt, für große Speichereinsparungen bei vernachlässigbarem Qualitätsverlust.
- Tiling und Latent Upscalers: Generiere kleiner und skaliere dann über einen Latent Upscaler-Knoten oder ein Image Upscaler-Modell hoch, um VRAM zu sparen.
- Caching: Verwende CLIP-Codierungen und decodierte VAEs über mehrere Durchläufe hinweg wieder, wenn sich die Prompts nicht ändern.
- Vermeide unnötige Zweige: Zusätzliche, nicht verbundene Knoten verbrauchen immer noch Speicher, wenn sie in derselben Warteschlange ausgeführt werden.
Workflows wie ein Profi organisieren
- Knoten gruppieren: Verwende Frames/Labels, um Abschnitte zu organisieren (Prompt, Modell, Sampler, Ausgabe usw.).
- Parameterfelder: Erstelle „Steuer“-Knoten (z. B. leere Prompt-Boxen, Schieberegler) oben für einfache Optimierung.
- Speichern/Teilen: Exportiere deinen Workflow als JSON und notiere die
verwendeten Modelle für die Reproduzierbarkeit.
- Versionsverwaltung: Führe separate Graphen für SD 1.5, SDXL und spezielle Pipelines (Anime, Fotorealistisch, Depth-to-Image usw.).
Behebung häufiger Probleme
- Schwarze oder leere Bilder:
- Falsches VAE oder fehlendes VAE Decode
- Denoise zu niedrig (z. B. <0.2 in img2img)
- Probiere ein anderes VAE aus; einige VAEs verbessern den Kontrast merklich
- Senke CFG oder ändere den Sampler
- Nichts ändert sich über mehrere Durchläufe hinweg:
- Seed ist fixiert; aktiviere Randomize oder setze einen neuen Seed
- Reduziere Auflösung, Schritte oder Batch-Größe; wechsle zu fp16
- Schließe andere GPU-Apps; vereinfache ControlNet/LoRA-Stacks
- Modell nicht gefunden / roter Knoten:
- Überprüfe Dateipfade und Modellordner; bestätige Dateiendungen
Schneller lernen mit vorgefertigten Workflows
Video-Walkthroughs und Anfängerserien können deine Lernkurve mit sofort einsatzbereiten Graphen beschleunigen, die du anhalten und sezieren kannst. Geschriebene Tutorials und Wikis bieten Knotenerklärungen und aktualisierte Installationsschritte, um dich auf dem Laufenden zu halten.
Fortgeschritten: Modularisieren und Erweitern deiner Graphen
- API/Externe Knoten: Einige Tutorials behandeln die Verbindung von ComfyUI mit externen KI-Diensten über spezielle Knoten, wodurch hybride Pipelines ermöglicht und rechenintensive Aufgaben ausgelagert werden können.
- Knotenbibliotheken und Erweiterungen: Erkunde Community-Knoten für Schedulers, Upscalers und Vorverarbeitung (Pose, Depth, Segmentation). Überprüfe immer die Kompatibilität mit deiner ComfyUI-Version.
- SDXL Refiners und verkettete Sampler: Führe stufenweise Entrauschung (Base → Refiner) oder sogar mehrere Sampler für stilistische Mischungen aus.
Erwähnenswert: Beschleunigung der Prompt-Erstellung mit Sider.AI
Wenn du häufig Prompts, Referenzen oder Beschreibungen iterierst, benötigst du möglicherweise einen Sidekick, um Variationen zu brainstormen und zu verfeinern. Übrigens kann Sider.AI dir helfen, schnell strukturierte Prompts zu entwerfen, negative Prompt-Listen zu erstellen und deine Workflow-Experimente zusammenzufassen, damit du zwischen den Durchläufen nicht den Überblick verlierst. Du kannst es hier ausprobieren: Ein einfacher SDXL-Starter-Workflow (Kopiere dieses Muster)
- Checkpoint Loader (SDXL Base)
- CLIP Text Encode (Positiv) – „ultradetailliertes Produktfoto, Softbox-Beleuchtung, 50-mm-Objektiv, reflektierende Oberfläche“
- CLIP Text Encode (Negativ) – „niedrige Auflösung, Bewegungsunschärfe, Wasserzeichen, Hintergrund-Unordnung“
- KSampler: 1024×1024, 28 Schritte, DPM++ 2M Karras, CFG 5.5, fester Seed
Optionale Add-ons:
- Refiner-Pass mit SDXL Refiner Checkpoint bei 10–15 Schritten
- ControlNet (Depth) mit einer einfachen Objektsilhouette für das Layout
- LoRA bei 0.6 für eine bestimmte Marke oder einen bestimmten Kunststil
Wichtige Erkenntnisse
- Die Stärke von ComfyUI liegt in seiner Transparenz – erstelle deine Pipeline Knoten für Knoten.
- Die Kernkette von Text zu Bild ist einfach: Checkpoint → CLIP (pos/neg) → KSampler → VAE Decode → Save.
- SDXL profitiert von Dual-Encodern und einem optionalen Refiner-Pass für Details.
- LoRAs und ControlNet geben dir Stilkontrolle und Kompositionspräzision.
- Optimiere CFG, Sampler und Seed für Qualität und Konsistenz; verwalte VRAM mit fp16 und sinnvollen Auflösungen.
- Organisiere Workflows und versioniere sie für schmerzfreie Iteration.
Nächste Schritte
- Installiere ComfyUI gemäß den Repo-/Wiki-Anweisungen und starte einen Beispiel-Workflow.
- Baue die minimale Kette von Grund auf neu, um die Grundlagen zu festigen.
- Füge ControlNet und eine LoRA hinzu und führe dann A/B-Tests mit Sampler- und CFG-Einstellungen durch.
- Speichere und teile deinen Workflow als JSON mit Notizen zu Modellen, Seeds und Parametern.
Viel Spaß beim Generieren – und willkommen in der ruhigen, kontrollierbaren Welt von ComfyUI.
FAQ
F1: Wie installiere und führe ich ComfyUI unter Windows, macOS oder Linux aus?
Folge dem offiziellen Repo und dem Community-Wiki für plattformspezifische Schritte, Modellordner-Speicherorte und Abhängigkeiten. Starte nach der Installation den lokalen Server und öffne ComfyUI in deinem Browser, um mit der Verdrahtung von Knoten zu beginnen.
F2: Was ist der einfachste ComfyUI-Workflow für Text-zu-Bild?
Lade einen Checkpoint, codiere positive und negative Prompts mit CLIP, führe einen KSampler aus, decodiere mit VAE und speichere dann das Bild. Diese Kette ist die Grundlage dafür, wie man ComfyUI effektiv für die meisten Generationen einsetzt.
F3: Wie verwende ich SDXL in ComfyUI?
Verwende einen SDXL-Checkpoint mit Dual-Text-Encodern und füge optional einen Refiner-Pass für bessere Details hinzu. Führe ihn mit 1024×1024 mit ausgeglichenem CFG (um 5–7) und einem effizienten Sampler wie DPM++ 2M Karras aus.
F4: Kann ich ControlNet und LoRA im selben ComfyUI-Workflow hinzufügen?
Ja. Lade deine LoRA- und ControlNet-Knoten, verbinde sie mit den Modell- und KSampler-Conditionings und optimiere die Gewichte (z. B. 0.6–0.8 für LoRA, ~0.5–1.2 für ControlNet). Achte auf die VRAM-Auslastung und reduziere die Auflösung oder die Anzahl der Schritte, wenn du auf OOM triffst.
F5: Warum haben meine ComfyUI-Bilder einen geringen Kontrast oder sind verwaschen?
Probiere ein anderes VAE aus, senke den CFG-Wert oder wechsle den Sampler. Einige VAEs erzeugen eine originalgetreuere Farbe und einen besseren Kontrast; kleine Anpassungen können verwaschene Ergebnisse schnell beheben.