Cómo usar ComfyUI: Una guía práctica paso a paso para principiantes

Actualizado el 24 de sep de 2025

9 min


Cómo usar ComfyUI: Una guía práctica paso a paso para principiantes

Si has oído que ComfyUI es "basado en nodos y súper potente", pero te sientes intimidado por todas las cajas y cables, no estás solo. La buena noticia: una vez que aprendas algunos conceptos básicos (checkpoints, encoders, samplers y decoders), estarás construyendo flujos de trabajo de imágenes como un profesional. Esta guía práctica te explica cómo usar ComfyUI desde la instalación hasta tus primeras imágenes SDXL, además de flujos de trabajo para ControlNet, LoRAs y ajuste de calidad/rendimiento.
Al final, sabrás exactamente cómo usar ComfyUI para realizar generaciones de imágenes consistentes, repetibles y flexibles sin conjeturas.

¿Qué es ComfyUI y por qué usarlo?

ComfyUI es una interfaz visual basada en nodos para Stable Diffusion que te permite diseñar tu pipeline de imágenes paso a paso. En lugar de un solo botón de "Generar", conectas nodos, cada uno manejando una tarea distinta como cargar un modelo, codificar texto, muestrear latentes o decodificar la imagen final. Es rápido, modular y transparente, perfecto para el aprendizaje, la experimentación y los flujos de trabajo de producción.

Inicio rápido: Instala y lanza ComfyUI

  • Windows/macOS/Linux: Sigue el repositorio oficial y las guías de instalación de la comunidad. Puedes usar la instalación manual (Python + dependencias) o métodos empaquetados dependiendo de tu plataforma y GPU. El wiki de ComfyUI proporciona una configuración paso a paso para Windows, macOS (incluido Apple Silicon) y Linux.
  • Modelos: Coloca tus checkpoints de Stable Diffusion (por ejemplo, SDXL base/refiner o SD 1.5) en la carpeta models/checkpoints. Pon los archivos VAE en models/vae, los LoRAs en models/loras, los modelos ControlNet en models/controlnet.
  • Lanzamiento: Ejecuta el script de inicio para tu sistema operativo; ComfyUI se abre en tu navegador. El lienzo es donde conectarás los nodos.
Consejo: Mantén actualizados los drivers de tu GPU y el kit de herramientas CUDA para obtener el mejor rendimiento.

Concepto básico: El flujo de trabajo mínimo de texto a imagen

El flujo básico de texto a imagen de ComfyUI (estilo SD 1.5) se ve así:
  1. Cargar el modelo
  • Nodo: Checkpoint Loader
  • Salida: Componentes UNet, CLIP y VAE
  1. Codificar prompts
  • Nodo: CLIP Text Encode (Positive)
  • Nodo: CLIP Text Encode (Negative)
  • Salida: Incrustaciones de condicionamiento para la guía
  1. Generar latentes
  • Nodo: KSampler
  • Entradas: UNet, condicionamiento positivo/negativo, seed, steps, sampler (por ejemplo, DPM++ 2M Karras) y escala CFG
  • Salida: Imagen latente
  1. Decodificar imagen
  • Nodo: VAE Decode
  • Salida: Imagen
  1. Guardar salida
  • Nodo: Save Image
Este gráfico básico (Checkpoint → CLIP (pos/neg) → KSampler → VAE Decode → Save) es la base de casi todo lo que harás en ComfyUI.

Flujo de trabajo SDXL: Base + (Opcional) Refinador

SDXL utiliza codificadores de texto duales y, a menudo, se beneficia de un pase de refinador.
  • Cargar SDXL Base: Usa un checkpoint compatible con SDXL. Muchas plantillas SDXL incluyen dos codificadores CLIP (para contexto grande/pequeño). Alimenta prompts positivos y negativos.
  • KSampler (Base): Genera latentes a 1024×1024 (o tu objetivo). Guarda los latentes o las imágenes decodificadas.
  • Refinador opcional: Carga el checkpoint SDXL Refiner y ejecuta un pase KSampler adicional condicionado en la salida base, luego decodifica con VAE.
Este proceso de dos etapas puede mejorar significativamente el detalle y la coherencia a resoluciones más altas.

Práctica: Construye tu primer gráfico ComfyUI

  • Comienza desde una plantilla: En la barra lateral, carga un ejemplo integrado de texto a imagen.
  • Reemplaza el checkpoint: Selecciona tu modelo SDXL o SD 1.5.
  • Escribe tu prompt: Usa los nodos CLIP Positivo y Negativo. Ejemplo:
  • Positivo: “retrato cinematográfico, iluminación suave de estudio, lente de 85 mm, muy detallado, grano de película”
  • Negativo: “borroso, baja resolución, deformado, dedos extra, marca de agua”
  • Configuración de KSampler:
  • Steps: 20–35 para equilibrio entre velocidad/calidad
  • Sampler: DPM++ 2M Karras (confiable) o Euler a (rápido)
  • CFG: 4.5–7.5 (más alto empuja el prompt con más fuerza, pero puede sobresaturar)
  • Seed: Fíjalo para reproducibilidad; varía para exploración
  • Resolución: Para SD 1.5, comienza en 512×512 o 768×768. Para SDXL, 1024×1024 funciona bien.
  • Decodifica y guarda: Agrega VAE Decode → Save Image. Haz clic en Queue Prompt para generar.

Entendiendo los nodos clave (en lenguaje sencillo)

  • Checkpoint Loader: Carga tu modelo de difusión (UNet), codificador(es) de texto (CLIP) y VAE. Piensa en ello como tu “motor + cerebro lingüístico + traductor de imágenes”.
  • CLIP Text Encode: Convierte tu prompt en incrustaciones numéricas que el modelo entiende. Usa codificadores de texto positivos y negativos.
  • KSampler: El corazón de la síntesis de imágenes. Elimina el ruido latente guiado por tu prompt y método de muestreo a través de una serie de pasos.
  • VAE Decode: Traduce los latentes finales en una imagen visible. Cambiar los VAE cambia la fidelidad del color/contraste.
  • Save Image: Escribe la salida en el disco con metadatos para que puedas recrear los resultados más tarde.
Para una inmersión más profunda en estos bloques de construcción, consulta los análisis amigables para principiantes y los explicadores de nodos.

Potenciadores: LoRA, ControlNet e Image-to-Image

Usa LoRA para control de estilo o tema

  • Agrega un nodo LoRA Loader y conéctalo a tu rama de modelo.
  • Fuerza: Comienza alrededor de 0.6–0.8; ajusta según la intensidad del estilo o el sobreajuste.
  • Múltiples LoRAs: Encadena o fusiona, pero ten cuidado con los conflictos; reduce las fuerzas al apilar.

Agrega ControlNet para una composición precisa

  • Los nodos ControlNet te permiten dirigir la composición utilizando un mapa de entrada (Canny, Profundidad, OpenPose, etc.).
  • Flujo típico: Carga el modelo ControlNet → Preprocesa tu imagen guía (por ejemplo, borde Canny) → Alimenta el condicionamiento ControlNet al KSampler junto con tu condicionamiento de texto.
  • Peso: 0.5–1.2 es un buen comienzo. Demasiado alto puede dominar tu prompt.

Image-to-Image o Inpainting

  • Reemplaza el ruido inicial con un latente de imagen a través de VAE Encode.
  • Ajusta la fuerza de eliminación de ruido en KSampler para controlar la cantidad de imagen original que permanece.
  • Para inpainting, usa una entrada de máscara y un pipeline de sampler con reconocimiento de inpaint.

Ajuste de calidad: Prompts, CFG, Samplers y Seeds

  • Ingeniería de prompts: Usa descriptores concisos, no párrafos. El orden importa menos que la claridad, pero mantén los atributos críticos al frente.
  • Escala CFG:
  • Bajo (3–5): Más creativo, menos adherencia al prompt
  • Medio (6–8): Equilibrado
  • Alto (9–12): Fuerte adherencia, puede crear artefactos
  • Elección del sampler:
  • DPM++ 2M Karras: Limpio, confiable
  • Euler a: Rápido y expresivo, ideal para vistas previas
  • UniPC / Heun / DDIM: Vale la pena probar; los resultados varían según el modelo
  • Seeds:
  • Seed fija = resultados reproducibles
  • Variar seed = explorar la diversidad

Consejos de rendimiento para renders fluidos

  • Presupuesto de VRAM: Reduce la resolución, los steps o el tamaño del batch si alcanzas OOM. SDXL a 1024×1024 puede requerir 8–12 GB de VRAM dependiendo de los nodos.
  • Precisión media: Habilita fp16 donde sea compatible para obtener grandes ahorros de memoria con una pérdida de calidad insignificante.
  • Tiling y upscalers latentes: Genera más pequeño, luego escala a través de un nodo upscaler latente o un modelo upscaler de imagen para ahorrar VRAM.
  • Caching: Reutiliza las codificaciones CLIP y los VAE decodificados en las ejecuciones cuando los prompts no cambian.
  • Evita ramas innecesarias: Los nodos desconectados adicionales aún consumen memoria cuando se ejecutan en la misma cola.

Organizando flujos de trabajo como un profesional

  • Agrupa nodos: Usa frames/etiquetas para organizar secciones (Prompt, Modelo, Sampler, Salida, etc.).
  • Paneles de parámetros: Crea nodos de "control" (por ejemplo, cuadros de prompt vacíos, sliders) en la parte superior para un ajuste fácil.
  • Guarda/comparte: Exporta tu JSON de flujo de trabajo y mantén una nota de modelos usados para la reproducibilidad.
  • Control de versiones: Mantén gráficos separados para SD 1.5, SDXL y pipelines de especialidad (anime, fotorrealismo, profundidad a imagen, etc.).

Solución de problemas comunes

  • Imágenes negras o en blanco:
  • VAE incorrecto o falta VAE Decode
  • Denoise demasiado bajo (por ejemplo, <0.2 en img2img)
  • Colores deslavados:
  • Prueba con otro VAE; algunos VAE mejoran el contraste notablemente
  • Baja CFG o cambia el sampler
  • Nada cambia entre ejecuciones:
  • Seed está fijo; habilita randomize o establece una nueva seed
  • Fuera de memoria (OOM):
  • Reduce la resolución, los steps o el tamaño del batch; cambia a fp16
  • Cierra otras aplicaciones de GPU; simplifica las pilas ControlNet/LoRA
  • Modelo no encontrado / nodo rojo:
  • Verifica las rutas de los archivos y las carpetas del modelo; confirma las extensiones de los archivos

Aprende más rápido con flujos de trabajo preconstruidos

Los tutoriales en video y las series para principiantes pueden acelerar tu curva de aprendizaje con gráficos listos para usar que puedes pausar y analizar. Los tutoriales escritos y los wikis proporcionan explicaciones de los nodos y pasos de instalación actualizados para mantenerte al día.

Avanzado: Modularización y extensión de tus gráficos

  • API/Nodos externos: Algunos tutoriales cubren la conexión de ComfyUI a servicios de IA externos a través de nodos especiales, lo que permite pipelines híbridos y la descarga de tareas pesadas.
  • Bibliotecas y extensiones de nodos: Explora los nodos de la comunidad para schedulers, upscalers y preprocesamiento (pose, profundidad, segmentación). Siempre verifica la compatibilidad con tu versión de ComfyUI.
  • Refinadores SDXL y samplers encadenados: Ejecuta la eliminación de ruido por etapas (base → refinador) o incluso múltiples samplers para la combinación estilística.

Vale la pena señalar: Acelerar el prompting con Sider.AI

Si iteras frecuentemente en prompts, referencias o descripciones, es posible que desees un compañero para generar ideas y refinar variaciones. Por cierto, Sider.AI puede ayudarte a redactar rápidamente prompts estructurados, generar listas de prompts negativos y resumir tus experimentos de flujo de trabajo para que no pierdas la pista entre ejecuciones. Puedes probarlo aquí:

Un flujo de trabajo de inicio SDXL simple (copia este patrón)

  • Checkpoint Loader (SDXL Base)
  • CLIP Text Encode (Positive) — “foto de producto ultra detallada, iluminación softbox, lente de 50 mm, superficie reflectante”
  • CLIP Text Encode (Negative) — “baja resolución, desenfoque de movimiento, marca de agua, desorden de fondo”
  • KSampler: 1024×1024, 28 steps, DPM++ 2M Karras, CFG 5.5, seed fija
  • VAE Decode → Save Image
Complementos opcionales:
  • Pase de refinador con checkpoint SDXL Refiner en 10–15 steps
  • ControlNet (Depth) con una silueta de objeto simple para el diseño
  • LoRA en 0.6 para una marca o estilo de arte específico

Conclusiones clave

  • El poder de ComfyUI proviene de su transparencia: construye tu pipeline nodo por nodo.
  • La cadena central de texto a imagen es simple: Checkpoint → CLIP (pos/neg) → KSampler → VAE Decode → Save.
  • SDXL se beneficia de codificadores duales y un pase de refinador opcional para el detalle.
  • Los LoRAs y ControlNet te brindan control de estilo y precisión de composición.
  • Ajusta CFG, sampler y seed para calidad y consistencia; administra VRAM con fp16 y resoluciones sensatas.
  • Organiza los flujos de trabajo y controla las versiones para una iteración sin problemas.

Próximos pasos

  1. Instala ComfyUI siguiendo las instrucciones del repositorio/wiki y lanza un flujo de trabajo de muestra.
  1. Reconstruye la cadena mínima desde cero para consolidar los conceptos básicos.
  1. Agrega ControlNet y un LoRA, luego realiza pruebas A/B de la configuración del sampler y CFG.
  1. Guarda y comparte tu JSON de flujo de trabajo con notas sobre modelos, seeds y parámetros.
Feliz generación y bienvenido al mundo tranquilo y controlable de ComfyUI.

Preguntas frecuentes

P1: ¿Cómo instalo y ejecuto ComfyUI en Windows, macOS o Linux? Sigue el repositorio oficial y el wiki de la comunidad para conocer los pasos específicos de la plataforma, las ubicaciones de las carpetas de modelos y las dependencias. Después de la instalación, inicia el servidor local y abre ComfyUI en tu navegador para comenzar a conectar nodos.
P2: ¿Cuál es el flujo de trabajo ComfyUI más simple para texto a imagen? Carga un checkpoint, codifica prompts positivos y negativos con CLIP, ejecuta un KSampler, decodifica con VAE y luego guarda la imagen. Esta cadena es la base de cómo usar ComfyUI de manera efectiva para la mayoría de las generaciones.
P3: ¿Cómo uso SDXL en ComfyUI? Usa un checkpoint SDXL con codificadores de texto duales, luego, opcionalmente, agrega un pase de refinador para obtener mejores detalles. Ejecuta a 1024 × 1024 con CFG balanceado (alrededor de 5–7) y un sampler eficiente como DPM++ 2M Karras.
P4: ¿Puedo agregar ControlNet y LoRA en el mismo flujo de trabajo de ComfyUI? Sí. Carga tus nodos LoRA y ControlNet, conéctalos a las condiciones del modelo y KSampler, y ajusta los pesos (por ejemplo, 0.6–0.8 para LoRA, ~0.5–1.2 para ControlNet). Observa el uso de VRAM y reduce la resolución o los pasos si alcanzas OOM.
P5: ¿Por qué mis imágenes de ComfyUI tienen poco contraste o están deslavadas? Prueba con un VAE diferente, baja CFG o cambia de sampler. Algunos VAE producen un color y un contraste más fieles; pequeños ajustes pueden solucionar los resultados deslavados rápidamente.