ComfyLab
Qwen Image 2.1 vs Krea 2 Raw en ComfyUI: 120 pruebas locales

Qwen Image 2.1 vs Krea 2 Raw en ComfyUI: 120 pruebas locales

24GB VRAM (entorno probado) VRAM Avanzado 18 min Krea 2 Raw, checkpoint propio y Qwen Image 2.1
Savien

La pregunta no era cuál de estos modelos tiene mejor marketing, sino qué cambia al pedir la misma clase de fotografía a Krea 2 Raw y Qwen Image 2.1 en ComfyUI. Congelamos una batería de 40 escenas antes de abrir los resultados y ejecutamos ambos flujos en la misma máquina. Un tercer flujo, identificado como checkpoint_propio_v1, se conserva como control interno de la prueba, no como producto ni como keyword de esta guía. De ese material, publicamos cuatro escenas seleccionadas para ilustrar retrato, contacto de mano con rostro, figura vestida y luz difícil.

No hay una clasificación total aquí. Los tres modelos producen imágenes utilizables en los ejemplos mostrados, pero no interpretan el prompt de la misma forma: cambian la persona, el encuadre, el grado de textura y cómo resuelven una fuente de luz. Eso importa más que un titular de “mejor modelo” cuando vas a trabajar una escena concreta.

Privacidad de los archivos publicados: cada PNG de esta página se exportó de nuevo desde el original. Los ficheros originales contenían el bloque prompt de ComfyUI; las copias publicadas no conservan prompt, workflow, EXIF, XMP ni información de ubicación.

Resultado rápido

Caso de usoObservación en las imágenes publicadasQué probar después
Retrato de ventanaKrea concentra más contraste; Qwen mantiene una lectura frontal más neutra; el control interno acentúa textura y edadElige por la dirección de luz que busques y revisa poros, ojos y pelo al 100 %
Mano y rostroLos tres muestran una mano identificable, con distinto recorte y exposición de los dedosSi una mano es crítica, valida la toma y usa inpainting cuando falle
Persona vestida en calleKrea conserva una lectura frontal; Qwen cambia con más claridad postura y entornoAñade referencia, pose o inpainting si el encuadre exacto importa
Contraluz cálidoKrea prioriza halo; Qwen mantiene más contraste local; el control interno deja flare más frontalEscoge la base que se aproxime a tu dirección de luz antes de retocar

Esta tabla describe las cuatro salidas que puedes ver debajo; no es una métrica de calidad general ni una extrapolación a todos los prompts.

Cómo hicimos la prueba

La batería completa tiene 40 prompts fijados. Cada ficha define el texto, un prompt negativo, seed y resolución. Para la publicación elegimos cuatro escenas no explícitas que cubren categorías distintas y dejamos el resto como evidencia privada.

VariableKrea 2 Raw y checkpoint propioQwen Image 2.1
Texto, seed y resoluciónFijados por escenaFijados por escena
Text encoderQwen3-VL 4B FP8Qwen3-VL 8B BF16
Pasos1425
CFG1.81.0
Sampler / schedulerEuler / simpleEuler / simple
Hardware de ejecuciónRTX 3090, 24 GB VRAMRTX 3090, 24 GB VRAM

Registro del entorno: ComfyUI commit 169fcf35; batería ejecutada el 21 de septiembre de 2026. Los hashes de los pesos no fueron retenidos por el runner original y no se reconstruyen a partir de copias no verificadas. El manifiesto público del subconjunto seguro incluye hashes SHA-256 de las 12 imágenes publicadas, sus rutas y la configuración documentada.

Los parámetros no son idénticos porque los workflows no lo son. Krea 2 Raw y el checkpoint propio comparten su pipeline; Qwen Image 2.1 usa el workflow oficial registrado para esa arquitectura. Por tanto, los mismos prompts y seeds nos permiten comparar la respuesta a una intención visual, pero no aíslan una “calidad intrínseca” de los pesos como si todos usaran el mismo codificador y el mismo proceso de muestreo.

Tampoco publicamos tiempos comparativos: los manifiestos de Krea y del checkpoint guardan tiempo por imagen, mientras que la corrida de Qwen se registró como salidas de workflow sin un manifiesto equivalente. Inventar una equivalencia de velocidad sería peor que dejar esa columna fuera.

La batería completa y los controles

La prueba generó 120 salidas: 40 para Krea 2 Raw, 40 para checkpoint_propio_v1 y 40 para Qwen Image 2.1. Los tres lotes están completos. La galería no enseña las 120 porque esta pieza editorial usa únicamente cuatro casos no explícitos seleccionados para ilustrar categorías; los demás originales quedan archivados como evidencia interna y no forman parte de esta publicación.

ControlCómo se aplicóQué evita
Catálogo congeladoLos 40 prompts existían antes de ejecutar las tres corridasCambiar el reto tras ver un resultado
Seed y resoluciónCada ficha fija ambas variablesComparar ruidos o tamaños distintos por error
Dos pipelines documentadosSe registran nodos y parámetros propios de Krea y QwenPresentar arquitecturas distintas como si usaran el mismo workflow
Revisión visual a tamaño realRostro, manos, ropa, luz y fallos se revisan sobre el PNG completoSacar conclusiones a partir de una miniatura
Exportación limpiaLas 12 imágenes de la galería se reescribieron sin metadatosPublicar prompt, workflow o datos técnicos embebidos por accidente

El detector de rostros usado en el registro interno sirve solamente para comprobar que una escena de retrato produjo una cara detectable. No lo usamos para puntuar belleza, realismo ni edad; esas inferencias no se sostienen con ese tipo de detector.

Nota técnica: integridad de archivos y presencia facial detectada

Como control adicional, volvimos a leer los 120 PNG completos y aplicamos el mismo detector facial en CPU a los tres lotes. Todas las imágenes se pudieron abrir correctamente; ningún resultado tenía más de una cara detectada por esa herramienta.

FlujoPNG legiblesAl menos una cara detectadaUna cara detectadaSin cara detectada
Krea 2 Raw40/40 · 100 %28/40 · 70 %28/40 · 70 %12/40 · 30 %
checkpoint_propio_v140/40 · 100 %22/40 · 55 %22/40 · 55 %18/40 · 45 %
Qwen Image 2.140/40 · 100 %31/40 · 77,5 %31/40 · 77,5 %9/40 · 22,5 %

Esta métrica es un control de presencia, no una nota de fotorealismo. El banco incluye manos, cuerpo entero, encuadres parciales y escenas donde la cara puede no estar visible o no ocupar suficientes píxeles para el detector. Por eso un porcentaje mayor no significa “mejor modelo”; solo documenta cómo se comportó este detector sobre estas 40 salidas concretas. La revisión visual de la escena sigue siendo el criterio de aceptación.

Workflow A: Krea 2 Raw y checkpoint_propio_v1

El workflow de Krea y el del checkpoint propio comparten topología. El único cambio de la prueba fue el peso cargado por UNETLoader: krea2Raw_v10.safetensors (Krea 2 Raw v1.0) en una corrida y checkpoint_propio_v1.safetensors en la otra. Este último es un alias editorial: no es el nombre del archivo original, no se distribuye y no revela su procedencia.

La model card de Krea identifica Raw como la variante base y no la recomienda como opción de inferencia de propósito general frente a Turbo. La incluimos porque es el peso que consta en este workflow y porque interesa medir precisamente ese pipeline sin sustituirlo por otro; no es una recomendación de instalación para todo uso.

NodoComponente / ajusteFunción en el grafo
1UNETLoader · krea2Raw_v10.safetensors o checkpoint_propio_v1.safetensors · FP8Carga el modelo de difusión elegido
2ModelSamplingAuraFlow · shift 3.0Aplica el ajuste de sampling usado por este pipeline
3CLIPLoader · Qwen3-VL 4B FP8 · tipo krea2Codifica el texto del prompt y negativo
4VAELoader · VAE compatible con Krea 2Decodifica el latente final
5EmptyLatentImageCrea el latente con la resolución fijada en cada ficha
6–7CLIPTextEncode positivo y negativoMantienen separadas la descripción y las exclusiones
8KSampler · Euler / simple · 14 pasos · CFG 1.8Genera la imagen con la seed congelada
9VAEDecodeConvierte el latente a píxeles
10SaveImageConserva la salida de la corrida

Flujo resumido:

UNETLoader → ModelSamplingAuraFlow ─┐
CLIPLoader → TextEncode positivo ───┼→ KSampler → VAEDecode → SaveImage
CLIPLoader → TextEncode negativo ───┤
EmptyLatentImage ───────────────────┘
VAELoader ─────────────────────────────→ VAEDecode

Workflow B: Qwen Image 2.1

Qwen Image 2.1 usa su codificador específico, por lo que no es correcto sustituirlo por el workflow anterior y comparar el resultado como si solo hubiese cambiado el archivo del modelo. Este fue el grafo empleado en la batería:

NodoComponente / ajusteFunción en el grafo
1UNETLoader · Qwen Image 2.1 BF16Carga el modelo de difusión Qwen
2CLIPLoader · Qwen3-VL 8B BF16 · tipo qwen_imageCarga el codificador que requiere Qwen Image 2.1
3VAELoader · VAE de Qwen Image 2.1 BF16Decodifica los latentes del modelo
4TextEncodeQwenImage21Construye conditioning positivo y negativo con la resolución objetivo
5EmptyLatentImageCrea el latente de la ficha
6KSampler · Euler / simple · 25 pasos · CFG 1.0Ejecuta el muestreo con la seed congelada
7VAEDecodeConvierte latentes a imagen
8SaveImageGuarda la salida del benchmark
UNETLoader ──────────────────────────┐
CLIPLoader → TextEncodeQwenImage21 ──┼→ KSampler → VAEDecode → SaveImage
EmptyLatentImage ────────────────────┤
VAELoader ────────────────────────────→ VAEDecode

Por qué no hay un JSON descargable del checkpoint propio: sería un falso descargable. El grafo contiene un peso interno que no se publica. Mostramos sus nodos y ajustes para que la comparación sea auditable, pero un JSON que fingiese incluir ese peso no sería reproducible para otra persona.

Fichas de los cuatro prompts publicados

Los siguientes son los prompts completos de las imágenes que se muestran. Publicamos también los negativos, seed, resolución y objetivos de revisión para que sea posible repetir el tipo de prueba con otros modelos. Los otros 36 prompts del banco no se incluyen en el artículo.

Escena 01 · retrato de ventana — seed 42001 · 896×1152

Prompt

A 35mm optical portrait of an adult 38-year-old Mediterranean woman with warm olive undertones, subtle authentic crow feet around eyes, faint natural laugh lines, and visible skin pores across her cheeks and nose bridge. Soft directional window daylight from the left, highlighting fine facial peach fuzz and realistic skin moisture. Unstyled dark wavy hair with a few natural grey strands near the temples. Neutral relaxed expression, direct eye contact with sharp cornea reflections. Uncompressed RAW photo, 85mm f/1.8 lens, shallow depth of field with creamy bokeh background.

Negativo: smooth plastic skin, airbrush, CGI, render, doll, anime, 3d, makeup blur, distorted pupils, unnatural teeth, fake eyelashes, oversharpened, extra ears.

Objetivos: poros, líneas perioculares naturales, reflejo corneal y ausencia de suavizado plástico.

Escena 09 · mano apoyada en barbilla y mejilla — seed 42009 · 896×1152

Prompt

Medium portrait of an adult 28-year-old woman resting her chin gently in her open hand, with her index finger curved along her jawline and thumb lightly resting against her lower cheek. Sharp optical focus on the hand showing realistic knuckles, finger creases, clean natural unpolished fingernails with visible lunula, and realistic skin deformation where fingers press softly against facial skin. Soft ambient studio light, relaxed contemplative mood. 85mm lens at f/2.8.

Negativo: six fingers, extra thumb, fused fingers, elongated fingers, claw hands, missing knuckles, rubber fingers, severed wrist, deformed nails.

Objetivos: cinco dedos proporcionados, pliegues de nudillos y lúnula, y contacto creíble entre mano y piel.

Escena 15 · persona vestida caminando — seed 42015 · 896×1152

Prompt

Full-length street photography of an adult 29-year-old woman walking along an urban Parisian boulevard. She is wearing an oversized washed blue denim jacket over a white cotton crewneck t-shirt, fitted olive green chino trousers, and white leather retro sneakers. Realistic heavy denim textile weave, authentic cloth creases at elbows and behind knees, natural gait with one foot slightly forward. Natural overcast European afternoon light, architectural background with gentle bokeh.

Negativo: lingerie, bikini, naked, painted-on clothes, blurry sneakers, floating feet, deformed legs, runway model distortion, plastic fabric.

Objetivos: proporciones de cuerpo completo, textura vaquera, suela y contacto del calzado, y biomecánica de marcha.

Escena 36 · contraluz de hora dorada — seed 42036 · 896×1152

Prompt

Cinematic contre-jour photographic portrait of an adult 26-year-old woman positioned directly in front of a low blazing setting sun. Intense warm golden rim lighting illuminating her hair into a halo of translucent golden strands, with a subtle natural lens flare and optical veiling glare washing softly over the lens without destroying facial shadow contrast. Authentic skin tones visible in the filled shadow side, sharp catchlights in eyes. Shot on 85mm f/1.4 wide open, creamy background bokeh.

Negativo: digital lens flare overlay, completely black face, silhouette only, blown out solid white, flat lighting, fake hair glow, cartoon.

Objetivos: flare óptico, detalle en sombras, transparencia del pelo a contraluz y bokeh circular.

Escena 1: retrato con textura facial y luz de ventana

La primera escena pide un retrato adulto con piel sin suavizado, líneas de expresión sutiles y luz lateral de ventana. Los tres resultados muestran detalle de piel, pero su lectura no es la misma: Krea 2 Raw crea una iluminación más dramática y un fondo más disuelto; el checkpoint propio acentúa líneas y microtextura; Qwen mantiene un retrato frontal más uniforme en luz y expresión.

Retrato de ventana generado con Krea 2 Raw
Krea 2 Raw · escena 01
Retrato de ventana generado con nuestro checkpoint propio
Checkpoint propio · escena 01
Retrato de ventana generado con Qwen Image 2.1
Qwen Image 2.1 · escena 01

Lo relevante no es decidir cuál rostro es “más bonito”. El prompt buscaba material de revisión: poros, transición de luz, pelo y marcas de edad. En una producción real, esta escena se aprobaría o descartaría revisando esos puntos al 100 %, no por la impresión de una miniatura.

Escena 2: mano en contacto con rostro

Las manos siguen siendo una prueba útil porque obligan al modelo a coordinar dedos, uñas, articulaciones y compresión de la piel. Las tres imágenes muestran una mano identificable y no presentan extremidades extra en este encuadre. Aun así, el recorte cambia cuánto permite comprobar: Krea encuadra la mano más cerca; el checkpoint propio deja ver mejor la presión sobre la mejilla; Qwen abre el plano y expone más de la anatomía de cara y mano.

Mano sobre el rostro generada con Krea 2 Raw
Krea 2 Raw · escena 09
Mano sobre el rostro generada con nuestro checkpoint propio
Checkpoint propio · escena 09
Mano sobre el rostro generada con Qwen Image 2.1
Qwen Image 2.1 · escena 09

Un único resultado correcto no permite afirmar que un modelo “resuelve las manos”. Sí permite fijar una práctica útil: cuando la mano es parte de la imagen final, hay que revisar proporciones, uñas, pliegues y contacto piel-objeto antes de dar la toma por válida.

Escena 3: cuerpo vestido y ropa vaquera en una calle

En la escena de cuerpo entero, los tres flujos entregan una persona vestida, una chaqueta vaquera reconocible y una situación urbana creíble. La diferencia visible está en la dirección que toma cada uno: Krea conserva una figura frontal caminando; el checkpoint propio también prioriza una lectura centrada de la prenda; Qwen cambia con más claridad el ángulo de la persona y el fondo urbano.

Persona vestida caminando generada con Krea 2 Raw
Krea 2 Raw · escena 15
Persona vestida caminando generada con nuestro checkpoint propio
Checkpoint propio · escena 15
Persona vestida caminando generada con Qwen Image 2.1
Qwen Image 2.1 · escena 15

Esto es importante para quien trabaje con referencias de moda o producto: seed igual no obliga a que los modelos mantengan el mismo encuadre ni la misma persona. Si la composición exacta es crítica, el siguiente paso no es cambiar de modelo a ciegas, sino añadir control de referencia, pose o inpainting al flujo.

Escena 4: contraluz de hora dorada

La última imagen publicada estresa separación de pelo, exposición de piel y flare frontal. Los tres resultados producen una escena de hora dorada, pero con compromisos distintos: Krea prioriza el halo y la saturación cálida; el checkpoint propio coloca el flare sobre la cara; Qwen conserva más contraste local alrededor del rostro, aunque vuelve a reinterpretar a la persona.

Retrato a contraluz generado con Krea 2 Raw
Krea 2 Raw · escena 36
Retrato a contraluz generado con nuestro checkpoint propio
Checkpoint propio · escena 36
Retrato a contraluz generado con Qwen Image 2.1
Qwen Image 2.1 · escena 36

La utilidad práctica aquí es elegir la respuesta que se acerca a tu dirección fotográfica antes de retocar. No hay motivo para llamar “fallo” a una interpretación más cálida si tu encargo buscaba un halo intenso; sí lo sería si necesitabas preservar detalle en el rostro y el flare lo cubre.

Qué podemos concluir y qué no

Podemos concluir que los tres workflows completaron la batería y que, en estas cuatro escenas, producen imágenes fotográficas plausibles con diferencias de encuadre, identidad visual y tratamiento de luz. También podemos afirmar que esas diferencias aparecen pese a usar la misma intención de prompt, seed y resolución de cada ficha.

No podemos concluir que uno sea universalmente más realista, más rápido o mejor para todos los casos. La prueba se realizó en un solo equipo, cada arquitectura tiene ajustes de inferencia propios y la galería pública es una muestra de cuatro escenarios, no una prueba estadística de todas las imágenes posibles.

Alcance y fuentes oficiales

Esta es una comparativa de texto a imagen fotográfica. Qwen Image 2.1 también declara capacidades de edición, RGBA, hasta diez referencias y tipografía mejorada, pero ninguna de esas funciones se ha medido aquí; mezclar esas promesas con este benchmark sería atribuir a la prueba algo que no ejecutamos. Para instalación, licencias, variantes y requisitos actuales, consulta las fuentes primarias:

Cómo usar esta comparativa

  • Usa Krea 2 Raw si necesitas evaluar el mismo pipeline base de este benchmark; para una instalación de propósito general, contrasta primero la variante Turbo que recomienda Krea.
  • Prueba el checkpoint propio cuando busques la interpretación que muestran sus salidas en esta batería, sin asumir que replicará cada encuadre de Krea.
  • Prueba Qwen Image 2.1 si te interesa su lectura alternativa de retrato, mano, calle y contraluz; valida siempre con tu propio prompt.

La regla útil no cambia: conserva seed, prompt y resolución cuando compares; revisa la imagen a tamaño real; y utiliza control adicional cuando el encuadre, la identidad o una mano deben coincidir exactamente con tu intención.

Preguntas frecuentes

¿Por qué se usan parámetros distintos si es una comparativa?

Porque forzar los mismos pasos y CFG en arquitecturas con workflows distintos no las haría más justas: solo empeoraría una de ellas por configuración. Mantenemos fijos texto, seed y resolución; documentamos las diferencias de pipeline y evitamos atribuirlas a una causa única.

¿Las imágenes publicadas contienen mis prompts o ubicación?

No. Los originales se mantienen privados como evidencia. Cada PNG publicado se volvió a guardar sin metadatos y se verificó con una lista vacía de campos incrustados.

¿Dónde está el workflow descargable?

Esta comparativa documenta la prueba, no distribuye el workflow interno ni el checkpoint propio. Los componentes públicos de ComfyUI y los modelos de referencia se instalan desde sus páginas oficiales; reproduce el método con tus propios prompts y confirma la compatibilidad de tu versión de ComfyUI.

Sigue leyendo

Si aún no tienes Krea funcionando en local, empieza por la guía de instalación de Krea 2 Turbo en ComfyUI. Para decidir cuándo una cuantización cabe realmente en tu GPU, consulta GGUF vs BF16 en una RTX 3090. Y si tu problema es una mano concreta, no un benchmark, usa el flujo de inpainting para corregir manos en ComfyUI.

Preguntas frecuentes

¿Cuál gana entre Krea 2 Raw, un checkpoint propio y Qwen Image 2.1?
Esta prueba no demuestra un ganador universal. Las tres alternativas completaron las escenas publicadas, pero cambian encuadre, fisonomía y tratamiento de luz. Elige después de probar la escena que necesitas, no solo por una imagen aislada.
¿Se usaron el mismo prompt y la misma seed?
Sí: la batería fija el texto, la seed y la resolución de cada escena. Sin embargo, Krea 2 y Qwen Image 2.1 requieren codificadores y ajustes de inferencia distintos; compartir seed no convierte ambas arquitecturas en el mismo experimento matemático.
¿Puedo descargar el checkpoint propio?
No. Este artículo documenta resultados observados de un checkpoint propio, sin publicar su procedencia, pesos ni workflow interno.
Compartir X LinkedIn

También te puede interesar

Guías Pro · 6 min

Fine-Tunes de Z-Image Turbo: 4 Checkpoints (ComfyUI)

24GB VRAM verificado (RTX 3090) -- no medimos el mínimo real, pero el CLIP (qwen_3_4b, ~7.7GB) más el UNet fp16 de unStable Revolution (~11.7GB) ya suman ~19.4GB antes de VAE, así que 16GB probablemente se queda corto para ese fine-tune concreto
Intermedio