Si has usado algún modelo de generación de imágenes talvez te hayas encontrado con algún tipo de restricción, que impide que obtengas la imagen deseada, esto sucede especialmente con modelos comerciales que trabajan de forma online, por motivos legales o de políticas, estas plataformas ofrecen buenos servicios para la generación de imágenes, pero el gran punto en contra son las enormes restricciones y que no precisamente tengan que ver por que solicites algo malo.

Cuando escribimos un prompt o simplemente pedimos una imagen en algún servicio como ChatGPT, Gemini, Copilot, etc, podemos recibir alguna negativa del modelo que no permita lograr la imagen deseada. Por lo general estas limitaciones suelen estar relacionadas con temas de sensualidad, religión, menores, violencia, maltrato y un largo etcétera, muchas veces ni siquiera tiene que ver con un pedido de todo eso nombrado, simplemente tener algunas similitudes o de alguna forma estar relacionado, todo esto impone un enorme limite, una censura atroz y reprime la creatividad.
Una forma de escapar de esta censura es utilizar modelos de generación offline, como su nombre lo indica, no utiliza internet, no depende de servicios de ninguna empresa, por lo tanto no estamos sujetos a sus ridículas políticas de control. Sin embargo no todo son buenas noticias, si bien los modelos de IA Offline son de altísima calidad, no son tan potentes como los que proporcionan grandes empresas como OpenAI, Google, etc. Otra mala noticia es que tendremos que utilizar nuestro propio hardware el cual debe ser potente, por lo menos una placa de video en lo posible nVidia mínimo de 8Gb de Memoria de Video, una RTX 2060 por ejemplo, para memoria RAM con 8Gb funcionara pero mínimo se recomienda 16Gb, para el procesador un Ryzen 5 serie 3000 o superior, aunque en estos casos siempre mas potencia es mayor velocidad,
Los modelos mas conocidos para generación de imágenes de forma Offline, son:
| Modelo o familia | Orientación | Nivel de libertad local | Requisitos aproximados |
|---|---|---|---|
| Stable Diffusion 1.5 | General, enorme cantidad de checkpoints y LoRA | Muy alto | 4–6 GB VRAM |
| Stable Diffusion XL — SDXL | Realismo, ilustración y uso general | Muy alto | 8–12 GB VRAM |
| Pony Diffusion V6 XL | Anime, manga, personajes y poses | Muy alto | 8–12 GB VRAM |
| Illustrious XL | Anime, manga y personajes detallados | Muy alto | 8–12 GB VRAM |
| DreamShaper XL | Semirrealismo, fantasía e ilustración | Alto | 8–12 GB VRAM |
| FLUX.1-dev | Realismo y buena comprensión de instrucciones | Alto, aunque algunos conceptos están limitados por el entrenamiento | 12–24 GB VRAM o cuantizado |
| FLUX.1-schnell | Generación rápida y uso general | Alto | 8–16 GB VRAM cuantizado |
| Stable Diffusion 3.5 | Realismo, texto y prompts complejos | Medio/alto | 12–24 GB VRAM |
| Z-Image / Z-Image-Turbo | Realismo eficiente y generación rápida | Alto | 8–12 GB VRAM cuantizado |
| Qwen-Image | Texto dentro de imágenes, edición y composición | Medio/alto | Bastante pesado; normalmente requiere cuantización |
El modelo Stable Diffusion 1.5 (SD 1.5) ofrece un gran rendimiento y muy buena calidad en la generación de imágenes de todo tipo y también es el mas ligero de todos. Además se puede expandir su capacidad con la utilización de LORAs, que son complementos que amplían el potencial del modelo en algo especifico. Por ejemplo un LORA que establezca un estilo artístico, que defina objetos, que optimice ojos, manos, mejore iluminación, y todo tipos de cosas, la comunidad de SD 1.5 es enorme y hay mucho material disponible.
¿Pero como hacemos entonces para utilizar estos modelos offline? Hay mas de una forma, se necesita una interfaz que ejecute el modelo, por ejemplo ComfyUI, Forge, AUTOMATIC1111, Krita AI Diffusion, etc. Este ultimo, Krita, es el mas fácil de utilizar, tanto en instalación como la forma de utilizarlo post-instalación. Lo mas conveniente en Krita es que se integra a un programa de edición de imágenes (especializado en dibujo), esta integración permitirá crear imágenes desde cero, reinterpretarlas, generar contenido dentro de una selección y muchas cosas mas, lo mejores es que se pueden utilizar varios modelos, SD 1.5, Flux, SDXL, Z-Imagen, etc, además se puede utilizar los ya mencionados LORAs. En uno de mis canales tengo un video donde te explico como instalar Krita y los modelos de generación de imágenes.

Deja un comentario