<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Image Generation on kenji.blog</title><link>http://kenji.blog/pt/categories/image-generation/</link><description>Recent content in Image Generation on kenji.blog</description><generator>Hugo -- gohugo.io</generator><language>pt</language><copyright>kenjinote</copyright><lastBuildDate>Fri, 11 Sep 2026 19:00:00 +0900</lastBuildDate><atom:link href="http://kenji.blog/pt/categories/image-generation/index.xml" rel="self" type="application/rss+xml"/><item><title>Manual de Configuração do Ambiente Local para Ferramentas de Geração de Imagem por IA (Stable Diffusion, etc.)</title><link>http://kenji.blog/pt/p/local-ai-image-generation-setup/</link><pubDate>Fri, 11 Sep 2026 19:00:00 +0900</pubDate><guid>http://kenji.blog/pt/p/local-ai-image-generation-setup/</guid><description>&lt;img src="http://kenji.blog/p/local-ai-image-generation-setup/img/eyecatch.jpg" alt="Featured image of post Manual de Configuração do Ambiente Local para Ferramentas de Geração de Imagem por IA (Stable Diffusion, etc.)" />&lt;h2 id="1-introdução-por-que-gerar-imagens-por-ia-em-um-ambiente-local">1. Introdução: Por que gerar imagens por IA em um ambiente local?
&lt;/h2>&lt;p>A tecnologia de geração de imagens por IA teve uma evolução explosiva desde que o Stable Diffusion se tornou código aberto. Atualmente, serviços comerciais baseados em nuvem como Midjourney, DALL-E 3 e Adobe Firefly também são muito poderosos e fáceis de usar. No entanto, esses serviços apresentam desvantagens, como restrições no conteúdo gerado pelos termos de serviço (filtros NSFW, etc.), custos contínuos de assinatura e a incapacidade de controlar o processo de geração detalhadamente.&lt;/p>
&lt;p>Construir ferramentas de geração de imagens por IA em um ambiente local (seu próprio PC) tem vantagens esmagadoras, como as seguintes:&lt;/p>
&lt;ol>
&lt;li>&lt;strong>Liberdade total e geração ilimitada&lt;/strong>: Não há limite de imagens geradas nem custos adicionais, e você pode gerar imagens infinitamente, desde que os recursos locais permitam.&lt;/li>
&lt;li>&lt;strong>Alta capacidade de personalização&lt;/strong>: É possível obter um controle detalhado da composição, além da reprodução de personagens ou estilos de arte específicos usando LoRA (Low-Rank Adaptation) e ControlNet.&lt;/li>
&lt;li>&lt;strong>Privacidade e segurança&lt;/strong>: Como os dados não são enviados para a nuvem, é ideal para trabalhos de design altamente confidenciais e projetos pessoais.&lt;/li>
&lt;li>&lt;strong>Adoção imediata de novas tecnologias&lt;/strong>: Você pode ser o primeiro a testar os modelos e extensões mais recentes lançados diariamente pela comunidade de código aberto.&lt;/li>
&lt;/ol>
&lt;p>Neste manual, presumindo um ambiente Windows, explicaremos de forma minuciosa, em mais de 10.000 caracteres, os métodos de configuração dos 3 principais ambientes de geração de imagens por IA atuais (AUTOMATIC1111 Stable Diffusion WebUI, ComfyUI, Fooocus), o contexto matemático subjacente e até os métodos de otimização de VRAM.&lt;/p>
&lt;hr>
&lt;h2 id="2-contexto-matemático-e-arquitetura-do-modelo-de-difusão-diffusion-model">2. Contexto Matemático e Arquitetura do Modelo de Difusão (Diffusion Model)
&lt;/h2>&lt;p>Para construir um ambiente local e configurar parâmetros adequadamente, é muito útil entender como os &lt;strong>Modelos de Difusão Latente (Latent Diffusion Models: LDM)&lt;/strong>, como o Stable Diffusion, funcionam.&lt;/p>
&lt;h3 id="21-processo-de-adição-de-ruído-forward-process-e-processo-de-remoção-reverse-process">2.1 Processo de Adição de Ruído (Forward Process) e Processo de Remoção (Reverse Process)
&lt;/h3>&lt;p>O princípio básico do modelo de difusão consiste no &amp;ldquo;Forward Process&amp;rdquo;, que adiciona gradualmente ruído gaussiano aos dados originais (imagem) até transformá-los completamente em ruído, e o &amp;ldquo;Reverse Process&amp;rdquo;, que restaura a imagem original a partir desse ruído.&lt;/p>
&lt;p>O Forward Process é definido como uma cadeia de Markov, e o estado $x_t$ no passo $t$ é expresso pela seguinte fórmula.&lt;/p>
$$ q(x_t | x_{t-1}) = \mathcal{N}(x_t; \sqrt{1 - \beta_t} x_{t-1}, \beta_t I) $$
&lt;p>Ao utilizar o truque de reparametrização (Reparameterization trick), o estado em qualquer passo $t$ pode ser calculado diretamente a partir do estado inicial $x_0$.&lt;/p>
$$ x_t = \sqrt{\bar{\alpha}_t} x_0 + \sqrt{1 - \bar{\alpha}_t} \epsilon $$
&lt;p>Aqui, $\alpha_t = 1 - \beta_t$, $\bar{\alpha}_t = \prod_{s=1}^t \alpha_s$, e $\epsilon \sim \mathcal{N}(0, I)$ é o ruído amostrado a partir de uma distribuição normal padrão.&lt;/p>
&lt;p>Na fase de geração de imagens (Reverse Process), uma rede neural (U-Net) $\epsilon_\theta$ é usada para prever e remover o ruído adicionado. A função de perda é simplesmente definida da seguinte forma.&lt;/p>
$$ L_{simple} = \mathbb{E}_{x_0, \epsilon \sim \mathcal{N}(0, I), t} \left[ || \epsilon - \epsilon_\theta(\sqrt{\bar{\alpha}_t} x_0 + \sqrt{1 - \bar{\alpha}_t} \epsilon, t) ||^2 \right] $$
&lt;h3 id="22-redução-da-complexidade-computacional-através-do-espaço-latente-latent-space">2.2 Redução da Complexidade Computacional através do Espaço Latente (Latent Space)
&lt;/h3>&lt;p>Remover o ruído diretamente no espaço de pixels (Pixel Space) aumenta a quantidade de cálculos de forma quadrática em relação à resolução da imagem, tornando o processo muito pesado. O Stable Diffusion utiliza um &lt;strong>VAE (Variational Autoencoder)&lt;/strong> para converter e comprimir a imagem em um &amp;ldquo;espaço latente&amp;rdquo; (Latent Space) antes de processá-la.&lt;/p>
&lt;p>O codificador $E$ comprime a imagem de resolução $H \times W \times 3$ em $z \in \mathbb{R}^{H/8 \times W/8 \times 4}$. Como as dimensões espaciais se tornam 1/8, a complexidade computacional do mecanismo de autoatenção (Self-Attention) passa a ser $\mathcal{O}((\frac{H \times W}{64})^2)$, trazendo uma melhoria drástica no desempenho. Após a geração, a imagem é restaurada ao espaço de pixels pelo decodificador $D$ como $\tilde{x} = D(z)$.&lt;/p>
&lt;h3 id="23-arquitetura-de-sistema-do-stable-diffusion">2.3 Arquitetura de Sistema do Stable Diffusion
&lt;/h3>&lt;p>O diagrama Mermaid abaixo ilustra o processo geral de geração do Stable Diffusion (geração de imagem a partir de texto: txt2img).&lt;/p>
&lt;div class="mermaid">graph TD
A["Entrada do Usuário (Prompt de Texto)"] --> B["Codificador de Texto (CLIP ViT-L/14)"]
B --> C["Vetor de Condicionamento (Conditioning)"]
D["Ruído Aleatório (Latent Space)"] --> E["U-Net (Preditor de Ruído)"]
C --> E
E --> F["Agendador (DDIM, Euler a, etc.)"]
F --> D
F --> G["Variável Latente sem Ruído"]
G --> H["Decodificador VAE (Variational Autoencoder)"]
H --> I["Imagem Final Gerada (Pixel Space)"]&lt;/div>
&lt;hr>
&lt;h2 id="3-análise-profunda-dos-requisitos-de-hardware">3. Análise Profunda dos Requisitos de Hardware
&lt;/h2>&lt;p>Na geração local de imagens por IA, a escolha do hardware é a mais importante.&lt;/p>
&lt;h3 id="31-gpu-placa-de-vídeo">3.1 GPU (Placa de Vídeo)
&lt;/h3>&lt;p>É o coração do processamento de IA. Para rodar o Stable Diffusion num ambiente Windows, a GPU da NVIDIA é o padrão de fato. É possível rodar em uma AMD Radeon usando ROCm, mas considerando a dificuldade de configurar o ambiente no Windows e o fato de que muitas extensões dependem do CUDA (arquitetura de computação paralela da NVIDIA), não é exagero dizer que a NVIDIA é a única escolha viável.&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Requisito Mínimo&lt;/strong>: VRAM 6GB (GTX 1060 6GB / RTX 2060, etc.). ※No entanto, haverá grandes limitações na resolução e funções.&lt;/li>
&lt;li>&lt;strong>Requisito Recomendado&lt;/strong>: VRAM 12GB (RTX 3060 12GB / RTX 4070, etc.). É a linha de base para rodar confortavelmente os modelos SDXL.&lt;/li>
&lt;li>&lt;strong>Requisito Ideal&lt;/strong>: VRAM 16GB〜24GB (RTX 4080 / RTX 3090 / RTX 4090). Necessário para geração de alta resolução, uso simultâneo de ControlNets complexos e treinamento de modelos locais (LoRA, etc.).&lt;/li>
&lt;/ul>
&lt;h3 id="32-memória-ram-e-armazenamento">3.2 Memória (RAM) e Armazenamento
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>RAM&lt;/strong>: Recomenda-se fortemente 32GB ou mais. Ao transferir modelos (de vários GB a dezenas de GB) do armazenamento para a VRAM, o sistema usa RAM temporariamente. A falta de RAM faz com que o arquivo de paginação seja usado, resultando numa queda fatal na velocidade.&lt;/li>
&lt;li>&lt;strong>Armazenamento&lt;/strong>: Um SSD NVMe M.2 é obrigatório. Os modelos recentes de IA (Checkpoints) têm uma capacidade de 2GB a 7GB cada. Se você usar um HDD, só o carregamento do modelo demorará vários minutos, tornando o uso impraticável.&lt;/li>
&lt;/ul>
&lt;hr>
&lt;h2 id="4-configuração-do-software-base-para-windows">4. Configuração do Software Base (Para Windows)
&lt;/h2>&lt;p>Antes de instalar as próprias ferramentas, configuraremos o software base necessário.&lt;/p>
&lt;h3 id="41-instalação-do-python">4.1 Instalação do Python
&lt;/h3>&lt;p>A grande maioria das ferramentas de IA é escrita em Python. Instalaremos o &lt;strong>Python 3.10.6&lt;/strong>, que tem a maior compatibilidade com o Stable Diffusion WebUI, etc. (uma versão muito nova pode quebrar as dependências do PyTorch e outros).&lt;/p>
&lt;ol>
&lt;li>Baixe o &lt;code>python-3.10.6-amd64.exe&lt;/code> no repositório oficial do Python.&lt;/li>
&lt;li>Ao iniciar o instalador, certifique-se de marcar a caixa &lt;strong>&amp;ldquo;Add Python 3.10 to PATH&amp;rdquo;&lt;/strong> na parte inferior.&lt;/li>
&lt;li>Na tela de conclusão da instalação, clique em &lt;strong>&amp;ldquo;Disable path length limit&amp;rdquo;&lt;/strong> (desativar limite de comprimento do caminho). (Importante: Se você não remover a limitação de caminho de 260 caracteres do Windows, ocorrerão erros nas bibliotecas de dependência em níveis mais profundos).&lt;/li>
&lt;/ol>
&lt;h3 id="42-instalação-do-git-for-windows">4.2 Instalação do Git for Windows
&lt;/h3>&lt;p>O Git é necessário para baixar códigos-fonte e modelos do GitHub.&lt;/p>
&lt;ol>
&lt;li>Baixe o instalador no site oficial do Git for Windows e instale com todas as configurações padrão.&lt;/li>
&lt;/ol>
&lt;h3 id="43-configuração-do-cuda-toolkit-e-cudnn">4.3 Configuração do CUDA Toolkit e cuDNN
&lt;/h3>&lt;p>Como o PyTorch mais recente já inclui os binários CUDA necessários no momento da instalação, não é mais obrigatório instalar o CUDA Toolkit em todo o sistema. No entanto, se você for usar extensões personalizadas (como compilar TensorRT ou xFormers), é recomendado instalar o &lt;strong>CUDA Toolkit 11.8&lt;/strong> ou &lt;strong>12.1&lt;/strong> (compatível com o PyTorch que você usar) através do site oficial da NVIDIA.&lt;/p>
&lt;hr>
&lt;h2 id="5-procedimentos-de-construção-dos-3-grandes-frontends">5. Procedimentos de Construção dos 3 Grandes Frontends
&lt;/h2>&lt;p>Explicaremos os métodos de configuração das três ferramentas de geração de imagens por IA mais comuns atualmente. Escolha a mais adequada de acordo com seus objetivos e habilidades.&lt;/p>
&lt;h3 id="51-construção-do-automatic1111-stable-diffusion-webui">5.1 Construção do AUTOMATIC1111 Stable Diffusion WebUI
&lt;/h3>&lt;p>É a ferramenta mais antiga, versátil, com muitas extensões e ajustes de parâmetros detalhados disponíveis.&lt;/p>
&lt;p>&lt;strong>Procedimento de Instalação:&lt;/strong>&lt;/p>
&lt;ol>
&lt;li>Abra o Prompt de Comando no diretório desejado (ex: &lt;code>C:\work\ai&lt;/code>).&lt;/li>
&lt;li>Execute o seguinte comando para clonar o repositório.
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-cmd" data-lang="cmd">&lt;span class="line">&lt;span class="cl">git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;/li>
&lt;li>Clique com o botão direito em &lt;code>webui-user.bat&lt;/code> dentro do diretório clonado e abra-o no modo de edição.&lt;/li>
&lt;li>Para melhorar o desempenho, defina os argumentos de inicialização &lt;code>COMMANDLINE_ARGS&lt;/code> da seguinte forma.
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bat" data-lang="bat">&lt;span class="line">&lt;span class="cl">&lt;span class="k">set&lt;/span> &lt;span class="nv">COMMANDLINE_ARGS&lt;/span>&lt;span class="p">=&lt;/span>--xformers --opt-sdp-attention --theme dark
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;/li>
&lt;li>Dê um duplo clique no &lt;code>webui-user.bat&lt;/code> para executá-lo. Bibliotecas gigantes como o PyTorch serão baixadas na primeira vez, o que pode levar dezenas de minutos, dependendo do ambiente.&lt;/li>
&lt;li>Quando a mensagem &lt;code>Running on local URL: http://127.0.0.1:7860&lt;/code> for exibida, acesse através do seu navegador.&lt;/li>
&lt;/ol>
&lt;h3 id="52-construção-do-comfyui-e-as-vantagens-do-sistema-baseado-em-nós">5.2 Construção do ComfyUI e as Vantagens do Sistema Baseado em Nós
&lt;/h3>&lt;p>O ComfyUI é uma interface de usuário visual (Node-based) que une visualmente o processo de geração através de blocos chamados &amp;ldquo;nós&amp;rdquo;. O gerenciamento da VRAM é excelente e, muitas vezes, funciona em ambientes onde o AUTOMATIC1111 ficaria sem memória.&lt;/p>
&lt;div class="mermaid">graph TD
subgraph "Exemplo de Fluxo de Trabalho do ComfyUI"
A["Load Checkpoint"] --> B["CLIP Text Encode (Positivo)"]
A --> C["CLIP Text Encode (Negativo)"]
A --> D["Empty Latent Image"]
B --> E["KSampler (Amostragem)"]
C --> E
D --> E
A --> F["VAEDecode"]
E --> F
F --> G["Save Image (Salvar Imagem)"]
end&lt;/div>
&lt;p>&lt;strong>Procedimento de Instalação:&lt;/strong>&lt;/p>
&lt;ol>
&lt;li>Baixe o arquivo 7z da versão Windows Standalone na página oficial de lançamentos do GitHub do ComfyUI.&lt;/li>
&lt;li>Descompacte-o e simplesmente execute &lt;code>run_nvidia_gpu.bat&lt;/code> (é uma versão portátil com Python incluso, sem necessidade de configuração).&lt;/li>
&lt;li>&lt;strong>Instalação do ComfyUI Manager&lt;/strong>: É essencial para gerenciar extensões. Abra o Prompt de Comando no diretório &lt;code>ComfyUI/custom_nodes/&lt;/code> e execute o seguinte.
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-cmd" data-lang="cmd">&lt;span class="line">&lt;span class="cl">git clone https://github.com/ltdrdata/ComfyUI-Manager.git
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>Ao reiniciar, um botão &amp;ldquo;Manager&amp;rdquo; aparecerá no canto inferior direito da UI, a partir do qual você pode instalar vários nós personalizados.&lt;/li>
&lt;/ol>
&lt;h3 id="53-construção-do-fooocus-geração-de-alta-qualidade-para-iniciantes">5.3 Construção do Fooocus: Geração de Alta Qualidade para Iniciantes
&lt;/h3>&lt;p>O Fooocus é uma interface de usuário desenvolvida com o objetivo de gerar imagens incrivelmente bonitas com comandos curtos, semelhante ao Midjourney. É ajustado especificamente para modelos SDXL, realizando automaticamente expansão de prompts baseada em GPT-2 e pipelines complexos internamente.&lt;/p>
&lt;p>&lt;strong>Procedimento de Instalação:&lt;/strong>&lt;/p>
&lt;ol>
&lt;li>Baixe o pacote de lançamento para Windows do GitHub oficial do Fooocus e descompacte-o.&lt;/li>
&lt;li>Execute &lt;code>run.bat&lt;/code>. Excelentes modelos SDXL, como o Juggernaut XL, serão baixados automaticamente, e o sistema estará pronto para gerar imagens de alta qualidade instantaneamente.&lt;/li>
&lt;li>Ao marcar &amp;ldquo;Advanced&amp;rdquo; (Avançado), você também pode usar recursos avançados, como Prompt de Imagem (Image Prompt) e Inpainting.&lt;/li>
&lt;/ol>
&lt;hr>
&lt;h2 id="6-gerenciamento-de-modelos-e-entendimento-da-estrutura-de-dados">6. Gerenciamento de Modelos e Entendimento da Estrutura de Dados
&lt;/h2>&lt;p>A qualidade da imagem gerada por IA depende inteiramente dos modelos (dados treinados) usados.&lt;/p>
&lt;h3 id="61-checkpoints-modelos-base">6.1 Checkpoints (Modelos Base)
&lt;/h3>&lt;p>O modelo principal no coração da geração de imagens. Antigamente, o formato &lt;code>.ckpt&lt;/code> (Pickle) era o mais comum, mas continha vulnerabilidades que permitiam a execução de código Python arbitrário (Arbitrary Code Execution). Atualmente, o formato &lt;strong>&lt;code>.safetensors&lt;/code>&lt;/strong> é o padrão, pois garante a segurança e permite o carregamento por cópia zero (mmap) do disco para a memória. Nunca baixe arquivos &lt;code>.ckpt&lt;/code> de origem desconhecida.&lt;/p>
&lt;h3 id="62-o-comportamento-matemático-do-lora-low-rank-adaptation">6.2 O Comportamento Matemático do LoRA (Low-Rank Adaptation)
&lt;/h3>&lt;p>O LoRA é uma tecnologia que permite o treinamento adicional de personagens ou estilos específicos, evitando os enormes recursos de computação necessários para o ajuste fino de todo o modelo.&lt;/p>
&lt;p>Em vez de atualizar diretamente a matriz de pesos com bilhões de parâmetros $W_0 \in \mathbb{R}^{d \times k}$, o LoRA introduz duas matrizes de baixa ordem $A \in \mathbb{R}^{r \times k}$ e $B \in \mathbb{R}^{d \times r}$ (onde a ordem $r \ll \min(d, k)$). Os novos pesos são calculados da seguinte maneira:&lt;/p>
$$ W = W_0 + \Delta W = W_0 + B A $$
&lt;p>Com isso, o número de parâmetros para treinar e salvar cai drasticamente de $d \times k$ para $r \times (d + k)$, permitindo forte aplicação de estilos usando arquivos leves de algumas centenas de MB.&lt;/p>
&lt;h3 id="63-vae-variational-autoencoder">6.3 VAE (Variational Autoencoder)
&lt;/h3>&lt;p>Como mencionado anteriormente, é um modelo para converter entre o espaço latente e o espaço de pixels. Com modelos estilo anime, se o VAE não for definido adequadamente, a imagem resultante pode ficar com uma aparência esbranquiçada, um aspecto &amp;ldquo;sonolento&amp;rdquo; e baixo contraste. Coloque um VAE especializado em animes, como &lt;code>kl-f8-anime2.ckpt&lt;/code>, na pasta &lt;code>models/VAE&lt;/code> e aplique.&lt;/p>
&lt;h3 id="64-exemplo-de-estrutura-de-diretório-automatic1111">6.4 Exemplo de Estrutura de Diretório (AUTOMATIC1111)
&lt;/h3>&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;span class="lnt">6
&lt;/span>&lt;span class="lnt">7
&lt;/span>&lt;span class="lnt">8
&lt;/span>&lt;span class="lnt">9
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-text" data-lang="text">&lt;span class="line">&lt;span class="cl">stable-diffusion-webui/
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">├── models/
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ ├── Stable-diffusion/ &amp;lt;-- Coloque Checkpoints (.safetensors) aqui
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ ├── Lora/ &amp;lt;-- Coloque modelos LoRA aqui
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ ├── VAE/ &amp;lt;-- Coloque modelos VAE aqui
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ └── ControlNet/ &amp;lt;-- Coloque modelos ControlNet aqui
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">├── embeddings/ &amp;lt;-- Coloque Inversão Textual (Textual Inversion, arquivos PT) aqui
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">├── extensions/ &amp;lt;-- Extensões clonadas via Git
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">└── webui-user.bat &amp;lt;-- Arquivo em lote para inicialização
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;hr>
&lt;h2 id="7-otimização-de-vram-e-ajuste-de-desempenho">7. Otimização de VRAM e Ajuste de Desempenho
&lt;/h2>&lt;p>Essas são as técnicas para evitar a barreira de &amp;ldquo;Falta de VRAM&amp;rdquo; (CUDA Out Of Memory), a maior parede da geração local, e maximizar as velocidades de geração ao máximo.&lt;/p>
&lt;h3 id="71-otimização-do-mecanismo-de-atenção-xformers--sdp-attention">7.1 Otimização do Mecanismo de Atenção (xFormers / SDP Attention)
&lt;/h3>&lt;p>A maior parte dos cálculos no Stable Diffusion é gasta no Cross-Attention dentro da U-Net. O cálculo de Attention padrão consome muita memória, então otimizaremos usando as abordagens a seguir.&lt;/p>
&lt;ul>
&lt;li>&lt;strong>xFormers (&lt;code>--xformers&lt;/code>)&lt;/strong>: Uma implementação da Meta de atenção eficiente em memória (Memory Efficient Attention). Reduz consideravelmente o consumo da VRAM e melhora a velocidade, mas introduz um comportamento não determinístico onde &amp;ldquo;imagens levemente diferentes são geradas mesmo com a semente exata&amp;rdquo;.&lt;/li>
&lt;li>&lt;strong>SDP Attention (&lt;code>--opt-sdp-attention&lt;/code>)&lt;/strong>: Scaled Dot Product Attention padrão a partir do PyTorch 2.0. Tem redução de consumo de VRAM e velocidade comparáveis ao xFormers, com a vantagem de ter menos dependências. Há variações, como &lt;code>--opt-sub-quad-attention&lt;/code>, que evitam a não determinância.&lt;/li>
&lt;/ul>
&lt;h3 id="72-opções-de-inicialização-para-economizar-vram">7.2 Opções de Inicialização para Economizar VRAM
&lt;/h3>&lt;ul>
&lt;li>&lt;code>--medvram&lt;/code>: Para ambientes com 6GB a 8GB de VRAM. Divide a U-Net em partes e as processa, o que economiza memória mas reduz levemente a velocidade.&lt;/li>
&lt;li>&lt;code>--lowvram&lt;/code>: Para ambientes com 4GB ou menos de VRAM. Traz e tira pequenos módulos da VRAM, o que derruba consideravelmente a velocidade, mas força a operação.&lt;/li>
&lt;li>&lt;code>--medvram-sdxl&lt;/code>: É uma flag extremamente útil que aplica o MedVRAM somente quando os modelos SDXL estão em uso.&lt;/li>
&lt;/ul>
&lt;h3 id="73-ultra-aceleração-através-do-tensorrt">7.3 Ultra Aceleração através do TensorRT
&lt;/h3>&lt;p>Um framework da NVIDIA feito para maximizar a utilização dos Tensor Cores em GPUs NVIDIA é o &lt;strong>TensorRT&lt;/strong>.
O U-Net do Stable Diffusion é compilado como um motor (arquivo &lt;code>.trt&lt;/code>) dedicado especificamente à GPU em uso. Embora a compilação leve vários minutos e traga a desvantagem de prender a resolução e os tamanhos de lote (Dynamic Shape é possível, mas com perda de eficiência), a velocidade de geração salta de &lt;strong>1.5 a 2 vezes ou mais&lt;/strong>. É a melhor técnica de otimização para uso comercial, onde muitas imagens com a mesma resolução são geradas.&lt;/p>
&lt;h3 id="74-tiled-vae--tiled-diffusion">7.4 Tiled VAE / Tiled Diffusion
&lt;/h3>&lt;p>Na geração ou redimensionamento de imagens em alta resolução (como 4K), o processamento de decodificação no VAE causa esgotamento instantâneo da VRAM. Para impedir que isso aconteça, é necessária uma extensão (Multidiffusion / Tiled VAE) que divida e processe a imagem como blocos (por exemplo, processando peças de $512 \times 512$ por vez) e depois as unifique no fim.&lt;/p>
&lt;hr>
&lt;h2 id="8-tecnologia-de-controle-avançada-controlnet">8. Tecnologia de Controle Avançada: ControlNet
&lt;/h2>&lt;p>Usar apenas um prompt de texto não permite especificar posições de personagens, perspectivas complexas, ou os movimentos finos das pontas dos dedos. Quem resolve isso é o &lt;strong>ControlNet&lt;/strong>.&lt;/p>
&lt;p>O ControlNet fixa os pesos dos modelos Stable Diffusion pré-treinados, copia a estrutura do codificador e adota uma arquitetura baseada na injeção de &amp;ldquo;Zero-convolutions (camadas de convolução com pesos inicializados em zero)&amp;rdquo;. Assim, permite um condicionamento extra sem destruir a capacidade nativa de gerar os elementos da imagem.&lt;/p>
&lt;p>&lt;strong>Modelos e Pré-processadores Típicos:&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>OpenPose&lt;/strong>: Extrai a estrutura óssea de humanos (posições articulares) e gera a imagem com exatamente a mesma postura.&lt;/li>
&lt;li>&lt;strong>Canny&lt;/strong>: Executa a detecção de bordas usando delineamento de linhas e pinta cores ou faz fotorrealismo partindo da arte linear.&lt;/li>
&lt;li>&lt;strong>Depth&lt;/strong>: Cria um mapa de profundidade (Depth Map) e produz uma imagem preservando a relação tridimensional do fundo ao primeiro plano.&lt;/li>
&lt;li>&lt;strong>Lineart&lt;/strong>: Extrai a arte em linhas com mais precisão do que o Canny num estilo mais focado em animes.&lt;/li>
&lt;/ul>
&lt;p>Aplicando vários desses ControlNets simultaneamente (Multi-ControlNet), torna-se possível extrair com firmeza &amp;ldquo;uma imagem com uma postura especificada e com a perspectiva de fundo especificada&amp;rdquo;.&lt;/p>
&lt;hr>
&lt;h2 id="9-solução-de-problemas-faq">9. Solução de Problemas (FAQ)
&lt;/h2>&lt;p>Estes são erros frequentes e suas soluções relacionadas com as configurações do ambiente e uso.&lt;/p>
&lt;h3 id="q1-a-geração-para-com-o-erro-cuda-out-of-memory">Q1. A geração para com o erro &lt;code>CUDA out of memory.&lt;/code>
&lt;/h3>&lt;p>&lt;strong>A1:&lt;/strong> Sua VRAM é insuficiente. Baixe a resolução da imagem, ou use o tamanho do lote para 1. Além disso, para A1111, tente editar seu &lt;code>webui-user.bat&lt;/code> para adicionar &lt;code>--xformers&lt;/code> e &lt;code>--medvram&lt;/code> e reinicie. Caso queira melhorar a resolução (Hires. fix), prefira usar uma classe baseada em ESRGAN em Upscaler, e não baseada em Latent (como os R-ESRGAN, etc.) para reduzir consumo da VRAM.&lt;/p>
&lt;h3 id="q2-a-imagem-criada-está-toda-preta-ou-com-falhas-de-ruído-total">Q2. A imagem criada está toda preta ou com falhas de ruído total.
&lt;/h3>&lt;p>&lt;strong>A2:&lt;/strong> Esse é um cenário causado pelos cálculos gerando o estado de valor NaN (Not a Number) onde o tensor se colapsa. Trate-o tomando as seguintes precauções:&lt;/p>
&lt;ol>
&lt;li>Adicione a opção &lt;code>--no-half-vae&lt;/code> ao boot limitando a computação do VAE à precisão única do flutuante (FP32).&lt;/li>
&lt;li>Adicione a opção &lt;code>--disable-nan-check&lt;/code> ao boot (Nota: esta não é a solução primordial).&lt;/li>
&lt;li>Se os modelos em processamento (especialmente baseados em SD 2.1) tiverem dificuldade com FP16, tente mudar para full-precision.&lt;/li>
&lt;/ol>
&lt;h3 id="q3-falhas-envolvendo-git-ou-python-ocorrem-ao-acionar-webui-userbat">Q3. Falhas envolvendo Git ou Python ocorrem ao acionar &lt;code>webui-user.bat&lt;/code>.
&lt;/h3>&lt;p>&lt;strong>A3:&lt;/strong> Há suspeita de conflito envolvendo dependências das bibliotecas. Exclua do seu diretório WebUI a pasta &lt;code>venv&lt;/code> completamente e torne a correr o arquivo &lt;code>webui-user.bat&lt;/code>. Isso recriará do zero seu ambiente de dependências (alguns gigabytes de download novamente).&lt;/p>
&lt;h3 id="q4-eu-baixei-os-modelos-safetensors-e-eles-não-aparecem-na-minha-lista-de-checkpoints">Q4. Eu baixei os modelos (.safetensors) e eles não aparecem na minha lista de checkpoints.
&lt;/h3>&lt;p>&lt;strong>A4:&lt;/strong> Após colocar seus arquivos no local exigido &lt;code>models/Stable-diffusion&lt;/code>, toque o botão de atualizar (ícone recarregar circular) localizado na frente do dropdown de Checkpoint do Web UI. Se seus modelos estão em subpastas, verifique novamente a extensão do arquivo para certificar-se de que nada difere.&lt;/p>
&lt;hr>
&lt;h2 id="10-conclusão-o-futuro-da-geração-de-imagens-de-ia-e-os-benefícios-do-local">10. Conclusão: O Futuro da Geração de Imagens de IA e os Benefícios do Local
&lt;/h2>&lt;p>O movimento de geração de imagens de IA baseada em open source, que teve largada a partir do Stable Diffusion, continua a florescer em arquiteturas de próximas gerações como o SDXL, e Stable Diffusion 3 ou Flux.1. Como os parâmetros contidos nesses modelos aumentaram a ordem de bilhões à ordem de dezenas de bilhões, os futuros hardwares tenderão a exigir, ainda mais, placas de vídeo a partir de 24GB de VRAM.&lt;/p>
&lt;p>No entanto, o progresso tecnológico nas adaptações do funcionamento local, usando processamento em Quantização (Quantization), o uso do formato GGUF ou os recursos avançados baseados em TensorRT continuam sua aceleração exponencial e já formam ecossistemas para rodar inferências até mesmo nos computadores voltados à massa.&lt;/p>
&lt;p>As compreensões baseadas neste manual sobre configurações baseadas em CUDA, técnicas de minimização do consumo do VRAM e abordagens aos pipelines presentes no ComfyUI, consistirão sempre num alicerce que perdurará por todas as mudanças presentes nas inovações de IA. Torcemos para que este manual garanta que sua criatividade floresça com restrições mínimas ao extrair o melhor possível do seu sistema local.&lt;/p></description></item></channel></rss>