<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>CUDA on kenji.blog</title><link>http://kenji.blog/id/tags/cuda/</link><description>Recent content in CUDA on kenji.blog</description><generator>Hugo -- gohugo.io</generator><language>id</language><copyright>kenjinote</copyright><lastBuildDate>Fri, 11 Sep 2026 19:00:00 +0900</lastBuildDate><atom:link href="http://kenji.blog/id/tags/cuda/index.xml" rel="self" type="application/rss+xml"/><item><title>Panduan Penyiapan Lingkungan Lokal untuk Alat Pembuatan Gambar AI (Stable Diffusion, dll.)</title><link>http://kenji.blog/id/p/local-ai-image-generation-setup/</link><pubDate>Fri, 11 Sep 2026 19:00:00 +0900</pubDate><guid>http://kenji.blog/id/p/local-ai-image-generation-setup/</guid><description>&lt;img src="http://kenji.blog/p/local-ai-image-generation-setup/img/eyecatch.jpg" alt="Featured image of post Panduan Penyiapan Lingkungan Lokal untuk Alat Pembuatan Gambar AI (Stable Diffusion, dll.)" />&lt;h2 id="1-pendahuluan-mengapa-membuat-gambar-ai-di-lingkungan-lokal">1. Pendahuluan: Mengapa membuat gambar AI di lingkungan lokal?
&lt;/h2>&lt;p>Teknologi pembuatan gambar AI telah mengalami evolusi eksplosif, dimulai dengan sumber terbuka Stable Diffusion. Saat ini, layanan komersial berbasis cloud seperti Midjourney, DALL-E 3, dan Adobe Firefly juga sangat kuat dan mudah digunakan. Namun, layanan tersebut memiliki kelemahan seperti pembatasan konten yang dihasilkan karena persyaratan layanan (filter NSFW, dll.), biaya berkelanjutan karena langganan, dan ketidakmampuan untuk mengontrol proses pembuatan secara mendetail.&lt;/p>
&lt;p>Membangun alat pembuatan gambar AI di lingkungan lokal (PC Anda sendiri) memiliki keuntungan luar biasa berikut:&lt;/p>
&lt;ol>
&lt;li>&lt;strong>Kebebasan Penuh dan Pembuatan Tanpa Batas&lt;/strong>: Anda dapat menghasilkan gambar tanpa batas selama sumber daya lokal Anda memungkinkan, tanpa batasan jumlah yang dihasilkan atau biaya tambahan.&lt;/li>
&lt;li>&lt;strong>Kustomisasi Tingkat Lanjut&lt;/strong>: Kontrol komposisi terperinci serta reproduksi karakter atau gaya seni tertentu dimungkinkan menggunakan LoRA (Low-Rank Adaptation) atau ControlNet.&lt;/li>
&lt;li>&lt;strong>Privasi dan Keamanan&lt;/strong>: Karena tidak ada data yang dikirim ke cloud, ini sangat ideal untuk pekerjaan desain yang sangat rahasia atau proyek pribadi.&lt;/li>
&lt;li>&lt;strong>Penerapan Teknologi Terbaru Secara Instan&lt;/strong>: Anda dapat dengan cepat menguji model terbaru dan ekstensi yang dirilis setiap hari oleh komunitas sumber terbuka.&lt;/li>
&lt;/ol>
&lt;p>Panduan ini berasumsi menggunakan lingkungan Windows dan menjelaskan secara menyeluruh cara membangun tiga lingkungan pembuatan gambar AI utama saat ini (AUTOMATIC1111 Stable Diffusion WebUI, ComfyUI, dan Fooocus), serta latar belakang matematika yang mendasarinya dan bahkan metode pengoptimalan VRAM, dengan volume melebihi 10.000 karakter (dalam bahasa Jepang).&lt;/p>
&lt;hr>
&lt;h2 id="2-latar-belakang-matematika-dan-arsitektur-model-difusi-diffusion-model">2. Latar Belakang Matematika dan Arsitektur Model Difusi (Diffusion Model)
&lt;/h2>&lt;p>Untuk membangun lingkungan lokal dan mengatur parameter dengan tepat, sangat bermanfaat untuk memahami bagaimana &lt;strong>Latent Diffusion Model (LDM)&lt;/strong> seperti Stable Diffusion berfungsi.&lt;/p>
&lt;h3 id="21-proses-penambahan-noise-forward-process-dan-proses-penghapusan-noise-reverse-process">2.1 Proses Penambahan Noise (Forward Process) dan Proses Penghapusan Noise (Reverse Process)
&lt;/h3>&lt;p>Prinsip dasar model difusi terdiri dari &amp;ldquo;Forward Process&amp;rdquo;, yang secara bertahap menambahkan Gaussian noise ke data asli (gambar) hingga akhirnya menjadi noise murni, dan &amp;ldquo;Reverse Process&amp;rdquo;, yang memulihkan gambar asli dari noise tersebut.&lt;/p>
&lt;p>Forward Process didefinisikan sebagai rantai Markov, dan status $x_t$ pada langkah $t$ dinyatakan dengan persamaan berikut:&lt;/p>
$$ q(x_t | x_{t-1}) = \mathcal{N}(x_t; \sqrt{1 - \beta_t} x_{t-1}, \beta_t I) $$
&lt;p>Dengan menggunakan trik reparameterisasi (Reparameterization trick), kita dapat menghitung status langkah $t$ mana pun langsung dari status awal $x_0$.&lt;/p>
$$ x_t = \sqrt{\bar{\alpha}_t} x_0 + \sqrt{1 - \bar{\alpha}_t} \epsilon $$
&lt;p>Di sini, $\alpha_t = 1 - \beta_t$, $\bar{\alpha}_t = \prod_{s=1}^t \alpha_s$, dan $\epsilon \sim \mathcal{N}(0, I)$ adalah noise yang diambil sampelnya dari distribusi normal standar.&lt;/p>
&lt;p>Dalam Reverse Process, yang merupakan fase pembuatan gambar, jaringan saraf (U-Net) $\epsilon_\theta$ digunakan untuk memprediksi dan menghapus noise yang ditambahkan. Fungsi kerugian (loss function) secara sederhana adalah sebagai berikut:&lt;/p>
$$ L_{simple} = \mathbb{E}_{x_0, \epsilon \sim \mathcal{N}(0, I), t} \left[ || \epsilon - \epsilon_\theta(\sqrt{\bar{\alpha}_t} x_0 + \sqrt{1 - \bar{\alpha}_t} \epsilon, t) ||^2 \right] $$
&lt;h3 id="22-pengurangan-kompleksitas-komputasi-melalui-ruang-laten-latent-space">2.2 Pengurangan Kompleksitas Komputasi melalui Ruang Laten (Latent Space)
&lt;/h3>&lt;p>Melakukan penghapusan noise langsung di Pixel Space akan menjadi proses yang sangat berat karena komputasi meningkat secara kuadrat terhadap resolusi gambar. Stable Diffusion menggunakan &lt;strong>VAE (Variational Autoencoder)&lt;/strong> untuk mengubah gambar menjadi &amp;ldquo;Ruang Laten&amp;rdquo; (Latent Space) terkompresi sebelum memprosesnya.&lt;/p>
&lt;p>Encoder $E$ mengompresi gambar dengan resolusi $H \times W \times 3$ menjadi $z \in \mathbb{R}^{H/8 \times W/8 \times 4}$. Karena dimensi spasial dikurangi menjadi seperdelapan, komputasi mekanisme perhatian diri (Self-Attention) menjadi $\mathcal{O}((\frac{H \times W}{64})^2)$, menghasilkan peningkatan kinerja yang dramatis. Setelah pembuatan, itu dipulihkan ke Pixel Space oleh decoder $D$ sebagai $\tilde{x} = D(z)$.&lt;/p>
&lt;h3 id="23-arsitektur-sistem-stable-diffusion">2.3 Arsitektur Sistem Stable Diffusion
&lt;/h3>&lt;p>Diagram Mermaid berikut menunjukkan keseluruhan proses pembuatan (pembuatan gambar dari teks: txt2img) dari Stable Diffusion.&lt;/p>
&lt;div class="mermaid">graph TD
A["Input Pengguna (Prompt Teks)"] --> B["Pembuat Enkode Teks (CLIP ViT-L/14)"]
B --> C["Vektor Pengondisian (Conditioning)"]
D["Noise Acak (Ruang Laten)"] --> E["U-Net (Prediktor Noise)"]
C --> E
E --> F["Penjadwal (DDIM, Euler a, dll.)"]
F --> D
F --> G["Variabel Laten Denoised"]
G --> H["Dekoder VAE (Variational Autoencoder)"]
H --> I["Gambar Akhir yang Dihasilkan (Pixel Space)"]&lt;/div>
&lt;hr>
&lt;h2 id="3-penjelasan-menyeluruh-tentang-persyaratan-perangkat-keras">3. Penjelasan Menyeluruh tentang Persyaratan Perangkat Keras
&lt;/h2>&lt;p>Dalam pembuatan gambar AI lokal, pemilihan perangkat keras adalah yang paling penting.&lt;/p>
&lt;h3 id="31-gpu-kartu-grafis">3.1 GPU (Kartu Grafis)
&lt;/h3>&lt;p>Inti dari pemrosesan AI. Untuk menjalankan Stable Diffusion di lingkungan Windows, GPU buatan NVIDIA adalah standar de facto. Dimungkinkan untuk menjalankannya pada AMD Radeon menggunakan ROCm, tetapi mengingat kesulitan pengaturan lingkungan pada Windows dan banyak ekstensi bergantung pada CUDA (arsitektur komputasi paralel NVIDIA), tidak berlebihan untuk mengatakan NVIDIA adalah satu-satunya pilihan.&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Persyaratan Minimum&lt;/strong>: VRAM 6GB (seperti GTX 1060 6GB / RTX 2060). ※Namun, akan ada batasan besar pada resolusi dan fungsi.&lt;/li>
&lt;li>&lt;strong>Persyaratan yang Disarankan&lt;/strong>: VRAM 12GB (seperti RTX 3060 12GB / RTX 4070). Ini adalah batas minimum untuk menjalankan model SDXL dengan nyaman.&lt;/li>
&lt;li>&lt;strong>Persyaratan Ideal&lt;/strong>: VRAM 16GB~24GB (RTX 4080 / RTX 3090 / RTX 4090). Diperlukan untuk pembuatan resolusi tinggi, penggunaan bersamaan ControlNet yang kompleks, dan pelatihan model lokal (LoRA, dll.).&lt;/li>
&lt;/ul>
&lt;h3 id="32-memori-ram-dan-penyimpanan">3.2 Memori (RAM) dan Penyimpanan
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>RAM&lt;/strong>: Sangat disarankan 32GB atau lebih. RAM sistem sementara digunakan saat mentransfer model (dari beberapa GB ke puluhan GB) dari penyimpanan ke VRAM. Jika RAM tidak mencukupi, file halaman (page file) akan digunakan, yang menyebabkan penurunan kecepatan yang fatal.&lt;/li>
&lt;li>&lt;strong>Penyimpanan&lt;/strong>: SSD NVMe M.2 sangat diperlukan. Model AI terbaru (Checkpoints) berukuran antara 2GB dan 7GB masing-masing. Jika Anda menggunakan HDD, memuat model saja bisa memakan waktu beberapa menit, membuatnya tidak praktis.&lt;/li>
&lt;/ul>
&lt;hr>
&lt;h2 id="4-penyiapan-perangkat-lunak-dasar-edisi-windows">4. Penyiapan Perangkat Lunak Dasar (Edisi Windows)
&lt;/h2>&lt;p>Sebelum menginstal alat itu sendiri, siapkan perangkat lunak dasar yang diperlukan.&lt;/p>
&lt;h3 id="41-menginstal-python">4.1 Menginstal Python
&lt;/h3>&lt;p>Sebagian besar alat AI ditulis dalam Python. Instal &lt;strong>Python 3.10.6&lt;/strong>, yang memiliki kompatibilitas tertinggi dengan Stable Diffusion WebUI, dll. (versi yang terlalu baru dapat merusak dependensi seperti PyTorch).&lt;/p>
&lt;ol>
&lt;li>Unduh &lt;code>python-3.10.6-amd64.exe&lt;/code> dari arsip resmi Python.&lt;/li>
&lt;li>Saat meluncurkan penginstal, pastikan untuk mencentang &lt;strong>&amp;ldquo;Add Python 3.10 to PATH&amp;rdquo;&lt;/strong> di bagian bawah.&lt;/li>
&lt;li>Pada layar penyelesaian penginstalan, klik &lt;strong>&amp;ldquo;Disable path length limit&amp;rdquo;&lt;/strong> (Penting: Jika Anda tidak menghapus batasan jalur 260 karakter di Windows, kesalahan akan terjadi pada pustaka dependensi berlapis dalam).&lt;/li>
&lt;/ol>
&lt;h3 id="42-menginstal-git-untuk-windows">4.2 Menginstal Git untuk Windows
&lt;/h3>&lt;p>Git diperlukan untuk mengambil kode sumber dan model dari GitHub.&lt;/p>
&lt;ol>
&lt;li>Unduh penginstal dari situs web resmi Git untuk Windows dan instal menggunakan semua pengaturan default.&lt;/li>
&lt;/ol>
&lt;h3 id="43-mengonfigurasi-cuda-toolkit-dan-cudnn">4.3 Mengonfigurasi CUDA Toolkit dan cuDNN
&lt;/h3>&lt;p>Karena versi terbaru PyTorch telah menyertakan dan mengunduh binari CUDA yang diperlukan selama penginstalan, tidak lagi wajib untuk menginstal CUDA Toolkit di seluruh sistem. Namun, jika Anda menggunakan ekstensi khusus (membuat TensorRT atau xFormers), disarankan untuk menginstal &lt;strong>CUDA Toolkit 11.8&lt;/strong> atau &lt;strong>12.1&lt;/strong> (cocokkan dengan PyTorch yang digunakan) dari situs resmi NVIDIA.&lt;/p>
&lt;hr>
&lt;h2 id="5-prosedur-pembangunan-3-frontend-utama">5. Prosedur Pembangunan 3 Frontend Utama
&lt;/h2>&lt;p>Kami akan menjelaskan cara membangun tiga alat pembuatan gambar AI utama saat ini. Silakan gunakan sesuai dengan tujuan dan tingkat keahlian Anda.&lt;/p>
&lt;h3 id="51-membangun-automatic1111-stable-diffusion-webui">5.1 Membangun AUTOMATIC1111 Stable Diffusion WebUI
&lt;/h3>&lt;p>Ini adalah alat serbaguna dengan sejarah terpanjang, ekstensi yang melimpah, dan kemampuan penyesuaian parameter yang terperinci.&lt;/p>
&lt;p>&lt;strong>Langkah Instalasi:&lt;/strong>&lt;/p>
&lt;ol>
&lt;li>Buka Command Prompt di direktori yang Anda inginkan (misalnya, &lt;code>C:\work\ai&lt;/code>).&lt;/li>
&lt;li>Jalankan perintah berikut untuk mengkloning repositori.
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-cmd" data-lang="cmd">&lt;span class="line">&lt;span class="cl">git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;/li>
&lt;li>Klik kanan pada &lt;code>webui-user.bat&lt;/code> di direktori yang dikloning, lalu buka dalam mode edit.&lt;/li>
&lt;li>Untuk meningkatkan kinerja, atur argumen baris perintah &lt;code>COMMANDLINE_ARGS&lt;/code> sebagai berikut.
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bat" data-lang="bat">&lt;span class="line">&lt;span class="cl">&lt;span class="k">set&lt;/span> &lt;span class="nv">COMMANDLINE_ARGS&lt;/span>&lt;span class="p">=&lt;/span>--xformers --opt-sdp-attention --theme dark
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;/li>
&lt;li>Klik ganda &lt;code>webui-user.bat&lt;/code> untuk menjalankannya. Untuk pertama kalinya, perpustakaan besar seperti PyTorch akan diunduh, yang mungkin memakan waktu puluhan menit tergantung pada lingkungan Anda.&lt;/li>
&lt;li>Setelah selesai, &lt;code>Running on local URL: http://127.0.0.1:7860&lt;/code> akan ditampilkan, jadi akseslah menggunakan browser Anda.&lt;/li>
&lt;/ol>
&lt;h3 id="52-membangun-comfyui-dan-manfaat-berbasis-node">5.2 Membangun ComfyUI dan Manfaat Berbasis Node
&lt;/h3>&lt;p>ComfyUI adalah antarmuka tempat proses pembuatan digabungkan secara visual (berbasis Node) dengan balok yang disebut &amp;ldquo;node&amp;rdquo;. Manajemen VRAM-nya sangat luar biasa, dan sering kali dapat berjalan di lingkungan yang kehabisan memori dengan AUTOMATIC1111.&lt;/p>
&lt;div class="mermaid">graph TD
subgraph "Contoh Alur Kerja ComfyUI"
A["Muat Titik Pemeriksaan (Load Checkpoint)"] --> B["Enkode Teks CLIP (Positif)"]
A --> C["Enkode Teks CLIP (Negatif)"]
A --> D["Gambar Laten Kosong"]
B --> E["KSampler (Pengambilan Sampel)"]
C --> E
D --> E
A --> F["VAEDecode"]
E --> F
F --> G["Simpan Gambar (Save Image)"]
end&lt;/div>
&lt;p>&lt;strong>Langkah Instalasi:&lt;/strong>&lt;/p>
&lt;ol>
&lt;li>Unduh file 7z Standalone Windows dari halaman rilis GitHub resmi ComfyUI.&lt;/li>
&lt;li>Ekstrak file dan jalankan &lt;code>run_nvidia_gpu.bat&lt;/code> di dalamnya (karena ini adalah versi portabel dengan Python bawaan, tidak diperlukan konfigurasi).&lt;/li>
&lt;li>&lt;strong>Memperkenalkan ComfyUI Manager&lt;/strong>: Wajib untuk mengelola ekstensi. Buka Command Prompt di direktori &lt;code>ComfyUI/custom_nodes/&lt;/code> dan jalankan yang berikut ini:
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-cmd" data-lang="cmd">&lt;span class="line">&lt;span class="cl">git clone https://github.com/ltdrdata/ComfyUI-Manager.git
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>Setelah memulai ulang, tombol &amp;ldquo;Manager&amp;rdquo; akan muncul di kanan bawah UI, memungkinkan Anda menginstal berbagai node kustom dari sini.&lt;/li>
&lt;/ol>
&lt;h3 id="53-membangun-fooocus-pembuatan-berkualitas-tinggi-untuk-pemula">5.3 Membangun Fooocus: Pembuatan Berkualitas Tinggi untuk Pemula
&lt;/h3>&lt;p>Fooocus dirancang dengan tujuan &amp;ldquo;menghasilkan gambar yang sangat indah bahkan dengan petunjuk pendek,&amp;rdquo; seperti Midjourney. Ini disetel khusus untuk model SDXL, dan secara otomatis melakukan ekstensi prompt berbasis GPT-2 dan saluran kompleks secara internal.&lt;/p>
&lt;p>&lt;strong>Langkah Instalasi:&lt;/strong>&lt;/p>
&lt;ol>
&lt;li>Unduh dan ekstrak paket rilis Windows dari GitHub Fooocus resmi.&lt;/li>
&lt;li>Jalankan &lt;code>run.bat&lt;/code>. Model SDXL yang sangat baik seperti Juggernaut XL akan diunduh secara otomatis, dan segera siap untuk memulai pembuatan gambar berkualitas tinggi.&lt;/li>
&lt;li>Dengan mencentang &amp;ldquo;Advanced&amp;rdquo;, Anda juga dapat menggunakan fitur lanjutan seperti Image Prompt dan Inpainting.&lt;/li>
&lt;/ol>
&lt;hr>
&lt;h2 id="6-manajemen-model-dan-pemahaman-struktur-data">6. Manajemen Model dan Pemahaman Struktur Data
&lt;/h2>&lt;p>Kualitas pembuatan gambar AI sepenuhnya bergantung pada model (data terlatih) yang digunakan.&lt;/p>
&lt;h3 id="61-checkpoints-model-dasar">6.1 Checkpoints (Model Dasar)
&lt;/h3>&lt;p>Ini adalah model utama di inti pembuatan gambar. Sebelumnya, format &lt;code>.ckpt&lt;/code> (format Pickle) adalah yang utama, tetapi format ini memiliki kerentanan yang dapat mengeksekusi kode Python sembarang (Arbitrary Code Execution). Saat ini, format &lt;strong>&lt;code>.safetensors&lt;/code>&lt;/strong> adalah standar, yang aman dan memungkinkan pemuatan salinan nol (zero-copy load/mmap) dari disk ke memori. Jangan pernah mengunduh file &lt;code>.ckpt&lt;/code> dari sumber yang tidak dikenal.&lt;/p>
&lt;h3 id="62-perilaku-matematis-lora-low-rank-adaptation">6.2 Perilaku Matematis LoRA (Low-Rank Adaptation)
&lt;/h3>&lt;p>LoRA adalah teknologi yang memungkinkan pembelajaran tambahan gaya seni atau karakter tertentu, menghindari komputasi besar yang diperlukan untuk fine-tuning model penuh.&lt;/p>
&lt;p>Alih-alih secara langsung memperbarui matriks bobot $W_0 \in \mathbb{R}^{d \times k}$ yang memiliki miliaran parameter, LoRA memperkenalkan dua matriks peringkat rendah $A \in \mathbb{R}^{r \times k}$ dan $B \in \mathbb{R}^{d \times r}$ (peringkat $r \ll \min(d, k)$). Bobot baru dihitung sebagai berikut:&lt;/p>
$$ W = W_0 + \Delta W = W_0 + B A $$
&lt;p>Ini secara drastis mengurangi jumlah parameter yang akan dilatih dan disimpan dari $d \times k$ menjadi $r \times (d + k)$, memungkinkan penerapan gaya yang kuat dengan file ringan berukuran beberapa ratus MB.&lt;/p>
&lt;h3 id="63-vae-variational-autoencoder">6.3 VAE (Variational Autoencoder)
&lt;/h3>&lt;p>Seperti disebutkan sebelumnya, ini adalah model yang mengubah ruang laten dan ruang piksel. Dalam model gaya anime, jika VAE tidak diatur dengan benar, hasil output mungkin &amp;ldquo;kusam&amp;rdquo; secara keseluruhan dengan warna putih dan kontras rendah. Tempatkan VAE khusus anime, seperti &lt;code>kl-f8-anime2.ckpt&lt;/code>, di folder &lt;code>models/VAE&lt;/code> untuk menerapkannya.&lt;/p>
&lt;h3 id="64-contoh-struktur-direktori-automatic1111">6.4 Contoh Struktur Direktori (AUTOMATIC1111)
&lt;/h3>&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;span class="lnt">6
&lt;/span>&lt;span class="lnt">7
&lt;/span>&lt;span class="lnt">8
&lt;/span>&lt;span class="lnt">9
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-text" data-lang="text">&lt;span class="line">&lt;span class="cl">stable-diffusion-webui/
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">├── models/
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ ├── Stable-diffusion/ &amp;lt;-- Tempat Checkpoints (.safetensors)
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ ├── Lora/ &amp;lt;-- Tempat Model LoRA
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ ├── VAE/ &amp;lt;-- Tempat Model VAE
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ └── ControlNet/ &amp;lt;-- Tempat Model ControlNet
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">├── embeddings/ &amp;lt;-- Tempat Textual Inversion (file PT)
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">├── extensions/ &amp;lt;-- Ekstensi hasil Git Clone
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">└── webui-user.bat &amp;lt;-- File batch peluncuran
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;hr>
&lt;h2 id="7-pengoptimalan-vram-dan-penyesuaian-kinerja">7. Pengoptimalan VRAM dan Penyesuaian Kinerja
&lt;/h2>&lt;p>Berikut adalah teknik untuk menghindari &amp;ldquo;Kehabisan VRAM (CUDA Out Of Memory)&amp;rdquo;, hambatan terbesar dalam pembuatan lokal, dan memaksimalkan kecepatan pembuatan hingga batas ekstrem.&lt;/p>
&lt;h3 id="71-optimalisasi-mekanisme-perhatian-xformers--sdp-attention">7.1 Optimalisasi Mekanisme Perhatian (xFormers / SDP Attention)
&lt;/h3>&lt;p>Sebagian besar komputasi Stable Diffusion dihabiskan untuk Cross-Attention di dalam U-Net. Karena komputasi Attention default menghabiskan banyak memori, optimalkan dengan pendekatan berikut.&lt;/p>
&lt;ul>
&lt;li>&lt;strong>xFormers (&lt;code>--xformers&lt;/code>)&lt;/strong>: Implementasi Attention hemat memori (Memory Efficient Attention) yang dikembangkan oleh Meta. Ini secara signifikan mengurangi konsumsi VRAM dan meningkatkan kecepatan, tetapi karena sifat komputasi non-deterministik, gambar yang &amp;ldquo;sedikit berbeda dapat dihasilkan meskipun nilai benih (seed) persis sama&amp;rdquo;.&lt;/li>
&lt;li>&lt;strong>SDP Attention (&lt;code>--opt-sdp-attention&lt;/code>)&lt;/strong>: Scaled Dot Product Attention menjadi standar sejak PyTorch 2.0. Ini memiliki pengurangan VRAM dan efek kecepatan yang setara dengan xFormers sambil memiliki lebih sedikit dependensi. Ada juga variasi seperti &lt;code>--opt-sub-quad-attention&lt;/code> yang tidak memiliki non-determinisme.&lt;/li>
&lt;/ul>
&lt;h3 id="72-opsi-peluncuran-penghemat-vram">7.2 Opsi Peluncuran Penghemat VRAM
&lt;/h3>&lt;ul>
&lt;li>&lt;code>--medvram&lt;/code>: Untuk lingkungan dengan VRAM 6GB~8GB. Ini membagi U-Net menjadi beberapa bagian untuk diproses, menghemat memori tetapi sedikit menurunkan kecepatan.&lt;/li>
&lt;li>&lt;code>--lowvram&lt;/code>: Untuk lingkungan dengan VRAM 4GB atau kurang. Karena modul masuk dan keluar VRAM secara terperinci, kecepatan sangat menurun tetapi dapat dijalankan secara paksa.&lt;/li>
&lt;li>&lt;code>--medvram-sdxl&lt;/code>: Tanda (flag) yang sangat berguna yang menerapkan MedVRAM hanya saat menggunakan model SDXL.&lt;/li>
&lt;/ul>
&lt;h3 id="73-akselerasi-ultra-cepat-dengan-tensorrt">7.3 Akselerasi Ultra-Cepat dengan TensorRT
&lt;/h3>&lt;p>&lt;strong>TensorRT&lt;/strong> adalah framework untuk memaksimalkan penggunaan inti tensor pada GPU NVIDIA.
Ini mengompilasi U-Net Stable Diffusion menjadi mesin khusus (file &lt;code>.trt&lt;/code>) untuk GPU yang Anda gunakan. Kompilasi memakan waktu puluhan menit, dan ukuran batch serta resolusi tetap (Bentuk Dinamis atau Dynamic Shape dimungkinkan tetapi efisiensinya menurun), tetapi kecepatan pembuatan melonjak &lt;strong>1,5 hingga lebih dari 2 kali lipat&lt;/strong>. Ini adalah metode optimasi terkuat untuk penggunaan bisnis yang menghasilkan sejumlah besar gambar dengan resolusi yang sama.&lt;/p>
&lt;h3 id="74-tiled-vae--tiled-diffusion">7.4 Tiled VAE / Tiled Diffusion
&lt;/h3>&lt;p>Saat menghasilkan atau meningkatkan skala (upscale) gambar beresolusi tinggi (seperti 4K), VRAM akan langsung habis oleh proses dekode VAE. Untuk mencegah hal ini, diperlukan ekstensi (Multidiffusion / Tiled VAE) yang membagi gambar menjadi kotak (misalnya, $512 \times 512$ masing-masing) untuk diproses, lalu menggabungkannya di akhir.&lt;/p>
&lt;hr>
&lt;h2 id="8-teknologi-kontrol-lanjutan-controlnet">8. Teknologi Kontrol Lanjutan: ControlNet
&lt;/h2>&lt;p>Tidak mungkin untuk menentukan pose karakter, perspektif kompleks, atau gerakan halus ujung jari hanya dengan prompt teks. Ini diselesaikan dengan &lt;strong>ControlNet&lt;/strong>.&lt;/p>
&lt;p>ControlNet memiliki arsitektur di mana bobot model Stable Diffusion terlatih tetap (di-freeze), salinan struktur encoder dibuat, dan &amp;ldquo;Zero-convolutions (lapisan konvolusi diinisialisasi dengan bobot nol)&amp;rdquo; disisipkan di antaranya. Hal ini memungkinkan pengondisian tambahan tanpa merusak kemampuan pembuatan asli.&lt;/p>
&lt;p>&lt;strong>Prapemroses (Preprocessors) dan model umum:&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>OpenPose&lt;/strong>: Mengekstrak kerangka manusia (posisi sendi) dan menghasilkan gambar dengan pose yang persis sama.&lt;/li>
&lt;li>&lt;strong>Canny&lt;/strong>: Melakukan deteksi tepi (edge detection) dan melakukan pewarnaan atau fotorealisme berdasarkan seni garis (line art).&lt;/li>
&lt;li>&lt;strong>Depth&lt;/strong>: Menghasilkan peta kedalaman (Depth Map) dan menghasilkan gambar yang mempertahankan hubungan spasial depan-belakang.&lt;/li>
&lt;li>&lt;strong>Lineart&lt;/strong>: Lebih baik dalam mengekstraksi seni garis bergaya anime daripada Canny.&lt;/li>
&lt;/ul>
&lt;p>Dengan menerapkan beberapa ControlNet ini secara bersamaan (Multi-ControlNet), menjadi mungkin untuk menghasilkan gambar secara andal &amp;ldquo;dengan pose yang ditentukan dan perspektif latar belakang yang ditentukan.&amp;rdquo;&lt;/p>
&lt;hr>
&lt;h2 id="9-pemecahan-masalah-faq">9. Pemecahan Masalah (FAQ)
&lt;/h2>&lt;p>Berikut adalah kesalahan umum dan solusinya selama pembangunan dan pengoperasian lingkungan lokal.&lt;/p>
&lt;h3 id="q1-pembuatan-berhenti-dengan-kesalahan-cuda-out-of-memory">Q1. Pembuatan berhenti dengan kesalahan &lt;code>CUDA out of memory.&lt;/code>
&lt;/h3>&lt;p>&lt;strong>A1:&lt;/strong> VRAM tidak mencukupi. Kurangi resolusi pembuatan atau atur ukuran batch menjadi 1. Selain itu, untuk A1111, tambahkan &lt;code>--xformers&lt;/code> dan &lt;code>--medvram&lt;/code> ke &lt;code>webui-user.bat&lt;/code> lalu mulai ulang. Jika melakukan peningkatan resolusi (Hires. fix), penggunaan sistem ESRGAN seperti R-ESRGAN untuk Upscaler alih-alih sistem Latent akan mengurangi konsumsi VRAM.&lt;/p>
&lt;h3 id="q2-gambar-yang-dihasilkan-menjadi-hitam-pekat-atau-penuh-noise">Q2. Gambar yang dihasilkan menjadi hitam pekat atau penuh noise.
&lt;/h3>&lt;p>&lt;strong>A2:&lt;/strong> Ini adalah fenomena di mana nilai NaN (Not a Number) terjadi selama perhitungan dan tensor menjadi kolaps. Ambil langkah berikut:&lt;/p>
&lt;ol>
&lt;li>Tambahkan &lt;code>--no-half-vae&lt;/code> ke opsi peluncuran untuk membuat perhitungan VAE hanya dengan presisi tunggal (FP32).&lt;/li>
&lt;li>Tambahkan &lt;code>--disable-nan-check&lt;/code> ke opsi peluncuran (bukan solusi fundamental).&lt;/li>
&lt;li>Karena perhitungan dalam FP16 mungkin tidak cocok untuk model yang digunakan (terutama seri SD 2.1), cobalah mode presisi penuh.&lt;/li>
&lt;/ol>
&lt;h3 id="q3-kesalahan-python-atau-git-muncul-saat-menjalankan-webui-userbat">Q3. Kesalahan Python atau Git muncul saat menjalankan &lt;code>webui-user.bat&lt;/code>.
&lt;/h3>&lt;p>&lt;strong>A3:&lt;/strong> Ketidakkonsistenan pustaka dependen dicurigai. Hapus folder &lt;code>venv&lt;/code> sepenuhnya di dalam direktori WebUI, lalu jalankan kembali &lt;code>webui-user.bat&lt;/code>. Lingkungan virtual akan dibangun kembali dalam keadaan bersih (akan terjadi pengunduhan ulang beberapa GB).&lt;/p>
&lt;h3 id="q4-model-safetensors-telah-diunduh-tetapi-tidak-muncul-dalam-daftar">Q4. Model (Safetensors) telah diunduh tetapi tidak muncul dalam daftar.
&lt;/h3>&lt;p>&lt;strong>A4:&lt;/strong> Pastikan file tersebut ditempatkan di folder &lt;code>models/Stable-diffusion&lt;/code>, lalu tekan tombol &amp;ldquo;Refresh&amp;rdquo; di sebelah menu dropdown pemilihan Checkpoint di UI. Jika Anda menempatkannya di subfolder, pastikan ekstensi filenya benar.&lt;/p>
&lt;hr>
&lt;h2 id="10-kesimpulan-masa-depan-pembuatan-gambar-ai-dan-keunggulan-lingkungan-lokal">10. Kesimpulan: Masa Depan Pembuatan Gambar AI dan Keunggulan Lingkungan Lokal
&lt;/h2>&lt;p>Gerakan pembuatan gambar AI sumber terbuka, yang dimulai dengan Stable Diffusion, terus berkembang menjadi SDXL dan arsitektur generasi mendatang seperti Stable Diffusion 3 dan Flux.1. Jumlah parameter model telah berkembang pesat dari miliaran menjadi puluhan miliar, dan di masa depan, lingkungan GPU dengan VRAM 24GB atau lebih akan semakin dibutuhkan.&lt;/p>
&lt;p>Namun, teknologi optimalisasi lokal seperti TensorRT, kuantisasi (Quantization), dan GGUF juga mempercepat evolusi mereka, membentuk ekosistem yang memungkinkan inferensi yang memadai bahkan pada perangkat keras untuk konsumen umum.&lt;/p>
&lt;p>Penyiapan lingkungan CUDA, optimalisasi VRAM, dan pemahaman pipeline seperti ComfyUI yang dijelaskan dalam panduan ini adalah fondasi universal yang akan berlaku tidak peduli bagaimana tren teknologi AI berubah. Kami berharap kreativitas Anda akan dimaksimalkan dalam lingkungan lokal yang tak terbatas.&lt;/p></description></item></channel></rss>