<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>ComfyUI on kenji.blog</title><link>http://kenji.blog/ar/tags/comfyui/</link><description>Recent content in ComfyUI on kenji.blog</description><generator>Hugo -- gohugo.io</generator><language>ar</language><copyright>kenjinote</copyright><lastBuildDate>Fri, 11 Sep 2026 19:00:00 +0900</lastBuildDate><atom:link href="http://kenji.blog/ar/tags/comfyui/index.xml" rel="self" type="application/rss+xml"/><item><title>دليل إعداد البيئة المحلية لأدوات توليد الصور بالذكاء الاصطناعي (مثل Stable Diffusion)</title><link>http://kenji.blog/ar/p/local-ai-image-generation-setup/</link><pubDate>Fri, 11 Sep 2026 19:00:00 +0900</pubDate><guid>http://kenji.blog/ar/p/local-ai-image-generation-setup/</guid><description>&lt;img src="http://kenji.blog/p/local-ai-image-generation-setup/img/eyecatch.jpg" alt="Featured image of post دليل إعداد البيئة المحلية لأدوات توليد الصور بالذكاء الاصطناعي (مثل Stable Diffusion)" />&lt;h2 id="1-مقدمة-لماذا-يجب-توليد-الصور-بالذكاء-الاصطناعي-في-بيئة-محلية">1. مقدمة: لماذا يجب توليد الصور بالذكاء الاصطناعي في بيئة محلية؟
&lt;/h2>&lt;p>شهدت تقنية توليد الصور بالذكاء الاصطناعي تطوراً هائلاً انطلاقاً من جعل Stable Diffusion مفتوح المصدر. حالياً، أصبحت الخدمات التجارية السحابية مثل Midjourney و DALL-E 3 و Adobe Firefly قوية جداً وسهلة الاستخدام. ومع ذلك، فإن هذه الخدمات تعاني من بعض العيوب مثل قيود المحتوى المولد بسبب شروط الاستخدام (مثل فلاتر NSFW)، والتكاليف المستمرة الناتجة عن الاشتراكات، بالإضافة إلى عدم القدرة على التحكم الدقيق في عملية التوليد.&lt;/p>
&lt;p>إن بناء أدوات توليد الصور بالذكاء الاصطناعي في بيئة محلية (على حاسوبك الشخصي) يوفر مزايا هائلة كما يلي:&lt;/p>
&lt;ol>
&lt;li>&lt;strong>حرية كاملة وتوليد غير محدود&lt;/strong>: لا توجد قيود على عدد الصور المولدة أو تكاليف إضافية، ويمكنك توليد عدد لا نهائي من الصور طالما تسمح مواردك المحلية بذلك.&lt;/li>
&lt;li>&lt;strong>قابلية تخصيص عالية&lt;/strong>: يمكن التحكم الدقيق في التكوين وإعادة إنشاء شخصيات أو أساليب رسم معينة باستخدام LoRA (Low-Rank Adaptation) و ControlNet.&lt;/li>
&lt;li>&lt;strong>الخصوصية والأمان&lt;/strong>: نظراً لعدم إرسال البيانات إلى السحابة، فهو مثالي لأعمال التصميم عالية السرية والمشاريع الشخصية.&lt;/li>
&lt;li>&lt;strong>الاعتماد الفوري لأحدث التقنيات&lt;/strong>: يمكنك تجربة أحدث النماذج والإضافات التي يتم الإعلان عنها يومياً في مجتمع المصادر المفتوحة في وقت مبكر.&lt;/li>
&lt;/ol>
&lt;p>في هذا الدليل، وعلى افتراض استخدام بيئة Windows، سنقوم بشرح شامل يتجاوز 10,000 حرف لكيفية إعداد ثلاث بيئات رئيسية حالية لتوليد الصور بالذكاء الاصطناعي (AUTOMATIC1111 Stable Diffusion WebUI، و ComfyUI، و Fooocus)، بدءاً من الخلفية الرياضية الأساسية، وصولاً إلى تقنيات تحسين VRAM.&lt;/p>
&lt;hr>
&lt;h2 id="2-الخلفية-الرياضية-وهيكلية-نماذج-الانتشار-diffusion-model">2. الخلفية الرياضية وهيكلية نماذج الانتشار (Diffusion Model)
&lt;/h2>&lt;p>من المفيد جداً فهم كيفية عمل &lt;strong>نماذج الانتشار الكامنة (Latent Diffusion Model: LDM)&lt;/strong> مثل Stable Diffusion من أجل إعداد البيئة المحلية وضبط المعلمات بشكل صحيح.&lt;/p>
&lt;h3 id="21-عملية-إضافة-الضوضاء-forward-process-وعملية-الإزالة-reverse-process">2.1 عملية إضافة الضوضاء (Forward Process) وعملية الإزالة (Reverse Process)
&lt;/h3>&lt;p>تتكون المبادئ الأساسية لنموذج الانتشار من &amp;ldquo;Forward Process&amp;rdquo; الذي يضيف ضوضاء غاوسية تدريجياً إلى البيانات الأصلية (الصورة) حتى تتحول إلى ضوضاء كاملة، و &amp;ldquo;Reverse Process&amp;rdquo; الذي يستعيد الصورة الأصلية من تلك الضوضاء.&lt;/p>
&lt;p>يتم تعريف Forward Process كسلسلة ماركوف، ويتم التعبير عن الحالة $x_t$ في الخطوة $t$ بالمعادلة التالية:&lt;/p>
$$ q(x_t | x_{t-1}) = \mathcal{N}(x_t; \sqrt{1 - \beta_t} x_{t-1}, \beta_t I) $$
&lt;p>باستخدام خدعة إعادة المعلمة (Reparameterization trick)، يمكن حساب الحالة في أي خطوة $t$ مباشرة من الحالة الأولية $x_0$.&lt;/p>
$$ x_t = \sqrt{\bar{\alpha}_t} x_0 + \sqrt{1 - \bar{\alpha}_t} \epsilon $$
&lt;p>هنا، $\alpha_t = 1 - \beta_t$، و $\bar{\alpha}_t = \prod_{s=1}^t \alpha_s$، و $\epsilon \sim \mathcal{N}(0, I)$ هي ضوضاء تم أخذ عينات منها من التوزيع الطبيعي القياسي.&lt;/p>
&lt;p>في مرحلة توليد الصور، وهي Reverse Process، يتم استخدام شبكة عصبية (U-Net) $\epsilon_\theta$ للتنبؤ بالضوضاء المضافة وإزالتها. وتكون دالة الخسارة ببساطة كما يلي:&lt;/p>
$$ L_{simple} = \mathbb{E}_{x_0, \epsilon \sim \mathcal{N}(0, I), t} \left[ || \epsilon - \epsilon_\theta(\sqrt{\bar{\alpha}_t} x_0 + \sqrt{1 - \bar{\alpha}_t} \epsilon, t) ||^2 \right] $$
&lt;h3 id="22-تقليل-العبء-الحسابي-من-خلال-الفضاء-الكامن-latent-space">2.2 تقليل العبء الحسابي من خلال الفضاء الكامن (Latent Space)
&lt;/h3>&lt;p>إذا تم إجراء إزالة الضوضاء مباشرة في فضاء البكسل (Pixel Space)، فإن العبء الحسابي سيزداد بشكل تربيعي مع دقة الصورة، مما يجعله عملية ثقيلة جداً. يستخدم Stable Diffusion &lt;strong>الترميز التلقائي المتغير (VAE - Variational Autoencoder)&lt;/strong> لتحويل الصورة إلى &amp;ldquo;فضاء كامن&amp;rdquo; (Latent Space) مضغوط قبل معالجتها.&lt;/p>
&lt;p>يقوم المشفر $E$ بضغط صورة بدقة $H \times W \times 3$ إلى $z \in \mathbb{R}^{H/8 \times W/8 \times 4}$. نظراً لأن البعد المكاني يصبح الثمن، فإن العبء الحسابي لآلية الانتباه الذاتي (Self-Attention) يصبح $\mathcal{O}((\frac{H \times W}{64})^2)$، مما يؤدي إلى تحسن هائل في الأداء. بعد التوليد، يقوم مفكك التشفير $D$ باستعادة الصورة إلى فضاء البكسل كـ $\tilde{x} = D(z)$.&lt;/p>
&lt;h3 id="23-هيكلية-نظام-stable-diffusion">2.3 هيكلية نظام Stable Diffusion
&lt;/h3>&lt;p>يوضح مخطط Mermaid التالي عملية التوليد الشاملة في Stable Diffusion (توليد الصور من النص: txt2img).&lt;/p>
&lt;div class="mermaid">graph TD
A["إدخال المستخدم (نص التوجيه)"] --> B["مشفر النص (CLIP ViT-L/14)"]
B --> C["متجه التكييف (Conditioning)"]
D["ضوضاء عشوائية (Latent Space)"] --> E["U-Net (متنبئ الضوضاء)"]
C --> E
E --> F["المجدول (DDIM, Euler a وغيرها)"]
F --> D
F --> G["المتغيرات الكامنة المزالة الضوضاء"]
G --> H["مفكك التشفير VAE (Variational Autoencoder)"]
H --> I["الصورة النهائية المولدة (Pixel Space)"]&lt;/div>
&lt;hr>
&lt;h2 id="3-تحليل-شامل-لمتطلبات-الأجهزة">3. تحليل شامل لمتطلبات الأجهزة
&lt;/h2>&lt;p>في توليد الصور بالذكاء الاصطناعي محلياً، يعد اختيار الأجهزة الأمر الأكثر أهمية.&lt;/p>
&lt;h3 id="31-وحدة-معالجة-الرسومات-gpu">3.1 وحدة معالجة الرسومات (GPU)
&lt;/h3>&lt;p>إنها قلب معالجة الذكاء الاصطناعي. عند تشغيل Stable Diffusion في بيئة Windows، تعتبر وحدات معالجة الرسومات من NVIDIA هي المعيار الفعلي. على الرغم من أنه من الممكن تشغيله على AMD Radeon باستخدام ROCm، بالنظر إلى صعوبة إعداد البيئة على Windows واعتماد العديد من الإضافات على CUDA (بنية الحوسبة المتوازية من NVIDIA)، فليس من المبالغة القول إن NVIDIA هي الخيار الوحيد.&lt;/p>
&lt;ul>
&lt;li>&lt;strong>الحد الأدنى للمتطلبات&lt;/strong>: VRAM بسعة 6GB (مثل GTX 1060 6GB / RTX 2060). &lt;em>لكن سيكون هناك قيود كبيرة على الدقة والميزات.&lt;/em>&lt;/li>
&lt;li>&lt;strong>المتطلبات الموصى بها&lt;/strong>: VRAM بسعة 12GB (مثل RTX 3060 12GB / RTX 4070). هذا هو الحد الفاصل لتشغيل نماذج SDXL بسلاسة.&lt;/li>
&lt;li>&lt;strong>المتطلبات المثالية&lt;/strong>: VRAM بسعة 16GB إلى 24GB (RTX 4080 / RTX 3090 / RTX 4090). هذا ضروري لتوليد صور عالية الدقة، والاستخدام المتزامن لـ ControlNet المعقدة، وتدريب النماذج محلياً (مثل LoRA).&lt;/li>
&lt;/ul>
&lt;h3 id="32-الذاكرة-ram-ومساحة-التخزين">3.2 الذاكرة (RAM) ومساحة التخزين
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>RAM (ذاكرة الوصول العشوائي)&lt;/strong>: يوصى بشدة باستخدام 32GB أو أكثر. عند نقل النماذج (التي يتراوح حجمها من عدة غيغابايت إلى عشرات الغيغابايت) من مساحة التخزين إلى VRAM، يتم استخدام ذاكرة النظام RAM مؤقتاً. إذا كانت الذاكرة غير كافية، سيتم استخدام ملفات المبادلة (Page files)، مما يؤدي إلى انخفاض حاد في السرعة.&lt;/li>
&lt;li>&lt;strong>مساحة التخزين&lt;/strong>: من الضروري استخدام NVMe M.2 SSD. تبلغ سعة نماذج الذكاء الاصطناعي الحالية (Checkpoints) حوالي 2GB إلى 7GB لكل منها. إذا استخدمت محرك أقراص صلبة HDD، فقد يستغرق تحميل النموذج وحده عدة دقائق، وهو أمر غير عملي.&lt;/li>
&lt;/ul>
&lt;hr>
&lt;h2 id="4-إعداد-البرامج-الأساسية-إصدار-windows">4. إعداد البرامج الأساسية (إصدار Windows)
&lt;/h2>&lt;p>قبل تثبيت الأداة نفسها، سنقوم بإعداد البرامج الأساسية المطلوبة.&lt;/p>
&lt;h3 id="41-تثبيت-python">4.1 تثبيت Python
&lt;/h3>&lt;p>تتم كتابة معظم أدوات الذكاء الاصطناعي بلغة Python. سنقوم بتثبيت &lt;strong>Python 3.10.6&lt;/strong>، والذي يتمتع بأعلى توافق مع Stable Diffusion WebUI وما شابه (الإصدارات الأحدث قد تتسبب في كسر التبعيات مثل PyTorch).&lt;/p>
&lt;ol>
&lt;li>قم بتنزيل &lt;code>python-3.10.6-amd64.exe&lt;/code> من أرشيف Python الرسمي.&lt;/li>
&lt;li>عند تشغيل المثبت، تأكد من وضع علامة على &lt;strong>&amp;ldquo;Add Python 3.10 to PATH&amp;rdquo;&lt;/strong> الموجودة في الأسفل.&lt;/li>
&lt;li>في شاشة اكتمال التثبيت، انقر على &lt;strong>&amp;ldquo;Disable path length limit&amp;rdquo;&lt;/strong> (تعطيل حد طول المسار). (هام: إذا لم تقم بإلغاء قيود مسار Windows المكونة من 260 حرفاً، ستحدث أخطاء في مكتبات التبعية العميقة).&lt;/li>
&lt;/ol>
&lt;h3 id="42-تثبيت-git-for-windows">4.2 تثبيت Git for Windows
&lt;/h3>&lt;p>أنت بحاجة إلى Git للحصول على التعليمات البرمجية المصدرية والنماذج من GitHub.&lt;/p>
&lt;ol>
&lt;li>قم بتنزيل المثبت من الموقع الرسمي لـ Git for Windows، وقم بتثبيته باستخدام الإعدادات الافتراضية.&lt;/li>
&lt;/ol>
&lt;h3 id="43-إعداد-cuda-toolkit-و-cudnn">4.3 إعداد CUDA Toolkit و cuDNN
&lt;/h3>&lt;p>نظراً لأن أحدث إصدارات PyTorch تقوم بتضمين وتنزيل ثنائيات CUDA الضرورية أثناء التثبيت، لم يعد من الضروري تثبيت CUDA Toolkit على النظام بأكمله. ومع ذلك، إذا كنت تستخدم إضافات مخصصة (مثل بناء TensorRT أو xFormers)، فمن المستحسن تثبيت &lt;strong>CUDA Toolkit 11.8&lt;/strong> أو &lt;strong>12.1&lt;/strong> (حسب إصدار PyTorch المستخدم) من موقع NVIDIA الرسمي.&lt;/p>
&lt;hr>
&lt;h2 id="5-خطوات-بناء-الواجهات-الأمامية-الثلاث-الكبرى">5. خطوات بناء الواجهات الأمامية الثلاث الكبرى
&lt;/h2>&lt;p>سنشرح كيفية بناء أدوات توليد الصور بالذكاء الاصطناعي الثلاثة السائدة حالياً. استخدم الأداة المناسبة وفقاً لأهدافك ومهاراتك.&lt;/p>
&lt;h3 id="51-بناء-automatic1111-stable-diffusion-webui">5.1 بناء AUTOMATIC1111 Stable Diffusion WebUI
&lt;/h3>&lt;p>هي الأداة الأكثر عراقة، وغنية بالإضافات، وتعد أداة شاملة تتيح إجراء تعديلات دقيقة على المعلمات.&lt;/p>
&lt;p>&lt;strong>خطوات التثبيت:&lt;/strong>&lt;/p>
&lt;ol>
&lt;li>افتح موجه الأوامر في أي دليل (مثال: &lt;code>C:\work\ai&lt;/code>).&lt;/li>
&lt;li>قم بتنفيذ الأمر التالي لاستنساخ المستودع:
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-cmd" data-lang="cmd">&lt;span class="line">&lt;span class="cl">git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;/li>
&lt;li>انقر بزر الماوس الأيمن على &lt;code>webui-user.bat&lt;/code> في الدليل المستنسخ وافتحه في وضع التحرير.&lt;/li>
&lt;li>لتحسين الأداء، قم بضبط وسيطات التشغيل &lt;code>COMMANDLINE_ARGS&lt;/code> كما يلي:
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bat" data-lang="bat">&lt;span class="line">&lt;span class="cl">&lt;span class="k">set&lt;/span> &lt;span class="nv">COMMANDLINE_ARGS&lt;/span>&lt;span class="p">=&lt;/span>--xformers --opt-sdp-attention --theme dark
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;/li>
&lt;li>انقر نقراً مزدوجاً على &lt;code>webui-user.bat&lt;/code> لتشغيله. في المرة الأولى، قد يستغرق الأمر عدة دقائق حسب بيئتك، حيث يتم تنزيل مكتبات ضخمة مثل PyTorch.&lt;/li>
&lt;li>عند الانتهاء، ستظهر رسالة &lt;code>Running on local URL: http://127.0.0.1:7860&lt;/code>، يمكنك الوصول إليها عبر المتصفح.&lt;/li>
&lt;/ol>
&lt;h3 id="52-بناء-comfyui-ومزايا-الاعتماد-على-العقد-node-based">5.2 بناء ComfyUI ومزايا الاعتماد على العقد (Node-based)
&lt;/h3>&lt;p>ComfyUI هي واجهة مستخدم تربط عملية التوليد بصرياً من خلال كتل تسمى &amp;ldquo;عقد&amp;rdquo; (Node-based). إدارة VRAM فيها ممتازة جداً، وغالباً ما تعمل في بيئات قد تواجه فيها AUTOMATIC1111 نقصاً في الذاكرة.&lt;/p>
&lt;div class="mermaid">graph TD
subgraph "ComfyUI Workflow Example"
A["تحميل النموذج (Load Checkpoint)"] --> B["تشفير نص CLIP (إيجابي)"]
A --> C["تشفير نص CLIP (سلبي)"]
A --> D["صورة كامنة فارغة (Empty Latent Image)"]
B --> E["KSampler (أخذ العينات)"]
C --> E
D --> E
A --> F["VAEDecode"]
E --> F
F --> G["حفظ الصورة (Save Image)"]
end&lt;/div>
&lt;p>&lt;strong>خطوات التثبيت:&lt;/strong>&lt;/p>
&lt;ol>
&lt;li>قم بتنزيل ملف 7z لإصدار Windows Standalone من صفحة إصدارات GitHub الرسمية لـ ComfyUI.&lt;/li>
&lt;li>قم بفك ضغطه، وقم بتشغيل &lt;code>run_nvidia_gpu.bat&lt;/code> الموجود بداخله لبدء التشغيل (لا يتطلب إعداداً لأنه إصدار محمول يتضمن Python).&lt;/li>
&lt;li>&lt;strong>تثبيت ComfyUI Manager&lt;/strong>: ضروري لإدارة الإضافات. افتح موجه الأوامر في دليل &lt;code>ComfyUI/custom_nodes/&lt;/code>، وقم بتنفيذ ما يلي:
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-cmd" data-lang="cmd">&lt;span class="line">&lt;span class="cl">git clone https://github.com/ltdrdata/ComfyUI-Manager.git
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>عند إعادة التشغيل، سيظهر زر &amp;ldquo;Manager&amp;rdquo; في أسفل يمين واجهة المستخدم، ومن هنا يمكنك تثبيت العديد من العقد المخصصة.&lt;/li>
&lt;/ol>
&lt;h3 id="53-بناء-fooocus-توليد-صور-عالية-الجودة-للمبتدئين">5.3 بناء Fooocus: توليد صور عالية الجودة للمبتدئين
&lt;/h3>&lt;p>Fooocus هي واجهة مستخدم تم تصميمها بهدف &amp;ldquo;إنتاج صور مذهلة حتى مع مطالبات قصيرة&amp;rdquo; مثل Midjourney. تم ضبطها خصيصاً لنماذج SDXL، وتقوم تلقائياً بتوسيع المطالبات بناءً على GPT-2 وتنفيذ خطوط أنابيب معقدة داخلياً.&lt;/p>
&lt;p>&lt;strong>خطوات التثبيت:&lt;/strong>&lt;/p>
&lt;ol>
&lt;li>قم بتنزيل حزمة إصدار Windows من GitHub الرسمي لـ Fooocus وقم بفك ضغطها.&lt;/li>
&lt;li>قم بتشغيل &lt;code>run.bat&lt;/code>. سيتم تنزيل نماذج SDXL ممتازة مثل Juggernaut XL تلقائياً، وستكون جاهزاً للبدء في توليد صور عالية الجودة على الفور.&lt;/li>
&lt;li>من خلال وضع علامة على &amp;ldquo;Advanced&amp;rdquo; (متقدم)، يمكنك أيضاً استخدام الميزات المتقدمة مثل Image Prompt (موجه الصورة) و Inpainting.&lt;/li>
&lt;/ol>
&lt;hr>
&lt;h2 id="6-فهم-إدارة-النماذج-وهيكل-البيانات">6. فهم إدارة النماذج وهيكل البيانات
&lt;/h2>&lt;p>تعتمد جودة توليد الصور بالذكاء الاصطناعي بشكل كامل على النموذج (البيانات المدربة) المستخدم.&lt;/p>
&lt;h3 id="61-نقاط-التحقق-checkpoints---النماذج-الأساسية">6.1 نقاط التحقق (Checkpoints - النماذج الأساسية)
&lt;/h3>&lt;p>هي النماذج الرئيسية التي تشكل جوهر توليد الصور. في الماضي، كانت صيغة &lt;code>.ckpt&lt;/code> (تنسيق Pickle) هي السائدة، ولكنها كانت تحتوي على ثغرة تسمح بتنفيذ تعليمات Python عشوائية (Arbitrary Code Execution). حالياً، أصبحت صيغة &lt;strong>&lt;code>.safetensors&lt;/code>&lt;/strong> هي المعيار، حيث تضمن الأمان وتتيح تحميل البيانات من القرص إلى الذاكرة دون نسخ (mmap). لا تقم أبداً بتنزيل ملفات &lt;code>.ckpt&lt;/code> مجهولة المصدر.&lt;/p>
&lt;h3 id="62-السلوك-الرياضي-لـ-lora-التكيف-منخفض-الرتبة---low-rank-adaptation">6.2 السلوك الرياضي لـ LoRA (التكيف منخفض الرتبة - Low-Rank Adaptation)
&lt;/h3>&lt;p>LoRA هي تقنية تتجنب الموارد الحسابية الهائلة المطلوبة للضبط الدقيق للنموذج الكامل (Fine-tuning)، وتسمح بتعلم إضافي لشخصيات أو أساليب رسم معينة.&lt;/p>
&lt;p>بدلاً من التحديث المباشر لمصفوفة الوزن $W_0 \in \mathbb{R}^{d \times k}$ التي تحتوي على مليارات المعلمات، يقدم LoRA مصفوفتين منخفضتي الرتبة $A \in \mathbb{R}^{r \times k}$ و $B \in \mathbb{R}^{d \times r}$ (حيث تكون الرتبة $r \ll \min(d, k)$). يتم حساب الوزن الجديد على النحو التالي:&lt;/p>
$$ W = W_0 + \Delta W = W_0 + B A $$
&lt;p>ونتيجة لذلك، ينخفض عدد المعلمات التي يتم تعلمها وحفظها بشكل كبير من $d \times k$ إلى $r \times (d + k)$، مما يتيح تطبيق أساليب قوية باستخدام ملفات خفيفة الوزن لا تتجاوز بضع مئات من الميغابايت.&lt;/p>
&lt;h3 id="63-الترميز-التلقائي-المتغير-vae---variational-autoencoder">6.3 الترميز التلقائي المتغير (VAE - Variational Autoencoder)
&lt;/h3>&lt;p>كما ذكرنا سابقاً، هذا هو النموذج الذي يحول بين الفضاء الكامن وفضاء البكسل. في نماذج الرسوم المتحركة (الأنمي)، إذا لم يتم إعداد VAE بشكل صحيح، قد يتم إخراج صور باهتة وذات تباين منخفض، تُعرف بـ &amp;ldquo;الصور النائمة&amp;rdquo;. قم بوضع VAE مخصص للأنمي مثل &lt;code>kl-f8-anime2.ckpt&lt;/code> في مجلد &lt;code>models/VAE&lt;/code> وتطبيقه.&lt;/p>
&lt;h3 id="64-مثال-على-هيكل-الدليل-automatic1111">6.4 مثال على هيكل الدليل (AUTOMATIC1111)
&lt;/h3>&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;span class="lnt">6
&lt;/span>&lt;span class="lnt">7
&lt;/span>&lt;span class="lnt">8
&lt;/span>&lt;span class="lnt">9
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-text" data-lang="text">&lt;span class="line">&lt;span class="cl">stable-diffusion-webui/
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">├── models/
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ ├── Stable-diffusion/ &amp;lt;-- وضع Checkpoints (.safetensors) هنا
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ ├── Lora/ &amp;lt;-- وضع نماذج LoRA هنا
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ ├── VAE/ &amp;lt;-- وضع نماذج VAE هنا
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">│ └── ControlNet/ &amp;lt;-- وضع نماذج ControlNet هنا
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">├── embeddings/ &amp;lt;-- وضع Textual Inversion (ملفات PT) هنا
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">├── extensions/ &amp;lt;-- الإضافات المستنسخة عبر Git
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">└── webui-user.bat &amp;lt;-- ملف دفعي للتشغيل
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;hr>
&lt;h2 id="7-تحسين-vram-وضبط-الأداء">7. تحسين VRAM وضبط الأداء
&lt;/h2>&lt;p>هذه تقنيات لتجنب &amp;ldquo;نقص VRAM (CUDA Out Of Memory)&amp;quot;، والذي يعد العائق الأكبر في التوليد المحلي، وزيادة سرعة التوليد إلى أقصى حد.&lt;/p>
&lt;h3 id="71-تحسين-آلية-الانتباه-xformers--sdp-attention">7.1 تحسين آلية الانتباه (xFormers / SDP Attention)
&lt;/h3>&lt;p>يتم استهلاك معظم العمليات الحسابية في Stable Diffusion في Cross-Attention داخل U-Net. نظراً لأن حساب الانتباه الافتراضي يستهلك قدراً كبيراً من الذاكرة، يتم تحسينه باستخدام النهج التالي:&lt;/p>
&lt;ul>
&lt;li>&lt;strong>xFormers (&lt;code>--xformers&lt;/code>)&lt;/strong>: تطبيق انتباه فعال من حيث الذاكرة طورته شركة Meta. يقلل بشكل كبير من استهلاك VRAM ويحسن السرعة، ولكنه يتميز بـ &amp;ldquo;إنتاج صور مختلفة قليلاً حتى مع نفس قيمة البذرة (Seed)&amp;rdquo; بسبب عدم الحتمية في الحساب.&lt;/li>
&lt;li>&lt;strong>SDP Attention (&lt;code>--opt-sdp-attention&lt;/code>)&lt;/strong>: Scaled Dot Product Attention المضمن بشكل قياسي في PyTorch 2.0. يتميز بنفس سرعة وتأثير تقليل VRAM مثل xFormers، مع ميزة وجود تبعيات أقل. هناك أيضاً متغيرات مثل &lt;code>--opt-sub-quad-attention&lt;/code> التي لا تعاني من عدم الحتمية.&lt;/li>
&lt;/ul>
&lt;h3 id="72-خيارات-التشغيل-لتوفير-vram">7.2 خيارات التشغيل لتوفير VRAM
&lt;/h3>&lt;ul>
&lt;li>&lt;code>--medvram&lt;/code>: للبيئات ذات VRAM تتراوح بين 6GB إلى 8GB. يقوم بتقسيم معالجة U-Net وتوفير الذاكرة، لكن السرعة تنخفض قليلاً.&lt;/li>
&lt;li>&lt;code>--lowvram&lt;/code>: للبيئات ذات VRAM 4GB أو أقل. نظراً لأنه ينقل الوحدات داخل وخارج VRAM بشكل متكرر، فإن السرعة تنخفض بشكل حاد ولكن يمكن تشغيله بالقوة.&lt;/li>
&lt;li>&lt;code>--medvram-sdxl&lt;/code>: علامة مفيدة جداً تطبق MedVRAM فقط عند استخدام نماذج SDXL.&lt;/li>
&lt;/ul>
&lt;h3 id="73-تسريع-فائق-السرعة-باستخدام-tensorrt">7.3 تسريع فائق السرعة باستخدام TensorRT
&lt;/h3>&lt;p>&lt;strong>TensorRT&lt;/strong> هو إطار عمل للاستفادة القصوى من نوى Tensor في وحدات معالجة الرسومات NVIDIA.
يقوم بتجميع U-Net الخاص بـ Stable Diffusion كمحرك مخصص لوحدة معالجة الرسومات المستخدمة (ملف &lt;code>.trt&lt;/code>). يستغرق التجميع عشرات الدقائق، وهناك عيوب تتمثل في ثبات الدقة وحجم الدفعة (يمكن استخدام Dynamic Shape ولكن تنخفض الكفاءة)، إلا أن سرعة التوليد تقفز لتصبح &lt;strong>من 1.5 إلى أكثر من ضعفين&lt;/strong>. إنها أقوى طريقة تحسين للاستخدام التجاري الذي يتطلب توليد عدد كبير من الصور بنفس الدقة.&lt;/p>
&lt;h3 id="74-tiled-vae--tiled-diffusion">7.4 Tiled VAE / Tiled Diffusion
&lt;/h3>&lt;p>عند توليد أو رفع دقة صور عالية الجودة (مثل 4K)، تستنفد عملية فك التشفير في VAE كل مساحة VRAM دفعة واحدة. لمنع ذلك، من الضروري استخدام إضافات (Multidiffusion / Tiled VAE) تقوم بتقسيم الصورة إلى بلاطات (على سبيل المثال، $512 \times 512$) ومعالجتها، ثم دمجها في النهاية.&lt;/p>
&lt;hr>
&lt;h2 id="8-تقنية-التحكم-المتقدمة-controlnet">8. تقنية التحكم المتقدمة: ControlNet
&lt;/h2>&lt;p>باستخدام المطالبات النصية فقط، من المستحيل تحديد وضعيات الشخصيات، والمنظور المعقد، والحركات الدقيقة لأطراف الأصابع. لحل هذه المشكلة تم ابتكار &lt;strong>ControlNet&lt;/strong>.&lt;/p>
&lt;p>تمتلك ControlNet هيكلية تثبت أوزان نموذج Stable Diffusion المدرب وتنسخ هيكل المشفر، مع إدخال &amp;ldquo;Zero-convolutions&amp;rdquo; (طبقات التفافية تمت تهيئة أوزانها بالصفر). وهذا يسمح بتوفير شروط إضافية دون تدمير قدرات التوليد الأصلية.&lt;/p>
&lt;p>&lt;strong>أبرز المعالجات المسبقة والنماذج:&lt;/strong>&lt;/p>
&lt;ul>
&lt;li>&lt;strong>OpenPose&lt;/strong>: يستخرج هيكل الشخص (مواضع المفاصل) ويولد صورة بنفس الوضعية تماماً.&lt;/li>
&lt;li>&lt;strong>Canny&lt;/strong>: يقوم باكتشاف الحواف، ويعتمد على الرسم الخطي للتلوين أو تحويله إلى صورة واقعية.&lt;/li>
&lt;li>&lt;strong>Depth&lt;/strong>: يولد خريطة عمق (Depth Map)، وينتج صورة تحافظ على العلاقات المكانية الأمامية والخلفية.&lt;/li>
&lt;li>&lt;strong>Lineart&lt;/strong>: يتفوق على Canny في استخراج الرسومات الخطية بأسلوب الأنمي.&lt;/li>
&lt;/ul>
&lt;p>من خلال تطبيق عدة ControlNet معاً في وقت واحد (Multi-ControlNet)، يصبح من الممكن إنتاج &amp;ldquo;صورة بوضعية محددة مع منظور خلفية محدد&amp;rdquo; بشكل مؤكد.&lt;/p>
&lt;hr>
&lt;h2 id="9-استكشاف-الأخطاء-وإصلاحها-الأسئلة-الشائعة">9. استكشاف الأخطاء وإصلاحها (الأسئلة الشائعة)
&lt;/h2>&lt;p>إليك الأخطاء الشائعة وحلولها أثناء بناء وتشغيل البيئة المحلية.&lt;/p>
&lt;h3 id="سؤال-1-يتوقف-التوليد-وتظهر-رسالة-خطأ-cuda-out-of-memory">سؤال 1: يتوقف التوليد وتظهر رسالة خطأ &lt;code>CUDA out of memory.&lt;/code>
&lt;/h3>&lt;p>&lt;strong>جواب 1:&lt;/strong> هناك نقص في VRAM. قم بتقليل دقة التوليد، أو تعيين حجم الدفعة إلى 1. أيضاً في حالة استخدام A1111، أضف &lt;code>--xformers&lt;/code> و &lt;code>--medvram&lt;/code> إلى &lt;code>webui-user.bat&lt;/code> وأعد التشغيل. إذا كنت ترغب في استخدام رفع الدقة (Hires. fix)، فاستخدم ترقيات من عائلة ESRGAN مثل R-ESRGAN بدلاً من عائلة Latent لتقليل استهلاك VRAM.&lt;/p>
&lt;h3 id="سؤال-2-الصور-المولدة-سوداء-تماما-أو-مليئة-بالضوضاء">سؤال 2: الصور المولدة سوداء تماماً أو مليئة بالضوضاء.
&lt;/h3>&lt;p>&lt;strong>جواب 2:&lt;/strong> هذه ظاهرة تحدث عندما تظهر قيم NaN (Not a Number) أثناء الحساب وينهار الموتر (Tensor). يرجى اتخاذ الخطوات التالية:&lt;/p>
&lt;ol>
&lt;li>أضف &lt;code>--no-half-vae&lt;/code> إلى خيارات التشغيل لجعل VAE يحسب بدقة أحادية (FP32) فقط.&lt;/li>
&lt;li>أضف &lt;code>--disable-nan-check&lt;/code> إلى خيارات التشغيل (هذا ليس حلاً جذرياً).&lt;/li>
&lt;li>قد لا يكون حساب FP16 مناسباً للنموذج المستخدم (خاصة عائلة SD 2.1)، لذا جرب وضع الدقة الكاملة.&lt;/li>
&lt;/ol>
&lt;h3 id="سؤال-3-تظهر-أخطاء-python-أو-git-عند-تشغيل-webui-userbat">سؤال 3: تظهر أخطاء Python أو Git عند تشغيل &lt;code>webui-user.bat&lt;/code>.
&lt;/h3>&lt;p>&lt;strong>جواب 3:&lt;/strong> يُشتبه في وجود عدم توافق في مكتبات التبعية. قم بحذف مجلد &lt;code>venv&lt;/code> داخل دليل WebUI بالكامل، ثم قم بتشغيل &lt;code>webui-user.bat&lt;/code> مرة أخرى. سيتم إعادة بناء البيئة الافتراضية في حالة نظيفة (سيحدث إعادة تنزيل لعدة غيغابايت).&lt;/p>
&lt;h3 id="سؤال-4-قمت-بتنزيل-نموذج-safetensors-ولكنه-لا-يظهر-في-القائمة">سؤال 4: قمت بتنزيل نموذج (Safetensors) ولكنه لا يظهر في القائمة.
&lt;/h3>&lt;p>&lt;strong>جواب 4:&lt;/strong> بعد وضعه في مجلد &lt;code>models/Stable-diffusion&lt;/code>، انقر على زر &amp;ldquo;تحديث (Refresh)&amp;rdquo; المجاور للقائمة المنسدلة لاختيار Checkpoint على واجهة المستخدم. إذا قمت بوضعه في مجلد فرعي، فتحقق من صحة الامتداد.&lt;/p>
&lt;hr>
&lt;h2 id="10-خاتمة-مستقبل-توليد-الصور-بالذكاء-الاصطناعي-وتفوق-البيئة-المحلية">10. خاتمة: مستقبل توليد الصور بالذكاء الاصطناعي وتفوق البيئة المحلية
&lt;/h2>&lt;p>تستمر حركة توليد الصور بالذكاء الاصطناعي مفتوحة المصدر، التي بدأت مع Stable Diffusion، في التطور نحو بنيات الجيل التالي مثل SDXL و Stable Diffusion 3 و Flux.1. لقد تضخم عدد معلمات النماذج من مليارات إلى عشرات المليارات، وفي المستقبل سيكون هناك طلب أكبر على بيئات وحدات معالجة الرسومات بذاكرة VRAM بسعة 24GB أو أكثر.&lt;/p>
&lt;p>ومع ذلك، فإن تقنيات التحسين المحلية مثل TensorRT وتقنيات التكميم (Quantization) و GGUF تعمل أيضاً على تسريع وتيرة تطورها، ويتشكل نظام بيئي يسمح بالاستدلال الكافي حتى على الأجهزة المخصصة للمستهلكين العاديين.&lt;/p>
&lt;p>إن فهم إعداد بيئة CUDA، وتحسين VRAM، وخطوط الأنابيب مثل ComfyUI المشروحة في هذا الدليل، ستشكل معرفة أساسية عالمية تظل صالحة بغض النظر عن كيفية تغير اتجاهات تكنولوجيا الذكاء الاصطناعي. نأمل أن يتم إطلاق العنان لإبداعك إلى أقصى حد في بيئة محلية خالية من القيود.&lt;/p></description></item></channel></rss>