<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Ollama on kenji.blog</title><link>http://kenji.blog/pt/tags/ollama/</link><description>Recent content in Ollama on kenji.blog</description><generator>Hugo -- gohugo.io</generator><language>pt</language><copyright>kenjinote</copyright><lastBuildDate>Fri, 11 Sep 2026 10:00:00 +0900</lastBuildDate><atom:link href="http://kenji.blog/pt/tags/ollama/index.xml" rel="self" type="application/rss+xml"/><item><title>【Atualizado em 2026】Guia Completo para Executar LLM Local em Ambiente Windows</title><link>http://kenji.blog/pt/p/local-llm-windows-2026/</link><pubDate>Fri, 11 Sep 2026 10:00:00 +0900</pubDate><guid>http://kenji.blog/pt/p/local-llm-windows-2026/</guid><description>&lt;img src="http://kenji.blog/p/local-llm-windows-2026/img/eyecatch.jpg" alt="Featured image of post 【Atualizado em 2026】Guia Completo para Executar LLM Local em Ambiente Windows" />&lt;h1 id="1-introdução-por-que-llm-local-no-windows-agora">1. Introdução: Por que LLM Local no Windows agora?
&lt;/h1>&lt;p>Em 2026, a evolução da IA generativa e dos Grandes Modelos de Linguagem (LLM) está mostrando uma grande mudança de paradigma de serviços gigantescos de API na nuvem para &amp;ldquo;LLMs Locais&amp;rdquo; rodando em PCs pessoais ou ambientes locais (on-premises). IAs na nuvem como o GPT-5 da OpenAI e o Claude 3.5 da Anthropic são extremamente poderosas, mas nem todas as empresas ou indivíduos podem enviar todos os seus dados para a nuvem. Do ponto de vista de privacidade, segurança, latência e custos sustentáveis a longo prazo, a demanda por LLMs locais explodiu como nunca antes.&lt;/p>
&lt;p>Particularmente no ambiente Windows, a evolução do ecossistema de LLM local tem sido notável. Até poucos anos atrás, &amp;ldquo;Desenvolvimento e execução de IA significa Linux&amp;rdquo; era o senso comum, mas em 2026, o Windows se transformou em uma plataforma de IA extremamente poderosa e acessível.&lt;/p>
&lt;p>Neste artigo, com base nas últimas tendências tecnológicas de 2026, forneceremos um guia completo para construir, operar e otimizar LLMs locais em ambientes Windows. Explicaremos detalhadamente, com um volume esmagador, desde configurações simples com o Ollama para iniciantes, passando por otimizações extremas usando o llama.cpp para usuários avançados, até abordagens matemáticas para cálculo de VRAM, compreensão profunda da arquitetura e fine-tuning local.&lt;/p>
&lt;h2 id="11-tendências-tecnológicas-de-llm-local-em-2026">1.1 Tendências Tecnológicas de LLM Local em 2026
&lt;/h2>&lt;p>As principais tendências que moldam o atual ecossistema de LLM local são as seguintes:&lt;/p>
&lt;ol>
&lt;li>&lt;strong>Adoção total do formato GGUF&lt;/strong>: O GGUF (GPT-Generated Unified Format), que integra metadados e tensores em um único arquivo, tornou-se completamente o padrão de fato. Isso permite a execução em qualquer ambiente apenas baixando um único arquivo do Hugging Face.&lt;/li>
&lt;li>&lt;strong>Democratização da arquitetura MoE (Mixture of Experts)&lt;/strong>: Vários modelos MoE pequenos, porém de alto desempenho, foram lançados. Ao ativar apenas alguns especialistas durante a inferência, eles alcançam um desempenho comparável ao de modelos gigantes, mantendo a carga computacional baixa em PCs de consumo.&lt;/li>
&lt;li>&lt;strong>Abstração avançada e otimização de motores de inferência&lt;/strong>: Ferramentas como Ollama, LM Studio e AnythingLLM foram refinadas, eliminando a necessidade de os usuários se preocuparem com dependências complexas, como a instalação de drivers CUDA. Além disso, o suporte nativo do FlashAttention 3 para Windows melhorou drasticamente a velocidade de inferência.&lt;/li>
&lt;li>&lt;strong>Utilização da NPU e a ascensão dos PCs Windows Copilot+&lt;/strong>: Mesmo em laptops sem GPU, a tecnologia para executar pequenos LLMs (SLMs: Small Language Models) com baixo consumo de energia usando a NPU (Neural Processing Unit) integrada entrou em fase prática.&lt;/li>
&lt;/ol>
&lt;hr>
&lt;h1 id="2-requisitos-de-hardware-e-preparação-do-so">2. Requisitos de Hardware e Preparação do SO
&lt;/h1>&lt;p>Para que um LLM local opere em uma velocidade prática (15 a 30+ tokens por segundo), a escolha do hardware é o fator mais importante.&lt;/p>
&lt;h2 id="21-configuração-de-hardware-recomendada">2.1 Configuração de Hardware Recomendada
&lt;/h2>&lt;p>Com a evolução dos AI PCs, as especificações exigidas também estão mudando.&lt;/p>
&lt;ul>
&lt;li>&lt;strong>SO&lt;/strong>: Windows 11 Pro (24H2 ou posterior). Essencial para utilizar as funções completas do WSL2, gerenciamento avançado de memória e as APIs mais recentes do DirectML.&lt;/li>
&lt;li>&lt;strong>CPU&lt;/strong>: Série Intel Core Ultra 200 ou superior, ou série AMD Ryzen 9000 ou superior. Quando usado em conjunto com inferência de CPU, a comunicação de memória de alta largura de banda é indispensável.&lt;/li>
&lt;li>&lt;strong>RAM&lt;/strong>: Mínimo de 32GB, recomendado 64GB ou mais. A largura de banda da memória principal (MB/s) torna-se o gargalo decisivo durante a inferência na CPU ou offloading. Memória de alta velocidade, como DDR5-6000 ou superior, é o ideal.&lt;/li>
&lt;li>&lt;strong>GPU&lt;/strong>: Séries NVIDIA RTX 4000/5000. O que mais importa para LLMs locais não é o desempenho de processamento, mas sim a &amp;ldquo;Capacidade de VRAM&amp;rdquo;.
&lt;ul>
&lt;li>&lt;strong>Entrada&lt;/strong>: RTX 4060 Ti (versão de 16GB) - Melhor custo-benefício. Ideal para modelos na classe de 8B a 14B.&lt;/li>
&lt;li>&lt;strong>Intermediário&lt;/strong>: RTX 4070 Ti SUPER (16GB) / RTX 4080 SUPER (16GB)&lt;/li>
&lt;li>&lt;strong>High-end&lt;/strong>: RTX 4090 (24GB) / RTX 5090 (32GB) - Necessário para rodar modelos quantizados na classe de 30B a 70B.&lt;/li>
&lt;/ul>
&lt;/li>
&lt;li>&lt;strong>Armazenamento&lt;/strong>: NVMe SSD PCIe Gen4 ou Gen5. Reduz drasticamente o tempo de carregamento de dezenas de GB de modelos.&lt;/li>
&lt;/ul>
&lt;h2 id="22-configuração-do-wsl2-windows-subsystem-for-linux-2">2.2 Configuração do WSL2 (Windows Subsystem for Linux 2)
&lt;/h2>&lt;p>Embora muitas ferramentas GUI funcionem nativamente no Windows, o WSL2 é extremamente útil para desenvolvimento com Python, compilação de ferramentas mais recentes e para o fine-tuning LoRA mencionado posteriormente. Nos ambientes Windows 11 mais recentes, você pode usar GPUs (CUDA) de forma transparente no WSL2 apenas instalando o driver da NVIDIA no host.&lt;/p>
&lt;p>Abra o PowerShell com privilégios de administrador e execute o seguinte:&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-powershell" data-lang="powershell">&lt;span class="line">&lt;span class="cl">&lt;span class="c"># Instalação do WSL2 e do Ubuntu mais recente&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">wsl&lt;/span> &lt;span class="p">-&lt;/span>&lt;span class="n">-install&lt;/span> &lt;span class="n">-d&lt;/span> &lt;span class="n">Ubuntu&lt;/span>&lt;span class="p">-&lt;/span>&lt;span class="mf">24.04&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c"># Atualização do kernel&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">wsl&lt;/span> &lt;span class="p">-&lt;/span>&lt;span class="n">-update&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Após a instalação, execute &lt;code>nvidia-smi&lt;/code> no terminal do WSL2; se a GPU for reconhecida corretamente, a configuração foi bem-sucedida.&lt;/p>
&lt;hr>
&lt;h1 id="3-arquitetura-de-llm-local-e-mecanismo-de-inferência">3. Arquitetura de LLM Local e Mecanismo de Inferência
&lt;/h1>&lt;p>Compreender a estrutura interna de como o modelo gera texto em um ambiente local é extremamente útil para solução de problemas e otimização.&lt;/p>
&lt;p>O diagrama Mermaid abaixo mostra um pipeline típico de inferência de LLM local.&lt;/p>
&lt;div class="mermaid">graph TD
User["Entrada do usuário (Prompt)"] --> Tokenizer["Tokenizador (Tokenizer)"]
Tokenizer --> Embedding["Camada de Embedding (Embedding)"]
subgraph "Transformer Block (x Layers)"
Embedding --> Attn["Autoatenção (Self-Attention)"]
Attn --> KVCache["Cache KV (Retenção Key/Value)"]
Attn --> FFN["Rede Feed-Forward (FFN)"]
end
FFN --> Logits["Cálculo de Logits (Logits)"]
Logits --> Sampler["Amostrador (Temperature, Top-K, Top-P)"]
Sampler --> OutputToken["Token de saída"]
OutputToken --> |"Geração autorregressiva"| Tokenizer
OutputToken --> Decoder["Detokenizador (Detokenizer)"]
Decoder --> FinalOutput["Texto de saída final"]&lt;/div>
&lt;h2 id="31-duas-fases-prefill-e-decode">3.1 Duas Fases: Prefill e Decode
&lt;/h2>&lt;p>A geração de texto do LLM é dividida em duas fases com características computacionais diferentes.&lt;/p>
&lt;ol>
&lt;li>&lt;strong>Fase Prefill (Processamento de Prompt)&lt;/strong>: A fase onde todo o prompt inserido é processado e compreendido de uma só vez. Devido à possibilidade de cálculo paralelo, a capacidade de cálculo da GPU (FLOPS) está diretamente ligada à velocidade. Se o prompt for longo, esta fase pode levar alguns segundos.&lt;/li>
&lt;li>&lt;strong>Fase Decode (Geração de Tokens)&lt;/strong>: A fase onde se prevê um token de cada vez, que é repassado como próxima entrada (autorregressivo). Nesta fase, o cálculo paralelo é limitado, portanto a largura de banda de memória VRAM da GPU (Memory Bandwidth) se torna um gargalo decisivo.&lt;/li>
&lt;/ol>
&lt;hr>
&lt;h1 id="4-cálculo-do-consumo-de-vram-e-compreensão-matemática-do-tamanho-do-modelo">4. Cálculo do Consumo de VRAM e Compreensão Matemática do Tamanho do Modelo
&lt;/h1>&lt;p>Para julgar corretamente &amp;ldquo;quais modelos rodam no meu PC?&amp;rdquo;, é necessário entender a fórmula de cálculo da VRAM. Se a falta de VRAM causar fallback para a memória do sistema (RAM), a velocidade de inferência cairá de 10x a 100x.&lt;/p>
&lt;h2 id="41-vram-base-com-base-no-tamanho-dos-parâmetros">4.1 VRAM Base com Base no Tamanho dos Parâmetros
&lt;/h2>&lt;p>Esta é a quantidade de memória necessária para carregar os pesos (weights) do modelo para a VRAM.
É calculada usando o tamanho do modelo $P$ (número de parâmetros, unidade: 1 bilhão = 1B) e os bytes por parâmetro $B$.&lt;/p>
$$
V_{base} = P \times B \quad \text{(GB)}
$$
&lt;p>Por exemplo, ao carregar um modelo de 8B (8 bilhões) de parâmetros em FP16 (ponto flutuante de meia precisão, 16 bits = 2 bytes):&lt;/p>
$$
V_{base} = 8 \times 2 = 16 \text{ GB}
$$
&lt;p>Em outras palavras, mesmo uma GPU com 16GB de VRAM estará no seu limite apenas carregando o modelo.&lt;/p>
&lt;h2 id="42-a-magia-da-quantização-quantization">4.2 A Magia da Quantização (Quantization)
&lt;/h2>&lt;p>Aí entra a &amp;ldquo;quantização&amp;rdquo;. Ao reduzir a precisão dos parâmetros, o tamanho do modelo é reduzido drasticamente. Na quantização de 4 bits mais comum (ex: Q4_K_M), a média é cerca de 0,55 bytes por parâmetro.&lt;/p>
$$
V_{base\_4bit} = 8 \times 0.55 = 4.4 \text{ GB}
$$
&lt;p>Com isso, se você tiver 16GB de VRAM, terá bastante margem para rodar um modelo 8B de forma muito tranquila.&lt;/p>
&lt;h2 id="43-cálculo-do-cache-kv-versão-compatível-com-gqa">4.3 Cálculo do Cache KV (Versão Compatível com GQA)
&lt;/h2>&lt;p>Durante a inferência, o &amp;ldquo;Cache KV&amp;rdquo;, usado para manter o contexto passado, consome VRAM. Nos modelos mais recentes, como o Llama 3, o GQA (Grouped Query Attention) é adotado para economizar memória.&lt;/p>
&lt;p>O consumo do Cache KV $V_{kv}$ (em gigabytes) é expresso pela seguinte fórmula:&lt;/p>
$$
V_{kv} = 2 \times b \times s \times l \times \left( \frac{h_{kv}}{h_q} \right) \times h_q \times d \times B_{kv} \div 10^9
$$
&lt;p>Simplificando, podemos calcular usando o número de cabeças de chave/valor (key/value heads) $h_{kv}$:&lt;/p>
$$
V_{kv} = 2 \times b \times s \times l \times h_{kv} \times d \times B_{kv} \div 10^9
$$
&lt;p>Onde:&lt;/p>
&lt;ul>
&lt;li>$b$: Tamanho do batch (geralmente 1 para uso local pessoal)&lt;/li>
&lt;li>$s$: Comprimento da sequência (comprimento do contexto, ex: 8192)&lt;/li>
&lt;li>$l$: Número de camadas (ex: 32)&lt;/li>
&lt;li>$h_{kv}$: Número de cabeças KV (ex: 8)&lt;/li>
&lt;li>$d$: Dimensões por cabeça (ex: 128)&lt;/li>
&lt;li>$B_{kv}$: Bytes do Cache KV (2 para FP16)&lt;/li>
&lt;/ul>
&lt;p>Exemplo de cálculo (Llama 3 8B, Contexto 8192, Cache FP16):
$V_{kv} = 2 \times 1 \times 8192 \times 32 \times 8 \times 128 \times 2 \div 10^9 \approx 1.07 \text{ GB}$&lt;/p>
&lt;p>Note que quanto mais longo for o comprimento do contexto $s$, mais a VRAM necessária aumentará linearmente.&lt;/p>
&lt;hr>
&lt;h1 id="5-prática-1-configuração-rápida-e-curta-com-ollama">5. Prática 1: Configuração Rápida e Curta com Ollama
&lt;/h1>&lt;p>Agora que entendemos a teoria, vamos rodar um LLM num ambiente Windows na prática.
A partir de 2026, a ferramenta mais amigável ao usuário é o &amp;ldquo;Ollama&amp;rdquo;. Ele fornece uma CLI intuitiva semelhante à do Docker.&lt;/p>
&lt;h2 id="51-instalação-e-execução">5.1 Instalação e Execução
&lt;/h2>&lt;ol>
&lt;li>Baixe e execute o instalador para Windows no &lt;a class="link" href="https://ollama.com/" target="_blank" rel="noopener"
>Site Oficial do Ollama&lt;/a>.&lt;/li>
&lt;li>Abra o PowerShell e insira o seguinte comando. Aqui usaremos o &lt;code>llama3:8b&lt;/code>, que possui suporte para japonês.&lt;/li>
&lt;/ol>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-powershell" data-lang="powershell">&lt;span class="line">&lt;span class="cl">&lt;span class="n">ollama&lt;/span> &lt;span class="n">run&lt;/span> &lt;span class="n">llama3&lt;/span>&lt;span class="err">:&lt;/span>&lt;span class="n">8b&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Na primeira execução, o modelo será baixado. Ao concluir, você poderá conversar diretamente no terminal.&lt;/p>
&lt;h2 id="52-criação-de-uma-ia-customizada-via-modelfile">5.2 Criação de uma IA Customizada via Modelfile
&lt;/h2>&lt;p>Você pode criar facilmente uma IA com uma persona específica. Crie um &lt;code>Modelfile&lt;/code> em qualquer local.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;span class="lnt">6
&lt;/span>&lt;span class="lnt">7
&lt;/span>&lt;span class="lnt">8
&lt;/span>&lt;span class="lnt">9
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-text" data-lang="text">&lt;span class="line">&lt;span class="cl">FROM llama3:8b
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">SYSTEM &amp;#34;&amp;#34;&amp;#34;
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">Você é um excelente engenheiro de software sênior.
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">Sempre responda às perguntas dos usuários com exemplos de código, de forma lógica e concisa.
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&amp;#34;&amp;#34;&amp;#34;
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">PARAMETER temperature 0.3
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">PARAMETER num_ctx 8192
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Execute os comandos a seguir para compilar e executar o seu próprio modelo customizado.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-powershell" data-lang="powershell">&lt;span class="line">&lt;span class="cl">&lt;span class="n">ollama&lt;/span> &lt;span class="n">create&lt;/span> &lt;span class="n">SeniorDev&lt;/span> &lt;span class="o">-f&lt;/span> &lt;span class="p">./&lt;/span>&lt;span class="n">Modelfile&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">ollama&lt;/span> &lt;span class="n">run&lt;/span> &lt;span class="n">SeniorDev&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h2 id="53-utilização-de-aplicações-externas-editores-de-ia">5.3 Utilização de Aplicações Externas (Editores de IA)
&lt;/h2>&lt;p>O Ollama expõe um endpoint de API compatível com OpenAI em &lt;code>http://localhost:11434&lt;/code>.
Ao especificar esta URL nas configurações de backend de extensões do VS Code, como Cursor ou Continue.dev, e designar o nome do modelo como &lt;code>SeniorDev&lt;/code>, você tem um assistente de codificação local poderoso e gratuito.&lt;/p>
&lt;hr>
&lt;h1 id="6-prática-2-afinação-extrema-de-desempenho-com-llamacpp">6. Prática 2: Afinação Extrema de Desempenho com llama.cpp
&lt;/h1>&lt;p>Se você quiser ter uma gestão fina de memória ou testar antecipadamente novos formatos (como EXL2, quantização IQ), interaja diretamente com o mecanismo central &lt;code>llama.cpp&lt;/code>.&lt;/p>
&lt;h2 id="61-procedimento-de-compilação-do-llamacpp">6.1 Procedimento de Compilação do llama.cpp
&lt;/h2>&lt;p>No ambiente Windows, a melhor forma é compilá-lo a partir do código-fonte usando CUDA Toolkit e CMake.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;span class="lnt">6
&lt;/span>&lt;span class="lnt">7
&lt;/span>&lt;span class="lnt">8
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-powershell" data-lang="powershell">&lt;span class="line">&lt;span class="cl">&lt;span class="n">git&lt;/span> &lt;span class="n">clone&lt;/span> &lt;span class="n">https&lt;/span>&lt;span class="err">:&lt;/span>&lt;span class="p">//&lt;/span>&lt;span class="n">github&lt;/span>&lt;span class="p">.&lt;/span>&lt;span class="n">com&lt;/span>&lt;span class="p">/&lt;/span>&lt;span class="n">ggerganov&lt;/span>&lt;span class="p">/&lt;/span>&lt;span class="n">llama&lt;/span>&lt;span class="p">.&lt;/span>&lt;span class="nb">cpp
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="nb">cd &lt;/span>&lt;span class="n">llama&lt;/span>&lt;span class="p">.&lt;/span>&lt;span class="nb">cpp
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="nb">&lt;/span>&lt;span class="n">mkdir&lt;/span> &lt;span class="n">build&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="nb">cd &lt;/span>&lt;span class="n">build&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c"># Configurar e compilar com suporte a CUDA&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">cmake&lt;/span> &lt;span class="p">..&lt;/span> &lt;span class="n">-DLLAMA_CUBLAS&lt;/span>&lt;span class="p">=&lt;/span>&lt;span class="n">ON&lt;/span> &lt;span class="n">-DBUILD_SHARED_LIBS&lt;/span>&lt;span class="p">=&lt;/span>&lt;span class="n">OFF&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">cmake&lt;/span> &lt;span class="p">-&lt;/span>&lt;span class="n">-build&lt;/span> &lt;span class="p">.&lt;/span> &lt;span class="p">-&lt;/span>&lt;span class="n">-config&lt;/span> &lt;span class="n">Release&lt;/span> &lt;span class="n">-j&lt;/span> &lt;span class="mf">16&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h2 id="62-execução-avançada-no-modo-servidor">6.2 Execução Avançada no Modo Servidor
&lt;/h2>&lt;p>Use o &lt;code>llama-server.exe&lt;/code> compilado para hospedar o modelo.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;span class="lnt">5
&lt;/span>&lt;span class="lnt">6
&lt;/span>&lt;span class="lnt">7
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-powershell" data-lang="powershell">&lt;span class="line">&lt;span class="cl">&lt;span class="p">.\&lt;/span>&lt;span class="n">bin&lt;/span>&lt;span class="p">\&lt;/span>&lt;span class="n">Release&lt;/span>&lt;span class="p">\&lt;/span>&lt;span class="nb">llama-server&lt;/span>&lt;span class="p">.&lt;/span>&lt;span class="py">exe&lt;/span> &lt;span class="p">`&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">-&lt;/span>&lt;span class="n">-model&lt;/span> &lt;span class="s2">&amp;#34;C:\models\Llama-3-8B-Instruct.Q4_K_M.gguf&amp;#34;&lt;/span> &lt;span class="p">`&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">-&lt;/span>&lt;span class="n">-ctx-size&lt;/span> &lt;span class="mf">8192&lt;/span> &lt;span class="p">`&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">-&lt;/span>&lt;span class="n">-n-gpu-layers&lt;/span> &lt;span class="mf">99&lt;/span> &lt;span class="p">`&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">-&lt;/span>&lt;span class="n">-threads&lt;/span> &lt;span class="mf">8&lt;/span> &lt;span class="p">`&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">-&lt;/span>&lt;span class="n">-flash-attn&lt;/span> &lt;span class="p">`&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">-&lt;/span>&lt;span class="n">-port&lt;/span> &lt;span class="mf">8080&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;ul>
&lt;li>&lt;code>--n-gpu-layers 99&lt;/code>: Descarrega (offload) todas as camadas possíveis para a VRAM da GPU.&lt;/li>
&lt;li>&lt;code>--flash-attn&lt;/code>: Habilita o FlashAttention 3, alcançando uma melhoria de velocidade de inferência e redução de consumo de VRAM para o Cache KV.&lt;/li>
&lt;/ul>
&lt;hr>
&lt;h1 id="7-front-end-gui-lm-studio-e-construção-de-rag-local">7. Front-end GUI: LM Studio e Construção de RAG Local
&lt;/h1>&lt;p>Se você não gosta de linhas de comando ou quer usar a RAG (Geração Aumentada por Recuperação) intuitivamente, utilize uma GUI.&lt;/p>
&lt;h2 id="71-lm-studio">7.1 LM Studio
&lt;/h2>&lt;p>O LM Studio é um aplicativo maravilhoso que centraliza a busca de modelos, o download, as verificações de pré-requisitos do sistema e a interface de chat. Ao simplesmente apertar o botão &amp;ldquo;Local Server&amp;rdquo; no app, uma API compatível com OpenAI é iniciada.&lt;/p>
&lt;h2 id="72-arquitetura-de-rag-usando-o-anythingllm">7.2 Arquitetura de RAG usando o AnythingLLM
&lt;/h2>&lt;p>Este é o diagrama de arquitetura do ambiente RAG para carregar documentos internos e notas pessoais.&lt;/p>
&lt;div class="mermaid">graph LR
Document["Documentos (PDF, MD)"] --> Chunking["Divisão em Chunks"]
Chunking --> EmbedModel["Modelo de Embedding"]
EmbedModel --> VectorDB["Banco de Dados Vetorial"]
UserQuery["Pergunta do usuário"] --> EmbedQuery["Embedding da Pergunta"]
EmbedQuery --> VectorDB
VectorDB --> |"Busca de similaridade"| RetrievedDocs["Extração de Documentos Relevantes"]
UserQuery --> PromptBuilder["Geração do Prompt"]
RetrievedDocs --> PromptBuilder
PromptBuilder --> LocalLLM["LLM Local"]
LocalLLM --> Answer["Resposta Final"]&lt;/div>
&lt;p>Com a versão desktop do AnythingLLM (Windows), você só precisa designar o Ollama (para LLM e Embedding) e configurar o VectorDB local (LanceDB) nas opções, e essa arquitetura estará concluída em minutos. É o nascimento de uma IA Privada que nunca envia os dados a terceiros.&lt;/p>
&lt;hr>
&lt;h1 id="8-fine-tuning-no-wsl2-do-windows-lora">8. Fine-tuning no WSL2 do Windows (LoRA)
&lt;/h1>&lt;p>Além de rodar os modelos localmente, se você deseja que eles fiquem mais inteligentes com seus próprios dados, o fine-tuning através do LoRA (Low-Rank Adaptation) é possível. Em 2026, com uma biblioteca chamada &amp;ldquo;Unsloth&amp;rdquo;, o treinamento de um modelo 8B é finalizado em algumas horas, mesmo com 16GB de VRAM, no ambiente Windows WSL2.&lt;/p>
&lt;p>Crie o ambiente executando o seguinte dentro do Ubuntu do WSL2:&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">conda create --name unsloth_env &lt;span class="nv">python&lt;/span>&lt;span class="o">=&lt;/span>3.11
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">conda activate unsloth_env
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">pip install &lt;span class="s2">&amp;#34;unsloth[colab-new] @ git+https://github.com/unslothai/unsloth.git&amp;#34;&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">pip install --no-deps trl peft accelerate bitsandbytes
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>O Unsloth otimiza ao extremo os kernels do CUDA. Se comparado a uma biblioteca padronizada do Hugging Face, sua velocidade de treinamento é duas vezes maior e o consumo de VRAM é reduzido pela metade. Bastará iniciar um Jupyter Notebook e carregar o seu dataset (formato JSONL) para que ocorram as épocas de treinamento em GPUs com VRAM entre 12GB a 16GB, como a RTX 4060 Ti, por exemplo.&lt;/p>
&lt;hr>
&lt;h1 id="9-solução-de-problemas-de-desempenho">9. Solução de Problemas de Desempenho
&lt;/h1>&lt;p>Abaixo, encontre os problemas comumente encontrados e suas soluções.&lt;/p>
&lt;h3 id="1-a-velocidade-de-inferência-é-extremamente-lenta-12-tokenss">1. A velocidade de inferência é extremamente lenta (1~2 tokens/s)
&lt;/h3>&lt;p>&lt;strong>Causa&lt;/strong>: O modelo extrapolou a capacidade da VRAM e o processamento offload recaiu à memória do sistema (RAM).
&lt;strong>Solução&lt;/strong>: Inspecione o espaço de &amp;ldquo;Memória da GPU Dedicada&amp;rdquo; no Gerenciador de Tarefas do Windows. Se já atingiu o limite, reduza o tamanho do contexto (&lt;code>-c&lt;/code>) ou utilize um modelo quantizado com menor número de bits (como o Q4_K_M).&lt;/p>
&lt;h3 id="2-erro-cuda-out-of-memory">2. Erro &amp;ldquo;CUDA out of memory&amp;rdquo;
&lt;/h3>&lt;p>&lt;strong>Causa&lt;/strong>: A VRAM foi completamente esgotada. Geralmente ocorre quando a conversa se estende, inchando o tamanho do Cache KV.
&lt;strong>Solução&lt;/strong>: Restrinja intencionalmente o valor de &lt;code>num_ctx&lt;/code> no Ollama ou o parâmetro &lt;code>-c&lt;/code> do llama.cpp para um número mais baixo.&lt;/p>
&lt;h3 id="3-a-geração-em-japonês-está-estranha">3. A geração em japonês está estranha
&lt;/h3>&lt;p>&lt;strong>Causa&lt;/strong>: Incompatibilidade no template de prompt ou o modelo não possui suporte.
&lt;strong>Solução&lt;/strong>: Utilize modelos que incluam &lt;code>Instruct&lt;/code> no nome, e confirme na ferramenta se o template exigido pelos criadores do modelo, como os formatos ChatML ou Llama3, encontra-se devidamente selecionado.&lt;/p>
&lt;hr>
&lt;h1 id="10-resumo-e-perspectivas-futuras">10. Resumo e Perspectivas Futuras
&lt;/h1>&lt;p>Em 2026, criar um ambiente local de LLM no Windows não é mais privilégio de apenas alguns engenheiros. Devido à padronização do formato GGUF, à ascensão de ecossistemas refinados como Ollama e LM Studio, e a otimizações de hardware como FlashAttention, qualquer pessoa pode obter um ambiente de IA corporativo com extrema facilidade.&lt;/p>
&lt;p>Aproveite ao máximo os seguintes pontos detalhados neste artigo:&lt;/p>
&lt;ol>
&lt;li>Fazer uso do &lt;strong>cálculo matemático de VRAM&lt;/strong> para logicamente selecionar o nível de quantização e o tamanho do modelo ideais para as especificações do seu computador.&lt;/li>
&lt;li>Usar o &lt;strong>Ollama&lt;/strong> para um ambiente o mais rápido de construir e integrá-lo a um editor de IA, com o objetivo de aumentar drasticamente a produtividade.&lt;/li>
&lt;li>Usar os parâmetros de controle avançado no &lt;strong>llama.cpp&lt;/strong> para extrair as margens de desempenho do hardware.&lt;/li>
&lt;li>Construir através do &lt;strong>AnythingLLM&lt;/strong> um ambiente e sistema RAG Local seguro o suficiente para manipular os dados da sua empresa.&lt;/li>
&lt;li>Fazer uso do &lt;strong>Unsloth (WSL2)&lt;/strong> para criar a sua própria customizada IA, baseada no seu nível e especialidade de conhecimento.&lt;/li>
&lt;/ol>
&lt;p>A &amp;ldquo;democratização&amp;rdquo; da IA não se resume a um mero jargão tecnológico. Trata-se do real cenário em que os próprios sistemas são executados na tela de desktop de seu Windows. Livre-se dos riscos de vazamento de dados e custos nas APIs em nuvem, e comece hoje mesmo sua imersão em um mundo onde a IA Privada é poderosa e completamente sua.&lt;/p></description></item></channel></rss>