<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Gemma on kenji.blog</title><link>http://kenji.blog/de/tags/gemma/</link><description>Recent content in Gemma on kenji.blog</description><generator>Hugo -- gohugo.io</generator><language>de</language><copyright>kenjinote</copyright><lastBuildDate>Fri, 11 Sep 2026 03:00:00 +0900</lastBuildDate><atom:link href="http://kenji.blog/de/tags/gemma/index.xml" rel="self" type="application/rss+xml"/><item><title>Top 5 empfohlene Open-Source-LLM-Modelle für die lokale Ausführung</title><link>http://kenji.blog/de/p/top-5-open-source-local-llms/</link><pubDate>Fri, 11 Sep 2026 03:00:00 +0900</pubDate><guid>http://kenji.blog/de/p/top-5-open-source-local-llms/</guid><description>&lt;img src="http://kenji.blog/p/top-5-open-source-local-llms/img/eyecatch.jpg" alt="Featured image of post Top 5 empfohlene Open-Source-LLM-Modelle für die lokale Ausführung" />&lt;h1 id="einführung">Einführung
&lt;/h1>&lt;p>In den letzten Jahren war die technologische Entwicklung von Large Language Models (LLMs) bemerkenswert, und Cloud-basierte KI-Dienste wie ChatGPT und Claude sind weit verbreitet. Gleichzeitig steigt jedoch rapide der Bedarf, &amp;ldquo;vertrauliche Unternehmensdaten nicht an externe Server senden zu wollen&amp;rdquo;, &amp;ldquo;API-Nutzungskosten senken zu wollen&amp;rdquo; und &amp;ldquo;ein vollständig offline funktionierendes KI-System aufbauen zu wollen&amp;rdquo;.&lt;/p>
&lt;p>Diese Anforderungen werden von &amp;ldquo;lokalen LLMs (Open-Source-LLMs)&amp;rdquo; erfüllt, die direkt auf den eigenen PC oder Unternehmensserver heruntergeladen und ausgeführt werden können. Bis etwa 2023 war es schwierig, lokal eine praktikable Genauigkeit zu erreichen, aber durch die Weiterentwicklung der Modellarchitekturen und Fortschritte in der Quantisierungstechnologie (Quantization) ist es heute möglich, selbst auf Consumer-GPUs (wie NVIDIA RTX 3090 / 4090 oder Apples Apple Silicon im Mac) sehr leistungsstarke LLMs flüssig auszuführen.&lt;/p>
&lt;p>In diesem Artikel wählen wir aus der Vielzahl von Open-Source-LLMs die &amp;ldquo;Top 5 der empfohlenen Modelle&amp;rdquo; aus, die ab 2026 als besonders herausragend bewertet werden. Wir werden die architektonischen Merkmale, die Anzahl der Parameter, die Speicheranforderungen aufgrund von GGUF-Quantisierung und konkrete Anwendungsfälle aus einer äußerst detaillierten und technischen Perspektive gründlich vergleichen und erläutern.&lt;/p>
&lt;hr>
&lt;h1 id="warum-llms-lokal-ausführen">Warum LLMs lokal ausführen?
&lt;/h1>&lt;p>Die Einführung von lokalen LLMs bietet viele einzigartige Vorteile, die Cloud-basierte APIs nicht haben.&lt;/p>
&lt;h3 id="1-gewährleistung-vollständiger-privatsphäre-und-sicherheit">1. Gewährleistung vollständiger Privatsphäre und Sicherheit
&lt;/h3>&lt;p>Bei der Nutzung einer Cloud-API werden die eingegebenen Prompts und Daten an die Server externer Unternehmen gesendet. Dies stellt ein erhebliches Risiko dar, wenn persönliche Informationen oder vertrauliche Unternehmensdaten verarbeitet werden. Bei einem lokalen LLM werden die Daten vollständig auf dem Endgerät verarbeitet, wodurch das Risiko von Datenlecks nach außen auf null reduziert werden kann.&lt;/p>
&lt;h3 id="2-erhebliche-kostensenkung">2. Erhebliche Kostensenkung
&lt;/h3>&lt;p>Kommerzielle APIs (wie die OpenAI API) basieren auf einem nutzungsabhängigen Preismodell entsprechend der Anzahl der Eingabe- und Ausgabe-Token. Die Verarbeitung großer Dokumentenmengen oder der ständige Betrieb von Chatbots kann monatliche Kosten von Tausenden bis Zehntausenden von Euro verursachen. Mit einem lokalen LLM hingegen fallen nur die anfänglichen Hardware-Investitionen und die Stromkosten an, und es kann unbegrenzt oft und ohne Token-Limit genutzt werden.&lt;/p>
&lt;h3 id="3-anpassbarkeit-und-offline-nutzung">3. Anpassbarkeit und Offline-Nutzung
&lt;/h3>&lt;p>Open-Source-LLMs können leicht mit eigenen Datensätzen feinabgestimmt (Fine-Tuning, z.B. LoRA) werden. Darüber hinaus können sie in vollständig netzunabhängigen Offline-Umgebungen oder sicheren geschlossenen Netzwerken betrieben werden, was sie ideal für die Integration in Edge-Geräte macht.&lt;/p>
&lt;hr>
&lt;h1 id="grundwissen-zur-ausführung-lokaler-llms">Grundwissen zur Ausführung lokaler LLMs
&lt;/h1>&lt;p>Bevor wir die Modelle vorstellen, sollten wir die &amp;ldquo;VRAM-Anforderungen&amp;rdquo; und &amp;ldquo;Quantisierung (Quantization)&amp;rdquo;, die beim Ausführen von LLMs in einer lokalen Umgebung unumgänglich sind, mathematisch klären.&lt;/p>
&lt;h2 id="mathematische-grundlagen-von-vram-videospeicher-und-quantisierung">Mathematische Grundlagen von VRAM (Videospeicher) und Quantisierung
&lt;/h2>&lt;p>Um ein LLM auf einer GPU zur Inferenz auszuführen, müssen die Parameter (Gewichte) des Modells im VRAM bereitgestellt werden. Der Speicherbedarf $M$ eines Modells kann durch folgende Formel angenähert werden:&lt;/p>
$$ M = \frac{P \times B}{8} + C $$
&lt;p>Hierbei ist:&lt;/p>
&lt;ul>
&lt;li>$M$: Benötigte Speicherkapazität (GB)&lt;/li>
&lt;li>$P$: Anzahl der Parameter (Billion = Milliarden)&lt;/li>
&lt;li>$B$: Anzahl der Bits pro Parameter (16 Bit für FP16, 4 Bit für 4-Bit-Quantisierung)&lt;/li>
&lt;li>$C$: Kontextfenster (KV-Cache) und Overhead bei der Inferenz (normalerweise geht man von etwa 20% bis 30% der Modellgröße aus)&lt;/li>
&lt;/ul>
&lt;p>Wenn beispielsweise ein Modell mit 8 Milliarden (8B) Parametern mit 16-Bit-Gleitkommazahlen (FP16) ausgeführt wird, ergibt sich:&lt;/p>
$$ M_{FP16} = \frac{8 \times 16}{8} = 16 \text{ GB} $$
&lt;p>Wenn man zusätzlich den KV-Cache und anderes berücksichtigt, werden fast 18 GB bis 20 GB VRAM benötigt, was den Betrieb auf einem typischen Gaming-PC erschwert.&lt;/p>
&lt;h3 id="der-aufstieg-des-gguf-formats">Der Aufstieg des GGUF-Formats
&lt;/h3>&lt;p>Hier kommt die &amp;ldquo;Quantisierung (Quantization)&amp;rdquo; ins Spiel. Durch die Reduzierung der Genauigkeit der Parameter von FP16 auf 8-Bit, 4-Bit oder im Extremfall 2-Bit kann der benötigte Speicherplatz drastisch reduziert werden, während die Leistungsverschlechterung des Modells auf ein Minimum beschränkt bleibt.&lt;/p>
&lt;p>Das derzeit am weitesten verbreitete Format ist &lt;strong>GGUF (GPT-Generated Unified Format)&lt;/strong>, das von Georgi Gerganov (dem Entwickler von llama.cpp) entworfen wurde. GGUF ist ein Binärformat für effiziente Inferenz sowohl auf CPU als auch auf GPU und zeichnet sich durch eine besonders gute Kompatibilität mit der Unified Memory-Architektur von Macs (Apple Silicon) aus.&lt;/p>
&lt;p>Die Speicherberechnung bei der Quantisierung eines 8B-Modells auf 4-Bit (z. B. Q4_K_M) sieht wie folgt aus:&lt;/p>
$$ M_{4bit} = \frac{8 \times 4.5}{8} = 4.5 \text{ GB} $$
&lt;p>*Da Q4_K_M für einige Gewichte eine höhere Genauigkeit beibehält, beträgt die effektive Bitrate etwa 4,5 Bit.&lt;/p>
&lt;p>Dadurch wird es möglich, selbst auf Einstiegs-GPUs mit nur 8 GB VRAM oder auf Standard-Laptops leistungsstarke LLMs der 8B-Klasse lokal flüssig auszuführen.&lt;/p>
&lt;hr>
&lt;h1 id="top-5-empfohlene-lokale-llm-modelle">Top 5 empfohlene lokale LLM-Modelle
&lt;/h1>&lt;p>Nun stellen wir 5 Open-Source-LLMs vor, die derzeit hohe Anerkennung von Entwicklern und KI-Forschern weltweit genießen.&lt;/p>
&lt;h2 id="1-llama-3-meta">1. Llama 3 (Meta)
&lt;/h2>&lt;p>Die von Meta entwickelte &amp;ldquo;Llama 3&amp;rdquo;-Serie ist der De-facto-Standard unter den Open-Source-LLMs.&lt;/p>
&lt;h3 id="entwicklung-und-merkmale-der-architektur">Entwicklung und Merkmale der Architektur
&lt;/h3>&lt;p>Llama 3 übernimmt die Standard-Transformer-Architektur, beinhaltet jedoch zahlreiche technische Verbesserungen gegenüber der Vorgängergeneration (Llama 2). Besonders bemerkenswert sind folgende Punkte:&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Standardmäßige Einführung von GQA (Grouped Query Attention)&lt;/strong>: GQA, das bei Llama 2 nur in großen Modellen verwendet wurde, wird bei Llama 3 auch in kleineren Modellen wie 8B eingesetzt. Dies reduziert den Speicherverbrauch des KV-Caches drastisch und ermöglicht eine schnelle Inferenz auch bei langen Kontexten.&lt;/li>
&lt;li>&lt;strong>Erweiterung der Vokabulargröße&lt;/strong>: Die Vokabulargröße des Tokenizers (Tiktoken-basiert) wurde auf 128.000 Token erweitert, was die Kompressionseffizienz für mehrere Sprachen und Programmcode dramatisch verbessert. Die Effizienz der japanischen Verarbeitung ist im Vergleich zu Llama 2 ebenfalls um ein Vielfaches besser geworden.&lt;/li>
&lt;/ul>
&lt;div class="mermaid">graph TD
A["Eingabe-Tokens"] --> B["Embedding-Schicht (128k Vokabular)"]
B --> C["Transformer-Block x N"]
C --> D["RMSNorm"]
C --> E["Grouped Query Attention (GQA)"]
C --> F["SwiGLU FFN"]
D -.-> E
D -.-> F
E --> G["Add &amp; Norm"]
F --> G
G --> H["Ausgabe-Logits"]&lt;/div>
&lt;h3 id="parametergrößen-und-anwendungsfälle">Parametergrößen und Anwendungsfälle
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>Llama 3 8B&lt;/strong>: 8 Milliarden Parameter. Läuft mit 4-Bit-Quantisierung bei ca. 5 GB Speicher. Reagiert extrem schnell und eignet sich ideal als persönlicher Assistent auf dem PC oder als Kern eines lokalen RAG-Systems (Retrieval-Augmented Generation).&lt;/li>
&lt;li>&lt;strong>Llama 3 70B&lt;/strong>: 70 Milliarden Parameter. Benötigt mit 4-Bit-Quantisierung ca. 40 GB VRAM (oder Unified Memory bei Apple Silicon). Es bietet eine Leistung, die dem Cloud-basierten GPT-4 nahekommt, und ist hervorragend für fortgeschrittenes logisches Denken, komplexe Programmierung, Datenanalyse usw. geeignet.&lt;/li>
&lt;/ul>
&lt;p>Llama 3 hat die stärkste Community-Unterstützung, und ein weiterer Vorteil ist, dass alle Quantisierungsformate wie GGUF, AWQ und EXL2 sofort verfügbar sind.&lt;/p>
&lt;hr>
&lt;h2 id="2-mistral--mixtral-mistral-ai">2. Mistral / Mixtral (Mistral AI)
&lt;/h2>&lt;p>Die Modelle des französischen KI-Startups &amp;ldquo;Mistral AI&amp;rdquo; schockierten die Branche mit ihrer Effizienz und ihrer einen Paradigmenwechsel herbeiführenden Architektur.&lt;/p>
&lt;h3 id="mechanismus-von-moe-mixture-of-experts">Mechanismus von MoE (Mixture of Experts)
&lt;/h3>&lt;p>&amp;ldquo;Mixtral 8x7B&amp;rdquo; war das erste Open-Source-LLM, das die &lt;strong>MoE (Mixture of Experts)&lt;/strong>-Architektur in großem Maßstab einsetzte und damit großen Erfolg hatte.
MoE ist ein Mechanismus, bei dem das gesamte Modell (etwa 47 Milliarden Parameter) in 8 &amp;ldquo;Experten (Expert)-Netzwerke&amp;rdquo; unterteilt ist, und für jedes eingegebene Token dynamisch nur die zwei optimalen Experten ausgewählt (geroutet) werden.&lt;/p>
&lt;div class="mermaid">graph LR
A["Eingabe-Token"] --> B["Router / Gating Network"]
B --> C["Experte 1 (Aktiv)"]
B --> D["Experte 2 (Inaktiv)"]
B --> E["Experte 3 (Aktiv)"]
B --> F["... Experte 8"]
C --> G["Gewichtete Summe"]
E --> G
G --> H["Nächste Schicht"]&lt;/div>
&lt;p>Der größte Vorteil dieser Architektur liegt darin, dass &amp;ldquo;obwohl die Anzahl der Parameter riesig ist, die während der Inferenz berechneten Parameter (Active Parameters) gering sind&amp;rdquo;. Bei Mixtral 8x7B sind während der Inferenz nur etwa 13 Milliarden Parameter aktiv. Dadurch wird die Inferenzgeschwindigkeit dramatisch erhöht, während eine hohe Leistung der 70B-Klasse beibehalten wird.&lt;/p>
&lt;h3 id="leistung-und-anwendungsfälle">Leistung und Anwendungsfälle
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>Mistral 7B / Mistral Nemo (12B)&lt;/strong>: Einzelne Dense-Modelle. Sehr leichtgewichtig und unter der Apache 2.0-Lizenz frei für kommerzielle Nutzung. Bei Programmier- und Zusammenfassungsaufgaben liefern sie Benchmark-Ergebnisse, die andere Modelle gleicher Größe übertreffen.&lt;/li>
&lt;li>&lt;strong>Mixtral 8x7B / 8x22B&lt;/strong>: Fortschrittliche MoE-Modelle. Die VRAM-Anforderungen sind hoch (da das gesamte Modell in den Speicher geladen werden muss, ca. 26 GB bei 4-Bit für 8x7B), aber aufgrund der schnellen Inferenzgeschwindigkeit eignen sie sich sehr gut für den Aufbau lokaler Server auf Mac-Umgebungen wie M2/M3 Max.&lt;/li>
&lt;/ul>
&lt;hr>
&lt;h2 id="3-gemma-2-google">3. Gemma 2 (Google)
&lt;/h2>&lt;p>Die &amp;ldquo;Gemma&amp;rdquo;-Serie besteht aus offenen Modellen, die Google unter Nutzung der Technologie seines modernsten &amp;ldquo;Gemini&amp;rdquo;-Modells entwickelt hat. Gemma 2 ist die zweite Generation und bringt bedeutende architektonische Änderungen mit sich.&lt;/p>
&lt;h3 id="einzigartiges-architekturdesign">Einzigartiges Architekturdesign
&lt;/h3>&lt;p>Gemma 2 verwendet einige einzigartige Designs, die es von anderen LLMs abheben.&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Logit Soft-capping&lt;/strong>: Eine Technologie, die verhindert, dass ungewöhnlich große Logit-Werte generiert werden, und so die Stabilität von Training und Inferenz erhöht.&lt;/li>
&lt;li>&lt;strong>Hybrid aus Sliding Window Attention (SWA) und Local Attention&lt;/strong>: Anstatt in allen Schichten Full Attention durchzuführen, wechseln sich Schichten, die nur den lokalen Kontext betrachten, mit Schichten ab, die den gesamten Kontext betrachten.&lt;/li>
&lt;/ul>
&lt;p>Die Reduzierung des Rechenaufwands in SWA lässt sich mathematisch wie folgt darstellen. Im Gegensatz zur normalen Self-Attention-Komplexität $O(N^2)$ beträgt die Komplexität der SWA mit der Fenstergröße $W$:&lt;/p>
$$ \text{Complexity}_{SWA} = O(N \times W) $$
&lt;p>Dabei ist $N$ die Sequenzlänge und $W$ eine feste Fenstergröße. Je größer $N$ wird (also je länger der eingegebene Text ist), desto immenser ist die Einsparung an Rechenressourcen durch SWA.&lt;/p>
&lt;h3 id="leistung-und-anwendungsfälle-1">Leistung und Anwendungsfälle
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>Gemma 2 2B / 9B&lt;/strong>: Das 2B-Modell läuft sogar auf ressourcenbeschränkten Umgebungen wie Smartphones oder Raspberry Pi, während das 9B-Modell für Standard-PCs gedacht ist. Insbesondere das 9B-Modell übertrifft in vielen Aufgaben die Benchmark-Ergebnisse des Llama 3 8B und gehört derzeit zu den stärksten Modellen unter 10 Milliarden Parametern.&lt;/li>
&lt;li>&lt;strong>Gemma 2 27B&lt;/strong>: 27 Milliarden Parameter. Das Hauptmerkmal ist die &amp;ldquo;perfekte Größe&amp;rdquo;, die mit 4-Bit- oder 6-Bit-Quantisierung genau in 24 GB VRAM (RTX 3090 / 4090 etc.) passt. Es ist sehr stark bei der Programmierung und komplexen Anweisungen und bei Enthusiasten sehr beliebt.&lt;/li>
&lt;/ul>
&lt;hr>
&lt;h2 id="4-qwen-25-alibaba-cloud">4. Qwen 2.5 (Alibaba Cloud)
&lt;/h2>&lt;p>Die von Alibaba Cloud entwickelte Qwen-Serie bietet weltweite Spitzenleistung, insbesondere bei der mehrsprachigen Verarbeitung, beim Programmieren und beim mathematischen Denken.&lt;/p>
&lt;h3 id="mehrsprachigkeit-und-programmierfähigkeit">Mehrsprachigkeit und Programmierfähigkeit
&lt;/h3>&lt;p>Qwen 2.5 wurde mit umfangreichen mehrsprachigen Korpora vortrainiert und wird nicht nur für Englisch und Chinesisch, sondern &lt;strong>insbesondere für die natürliche Ausgabe von Japanisch hoch bewertet&lt;/strong>. Für japanische Nutzer ist der größte Vorteil, dass &amp;ldquo;es nicht wie unnatürliches, übersetztes Japanisch klingt&amp;rdquo;.
Es gibt auch das Modell &amp;ldquo;Qwen 2.5 Coder&amp;rdquo;, das auf Programmierfähigkeiten spezialisiert ist, und die Anwendungsfälle nehmen rasant zu, in denen es in Kombination mit VSCode-Erweiterungen (wie Continue) als lokale Alternative zu GitHub Copilot verwendet wird.&lt;/p>
&lt;h3 id="architektur-und-anwendungsfälle">Architektur und Anwendungsfälle
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>Tie Word Embeddings&lt;/strong>: Durch die gemeinsame Nutzung (Tie) der Gewichte der Eingabe-Embedding-Schicht und der Ausgabeschicht wird ein Mechanismus angewandt, der Parameter einspart und gleichzeitig effizient lernt.&lt;/li>
&lt;li>&lt;strong>Erweiterung von RoPE (Rotary Position Embedding)&lt;/strong>: Es unterstützt ein riesiges Kontextfenster von bis zu 128.000 Token, was das lokale Lesen riesiger PDFs oder die vollständige Analyse von Quellcode mit Zehntausenden von Zeilen ermöglicht.&lt;/li>
&lt;/ul>
&lt;p>Die Modellgrößen sind sehr fein gestaffelt (0.5B, 1.5B, 3B, 7B, 14B, 32B, 72B), was den Reiz von Qwen ausmacht, da man genau die Größe wählen kann, die bis an die Grenzen der eigenen Hardware-Spezifikationen (VRAM-Kapazität) geht.&lt;/p>
&lt;hr>
&lt;h2 id="5-phi-3--phi-35-microsoft">5. Phi-3 / Phi-3.5 (Microsoft)
&lt;/h2>&lt;p>Die Phi-Serie ist aus dem von Microsoft propagierten Paradigma &amp;ldquo;Textbook is all you need&amp;rdquo; (Das Lehrbuch ist alles, was man braucht) hervorgegangen.&lt;/p>
&lt;h3 id="revolution-der-slms-small-language-models">Revolution der SLMs (Small Language Models)
&lt;/h3>&lt;p>Während die jüngste LLM-Entwicklung von der brachialen Methode geprägt war, &amp;ldquo;einfach die Anzahl der Parameter und der Daten zu erhöhen&amp;rdquo;, hat Microsoft bewiesen, dass &amp;ldquo;wenn man die Qualität der dem Modell zur Verfügung gestellten Daten (hochwertige Lehrbuchdaten und synthetische Daten) aufs Äußerste erhöht, ein Modell selbst mit einer kleinen Anzahl von Parametern eine Intelligenz auf dem Niveau von GPT-3.5 besitzen kann&amp;rdquo;.
Phi-3 wird nicht als LLM (Large Language Model), sondern als &lt;strong>SLM (Small Language Model)&lt;/strong> bezeichnet.&lt;/p>
&lt;div class="mermaid">graph TD
A["Rohe Web-Daten"] --> B["Filtern &amp; Bereinigen"]
B --> C["LLM (z.B. GPT-4) generiert synthetische Daten"]
C --> D["Hochwertige lehrbuchartige Daten"]
D --> E["Pre-Training des Phi-3 Modells"]
E --> F["Kleines Modell mit hoher Inferenzfähigkeit"]&lt;/div>
&lt;h3 id="leistung-und-anwendungsfälle-2">Leistung und Anwendungsfälle
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>Phi-3 Mini (3.8B)&lt;/strong>: Ein Modell, das dafür entwickelt wurde, nativ auf Smartphones ausgeführt zu werden (z. B. unter Verwendung der ONNX Runtime). Obwohl es etwas weniger als 4 Milliarden Parameter hat, sind seine Fähigkeiten in Inferenz und logischem Denken überraschend hoch. Einfache Frage-Antwort- oder Textformatierungsaufgaben werden im Handumdrehen erledigt.&lt;/li>
&lt;li>&lt;strong>Phi-3.5 Vision / MoE&lt;/strong>: Es wurden auch ein Vision-Modell, das Bilder erkennen kann, und eine MoE-Version veröffentlicht.&lt;/li>
&lt;/ul>
&lt;p>Als extrem leichtgewichtiger Agent, der in Edge-Geräten als lokale KI implementiert ist, in mobile Apps eingebettet ist oder ständig im Hintergrund läuft, ist die Phi-3-Serie unübertroffen.&lt;/p>
&lt;hr>
&lt;h1 id="technischer-vergleich-und-benchmarks-der-modelle">Technischer Vergleich und Benchmarks der Modelle
&lt;/h1>&lt;p>Lassen Sie uns hier die vorgestellten Modelle im Hinblick auf &amp;ldquo;VRAM-Anforderungen&amp;rdquo; und &amp;ldquo;Inferenzgeschwindigkeit&amp;rdquo; bei lokaler Ausführung aus einer quantitativen Perspektive vergleichen.&lt;/p>
&lt;h2 id="beziehung-zwischen-parameteranzahl-und-vram-anforderung-bei-gguf-4-bit-quantisierung">Beziehung zwischen Parameteranzahl und VRAM-Anforderung (bei GGUF 4-Bit-Quantisierung)
&lt;/h2>&lt;p>Das folgende Diagramm zeigt den geschätzten VRAM-Bedarf (einschließlich KV-Cache-Overhead) während der Inferenz im Verhältnis zur Anzahl der Parameter jedes Modells.&lt;/p>
&lt;div class="mermaid">xychart-beta
title "Anzahl der Parameter und benötigter VRAM (Annahme: 4-Bit Quantisierung)"
x-axis "Modellname" ["Phi-3 Mini (3.8B)", "Llama 3 (8B)", "Gemma 2 (9B)", "Mixtral (8x7B)", "Qwen 2.5 (32B)", "Llama 3 (70B)"]
y-axis "Benötigter VRAM (GB)" 0 --> 45
bar [3.5, 6.0, 6.5, 26.0, 22.0, 40.0]&lt;/div>
&lt;p>*Mixtral 8x7B verbraucht aufgrund der großen Gesamtparameterzahl viel VRAM, aber da die Berechnung selbst leicht ist, ist die Belastung der Berechnungsressourcen der GPU (CUDA-Cores usw.) gering.&lt;/p>
&lt;h2 id="theoretische-berechnung-der-inferenzgeschwindigkeit-tokenssec">Theoretische Berechnung der Inferenzgeschwindigkeit (Tokens/sec)
&lt;/h2>&lt;p>Die Inferenzgeschwindigkeit eines lokalen LLM hängt stark von der &amp;ldquo;Speicherbandbreite (Memory Bandwidth)&amp;rdquo; der GPU ab. In der Generierungsphase (Dekodierung) müssen alle Gewichte des Modells für jedes generierte Token aus dem Speicher gelesen werden. Es handelt sich also um einen speicherbegrenzten (Memory-bound) und nicht um einen rechenbegrenzten (Compute-bound) Prozess.&lt;/p>
&lt;p>Die theoretisch maximale Inferenzgeschwindigkeit $T$ (Tokens/sec) wird durch folgende Formel berechnet:&lt;/p>
$$ T = \frac{\text{BW}}{M_{\text{weights}}} $$
&lt;p>Hierbei ist:&lt;/p>
&lt;ul>
&lt;li>$\text{BW}$: Effektive Speicherbandbreite der GPU (GB/s)&lt;/li>
&lt;li>$M_{\text{weights}}$: Die geladene Größe des Modells (GB)&lt;/li>
&lt;/ul>
&lt;p>Berechnen wir beispielsweise den Fall, dass die 4-Bit-Version von Llama 3 8B (ca. 4,5 GB) auf einer NVIDIA RTX 4090 (Speicherbandbreite 1.008 GB/s) ausgeführt wird. Unter der Annahme, dass die effektive Bandbreite etwa 80 % des theoretischen Wertes beträgt (ca. 800 GB/s):&lt;/p>
$$ T \approx \frac{800}{4.5} \approx 177 \text{ Tokens/sec} $$
&lt;p>Dies ist eine enorme Geschwindigkeit, die die Lesegeschwindigkeit von Menschen bei weitem übertrifft. Wenn man hingegen Llama 3 70B (4-Bit-Version, ca. 40 GB &lt;em>unter der Annahme, dass es auf zwei GPUs aufgeteilt wird usw.&lt;/em>) auf derselben RTX 4090 ausführt, liegt die Token-Generierungsgeschwindigkeit bei etwa 20 Tokens/sec. Auf diese Weise ist es möglich, im Voraus mathematisch vorherzusagen, &amp;ldquo;mit welcher Geschwindigkeit der Output generiert wird&amp;rdquo;, basierend auf den Spezifikationen des eigenen PCs.&lt;/p>
&lt;hr>
&lt;h1 id="tools-zum-ausführen-lokaler-llms">Tools zum Ausführen lokaler LLMs
&lt;/h1>&lt;p>Das Software-Ökosystem zur Ausführung dieser leistungsstarken Open-Source-LLMs in einer lokalen Umgebung ist heute ebenfalls sehr ausgereift. Hier sind drei repräsentative Tools.&lt;/p>
&lt;h3 id="1-ollama">1. Ollama
&lt;/h3>&lt;p>Dies ist derzeit das einfachste und beliebteste Tool. Ähnlich wie bei Docker übernimmt es mit einem einzigen Befehl alles vom Herunterladen des Modells bis zur Ausführung. Es unterstützt Mac, Windows und Linux.
Öffnen Sie das Terminal und geben Sie einfach den folgenden Befehl ein, um Llama 3 zu starten:&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">ollama run llama3
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Darüber hinaus fungiert Ollama im Hintergrund als REST-API-Server, was die Integration mit Python-Skripten oder externen Anwendungen extrem einfach macht.&lt;/p>
&lt;h3 id="2-lm-studio">2. LM Studio
&lt;/h3>&lt;p>Eine empfehlenswerte Anwendung für diejenigen, die eine intuitive GUI-basierte Bedienung bevorzugen. Sie können eine riesige Liste von GGUF-Modellen von Hugging Face direkt in der App suchen und herunterladen und Unterhaltungen in einem ChatGPT-ähnlichen Chat-Fenster genießen. Die Funktion, die visuell anzeigt, welche Modelle in den RAM/VRAM Ihres PCs passen, ist sehr nützlich.&lt;/p>
&lt;h3 id="3-llamacpp">3. llama.cpp
&lt;/h3>&lt;p>Dies ist der Auslöser des lokalen LLM-Booms und die in C/C++ geschriebene Bibliothek, die die Grundlage für alles bildet. Sie richtet sich an Ingenieure, die die Leistung bis zum Äußersten optimieren wollen, oder an Hacker, die sie in ihre eigenen Skripte einbauen möchten. Sie reizt das Potenzial aller Hardware bis zum Limit aus, von Apples Metal über NVIDIAs CUDA und AMDs ROCm bis hin zum Intel AVX-Befehlssatz.&lt;/p>
&lt;hr>
&lt;h1 id="zusammenfassung-und-zukunftsausblick">Zusammenfassung und Zukunftsausblick
&lt;/h1>&lt;p>In diesem Artikel haben wir 5 der besten Open-Source- und lokalen LLMs aus dem Jahr 2026 vorgestellt und ihre Architektur sowie ihren technischen Hintergrund erläutert. Die Auswahl nach Verwendungszweck lässt sich wie folgt zusammenfassen:&lt;/p>
&lt;ol>
&lt;li>&lt;strong>Wenn Sie Wert auf eine ausgewogene Balance und das Ökosystem legen&lt;/strong>: &lt;code>Llama 3 (8B / 70B)&lt;/code>&lt;/li>
&lt;li>&lt;strong>Wenn Sie schnelle Inferenz auf Macs mit großem Unified Memory wollen&lt;/strong>: &lt;code>Mixtral 8x7B&lt;/code>&lt;/li>
&lt;li>&lt;strong>Wenn Sie die maximale Intelligenz mit 24 GB VRAM herausholen möchten&lt;/strong>: &lt;code>Gemma 2 27B&lt;/code> oder &lt;code>Qwen 2.5 32B&lt;/code>&lt;/li>
&lt;li>&lt;strong>Wenn das Ziel natürliche japanische Ausgaben und fortgeschrittene Programmierunterstützung ist&lt;/strong>: &lt;code>Qwen 2.5&lt;/code>&lt;/li>
&lt;li>&lt;strong>Für Smartphones, leistungsschwache PCs oder superleichte Verarbeitung im Hintergrund&lt;/strong>: &lt;code>Phi-3 / Phi-3.5&lt;/code>&lt;/li>
&lt;/ol>
&lt;p>Die Entwicklungsgeschwindigkeit von Open-Source-LLMs ist atemberaubend, und alle paar Monate werden Durchbrüche verkündet, die den bisherigen gesunden Menschenverstand auf den Kopf stellen. Durch weitere Verbesserungen der Quantisierungstechnologie und das Aufkommen neuer Architekturen rückt vielleicht bald der Tag näher, an dem allein die lokale Umgebung die Cloud-KI übertrifft.
Laden Sie das optimale Modell für Ihre Hardwareumgebung herunter und erleben Sie die überwältigende Freiheit und die Möglichkeiten der lokalen KI.&lt;/p></description></item></channel></rss>