<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Workflow on kenji.blog</title><link>http://kenji.blog/de/tags/workflow/</link><description>Recent content in Workflow on kenji.blog</description><generator>Hugo -- gohugo.io</generator><language>de</language><copyright>kenjinote</copyright><lastBuildDate>Fri, 11 Sep 2026 21:00:00 +0900</lastBuildDate><atom:link href="http://kenji.blog/de/tags/workflow/index.xml" rel="self" type="application/rss+xml"/><item><title>Entwicklungseffizienz durch die richtige Balance zwischen Copilot und lokaler KI maximieren</title><link>http://kenji.blog/de/p/hybrid-ai-development-workflow/</link><pubDate>Fri, 11 Sep 2026 21:00:00 +0900</pubDate><guid>http://kenji.blog/de/p/hybrid-ai-development-workflow/</guid><description>&lt;img src="http://kenji.blog/p/hybrid-ai-development-workflow/img/eyecatch.jpg" alt="Featured image of post Entwicklungseffizienz durch die richtige Balance zwischen Copilot und lokaler KI maximieren" />&lt;h1 id="entwicklungseffizienz-maximieren-durch-die-richtige-balance-zwischen-copilot-und-lokaler-ki-der-vollständige-leitfaden-für-hybride-ki-entwicklungsworkflows">Entwicklungseffizienz maximieren durch die richtige Balance zwischen Copilot und lokaler KI: Der vollständige Leitfaden für hybride KI-Entwicklungsworkflows
&lt;/h1>&lt;p>In der modernen Softwareentwicklung hat sich die Nutzung von KI-Assistenten von einem &amp;ldquo;nice-to-have&amp;rdquo; Werkzeug zu einer &amp;ldquo;unverzichtbaren&amp;rdquo; Infrastruktur entwickelt. Insbesondere seit der Einführung von GitHub Copilot hat sich die Programmiererfahrung für Entwickler dramatisch verändert. Es ist jedoch nicht immer die optimale Lösung, sich bei allen Aufgaben auf KI in der Cloud zu verlassen.&lt;/p>
&lt;p>Beim Umgang mit vertraulichen Unternehmensinformationen (Secret-Keys, proprietäre Algorithmen, unveröffentlichte Architekturen) bestehen Sicherheitsrisiken, Latenzzeiten (Verzögerungen) bei APIs und zudem Herausforderungen beim Arbeiten in Offline-Umgebungen ohne Netzwerkverbindung. Daher hat in den letzten Jahren die Nutzung von &lt;strong>lokal laufenden offenen Modellen (lokale KI)&lt;/strong> wie Llama 3, CodeLlama und Mistral rapide an Aufmerksamkeit gewonnen.&lt;/p>
&lt;p>In diesem Artikel werden wir äußerst detailliert erläutern, wie man Cloud-basierte KI (wie GitHub Copilot und GPT-4) und lokale KI kombinieren und gezielt einsetzen kann, um die Entwicklungseffizienz zu maximieren (zu steigern) – vom Architekturdesign über konkrete Entscheidungsbäume bis hin zur mathematischen Analyse von Kosten und Latenz.&lt;/p>
&lt;hr>
&lt;h2 id="1-cloud-ki-und-lokale-ki-im-umfassenden-vergleich">1. Cloud-KI und lokale KI im umfassenden Vergleich
&lt;/h2>&lt;p>Beim Aufbau eines hybriden KI-Entwicklungsworkflows ist es zunächst wichtig, die jeweiligen Eigenschaften tiefgreifend zu verstehen.&lt;/p>
&lt;h3 id="11-cloud-basierte-ki-github-copilot-gpt-4-claude-35-sonnet">1.1 Cloud-basierte KI (GitHub Copilot, GPT-4, Claude 3.5 Sonnet)
&lt;/h3>&lt;p>Die größte Waffe der Cloud-KI liegt in ihrer &amp;ldquo;überwältigenden Modellgröße&amp;rdquo; und &amp;ldquo;allgemeinen Schlussfolgerungsfähigkeit&amp;rdquo;. Da sie auf riesigen GPU-Clustern läuft, können Modelle in einer Größenordnung von zig Milliarden bis Billionen Parametern mit hoher Geschwindigkeit ausgeführt werden.&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Vorteile (Pros)&lt;/strong>:
&lt;ul>
&lt;li>&lt;strong>Unübertroffene Schlussfolgerungsfähigkeit&lt;/strong>: Bei Aufgaben, die ein tiefes Verständnis des Kontexts erfordern – wie das Identifizieren komplexer Bugs, das Zero-Base-Design von Architekturen oder anspruchsvolles Refactoring über mehrere Dateien hinweg –, ist sie unübertroffen.&lt;/li>
&lt;li>&lt;strong>Riesiges Kontextfenster&lt;/strong>: Moderne Modelle verfügen über ein Kontextfenster von 100k bis 2M Tokens, was es ermöglicht, die Codebasis des gesamten Projekts auf einmal zu laden und zu analysieren.&lt;/li>
&lt;li>&lt;strong>Kein Infrastrukturmanagement erforderlich&lt;/strong>: Entwickler müssen sich nicht um GPU-Ressourcen oder Modell-Updates kümmern.&lt;/li>
&lt;/ul>
&lt;/li>
&lt;li>&lt;strong>Nachteile (Cons)&lt;/strong>:
&lt;ul>
&lt;li>&lt;strong>Datenschutz und Sicherheit&lt;/strong>: Da der Code an externe Server gesendet wird, kann die Nutzung in Unternehmen oder Projekten, die strenge Compliance-Vorgaben haben, eingeschränkt sein.&lt;/li>
&lt;li>&lt;strong>Latenz&lt;/strong>: Da sie von der Netzwerkverbindung abhängt, können bei Inline-Vervollständigungen, die Antworten im Millisekundenbereich erfordern, Verzögerungen auftreten.&lt;/li>
&lt;li>&lt;strong>Kosten&lt;/strong>: Es fallen nutzungsabhängige Gebühren (Pay-as-you-go) oder monatliche Abonnementkosten an, was bei großflächiger Nutzung zu erheblichen laufenden Kosten führen kann.&lt;/li>
&lt;/ul>
&lt;/li>
&lt;/ul>
&lt;h3 id="12-lokale-ki-llama-3-codellama-qwen25-coder-usw">1.2 Lokale KI (Llama 3, CodeLlama, Qwen2.5-Coder usw.)
&lt;/h3>&lt;p>Lokale KI bezieht sich auf Modelle, die direkt auf der lokalen Maschine des Entwicklers ausgeführt werden (z. B. auf einem MacBook mit Apple Silicon oder einem Windows-PC mit einer NVIDIA-GPU). Dank der Weiterentwicklung von Quantisierungstechniken (GGUF, AWQ, GPTQ usw.) können Modelle der 8B- bis 70B-Klasse mittlerweile auch auf Standard-Entwicklungs-PCs mit praxistauglicher Geschwindigkeit betrieben werden.&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Vorteile (Pros)&lt;/strong>:
&lt;ul>
&lt;li>&lt;strong>Ultimativer Datenschutz&lt;/strong>: Daten verlassen das lokale Netzwerk unter keinen Umständen. Ideal für die Arbeit an streng geheimen Projekten oder Codebasen, die strengen NDAs unterliegen.&lt;/li>
&lt;li>&lt;strong>Null Netzwerk-Latenz&lt;/strong>: Unabhängig von der Geschwindigkeit der Internetverbindung wird immer mit konstanter Geschwindigkeit geantwortet.&lt;/li>
&lt;li>&lt;strong>Betrieb in Offline-Umgebungen&lt;/strong>: Der volle Funktionsumfang kann auch in Flugzeugen oder in Umgebungen genutzt werden, die aus Sicherheitsgründen vom externen Netzwerk isoliert sind.&lt;/li>
&lt;li>&lt;strong>Grenzenlose Anpassbarkeit&lt;/strong>: Man kann spezifisches Fine-Tuning für bestimmte Sprachen oder Frameworks durchführen oder eigenes Prompt-Engineering frei integrieren.&lt;/li>
&lt;/ul>
&lt;/li>
&lt;li>&lt;strong>Nachteile (Cons)&lt;/strong>:
&lt;ul>
&lt;li>&lt;strong>Hardwareanforderungen&lt;/strong>: Für einen reibungslosen Betrieb ist eine Maschine mit ausreichendem VRAM (Videospeicher) erforderlich (z. B. 16 GB bis 24 GB+ VRAM oder 32 GB+ Unified Memory bei M-Serie-Chips).&lt;/li>
&lt;li>&lt;strong>Grenzen der Modellleistung&lt;/strong>: Aufgrund von Hardwarebeschränkungen ist die ausführbare Modellgröße limitiert, sodass sie bei komplexen logischen Schlussfolgerungen oft nicht an die Leistung der GPT-4-Klasse heranreicht.&lt;/li>
&lt;li>&lt;strong>Begrenzung des Kontextfensters&lt;/strong>: Aus Speicherplatzgründen ist die verarbeitbare Kontextlänge in der Regel auf einige Tausend bis Zehntausend Tokens beschränkt.&lt;/li>
&lt;/ul>
&lt;/li>
&lt;/ul>
&lt;hr>
&lt;h2 id="2-architekturdesign-des-hybriden-ki-workflows">2. Architekturdesign des hybriden KI-Workflows
&lt;/h2>&lt;p>Um die bestmögliche Entwicklungserfahrung zu erzielen, müssen diese Tools in einer einzigen IDE (z. B. VS Code, Cursor, Neovim) integriert und eine Architektur aufgebaut werden, die einen nahtlosen Wechsel ermöglicht.&lt;/p>
&lt;p>Das folgende Mermaid-Diagramm zeigt die hybride Architektur, wie lokale Agenten und Cloud-Dienste zusammenarbeiten und die Aufgaben der Entwickler verteilt verarbeiten.&lt;/p>
&lt;div class="mermaid">graph TD
Dev["Entwickler (IDE)"] -->|"Echtzeit-Tippen"| LocalProxy{"Intelligenter Router / Proxy"}
LocalProxy -->|"Schnelle, datenschutzorientierte Aufgabe"| LocalAI["Lokale KI-Engine (Ollama / LM Studio)"]
LocalProxy -->|"Komplexe Logik, großer Kontext"| CloudAI["Cloud KI-Engine (Copilot / OpenAI API)"]
subgraph "Lokale Umgebung"
LocalAI --> ModelA["Llama-3-8B-Instruct (GGUF)"]
LocalAI --> ModelB["CodeLlama-13B (GGUF)"]
VectorDB["Lokale Vektor-DB (Chroma/FAISS)"] -.->|"RAG-Kontext"| LocalAI
end
subgraph "Cloud-Umgebung"
CloudAI --> GPT4["GPT-4o / Claude 3.5"]
CloudAI --> CopilotBackend["GitHub Copilot Backend"]
end
LocalAI --> ResponseLocal["Antwort &lt; 200ms"]
CloudAI --> ResponseCloud["Antwort 1s - 5s"]
ResponseLocal --> Dev
ResponseCloud --> Dev&lt;/div>
&lt;p>Das Herzstück dieser Architektur ist die Präsenz des &lt;strong>Intelligent Routers (Intelligenter Router)&lt;/strong>. Abhängig vom Kontext des vom Entwickler geschriebenen Codes, der Geheimhaltungsstufe der Zieldatei und der Komplexität der angeforderten Aufgabe leitet die Erweiterung in der IDE die Anfragen automatisch (oder schnell manuell) an das lokale Modell oder das Cloud-Modell weiter.&lt;/p>
&lt;p>Beispielsweise wird die Vervollständigung einer einfachen Funktionsdefinition oder die Generierung von Boilerplate-Code an ein lokales Modell (wie Llama 3 8B) gesendet, das in wenigen Dutzend Millisekunden antwortet. Fragen zum Design des gesamten Projekts oder Chat-Prompts, die ein umfangreiches Refactoring beinhalten, werden hingegen dynamisch an GPT-4 in der Cloud weitergeleitet.&lt;/p>
&lt;hr>
&lt;h2 id="3-entscheidungskriterien-für-die-nutzung-entscheidungsbaum">3. Entscheidungskriterien für die Nutzung: Entscheidungsbaum
&lt;/h2>&lt;p>Wie sollten Entwickler in der realen Programmierpraxis entscheiden, &amp;ldquo;welche KI soll ich jetzt nutzen&amp;rdquo;? Der folgende Entscheidungsbaum definiert den Beurteilungsfluss visuell.&lt;/p>
&lt;div class="mermaid">graph TD
Start["Neue Programmieraufgabe"] --> Q1{"Ist der Code streng vertraulich?"}
Q1 -->|Ja| Action1["Nutze Lokale KI (Llama 3 / CodeLlama)"]
Q1 -->|Nein| Q2{"Ist es eine einfache Inline-Vervollständigung?"}
Q2 -->|Ja| Q3{"Ist die Netzwerkverbindung stabil?"}
Q3 -->|Ja| Action2["Nutze GitHub Copilot"]
Q3 -->|Nein| Action1
Q2 -->|Nein| Q4{"Wird komplexe Architekturlogik oder dateiübergreifendes Refactoring benötigt?"}
Q4 -->|Ja| Action3["Nutze Cloud-KI (GPT-4 / Claude 3.5 Sonnet)"]
Q4 -->|Nein| Action4["Nutze Lokale KI für mittlere Aufgaben, um API-Kosten zu sparen"]&lt;/div>
&lt;h3 id="31-bewertungsachse-1-vertraulichkeit-privacy-and-security">3.1 Bewertungsachse 1: Vertraulichkeit (Privacy and Security)
&lt;/h3>&lt;p>Dies ist das wichtigste Entscheidungskriterium. Bei Testcode, der Kundendaten enthält, deren externe Übertragung durch Unternehmensrichtlinien verboten ist, oder in Dateien, in denen proprietäre Kernalgorithmen implementiert sind, wird kompromisslos die lokale KI gewählt. Eine sehr effektive Methode besteht auch darin, lokal RAG (Retrieval-Augmented Generation) aufzubauen, interne Dokumente in einem Vektorspeicher zu speichern und sie von der lokalen LLM referenzieren zu lassen.&lt;/p>
&lt;h3 id="32-bewertungsachse-2-latenz-latency">3.2 Bewertungsachse 2: Latenz (Latency)
&lt;/h3>&lt;p>Um den Denkfluss nicht zu unterbrechen, ist die Latenz bei der Vervollständigung von entscheidender Bedeutung. Bei der Cloud-KI tritt immer eine Netzwerk-Round-Trip-Zeit (RTT) auf. Da die lokale KI keine Netzwerkverzögerung hat, kann man durch das Bereithalten eines leichtgewichtigen Modells im VRAM eine gefühlte Geschwindigkeit erreichen, die die der Cloud übertrifft.&lt;/p>
&lt;h3 id="33-bewertungsachse-3-kontextfenster-context-window">3.3 Bewertungsachse 3: Kontextfenster (Context Window)
&lt;/h3>&lt;p>Für Prompts wie &amp;ldquo;Lies alle Dateien in diesem Repository und organisiere die Abhängigkeiten&amp;rdquo; ist eine Cloud-KI, die über 100k Tokens verarbeiten kann, unerlässlich. Wenn man versucht, zehntausende Tokens mit einem lokalen Modell zu verarbeiten, geht entweder der Speicher aus oder die Inferenzgeschwindigkeit sinkt dramatisch (z. B. auf mehrere Sekunden pro Token).&lt;/p>
&lt;hr>
&lt;h2 id="4-mathematische-analyse-von-kosten-und-verzögerung-mathematical-analysis">4. Mathematische Analyse von Kosten und Verzögerung (Mathematical Analysis)
&lt;/h2>&lt;p>Lassen Sie uns die Vorteile des hybriden Workflows anhand von mathematischen Formeln quantitativ analysieren.&lt;/p>
&lt;h3 id="41-kostenberechnungsmodell">4.1 Kostenberechnungsmodell
&lt;/h3>&lt;p>Wir formulieren die Kosten für die ausschließliche Nutzung einer Cloud-API (z. B. GPT-4). Die Gesamtkosten pro Tag in einem Entwicklungsprojekt $C_{total}$ sind die Summe der Anzahl der Eingabe- und Ausgabe-Tokens für jeden Prompt multipliziert mit dem jeweiligen Stückpreis.&lt;/p>
$$ C_{total} = \sum_{i=1}^{N} \left( P_{in} \times T_{in}^{(i)} + P_{out} \times T_{out}^{(i)} \right) $$
&lt;ul>
&lt;li>$N$ : Anzahl der API-Aufrufe pro Tag&lt;/li>
&lt;li>$P_{in}$ : Preis pro Eingabe-Token&lt;/li>
&lt;li>$P_{out}$ : Preis pro Ausgabe-Token&lt;/li>
&lt;li>$T_{in}^{(i)}$ : Anzahl der Eingabe-Tokens für den $i$-ten Aufruf&lt;/li>
&lt;li>$T_{out}^{(i)}$ : Anzahl der Ausgabe-Tokens für den $i$-ten Aufruf&lt;/li>
&lt;/ul>
&lt;p>Wenn wir eine lokale KI einführen und annehmen, dass wir einen Anteil $\alpha$ (0 &amp;lt; $\alpha$ &amp;lt; 1) der Aufrufe $N$ auf das lokale Modell auslagern können, werden die neuen Cloud-API-Kosten $C_{hybrid}$ wie folgt reduziert:&lt;/p>
$$ C_{hybrid} = (1 - \alpha) \sum_{i=1}^{N} \left( P_{in} \times T_{in}^{(i)} + P_{out} \times T_{out}^{(i)} \right) = (1 - \alpha) C_{total} $$
&lt;p>Selbst wenn man Hardware-Abschreibungen und Stromkosten berücksichtigt, führt eine Erhöhung von $\alpha$ auf 50% bis 70% langfristig zu einer drastischen Kostenreduzierung.&lt;/p>
&lt;h3 id="42-latenzmodell-verzögerung">4.2 Latenzmodell (Verzögerung)
&lt;/h3>&lt;p>Wir modellieren die Zeit, vom Absenden des Prompts durch den Nutzer bis zum Erscheinen des ersten Zeichens (Time To First Token: TTFT).&lt;/p>
&lt;p>Die Verzögerung der Cloud-KI $L_{cloud}$ wird durch folgende Formel ausgedrückt:&lt;/p>
$$ L_{cloud} = L_{network\_rtt} + L_{queue} + \frac{T_{in}}{S_{process\_cloud}} $$
&lt;ul>
&lt;li>$L_{network\_rtt}$ : Netzwerk-Round-Trip-Zeit (normalerweise 20ms - 200ms)&lt;/li>
&lt;li>$L_{queue}$ : Wartezeit in der Warteschlange beim Cloud-Anbieter (steigt bei Überlastung)&lt;/li>
&lt;li>$S_{process\_cloud}$ : Token-Verarbeitungsgeschwindigkeit der Cloud-GPU (Tokens/Sek.)&lt;/li>
&lt;/ul>
&lt;p>Auf der anderen Seite sieht die Verzögerung der lokalen KI $L_{local}$ wie folgt aus:&lt;/p>
$$ L_{local} = \frac{T_{in}}{S_{process\_local}} $$
&lt;p>Da die Netzwerkverzögerung $L_{network\_rtt}$ und die Cloud-Warteschlangenverzögerung $L_{queue}$ auf Null fallen, ist bei ausreichend hoher Verarbeitungsgeschwindigkeit der lokalen GPU $S_{process\_local}$ eine extrem schnelle Antwort (TTFT) im Millisekundenbereich möglich. Dies ist der Grund, warum lokale KI das stärkste Werkzeug für die Inline-Vervollständigung sein kann.&lt;/p>
&lt;hr>
&lt;h2 id="5-detaillierte-betrachtung-spezifischer-anwendungsfälle-im-entwicklungsalltag">5. Detaillierte Betrachtung spezifischer Anwendungsfälle im Entwicklungsalltag
&lt;/h2>&lt;h3 id="anwendungsfall-1-generierung-von-boilerplate-code-und-inline-vervollständigung-durch-github-copilot">Anwendungsfall 1: Generierung von Boilerplate-Code und Inline-Vervollständigung durch GitHub Copilot
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>Szenario&lt;/strong>: Wenn das Grundgerüst für React-Komponenten erstellt oder routinemäßige Fehlerbehandlungen geschrieben werden.&lt;/li>
&lt;li>&lt;strong>Ansatz&lt;/strong>: Dies ist die absolute Stärke von Copilot. Während des Tippens liest es kontinuierlich den Kontext im Hintergrund und schlägt präzise einige bis Dutzende Zeilen Code vor. Das Erlebnis, den Code durch einfaches Drücken der &amp;ldquo;Tab-Taste&amp;rdquo; zu vervollständigen, ohne den Denkfluss zu unterbrechen, erhöht die Entwicklungsgeschwindigkeit am unmittelbarsten.&lt;/li>
&lt;/ul>
&lt;h3 id="anwendungsfall-2-refactoring-von-vertraulichem-code-durch-lokale-ki-codellama--llama-3">Anwendungsfall 2: Refactoring von vertraulichem Code durch lokale KI (CodeLlama / Llama 3)
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>Szenario&lt;/strong>: Wenn Datenbankpasswörter, proprietäre Verschlüsselungslogik oder die Kernlogik neuer, unveröffentlichter Funktionen refaktorisiert werden sollen.&lt;/li>
&lt;li>&lt;strong>Ansatz&lt;/strong>: Man blockiert vorübergehend den Netzwerkzugriff der IDE oder nutzt eine spezielle Erweiterung für lokale KI (z. B. Continue.dev), um Prompts an das lokal laufende Modell (z. B. via Ollama) zu senden. So kann man KI-Unterstützung in Anspruch nehmen, während das Risiko eines Datenlecks bei Null bleibt.&lt;/li>
&lt;/ul>
&lt;h3 id="anwendungsfall-3-architekturdesign-und-komplexe-fehlerbehebung-durch-cloud-llms-gpt-4--claude-35-sonnet">Anwendungsfall 3: Architekturdesign und komplexe Fehlerbehebung durch Cloud-LLMs (GPT-4 / Claude 3.5 Sonnet)
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>Szenario&lt;/strong>: Die Analyse eines Speicherlecks unbekannter Ursache oder hochrangige Designberatung wie &amp;ldquo;Was ist der beste Ansatz, um diese monolithische App in Microservices aufzuteilen?&amp;rdquo;.&lt;/li>
&lt;li>&lt;strong>Ansatz&lt;/strong>: Solche Aufgaben erfordern ein immenses Vorwissen und hochgradig logische Schlussfolgerungsfähigkeiten. Auch wenn es Kosten verursacht, sollte man die intelligentesten Cloud-Modelle nutzen. Man übergibt Dutzende von Dateien als Kontext und lässt das Modell tiefgehend analysieren, &amp;ldquo;wo das Problem liegt&amp;rdquo;.&lt;/li>
&lt;/ul>
&lt;hr>
&lt;h2 id="6-leitfaden-zur-einrichtung-einer-lokalen-ki-umgebung-praxisteil">6. Leitfaden zur Einrichtung einer lokalen KI-Umgebung (Praxisteil)
&lt;/h2>&lt;p>Hier stellen wir kurz die konkreten Schritte zur Einführung von lokaler KI vor. Derzeit ist der einfachste und leistungsfähigste Ansatz die Nutzung von &lt;strong>Ollama&lt;/strong> oder &lt;strong>LM Studio&lt;/strong>.&lt;/p>
&lt;h3 id="61-installation-von-ollama">6.1 Installation von Ollama
&lt;/h3>&lt;p>Ollama ist ein leichtgewichtiges Framework zum Ausführen von LLMs in lokalen Umgebungen. Es unterstützt MacOS, Windows und Linux und ermöglicht die Verwaltung von Modellen auf intuitive Weise, ähnlich wie Docker.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Für MacOS&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">brew install ollama
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Starten des Servers&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">ollama serve
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Herunterladen und Ausführen des Llama 3 (8B) Modells&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">ollama run llama3
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Ausführen von CodeLlama, das auf Programmierung spezialisiert ist&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">ollama run codellama
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="62-integration-in-den-editor-nutzung-von-continuedev">6.2 Integration in den Editor (Nutzung von Continue.dev)
&lt;/h3>&lt;p>Um lokale Modelle in VS Code oder JetBrains IDEs zu nutzen, ist die Open-Source-Erweiterung &lt;strong>Continue&lt;/strong> hervorragend geeignet.
Indem man einfach den lokalen Ollama-Server als Endpunkt in der Einstellungsdatei von Continue (&lt;code>config.json&lt;/code>) angibt, werden der IDE ein Chat-Fenster im Stil von ChatGPT sowie Funktionen zur Code-Hervorhebung und -Bearbeitung hinzugefügt.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;span class="lnt">14
&lt;/span>&lt;span class="lnt">15
&lt;/span>&lt;span class="lnt">16
&lt;/span>&lt;span class="lnt">17
&lt;/span>&lt;span class="lnt">18
&lt;/span>&lt;span class="lnt">19
&lt;/span>&lt;span class="lnt">20
&lt;/span>&lt;span class="lnt">21
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-json" data-lang="json">&lt;span class="line">&lt;span class="cl">&lt;span class="p">{&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;models&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="p">[&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">{&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;title&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;Ollama Llama 3&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;provider&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;ollama&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;model&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;llama3&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;apiBase&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;http://localhost:11434&amp;#34;&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">},&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">{&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;title&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;GPT-4&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;provider&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;openai&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;model&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;gpt-4&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;apiKey&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;sk-your-openai-api-key&amp;#34;&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">}&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">],&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;tabAutocompleteModel&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="p">{&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;title&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;Starcoder 2&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;provider&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;ollama&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;model&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;starcoder2&amp;#34;&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">}&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="p">}&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>Durch diese Konfiguration können Entwickler bei Bedarf über ein Dropdown-Menü sofort zwischen dem &amp;ldquo;lokalen Modell&amp;rdquo; und dem &amp;ldquo;Cloud-Modell&amp;rdquo; wechseln, um zu chatten oder Code zu vervollständigen.&lt;/p>
&lt;hr>
&lt;h2 id="7-die-zukunft-der-ki-gestützten-entwicklung-der-aufstieg-autonomer-agenten">7. Die Zukunft der KI-gestützten Entwicklung: Der Aufstieg autonomer Agenten
&lt;/h2>&lt;p>Der aktuelle hybride Workflow basiert auf dem Paradigma eines Co-Piloten (Copilot), bei dem &amp;ldquo;der Mensch der KI Anweisungen gibt&amp;rdquo;. In einigen Jahren wird sich dies jedoch weiterentwickeln, und wir werden in die Ära &lt;strong>hierarchischer autonomer KI-Agenten&lt;/strong> eintreten. Dann wird ein leichtgewichtiges lokales Modell kontinuierlich die Codebasis überwachen und im Hintergrund Tests ausführen, und nur wenn es komplexe Fehler erkennt, wird es autonom ein riesiges Cloud-Modell aufrufen, um Lösungen zu generieren.&lt;/p>
&lt;p>In diesem Fall wird der lokale PC des Entwicklers nicht mehr nur ein Bildschirm zum Ausführen eines Editors sein, sondern eine starke Rolle als Frontlinie einer Inferenz-Engine (Edge-KI) übernehmen. Die kontinuierliche Aufrüstung des Speichers (VRAM / Unified Memory) bei Entwicklermaschinen durch Unternehmen wie NVIDIA und Apple geschieht im Hinblick auf genau diese Zukunft.&lt;/p>
&lt;hr>
&lt;h2 id="8-fazit-conclusion">8. Fazit (Conclusion)
&lt;/h2>&lt;p>Anstatt eines binären Gegensatzes von &amp;ldquo;Cloud GitHub Copilot&amp;rdquo; oder &amp;ldquo;Lokale KI&amp;rdquo; ist der &lt;strong>hybride Workflow, bei dem man die Stärken beider versteht und sie je nach Art der Aufgabe entsprechend einsetzt&lt;/strong>, die derzeit stärkste Entwicklungsumgebung.&lt;/p>
&lt;ul>
&lt;li>&lt;strong>GitHub Copilot / Cloud-API&lt;/strong>: Wird für die allgemeine Steigerung der Entwicklungsgeschwindigkeit, das Design komplexer Logik und die holistische Analyse des gesamten Projekts verwendet.&lt;/li>
&lt;li>&lt;strong>Lokale KI (Ollama, LM Studio)&lt;/strong>: Wird für die Verarbeitung vertraulichen Codes, in Offline-Umgebungen, für ultraschnelle Inline-Vervollständigungen ohne Netzwerk-Latenz und zur Reduzierung von API-Kosten verwendet.&lt;/li>
&lt;/ul>
&lt;p>Bitte nutzen Sie die in diesem Artikel vorgestellten Entscheidungsbäume und Architekturen als Referenz, um Ihre IDE-Umgebung auf die nächste Stufe zu heben. Indem Sie vom &amp;ldquo;Nutzer&amp;rdquo; von KI zu jemandem aufsteigen, der KI &amp;ldquo;kombiniert und sie am richtigen Ort einsetzt&amp;rdquo;, wird Ihre Entwicklungseffizienz zweifellos maximiert.&lt;/p>
&lt;p>Happy Coding with Hybrid AI!&lt;/p></description></item></channel></rss>