<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Workflow on kenji.blog</title><link>http://kenji.blog/ru/tags/workflow/</link><description>Recent content in Workflow on kenji.blog</description><generator>Hugo -- gohugo.io</generator><language>ru</language><copyright>kenjinote</copyright><lastBuildDate>Fri, 11 Sep 2026 21:00:00 +0900</lastBuildDate><atom:link href="http://kenji.blog/ru/tags/workflow/index.xml" rel="self" type="application/rss+xml"/><item><title>Использование Copilot и локального ИИ для резкого повышения эффективности разработки</title><link>http://kenji.blog/ru/p/hybrid-ai-development-workflow/</link><pubDate>Fri, 11 Sep 2026 21:00:00 +0900</pubDate><guid>http://kenji.blog/ru/p/hybrid-ai-development-workflow/</guid><description>&lt;img src="http://kenji.blog/p/hybrid-ai-development-workflow/img/eyecatch.jpg" alt="Featured image of post Использование Copilot и локального ИИ для резкого повышения эффективности разработки" />&lt;h1 id="использование-copilot-и-локального-ии-для-резкого-повышения-эффективности-разработки-полное-руководство-по-гибридному-процессу-разработки-с-ии">Использование Copilot и локального ИИ для резкого повышения эффективности разработки: Полное руководство по гибридному процессу разработки с ИИ
&lt;/h1>&lt;p>В современной разработке программного обеспечения использование ИИ-ассистентов эволюционировало из «удобного инструмента» в «незаменимую» инфраструктуру. В частности, после появления GitHub Copilot опыт написания кода разработчиками кардинально изменился. Однако зависимость от облачного ИИ для всех задач не всегда является оптимальным решением.&lt;/p>
&lt;p>Существует несколько проблем с облачным ИИ, таких как риски безопасности при работе с конфиденциальной корпоративной информацией (секретные ключи, проприетарные алгоритмы, нераскрытая архитектура), задержки API (latency) и работа в офлайн-средах без подключения к сети. В связи с этим в последние годы стремительно набирает популярность использование &lt;strong>локальных открытых моделей (локальный ИИ)&lt;/strong>, таких как Llama 3, CodeLlama и Mistral.&lt;/p>
&lt;p>В этой статье мы подробно расскажем, как максимизировать (резко повысить) эффективность разработки путем комбинирования и правильного использования облачного ИИ (GitHub Copilot, GPT-4 и др.) и локального ИИ. Мы рассмотрим все детально: от проектирования архитектуры до конкретных деревьев принятия решений и математического анализа стоимости и задержек.&lt;/p>
&lt;hr>
&lt;h2 id="1-тщательное-сравнение-облачного-и-локального-ии">1. Тщательное сравнение облачного и локального ИИ
&lt;/h2>&lt;p>При построении гибридного рабочего процесса разработки с ИИ в первую очередь важно глубоко понять особенности каждого из них.&lt;/p>
&lt;h3 id="11-облачный-ии-github-copilot-gpt-4-claude-35-sonnet">1.1 Облачный ИИ (GitHub Copilot, GPT-4, Claude 3.5 Sonnet)
&lt;/h3>&lt;p>Главным оружием облачного ИИ является его «огромный размер модели» и «универсальные способности к логическому выводу». Поскольку он работает на гигантских кластерах GPU, он может на высокой скорости выполнять модели масштабом от десятков миллиардов до триллионов параметров.&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Преимущества (Pros)&lt;/strong>:
&lt;ul>
&lt;li>&lt;strong>Непревзойденная способность к логическому выводу&lt;/strong>: Нет равных в задачах, требующих глубокого понимания контекста, таких как поиск сложных багов, проектирование архитектуры с нуля и продвинутый рефакторинг нескольких файлов.&lt;/li>
&lt;li>&lt;strong>Огромное контекстное окно&lt;/strong>: Современные модели имеют контекстное окно размером от 100k до 2M токенов, что позволяет загружать и анализировать всю кодовую базу проекта за один раз.&lt;/li>
&lt;li>&lt;strong>Отсутствие необходимости в управлении инфраструктурой&lt;/strong>: Разработчикам не нужно беспокоиться о ресурсах GPU или обновлениях моделей.&lt;/li>
&lt;/ul>
&lt;/li>
&lt;li>&lt;strong>Недостатки (Cons)&lt;/strong>:
&lt;ul>
&lt;li>&lt;strong>Конфиденциальность и безопасность&lt;/strong>: Поскольку код отправляется на внешние серверы, использование может быть ограничено в компаниях или проектах, требующих строгого соблюдения нормативных требований (комплаенса).&lt;/li>
&lt;li>&lt;strong>Задержка&lt;/strong>: Поскольку она зависит от состояния сетевого соединения, могут возникать задержки при встроенном (inline) автодополнении, где требуется ответ в миллисекундах.&lt;/li>
&lt;li>&lt;strong>Стоимость&lt;/strong>: Взимается плата за использование или ежемесячная абонентская плата, и при масштабном использовании эксплуатационные расходы становятся существенными.&lt;/li>
&lt;/ul>
&lt;/li>
&lt;/ul>
&lt;h3 id="12-локальный-ии-llama-3-codellama-qwen25-coder-и-др">1.2 Локальный ИИ (Llama 3, CodeLlama, Qwen2.5-Coder и др.)
&lt;/h3>&lt;p>Локальный ИИ — это модель, которая выполняется непосредственно на локальном компьютере разработчика (MacBook с Apple Silicon, ПК на Windows с GPU от NVIDIA и т. д.). Благодаря развитию технологий квантования (GGUF, AWQ, GPTQ и др.) модели класса 8B–70B теперь могут работать с практичной скоростью на обычных ПК для разработки.&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Преимущества (Pros)&lt;/strong>:
&lt;ul>
&lt;li>&lt;strong>Абсолютная конфиденциальность&lt;/strong>: Данные вообще не выходят во внешнюю сеть. Идеально подходит для работы над сверхсекретными проектами или кодовыми базами, находящимися под строгими NDA.&lt;/li>
&lt;li>&lt;strong>Нулевая сетевая задержка&lt;/strong>: Не зависит от скорости интернет-соединения и всегда возвращает ответ с постоянной скоростью.&lt;/li>
&lt;li>&lt;strong>Работа в офлайн-среде&lt;/strong>: Вы можете использовать весь функционал даже в самолете или в среде, изолированной от внешних сетей по соображениям безопасности.&lt;/li>
&lt;li>&lt;strong>Безграничная кастомизация&lt;/strong>: Вы можете свободно выполнять тонкую настройку (fine-tuning) для конкретных языков или фреймворков и внедрять собственную инженерию промптов.&lt;/li>
&lt;/ul>
&lt;/li>
&lt;li>&lt;strong>Недостатки (Cons)&lt;/strong>:
&lt;ul>
&lt;li>&lt;strong>Требования к аппаратному обеспечению&lt;/strong>: Для комфортной работы требуется компьютер с достаточным объемом VRAM (видеопамяти) (например, VRAM 16–24 ГБ и более, или объединенная память 32 ГБ и более для чипов серии M).&lt;/li>
&lt;li>&lt;strong>Ограничения производительности модели&lt;/strong>: Из-за аппаратных ограничений существуют пределы размера моделей, которые можно запустить, и они часто уступают моделям класса GPT-4 в сложных логических рассуждениях.&lt;/li>
&lt;li>&lt;strong>Ограничения контекстного окна&lt;/strong>: Из-за объема памяти длина контекста, которую можно обработать, как правило, ограничена несколькими тысячами или десятками тысяч токенов.&lt;/li>
&lt;/ul>
&lt;/li>
&lt;/ul>
&lt;hr>
&lt;h2 id="2-проектирование-архитектуры-гибридного-рабочего-процесса-ии">2. Проектирование архитектуры гибридного рабочего процесса ИИ
&lt;/h2>&lt;p>Чтобы получить лучший опыт разработки, необходимо интегрировать эти инструменты в одну IDE (например, VS Code, Cursor, Neovim) и построить архитектуру, позволяющую беспрепятственно переключаться между ними.&lt;/p>
&lt;p>Следующая диаграмма Mermaid показывает гибридную архитектуру того, как локальные агенты и облачные сервисы взаимодействуют и распределяют задачи разработчика.&lt;/p>
&lt;div class="mermaid">graph TD
Dev["Разработчик (IDE)"] -->|"Печать в реальном времени"| LocalProxy{"Интеллектуальный маршрутизатор / Прокси"}
LocalProxy -->|"Быстрая задача, приоритет конфиденциальности"| LocalAI["Локальный ИИ-движок (Ollama / LM Studio)"]
LocalProxy -->|"Сложная логика, большой контекст"| CloudAI["Облачный ИИ-движок (Copilot / OpenAI API)"]
subgraph "Локальная среда"
LocalAI --> ModelA["Llama-3-8B-Instruct (GGUF)"]
LocalAI --> ModelB["CodeLlama-13B (GGUF)"]
VectorDB["Локальная векторная БД (Chroma/FAISS)"] -.->|"Контекст RAG"| LocalAI
end
subgraph "Облачная среда"
CloudAI --> GPT4["GPT-4o / Claude 3.5"]
CloudAI --> CopilotBackend["Бэкенд GitHub Copilot"]
end
LocalAI --> ResponseLocal["Ответ &lt; 200 мс"]
CloudAI --> ResponseCloud["Ответ 1с - 5с"]
ResponseLocal --> Dev
ResponseCloud --> Dev&lt;/div>
&lt;p>Суть этой архитектуры заключается в наличии &lt;strong>Intelligent Router (Интеллектуального маршрутизатора)&lt;/strong>. Расширение в IDE автоматически (или быстро вручную) перенаправляет запросы к локальным или облачным моделям в зависимости от контекста кода, который пишет разработчик, уровня конфиденциальности целевого файла и сложности требуемой задачи.&lt;/p>
&lt;p>Например, автодополнение простого определения функции или генерация шаблонного кода будут отправлены на локальную модель (например, Llama 3 8B), которая ответит за десятки миллисекунд, тогда как вопросы, связанные с проектированием всего проекта, или запросы в чат, предполагающие масштабный рефакторинг, будут отправлены в облачный GPT-4. Это динамическое распределение.&lt;/p>
&lt;hr>
&lt;h2 id="3-критерии-выбора-дерево-принятия-решений">3. Критерии выбора: Дерево принятия решений
&lt;/h2>&lt;p>Как разработчикам в реальной практике программирования определить, «какой ИИ использовать прямо сейчас»? В следующем дереве принятия решений мы визуально определим процесс принятия решения.&lt;/p>
&lt;div class="mermaid">graph TD
Start["Новая задача по программированию"] --> Q1{"Код строго конфиденциален?"}
Q1 -->|Да| Action1["Использовать локальный ИИ (Llama 3 / CodeLlama)"]
Q1 -->|Нет| Q2{"Это простое встроенное автодополнение?"}
Q2 -->|Да| Q3{"Сетевое соединение стабильно?"}
Q3 -->|Да| Action2["Использовать GitHub Copilot"]
Q3 -->|Нет| Action1
Q2 -->|Нет| Q4{"Нужна сложная архитектурная логика или рефакторинг нескольких файлов?"}
Q4 -->|Да| Action3["Использовать облачный ИИ (GPT-4 / Claude 3.5 Sonnet)"]
Q4 -->|Нет| Action4["Использовать локальный ИИ для средних задач для экономии затрат на API"]&lt;/div>
&lt;h3 id="31-критерий-1-конфиденциальность-privacy-and-security">3.1 Критерий 1: Конфиденциальность (Privacy and Security)
&lt;/h3>&lt;p>Самый важный критерий. В тестовом коде, содержащем данные клиентов, отправка которых запрещена политикой компании, или в файлах, где реализованы базовые проприетарные алгоритмы, без компромиссов выбирается локальный ИИ. Создание локальной системы RAG (поисковой генерации) и хранение внутренней документации в векторном хранилище для использования локальной LLM — также очень эффективный метод.&lt;/p>
&lt;h3 id="32-критерий-2-задержка-latency">3.2 Критерий 2: Задержка (Latency)
&lt;/h3>&lt;p>Чтобы не прерывать скорость мышления, задержка автодополнения имеет решающее значение. Облачный ИИ всегда имеет время кругового обращения по сети (RTT). Поскольку у локального ИИ сетевая задержка равна нулю, то при постоянном нахождении легковесной модели в VRAM можно достичь субъективной скорости, превышающей скорость облака.&lt;/p>
&lt;h3 id="33-критерий-3-контекстное-окно-context-window">3.3 Критерий 3: Контекстное окно (Context Window)
&lt;/h3>&lt;p>Для промптов вроде «Прочитай все файлы в этом репозитории и организуй зависимости» необходим облачный ИИ, способный обработать 100k и более токенов. Если попытаться обработать десятки тысяч токенов с помощью локальной модели, либо закончится память, либо скорость логического вывода резко упадет (например, до нескольких секунд на токен).&lt;/p>
&lt;hr>
&lt;h2 id="4-математический-анализ-стоимости-и-задержки-mathematical-analysis">4. Математический анализ стоимости и задержки (Mathematical Analysis)
&lt;/h2>&lt;p>Давайте количественно проанализируем преимущества гибридного рабочего процесса с использованием математических формул.&lt;/p>
&lt;h3 id="41-модель-расчета-стоимости">4.1 Модель расчета стоимости
&lt;/h3>&lt;p>Выведем формулу для стоимости использования только облачного API (например, GPT-4). Общая стоимость $C_{total}$ за один день в проекте разработки — это сумма количества входящих и исходящих токенов для каждого промпта, умноженная на цену за единицу.&lt;/p>
$$ C_{total} = \sum_{i=1}^{N} \left( P_{in} \times T_{in}^{(i)} + P_{out} \times T_{out}^{(i)} \right) $$
&lt;ul>
&lt;li>$N$ : Количество вызовов API за день&lt;/li>
&lt;li>$P_{in}$ : Цена за 1 входящий токен&lt;/li>
&lt;li>$P_{out}$ : Цена за 1 исходящий токен&lt;/li>
&lt;li>$T_{in}^{(i)}$ : Количество входящих токенов для $i$-го вызова&lt;/li>
&lt;li>$T_{out}^{(i)}$ : Количество исходящих токенов для $i$-го вызова&lt;/li>
&lt;/ul>
&lt;p>Предположив, что мы внедрили локальный ИИ и смогли перенести долю $\alpha$ (0 &amp;lt; $\alpha$ &amp;lt; 1) из $N$ вызовов на локальную модель, новая стоимость облачного API $C_{hybrid}$ будет снижена следующим образом:&lt;/p>
$$ C_{hybrid} = (1 - \alpha) \sum_{i=1}^{N} \left( P_{in} \times T_{in}^{(i)} + P_{out} \times T_{out}^{(i)} \right) = (1 - \alpha) C_{total} $$
&lt;p>Даже с учетом амортизации оборудования и затрат на электроэнергию, если $\alpha$ удастся увеличить до 50%–70%, в долгосрочной перспективе это приведет к кардинальному эффекту снижения затрат.&lt;/p>
&lt;h3 id="42-модель-задержки-latency">4.2 Модель задержки (Latency)
&lt;/h3>&lt;p>Смоделируем время с момента отправки промпта пользователем до появления первого символа (Time To First Token: TTFT).&lt;/p>
&lt;p>Задержка облачного ИИ $L_{cloud}$ выражается следующей формулой:&lt;/p>
$$ L_{cloud} = L_{network\_rtt} + L_{queue} + \frac{T_{in}}{S_{process\_cloud}} $$
&lt;ul>
&lt;li>$L_{network\_rtt}$ : Время кругового обращения по сети (обычно 20 мс - 200 мс)&lt;/li>
&lt;li>$L_{queue}$ : Время ожидания в очереди на стороне облачного провайдера (увеличивается при перегрузке)&lt;/li>
&lt;li>$S_{process\_cloud}$ : Скорость обработки токенов облачным GPU (tokens/sec)&lt;/li>
&lt;/ul>
&lt;p>С другой стороны, задержка локального ИИ $L_{local}$ выглядит следующим образом:&lt;/p>
$$ L_{local} = \frac{T_{in}}{S_{process\_local}} $$
&lt;p>Поскольку сетевая задержка $L_{network\_rtt}$ и облачная задержка очереди $L_{queue}$ равны нулю, если $S_{process\_local}$ (скорость обработки локального GPU) достаточно высока, достигается сверхбыстрый ответ (TTFT) порядка нескольких миллисекунд. Вот почему локальный ИИ может быть лучшим инструментом для встроенного (inline) автодополнения.&lt;/p>
&lt;hr>
&lt;h2 id="5-по-сценариям-разработки-глубокое-погружение-в-конкретные-случаи-использования">5. По сценариям разработки: Глубокое погружение в конкретные случаи использования
&lt;/h2>&lt;h3 id="сценарий-1-генерация-шаблонного-кода-и-встроенное-автодополнение-с-помощью-github-copilot">Сценарий 1: Генерация шаблонного кода и встроенное автодополнение с помощью GitHub Copilot
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>Сценарий&lt;/strong>: Когда вам нужно создать каркас компонента React или написать стандартную обработку ошибок.&lt;/li>
&lt;li>&lt;strong>Подход&lt;/strong>: Здесь у Copilot нет конкурентов. Во время набора текста он постоянно считывает контекст в фоновом режиме и точно предлагает от нескольких строк до десятков строк кода. Опыт, когда код завершается простым нажатием «клавиши Tab» без прерывания мыслей, наиболее напрямую повышает скорость разработки.&lt;/li>
&lt;/ul>
&lt;h3 id="сценарий-2-рефакторинг-конфиденциального-кода-с-помощью-локального-ии-codellama--llama-3">Сценарий 2: Рефакторинг конфиденциального кода с помощью локального ИИ (CodeLlama / Llama 3)
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>Сценарий&lt;/strong>: Когда вы хотите провести рефакторинг паролей базы данных, проприетарной логики шифрования или основной логики еще не выпущенной новой функции.&lt;/li>
&lt;li>&lt;strong>Подход&lt;/strong>: Временно отключите доступ к сети в IDE или используйте расширение, предназначенное для локального ИИ (например, Continue.dev и т. д.), и отправьте промпт модели, работающей локально (например, через Ollama). Вы можете получать помощь ИИ, сохраняя риск утечки данных равным нулю.&lt;/li>
&lt;/ul>
&lt;h3 id="сценарий-3-проектирование-архитектуры-и-исправление-сложных-багов-с-помощью-облачных-llm-gpt-4--claude-35-sonnet">Сценарий 3: Проектирование архитектуры и исправление сложных багов с помощью облачных LLM (GPT-4 / Claude 3.5 Sonnet)
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>Сценарий&lt;/strong>: Анализ причин утечки памяти неизвестного происхождения или консультации по проектированию высокого уровня, такие как «Какой подход лучше всего использовать для разделения этого монолитного приложения на микросервисы?».&lt;/li>
&lt;li>&lt;strong>Подход&lt;/strong>: Такие задачи требуют огромных предварительных знаний и продвинутых навыков логического вывода. Стоит использовать самую умную облачную модель, даже если это требует затрат. Передайте десятки файлов в качестве контекста, чтобы она могла глубоко проанализировать, «где проблема».&lt;/li>
&lt;/ul>
&lt;hr>
&lt;h2 id="6-руководство-по-настройке-среды-локального-ии-практическая-часть">6. Руководство по настройке среды локального ИИ (Практическая часть)
&lt;/h2>&lt;p>Мы кратко опишем конкретные шаги по внедрению локального ИИ. В настоящее время наиболее простым и мощным подходом является использование &lt;strong>Ollama&lt;/strong> или &lt;strong>LM Studio&lt;/strong>.&lt;/p>
&lt;h3 id="61-установка-ollama">6.1 Установка Ollama
&lt;/h3>&lt;p>Ollama — это легковесный фреймворк для запуска LLM в локальной среде. Он поддерживает MacOS, Windows и Linux и позволяет управлять моделями интуитивно понятно, как в Docker.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Для MacOS&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">brew install ollama
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Запуск сервера&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">ollama serve
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Скачивание и запуск модели Llama 3 (8B)&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">ollama run llama3
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c1"># Запуск CodeLlama, специализированной на программировании&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">ollama run codellama
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;h3 id="62-интеграция-в-редактор-использование-continuedev">6.2 Интеграция в редактор (Использование Continue.dev)
&lt;/h3>&lt;p>Для использования локальных моделей в VS Code или JetBrains IDE отличным вариантом является опенсорсное расширение &lt;strong>Continue&lt;/strong>.
Просто указав локальный сервер Ollama в качестве конечной точки (endpoint) в файле конфигурации Continue (&lt;code>config.json&lt;/code>), вы добавите в IDE окно чата в стиле ChatGPT и функции выделения и редактирования кода.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;span class="lnt">14
&lt;/span>&lt;span class="lnt">15
&lt;/span>&lt;span class="lnt">16
&lt;/span>&lt;span class="lnt">17
&lt;/span>&lt;span class="lnt">18
&lt;/span>&lt;span class="lnt">19
&lt;/span>&lt;span class="lnt">20
&lt;/span>&lt;span class="lnt">21
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-json" data-lang="json">&lt;span class="line">&lt;span class="cl">&lt;span class="p">{&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;models&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="p">[&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">{&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;title&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;Ollama Llama 3&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;provider&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;ollama&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;model&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;llama3&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;apiBase&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;http://localhost:11434&amp;#34;&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">},&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">{&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;title&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;GPT-4&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;provider&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;openai&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;model&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;gpt-4&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;apiKey&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;sk-your-openai-api-key&amp;#34;&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">}&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">],&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;tabAutocompleteModel&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="p">{&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;title&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;Starcoder 2&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;provider&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;ollama&amp;#34;&lt;/span>&lt;span class="p">,&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="nt">&amp;#34;model&amp;#34;&lt;/span>&lt;span class="p">:&lt;/span> &lt;span class="s2">&amp;#34;starcoder2&amp;#34;&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl"> &lt;span class="p">}&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="p">}&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>С помощью этой настройки разработчики могут мгновенно переключаться между «локальной моделью» и «облачной моделью» из выпадающего меню по мере необходимости для общения в чате и автодополнения.&lt;/p>
&lt;hr>
&lt;h2 id="7-будущее-разработки-с-поддержкой-ии-рост-автономных-агентов">7. Будущее разработки с поддержкой ИИ: Рост автономных агентов
&lt;/h2>&lt;p>Современный гибридный рабочий процесс основан на парадигме «Второго пилота» (Copilot), где «человек дает инструкции ИИ». Однако через несколько лет он эволюционирует еще дальше, и наступит эра &lt;strong>иерархических автономных ИИ-агентов&lt;/strong>, когда легковесная локальная модель будет постоянно отслеживать кодовую базу, запускать тесты в фоновом режиме и автономно вызывать гигантскую облачную модель для создания решения только при обнаружении сложной ошибки.&lt;/p>
&lt;p>В этом случае локальный ПК разработчика будет играть сильную роль передовой (Edge AI) системы логического вывода, а не просто экрана для работы редактора. NVIDIA и Apple продолжают увеличивать объем памяти (VRAM / объединенная память) в компьютерах для разработчиков именно с прицелом на это будущее.&lt;/p>
&lt;hr>
&lt;h2 id="8-заключение-conclusion">8. Заключение (Conclusion)
&lt;/h2>&lt;p>Сейчас не время для дихотомии «облачный GitHub Copilot» или «локальный ИИ». &lt;strong>Гибридный рабочий процесс, который понимает сильные стороны обоих подходов и использует их в зависимости от характера задачи&lt;/strong> — это, безусловно, лучшая среда разработки на сегодняшний день.&lt;/p>
&lt;ul>
&lt;li>&lt;strong>GitHub Copilot / Облачный API&lt;/strong>: Используйте для универсального повышения скорости разработки, проектирования сложной логики и комплексного анализа всего проекта.&lt;/li>
&lt;li>&lt;strong>Локальный ИИ (Ollama, LM Studio)&lt;/strong>: Используйте для обработки высококонфиденциального кода, работы в офлайн-средах, сверхбыстрого встроенного автодополнения без сетевых задержек и снижения затрат на API.&lt;/li>
&lt;/ul>
&lt;p>Пожалуйста, используйте дерево принятия решений и архитектуру, представленные в этой статье, чтобы вывести вашу среду IDE на новый уровень. Сделав шаг от просто «использования» ИИ к «использованию нужных инструментов в нужном месте», вы несомненно резко повысите эффективность вашей разработки.&lt;/p>
&lt;p>Happy Coding with Hybrid AI!&lt;/p></description></item></channel></rss>