<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Llama on kenji.blog</title><link>http://kenji.blog/fr/tags/llama/</link><description>Recent content in Llama on kenji.blog</description><generator>Hugo -- gohugo.io</generator><language>fr</language><copyright>kenjinote</copyright><lastBuildDate>Fri, 11 Sep 2026 03:00:00 +0900</lastBuildDate><atom:link href="http://kenji.blog/fr/tags/llama/index.xml" rel="self" type="application/rss+xml"/><item><title>Le top 5 des modèles LLM open source recommandés à exécuter en local</title><link>http://kenji.blog/fr/p/top-5-open-source-local-llms/</link><pubDate>Fri, 11 Sep 2026 03:00:00 +0900</pubDate><guid>http://kenji.blog/fr/p/top-5-open-source-local-llms/</guid><description>&lt;img src="http://kenji.blog/p/top-5-open-source-local-llms/img/eyecatch.jpg" alt="Featured image of post Le top 5 des modèles LLM open source recommandés à exécuter en local" />&lt;h1 id="introduction">Introduction
&lt;/h1>&lt;p>Ces dernières années, l&amp;rsquo;évolution technologique des grands modèles de langage (LLM) a été remarquable, et les services d&amp;rsquo;IA basés sur le cloud comme ChatGPT et Claude se sont largement répandus. Cependant, dans le même temps, les besoins tels que &amp;ldquo;ne pas envoyer les données confidentielles de l&amp;rsquo;entreprise à des serveurs externes&amp;rdquo;, &amp;ldquo;réduire les coûts d&amp;rsquo;utilisation des API&amp;rdquo; ou &amp;ldquo;construire un système d&amp;rsquo;IA fonctionnant de manière totalement hors ligne&amp;rdquo; augmentent rapidement.&lt;/p>
&lt;p>Pour répondre à ces exigences, il existe les &amp;ldquo;LLM locaux (LLM open source)&amp;rdquo; que vous pouvez télécharger et exécuter directement sur votre PC ou serveur interne. Jusqu&amp;rsquo;en 2023 environ, il était difficile d&amp;rsquo;obtenir une précision pratique en local, mais grâce à l&amp;rsquo;évolution de l&amp;rsquo;architecture des modèles et au développement de la technologie de quantification (Quantization), il est désormais possible d&amp;rsquo;exécuter de manière très fluide des LLM extrêmement performants même sur des GPU grand public (NVIDIA RTX 3090 / 4090 ou Apple Silicon sur Mac, etc.).&lt;/p>
&lt;p>Dans cet article, parmi de nombreux LLM open source, nous avons sélectionné &amp;ldquo;les 5 meilleurs modèles recommandés&amp;rdquo; qui sont particulièrement bien notés en 2026. Nous comparerons et expliquerons en profondeur, avec une perspective extrêmement détaillée et technique, les caractéristiques de leur architecture, le nombre de paramètres, les exigences en matière de mémoire avec la quantification GGUF, jusqu&amp;rsquo;aux cas d&amp;rsquo;utilisation spécifiques.&lt;/p>
&lt;hr>
&lt;h1 id="pourquoi-exécuter-un-llm-en-local-">Pourquoi exécuter un LLM en local ?
&lt;/h1>&lt;p>Le déploiement d&amp;rsquo;un LLM local présente de nombreux avantages uniques que les API basées sur le cloud n&amp;rsquo;offrent pas.&lt;/p>
&lt;h3 id="1-garantie-dune-confidentialité-et-dune-sécurité-totales">1. Garantie d&amp;rsquo;une confidentialité et d&amp;rsquo;une sécurité totales
&lt;/h3>&lt;p>Lorsque vous utilisez une API cloud, les prompts et les données que vous saisissez sont envoyés aux serveurs d&amp;rsquo;une entreprise externe. Cela constitue un risque majeur lors de la manipulation d&amp;rsquo;informations personnelles ou de données confidentielles d&amp;rsquo;entreprise. Avec un LLM local, les données sont entièrement traitées au sein de votre terminal, ce qui permet de réduire à zéro le risque de fuite de données vers l&amp;rsquo;extérieur.&lt;/p>
&lt;h3 id="2-réduction-considérable-des-coûts">2. Réduction considérable des coûts
&lt;/h3>&lt;p>Les API commerciales (telles que l&amp;rsquo;API d&amp;rsquo;OpenAI) sont basées sur une facturation à l&amp;rsquo;utilisation selon le nombre de tokens d&amp;rsquo;entrée et de sortie. Si vous traitez une grande quantité de documents ou si vous laissez un chatbot fonctionner en permanence, cela peut coûter de plusieurs centaines à plusieurs milliers de dollars par mois. En revanche, avec un LLM local, avec le seul investissement initial dans le matériel et les frais d&amp;rsquo;électricité, vous pouvez l&amp;rsquo;utiliser autant de fois que vous le souhaitez avec un nombre illimité de tokens.&lt;/p>
&lt;h3 id="3-personnalisation-et-utilisation-hors-ligne">3. Personnalisation et utilisation hors ligne
&lt;/h3>&lt;p>Les LLM open source permettent d&amp;rsquo;effectuer facilement un fine-tuning (comme LoRA) à l&amp;rsquo;aide de vos propres jeux de données. De plus, ils peuvent être exécutés dans des environnements entièrement hors ligne sans connexion Internet ou dans des réseaux fermés sécurisés, ce qui les rend idéaux pour l&amp;rsquo;intégration dans des appareils edge (périphériques de périphérie).&lt;/p>
&lt;hr>
&lt;h1 id="connaissances-de-base-pour-exécuter-un-llm-local">Connaissances de base pour exécuter un LLM local
&lt;/h1>&lt;p>Avant d&amp;rsquo;introduire les modèles, revoyons mathématiquement &amp;ldquo;les exigences en VRAM&amp;rdquo; et &amp;ldquo;la quantification (Quantization)&amp;rdquo;, qui sont inévitables pour exécuter un LLM dans un environnement local.&lt;/p>
&lt;h2 id="base-mathématique-de-la-vram-mémoire-vidéo-et-de-la-quantification">Base mathématique de la VRAM (mémoire vidéo) et de la quantification
&lt;/h2>&lt;p>Pour exécuter une inférence LLM sur un GPU, il est nécessaire de déployer les paramètres (poids) du modèle dans la VRAM. Les besoins en mémoire $M$ d&amp;rsquo;un modèle peuvent être approximés par la formule suivante.&lt;/p>
$$ M = \frac{P \times B}{8} + C $$
&lt;p>Où :&lt;/p>
&lt;ul>
&lt;li>$M$ : Capacité de mémoire requise (Go)&lt;/li>
&lt;li>$P$ : Nombre de paramètres (Billion = milliard)&lt;/li>
&lt;li>$B$ : Nombre de bits par paramètre (16 bits pour FP16, 4 bits pour une quantification 4-bit)&lt;/li>
&lt;li>$C$ : Fenêtre de contexte (KV cache) et surcoût lors de l&amp;rsquo;inférence (généralement estimé à environ 20 % à 30 % de la taille du modèle)&lt;/li>
&lt;/ul>
&lt;p>Par exemple, si vous exécutez un modèle de 8 milliards de paramètres (8B) en virgule flottante 16 bits (FP16),
&lt;/p>
$$ M_{FP16} = \frac{8 \times 16}{8} = 16 \text{ GB} $$
&lt;p>
Si l&amp;rsquo;on tient compte du KV cache, etc., près de 18 Go à 20 Go de VRAM seront nécessaires, ce qui le rend difficile à exécuter sur un PC de jeu standard.&lt;/p>
&lt;h3 id="lavènement-du-format-gguf">L&amp;rsquo;avènement du format GGUF
&lt;/h3>&lt;p>C&amp;rsquo;est là qu&amp;rsquo;intervient la &amp;ldquo;quantification (Quantization)&amp;rdquo;. Il s&amp;rsquo;agit d&amp;rsquo;une technologie qui réduit considérablement la quantité de mémoire requise tout en minimisant la dégradation des performances du modèle, en réduisant la précision des paramètres de FP16 à 8 bits, 4 bits ou dans des cas extrêmes à 2 bits.&lt;/p>
&lt;p>Le format actuellement le plus populaire est le &lt;strong>GGUF (GPT-Generated Unified Format)&lt;/strong>, conçu par M. Georgi Gerganov (le développeur de llama.cpp). GGUF est un format binaire permettant d&amp;rsquo;effectuer efficacement des inférences à la fois sur le CPU et le GPU, et se caractérise par une très bonne compatibilité, notamment avec l&amp;rsquo;architecture Unified Memory des Mac (Apple Silicon).&lt;/p>
&lt;p>Le calcul de la mémoire lors de la quantification d&amp;rsquo;un modèle 8B en 4 bits (par exemple : Q4_K_M) est le suivant.&lt;/p>
$$ M_{4bit} = \frac{8 \times 4.5}{8} = 4.5 \text{ GB} $$
&lt;p>
※ Puisque Q4_K_M conserve une haute précision pour certains poids, le nombre effectif de bits est d&amp;rsquo;environ 4,5 bits.&lt;/p>
&lt;p>Grâce à cela, même sur des GPU d&amp;rsquo;entrée de gamme avec seulement 8 Go de VRAM ou sur des ordinateurs portables classiques, il devient possible d&amp;rsquo;exécuter de manière fluide de puissants LLM de classe 8B en local.&lt;/p>
&lt;hr>
&lt;h1 id="le-top-5-des-modèles-llm-locaux-recommandés">Le top 5 des modèles LLM locaux recommandés
&lt;/h1>&lt;p>Présentons maintenant cinq LLM open source qui bénéficient actuellement d&amp;rsquo;un fort soutien de la part des développeurs et des chercheurs en IA du monde entier.&lt;/p>
&lt;h2 id="1-llama-3-meta">1. Llama 3 (Meta)
&lt;/h2>&lt;p>Développé par Meta, la série &amp;ldquo;Llama 3&amp;rdquo; est devenue le standard de facto de l&amp;rsquo;industrie pour les LLM open source.&lt;/p>
&lt;h3 id="évolution-et-caractéristiques-de-larchitecture">Évolution et caractéristiques de l&amp;rsquo;architecture
&lt;/h3>&lt;p>Llama 3 adopte l&amp;rsquo;architecture standard des Transformers, tout en ajoutant de nombreuses améliorations techniques par rapport à la génération précédente (Llama 2). Les points particulièrement notables sont les suivants :&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Adoption standard du GQA (Grouped Query Attention)&lt;/strong> : Le GQA, qui n&amp;rsquo;était adopté que pour les modèles à grande échelle dans Llama 2, a également été adopté pour les modèles à petite échelle comme le 8B dans Llama 3. En conséquence, l&amp;rsquo;utilisation de la mémoire pour le KV cache est considérablement réduite, ce qui permet une inférence rapide même avec des contextes longs.&lt;/li>
&lt;li>&lt;strong>Expansion de la taille du vocabulaire&lt;/strong> : La taille du vocabulaire du tokenizer (basé sur Tiktoken) a été étendue à 128 000 tokens, améliorant considérablement l&amp;rsquo;efficacité de la compression du multilinguisme et du code source. L&amp;rsquo;efficacité du traitement du japonais s&amp;rsquo;est également améliorée de plusieurs fois par rapport à Llama 2.&lt;/li>
&lt;/ul>
&lt;div class="mermaid">graph TD
A["Tokens d'entrée"] --> B["Couche de plongement (Vocabulaire de 128k)"]
B --> C["Bloc Transformer x N"]
C --> D["RMSNorm"]
C --> E["Grouped Query Attention (GQA)"]
C --> F["SwiGLU FFN"]
D -.-> E
D -.-> F
E --> G["Addition &amp; Normalisation"]
F --> G
G --> H["Logits de sortie"]&lt;/div>
&lt;h3 id="taille-des-paramètres-et-cas-dutilisation">Taille des paramètres et cas d&amp;rsquo;utilisation
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>Llama 3 8B&lt;/strong> : 8 milliards de paramètres. Il fonctionne avec environ 5 Go de mémoire avec une quantification 4-bit. La réponse est très rapide, ce qui le rend idéal comme assistant personnel sur PC ou au cœur d&amp;rsquo;un système RAG (Retrieval-Augmented Generation) local.&lt;/li>
&lt;li>&lt;strong>Llama 3 70B&lt;/strong> : 70 milliards de paramètres. Il nécessite environ 40 Go de VRAM (ou d&amp;rsquo;Unified Memory sur Apple Silicon) avec une quantification 4-bit. Il possède des performances qui rivalisent avec le GPT-4 du cloud et démontre sa puissance dans le raisonnement avancé, le codage complexe, l&amp;rsquo;analyse de données, etc.&lt;/li>
&lt;/ul>
&lt;p>Llama 3 bénéficie du soutien le plus solide de la part de la communauté, et son point fort est que tous les formats de quantification, y compris GGUF, AWQ, et EXL2, sont immédiatement disponibles.&lt;/p>
&lt;hr>
&lt;h2 id="2-mistral--mixtral-mistral-ai">2. Mistral / Mixtral (Mistral AI)
&lt;/h2>&lt;p>Les modèles proposés par &amp;ldquo;Mistral AI&amp;rdquo;, une startup d&amp;rsquo;IA française, ont secoué l&amp;rsquo;industrie avec leur efficacité et leur architecture qui a apporté un changement de paradigme.&lt;/p>
&lt;h3 id="le-mécanisme-moe-mixture-of-experts">Le mécanisme MoE (Mixture of Experts)
&lt;/h3>&lt;p>&amp;ldquo;Mixtral 8x7B&amp;rdquo; a été le premier LLM open source à adopter à grande échelle l&amp;rsquo;architecture &lt;strong>MoE (Mixture of Experts)&lt;/strong> et a connu un énorme succès.
MoE est un mécanisme qui dote l&amp;rsquo;ensemble du modèle (environ 47 milliards de paramètres) de 8 &amp;ldquo;réseaux d&amp;rsquo;experts&amp;rdquo;, et sélectionne dynamiquement (route) seulement les 2 experts les plus optimaux pour chaque token en entrée.&lt;/p>
&lt;div class="mermaid">graph LR
A["Token d'entrée"] --> B["Routeur / Réseau de portage (Gating Network)"]
B --> C["Expert 1 (Actif)"]
B --> D["Expert 2 (Inactif)"]
B --> E["Expert 3 (Actif)"]
B --> F["... Expert 8"]
C --> G["Somme pondérée"]
E --> G
G --> H["Couche suivante"]&lt;/div>
&lt;p>Le plus grand avantage de cette architecture est que &amp;ldquo;bien que le nombre de paramètres soit énorme, les paramètres calculés lors de l&amp;rsquo;inférence (Active Parameters) sont peu nombreux&amp;rdquo;. Dans le cas de Mixtral 8x7B, seuls environ 13B sont actifs lors de l&amp;rsquo;inférence. Cela permet d&amp;rsquo;améliorer considérablement la vitesse d&amp;rsquo;inférence tout en conservant les hautes performances de la classe 70B.&lt;/p>
&lt;h3 id="performances-et-cas-dutilisation">Performances et cas d&amp;rsquo;utilisation
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>Mistral 7B / Mistral Nemo (12B)&lt;/strong> : Modèles denses (Dense) uniques. Bien qu&amp;rsquo;ils soient très légers, ils sont libres pour un usage commercial sous licence Apache 2.0. Pour les tâches de codage et de résumé, ils obtiennent des scores de référence qui surpassent écrasamment les autres modèles de même taille.&lt;/li>
&lt;li>&lt;strong>Mixtral 8x7B / 8x22B&lt;/strong> : Modèles MoE avancés. Bien que les exigences en matière de VRAM soient élevées (puisque l&amp;rsquo;ensemble du modèle doit être chargé en mémoire, soit environ 26 Go pour le 8x7B en 4-bit), la vitesse d&amp;rsquo;inférence est rapide, ce qui les rend très adaptés à la création de serveurs locaux sur des environnements Mac tels que M2/M3 Max.&lt;/li>
&lt;/ul>
&lt;hr>
&lt;h2 id="3-gemma-2-google">3. Gemma 2 (Google)
&lt;/h2>&lt;p>Les modèles ouverts développés par Google en utilisant la technologie de son modèle de pointe &amp;ldquo;Gemini&amp;rdquo; sont la série &amp;ldquo;Gemma&amp;rdquo;. En tant que 2ème génération, Gemma 2 a apporté des modifications majeures à son architecture.&lt;/p>
&lt;h3 id="conception-darchitecture-unique">Conception d&amp;rsquo;architecture unique
&lt;/h3>&lt;p>Gemma 2 adopte plusieurs conceptions uniques qui le distinguent des autres LLM.&lt;/p>
&lt;ul>
&lt;li>&lt;strong>Logit Soft-capping&lt;/strong> : Une technique qui empêche la génération de valeurs de logit anormalement élevées et améliore la stabilité de l&amp;rsquo;apprentissage et de l&amp;rsquo;inférence.&lt;/li>
&lt;li>&lt;strong>Hybride de Sliding Window Attention (SWA) et Local Attention&lt;/strong> : Plutôt que d&amp;rsquo;effectuer une Full Attention sur toutes les couches, il alterne les couches qui ne regardent que le contexte local et les couches qui regardent l&amp;rsquo;ensemble.&lt;/li>
&lt;/ul>
&lt;p>La réduction de la complexité de calcul dans le SWA est démontrée mathématiquement comme suit. Par rapport à la complexité de calcul de la Self-Attention normale $O(N^2)$, la complexité de calcul du SWA en utilisant la taille de fenêtre $W$ est la suivante :&lt;/p>
$$ \text{Complexity}_{SWA} = O(N \times W) $$
&lt;p>Où, $N$ est la longueur de la séquence et $W$ est une taille de fenêtre fixe. Plus $N$ est grand (entrée de texte long), plus l&amp;rsquo;effet d&amp;rsquo;économie des ressources de calcul grâce au SWA est immense.&lt;/p>
&lt;h3 id="performances-et-cas-dutilisation-1">Performances et cas d&amp;rsquo;utilisation
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>Gemma 2 2B / 9B&lt;/strong> : Le 2B fonctionne même dans des environnements à ressources extrêmement limitées tels que les smartphones ou Raspberry Pi, tandis que le modèle 9B est destiné aux PC classiques. Le modèle 9B, en particulier, affiche souvent des résultats de référence supérieurs à Llama 3 8B, ce qui en fait l&amp;rsquo;un des modèles de moins de 10B les plus puissants actuellement.&lt;/li>
&lt;li>&lt;strong>Gemma 2 27B&lt;/strong> : 27 milliards de paramètres. Il se caractérise par une &amp;ldquo;taille exquise&amp;rdquo; qui s&amp;rsquo;intègre parfaitement dans 24 Go de VRAM (RTX 3090 / 4090, etc.) avec une quantification 4-bit ou 6-bit. Il est très performant en programmation et pour les instructions complexes en japonais, et est très populaire parmi les passionnés (enthousiastes).&lt;/li>
&lt;/ul>
&lt;hr>
&lt;h2 id="4-qwen-25-alibaba-cloud">4. Qwen 2.5 (Alibaba Cloud)
&lt;/h2>&lt;p>La série Qwen, développée par Alibaba Cloud, est un modèle qui affiche des performances de classe mondiale, en particulier dans le traitement multilingue, le codage et le raisonnement mathématique.&lt;/p>
&lt;h3 id="prise-en-charge-multilingue-et-capacités-de-codage">Prise en charge multilingue et capacités de codage
&lt;/h3>&lt;p>Qwen 2.5 a été pré-entraîné sur un vaste corpus multilingue et a été &lt;strong>très bien noté pour sa production naturelle en japonais&lt;/strong>, ainsi qu&amp;rsquo;en anglais et en chinois. Pour les utilisateurs japonais, le plus grand avantage est que &amp;ldquo;le japonais n&amp;rsquo;a pas l&amp;rsquo;air d&amp;rsquo;une traduction artificielle&amp;rdquo;.
De plus, il existe un modèle &amp;ldquo;Qwen 2.5 Coder&amp;rdquo; spécialisé dans les capacités de programmation, dont l&amp;rsquo;utilisation comme alternative locale à GitHub Copilot en l&amp;rsquo;intégrant aux extensions VSCode (comme Continue) augmente rapidement.&lt;/p>
&lt;h3 id="architecture-et-cas-dutilisation">Architecture et cas d&amp;rsquo;utilisation
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>Tie Word Embeddings&lt;/strong> : Il adopte un mécanisme qui partage (Tie) les poids de la couche de plongement d&amp;rsquo;entrée (Embedding) et de la couche de sortie, afin d&amp;rsquo;apprendre efficacement tout en économisant le nombre de paramètres.&lt;/li>
&lt;li>&lt;strong>Extension de RoPE (Rotary Position Embedding)&lt;/strong> : Il prend en charge une gigantesque fenêtre de contexte allant jusqu&amp;rsquo;à 128 000 tokens, ce qui permet de lire d&amp;rsquo;immenses PDF ou d&amp;rsquo;effectuer une analyse complète de codes sources comprenant des dizaines de milliers de lignes en local.&lt;/li>
&lt;/ul>
&lt;p>Les tailles de modèle sont finement déclinées en 0.5B, 1.5B, 3B, 7B, 14B, 32B et 72B. Le fait que vous puissiez choisir la taille qui correspond à la limite absolue de vos spécifications matérielles (capacité VRAM) est également un point attrayant de Qwen.&lt;/p>
&lt;hr>
&lt;h2 id="5-phi-3--phi-35-microsoft">5. Phi-3 / Phi-3.5 (Microsoft)
&lt;/h2>&lt;p>La série Phi est née du paradigme préconisé par Microsoft selon lequel &amp;ldquo;Textbook is all you need&amp;rdquo; (Les manuels sont tout ce dont vous avez besoin).&lt;/p>
&lt;h3 id="la-révolution-des-slm-small-language-models">La révolution des SLM (Small Language Models)
&lt;/h3>&lt;p>Jusqu&amp;rsquo;à récemment, le développement des LLM consistait principalement à &amp;ldquo;augmenter par la force brute le nombre de paramètres et la quantité de données&amp;rdquo;, mais Microsoft a prouvé que &amp;ldquo;si la qualité des données fournies au modèle (données de manuels de haute qualité ou données synthétiques) est poussée à l&amp;rsquo;extrême, même avec un petit nombre de paramètres, il peut posséder une intelligence de la classe de GPT-3.5&amp;rdquo;.
Phi-3 n&amp;rsquo;est pas appelé LLM (Large Language Model) mais &lt;strong>SLM (Small Language Model)&lt;/strong>.&lt;/p>
&lt;div class="mermaid">graph TD
A["Données Web brutes"] --> B["Filtrage &amp; Nettoyage"]
B --> C["LLM (ex. GPT-4) générant des données synthétiques"]
C --> D["Données de haute qualité de type manuel"]
D --> E["Pré-entraînement du modèle Phi-3"]
E --> F["Petit modèle avec un haut niveau de raisonnement"]&lt;/div>
&lt;h3 id="performances-et-cas-dutilisation-2">Performances et cas d&amp;rsquo;utilisation
&lt;/h3>&lt;ul>
&lt;li>&lt;strong>Phi-3 Mini (3.8B)&lt;/strong> : Un modèle conçu pour s&amp;rsquo;exécuter de manière native (en utilisant ONNX Runtime, etc.) sur les smartphones. Avec un peu moins de 4B de paramètres, il possède des capacités de raisonnement et de réflexion logique étonnamment élevées, et peut accomplir des tâches simples de questions-réponses ou de mise en forme de texte en un clin d&amp;rsquo;œil.&lt;/li>
&lt;li>&lt;strong>Phi-3.5 Vision / MoE&lt;/strong> : Des versions Vision capables de reconnaître des images, ainsi que des versions MoE, ont également été publiées.&lt;/li>
&lt;/ul>
&lt;p>En tant qu&amp;rsquo;implémentation d&amp;rsquo;IA locale sur les appareils edge, d&amp;rsquo;intégration dans les applications mobiles, ou d&amp;rsquo;agent ultraléger résidant en permanence en arrière-plan, la série Phi-3 est sans égal.&lt;/p>
&lt;hr>
&lt;h1 id="comparaison-technique-des-modèles-et-benchmarks">Comparaison technique des modèles et Benchmarks
&lt;/h1>&lt;p>Comparons maintenant d&amp;rsquo;un point de vue quantitatif &amp;ldquo;les exigences en VRAM&amp;rdquo; et la &amp;ldquo;vitesse d&amp;rsquo;inférence&amp;rdquo; lors de l&amp;rsquo;exécution de ces modèles en local.&lt;/p>
&lt;h2 id="relation-entre-le-nombre-de-paramètres-et-les-exigences-en-vram-quantification-gguf-4-bit">Relation entre le nombre de paramètres et les exigences en VRAM (Quantification GGUF 4-bit)
&lt;/h2>&lt;p>Le graphique ci-dessous indique une estimation de la VRAM requise lors de l&amp;rsquo;inférence (y compris le surcoût du KV cache) en fonction du nombre de paramètres de chaque modèle.&lt;/p>
&lt;div class="mermaid">xychart-beta
title "Nombre de paramètres et VRAM requise (Estimation pour quantification 4-bit)"
x-axis "Nom du modèle" ["Phi-3 Mini (3.8B)", "Llama 3 (8B)", "Gemma 2 (9B)", "Mixtral (8x7B)", "Qwen 2.5 (32B)", "Llama 3 (70B)"]
y-axis "VRAM requise (Go)" 0 --> 45
bar [3.5, 6.0, 6.5, 26.0, 22.0, 40.0]&lt;/div>
&lt;p>※ Bien que Mixtral 8x7B consomme beaucoup de VRAM en raison de son grand nombre total de paramètres, le calcul lui-même est léger, de sorte que la charge sur les ressources de calcul du GPU (cœurs CUDA, etc.) est faible.&lt;/p>
&lt;h2 id="calcul-théorique-de-la-vitesse-dinférence-tokenssec">Calcul théorique de la vitesse d&amp;rsquo;inférence (Tokens/sec)
&lt;/h2>&lt;p>La vitesse d&amp;rsquo;inférence d&amp;rsquo;un LLM local dépend fortement de la &amp;ldquo;bande passante de la mémoire (Memory Bandwidth)&amp;rdquo; du GPU. En effet, lors de la phase de génération (décodage), il est nécessaire de lire tous les poids du modèle depuis la mémoire pour chaque token généré. C&amp;rsquo;est un processus limité par la mémoire (Memory-bound) et non limité par le calcul (Compute-bound).&lt;/p>
&lt;p>La vitesse maximale théorique d&amp;rsquo;inférence $T$ (Tokens/sec) est calculée par la formule suivante.&lt;/p>
$$ T = \frac{\text{BW}}{M_{\text{weights}}} $$
&lt;p>Où :&lt;/p>
&lt;ul>
&lt;li>$\text{BW}$ : Bande passante mémoire effective du GPU (Go/s)&lt;/li>
&lt;li>$M_{\text{weights}}$ : Taille du modèle chargé (Go)&lt;/li>
&lt;/ul>
&lt;p>Par exemple, si nous exécutons la version 4-bit de Llama 3 8B (environ 4,5 Go) sur une NVIDIA RTX 4090 (bande passante mémoire de 1 008 Go/s). En supposant que la bande passante effective soit d&amp;rsquo;environ 80 % de la valeur théorique (environ 800 Go/s) :&lt;/p>
$$ T \approx \frac{800}{4.5} \approx 177 \text{ Tokens/sec} $$
&lt;p>C&amp;rsquo;est une vitesse fulgurante qui dépasse de loin la vitesse de lecture d&amp;rsquo;un être humain. En revanche, si vous exécutez Llama 3 70B (version 4-bit environ 40 Go ※ dans le cas d&amp;rsquo;une répartition sur 2 GPU) sur la même RTX 4090, la vitesse de génération de tokens se stabilise autour de 20 Tokens/sec. Ainsi, il est possible de prédire mathématiquement à l&amp;rsquo;avance &amp;ldquo;à quelle vitesse la sortie sera générée&amp;rdquo; en fonction des spécifications de votre PC.&lt;/p>
&lt;hr>
&lt;h1 id="outils-pour-exécuter-des-llm-locaux">Outils pour exécuter des LLM locaux
&lt;/h1>&lt;p>L&amp;rsquo;écosystème logiciel permettant d&amp;rsquo;exécuter ces puissants LLM open source dans un environnement local est également très développé aujourd&amp;rsquo;hui. Voici trois outils représentatifs.&lt;/p>
&lt;h3 id="1-ollama">1. Ollama
&lt;/h3>&lt;p>C&amp;rsquo;est actuellement l&amp;rsquo;outil le plus simple et le plus populaire. Tout comme Docker, il télécharge et exécute le modèle avec une seule commande. Il est compatible avec Mac, Windows et Linux.
Il vous suffit d&amp;rsquo;ouvrir le terminal et de taper la commande suivante pour lancer Llama 3.&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-bash" data-lang="bash">&lt;span class="line">&lt;span class="cl">ollama run llama3
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>De plus, Ollama fonctionne comme un serveur API REST en arrière-plan, ce qui rend l&amp;rsquo;intégration avec des scripts Python ou des applications externes extrêmement facile.&lt;/p>
&lt;h3 id="2-lm-studio">2. LM Studio
&lt;/h3>&lt;p>C&amp;rsquo;est l&amp;rsquo;application recommandée pour ceux qui souhaitent une interface utilisateur graphique (GUI) intuitive. Vous pouvez rechercher et télécharger parmi l&amp;rsquo;immense liste de modèles GGUF de Hugging Face directement depuis l&amp;rsquo;application, et profiter de conversations dans une interface de chat similaire à ChatGPT. Sa fonctionnalité qui vous indique visuellement quel modèle s&amp;rsquo;intègrera dans la RAM/VRAM de votre PC est très pratique.&lt;/p>
&lt;h3 id="3-llamacpp">3. llama.cpp
&lt;/h3>&lt;p>C&amp;rsquo;est l&amp;rsquo;étincelle qui a déclenché le boom des LLM locaux et la bibliothèque en C/C++ qui sert de base à tout le reste. Elle s&amp;rsquo;adresse aux ingénieurs souhaitant ajuster les performances à l&amp;rsquo;extrême ou aux hackers souhaitant l&amp;rsquo;intégrer dans leurs propres scripts. Elle exploite tout le potentiel de n&amp;rsquo;importe quel matériel, allant du Metal d&amp;rsquo;Apple, au CUDA de NVIDIA, au ROCm d&amp;rsquo;AMD, jusqu&amp;rsquo;au jeu d&amp;rsquo;instructions AVX d&amp;rsquo;Intel.&lt;/p>
&lt;hr>
&lt;h1 id="conclusion-et-perspectives-davenir">Conclusion et perspectives d&amp;rsquo;avenir
&lt;/h1>&lt;p>Dans cet article, nous avons présenté cinq des meilleurs LLM locaux open source disponibles en 2026 et expliqué leur architecture ainsi que leur contexte technique. Si l&amp;rsquo;on résume comment les choisir en fonction de l&amp;rsquo;objectif, cela donne :&lt;/p>
&lt;ol>
&lt;li>&lt;strong>Si vous privilégiez l&amp;rsquo;équilibre global et l&amp;rsquo;écosystème&lt;/strong> : &lt;code>Llama 3 (8B / 70B)&lt;/code>&lt;/li>
&lt;li>&lt;strong>Si vous souhaitez une inférence à haute vitesse dans un environnement avec une grande capacité d&amp;rsquo;Unified Memory comme sur Mac&lt;/strong> : &lt;code>Mixtral 8x7B&lt;/code>&lt;/li>
&lt;li>&lt;strong>Si vous souhaitez tirer le maximum d&amp;rsquo;intelligence avec une VRAM de classe 24 Go&lt;/strong> : &lt;code>Gemma 2 27B&lt;/code> ou &lt;code>Qwen 2.5 32B&lt;/code>&lt;/li>
&lt;li>&lt;strong>Si votre objectif est une sortie naturelle en japonais et une assistance avancée au codage&lt;/strong> : &lt;code>Qwen 2.5&lt;/code>&lt;/li>
&lt;li>&lt;strong>Pour les smartphones, les PC peu puissants ou les traitements ultralégers en arrière-plan&lt;/strong> : &lt;code>Phi-3 / Phi-3.5&lt;/code>&lt;/li>
&lt;/ol>
&lt;p>La vitesse d&amp;rsquo;évolution des LLM open source est stupéfiante, et des avancées bouleversant les conventions actuelles sont annoncées tous les quelques mois. À l&amp;rsquo;avenir, avec les améliorations continues de la technologie de quantification et l&amp;rsquo;émergence de nouvelles architectures, le jour où un environnement local surpassera l&amp;rsquo;IA cloud n&amp;rsquo;est peut-être pas loin.
N&amp;rsquo;hésitez pas à télécharger le modèle optimal en fonction de votre environnement matériel et à expérimenter la liberté et le potentiel extraordinaires de l&amp;rsquo;IA locale.&lt;/p></description></item></channel></rss>