<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Development on kenji.blog</title><link>http://kenji.blog/zh-cn/tags/development/</link><description>Recent content in Development on kenji.blog</description><generator>Hugo -- gohugo.io</generator><language>zh-cn</language><copyright>kenjinote</copyright><lastBuildDate>Fri, 11 Sep 2026 14:00:00 +0900</lastBuildDate><atom:link href="http://kenji.blog/zh-cn/tags/development/index.xml" rel="self" type="application/rss+xml"/><item><title>使用C++开发小规模AI模型（如TinyLLaMA）的步骤</title><link>http://kenji.blog/zh-cn/p/cpp-small-ai-model-tinyllama-dev-guide/</link><pubDate>Fri, 11 Sep 2026 14:00:00 +0900</pubDate><guid>http://kenji.blog/zh-cn/p/cpp-small-ai-model-tinyllama-dev-guide/</guid><description>&lt;img src="http://kenji.blog/p/cpp-small-ai-model-tinyllama-dev-guide/img/eyecatch.jpg" alt="Featured image of post 使用C++开发小规模AI模型（如TinyLLaMA）的步骤" />&lt;h1 id="使用c开发小规模ai模型如tinyllama的步骤">使用C++开发小规模AI模型（如TinyLLaMA）的步骤
&lt;/h1>&lt;p>近年来，在本地环境运行大型语言模型（LLM）的关注度急剧上升。特别是像TinyLLaMA（1.1B参数）这样的小规模模型，即使在资源有限的边缘设备或普通笔记本电脑（包括Windows环境）上，也能以实用的速度进行推理。虽然使用Python和PyTorch进行开发是主流，但在追求极致性能和内存节省时，C++和基于C语言的张量库“ggml”的组合成为了事实上的标准。&lt;/p>
&lt;p>本文将非常详细地讲解如何从零开始构建一个使用C++加载TinyLLaMA并进行文本生成的推理引擎（或者说，深入理解现有的llama.cpp内部结构）的开发步骤。&lt;/p>
&lt;hr>
&lt;h2 id="1-为什么选择c和ggml">1. 为什么选择C++和ggml？
&lt;/h2>&lt;p>在AI的训练阶段，具有灵活性和丰富生态系统的Python具有压倒性的优势。然而，在部署和“推理（Inference）”阶段，基于以下理由，C++成为了强大的选择。&lt;/p>
&lt;ol>
&lt;li>&lt;strong>减少开销&lt;/strong>：可以完全消除Python的全局解释器锁（GIL）和运行时的开销。&lt;/li>
&lt;li>&lt;strong>内存效率和Arena分配&lt;/strong>：可以手动控制内存的分配和释放，从而防止垃圾回收带来的不可预测的峰值。&lt;/li>
&lt;li>&lt;strong>直接访问硬件&lt;/strong>：直接调用AVX-512、AVX2、ARM NEON等SIMD内置函数（Intrinsics），将CPU的运算能力发挥到极致。&lt;/li>
&lt;li>&lt;strong>零依赖&lt;/strong>：ggml是一个零依赖（Zero dependencies）的C/C++库，只要有编译器，即使在Windows上的MSVC环境中也很容易编译。&lt;/li>
&lt;/ol>
&lt;hr>
&lt;h2 id="2-架构全景图">2. 架构全景图
&lt;/h2>&lt;p>整个推理流水线的流程如以下Mermaid图表所示。这是一系列从用户输入文本开始，到最终生成下一个Token为止的过程。&lt;/p>
&lt;div class="mermaid">graph TD
A["用户输入文本"] --> B["BPE 分词器"]
B --> C["Token ID 数组"]
C --> D["嵌入层查找"]
D --> E["Transformer 块"]
E --> F["RMSNorm"]
F --> G["LM Head 层"]
G --> H["Logits 数组"]
H --> I["采样器模块"]
I --> J["下一个 Token ID"]
J --> K["去分词器"]
K --> L["输出文本块"]
J -.-> |"追加到上下文"| C&lt;/div>
&lt;p>由于它是自回归模型，输出的Token会再次被添加到上下文中，作为预测下一个Token的输入进行循环（图中虚线部分）。&lt;/p>
&lt;hr>
&lt;h2 id="3-模型格式与内存映射-mmap">3. 模型格式与内存映射 (mmap)
&lt;/h2>&lt;p>处理庞大的神经网络权重时，最大的障碍是磁盘I/O和内存消耗。在C++实现中，通过**内存映射（mmap）**来解决这个问题。&lt;/p>
&lt;h3 id="31-内存映射的原理及在windows中的实现">3.1 内存映射的原理及在Windows中的实现
&lt;/h3>&lt;p>使用mmap，可以将文件的内容直接映射到进程的虚拟内存空间中。&lt;/p>
&lt;ul>
&lt;li>&lt;strong>零拷贝（Zero-copy）&lt;/strong>：数据直接从磁盘加载到内核的页面缓存中，不会发生向用户空间的多余拷贝。&lt;/li>
&lt;li>&lt;strong>按需加载（Page Fault）&lt;/strong>：只有当CPU实际访问该内存地址的瞬间，才会发生缺页中断（Page Fault），并且仅将需要的块（通常为4KB）加载到物理内存中。&lt;/li>
&lt;/ul>
&lt;p>在Windows环境中，不使用POSIX的 &lt;code>mmap&lt;/code>，而是使用Win32 API的 &lt;code>CreateFileMapping&lt;/code> 和 &lt;code>MapViewOfFile&lt;/code>。&lt;/p>
&lt;div class="mermaid">sequenceDiagram
participant OS["Windows 操作系统"]
participant RAM["物理内存"]
participant App["C++ 应用程序"]
App->>OS: "CreateFileMapping / MapViewOfFile"
OS-->>App: "虚拟内存地址指针"
App->>App: "在指针处读取张量数据"
OS->>RAM: "缺页中断 / 从磁盘加载页面"
RAM-->>App: "数据已准备好进行 SIMD 计算"&lt;/div>
&lt;h3 id="32-gguf-格式的二进制结构">3.2 GGUF 格式的二进制结构
&lt;/h3>&lt;p>从Hugging Face等的 &lt;code>.safetensors&lt;/code> 格式转换而来的 &lt;strong>GGUF (GPT-Generated Unified Format)&lt;/strong> 是用于推理的终极格式。它具有以下严格的二进制布局：&lt;/p>
&lt;ol>
&lt;li>&lt;strong>Magic Bytes&lt;/strong>: &lt;code>0x46554747&lt;/code> (GGUF)。&lt;/li>
&lt;li>&lt;strong>Version&lt;/strong>: 格式的版本号。&lt;/li>
&lt;li>&lt;strong>Tensor Count &amp;amp; Metadata Count&lt;/strong>: 张量数量和元数据的键值对数量。&lt;/li>
&lt;li>&lt;strong>Metadata (Key-Value Pairs)&lt;/strong>: 带有字符串长度前缀的键和带有类型的值。&lt;/li>
&lt;li>&lt;strong>Tensor Info&lt;/strong>: 每个张量的名称、维度数、数据类型（如FP16，Q4_K等），以及在文件中的偏移位置。&lt;/li>
&lt;li>&lt;strong>Padding&lt;/strong>: 插入的填充物，用于将张量数据对齐到特定边界（通常为32字节或64字节）。这对使用SIMD指令（特别是AVX）进行高速内存访问至关重要。&lt;/li>
&lt;li>&lt;strong>Tensor Data&lt;/strong>: 已对齐的实际权重数据数组。&lt;/li>
&lt;/ol>
&lt;hr>
&lt;h2 id="4-tinyllama的数学基础与c算法">4. TinyLLaMA的数学基础与C++算法
&lt;/h2>&lt;p>TinyLLaMA为了提高效率，引入了一些高级的架构设计。为了在C++中正确实现这些，以下是它们的数学公式表示。&lt;/p>
&lt;h3 id="41-rmsnorm-root-mean-square-normalization">4.1 RMSNorm (Root Mean Square Normalization)
&lt;/h3>&lt;p>省略了LayerNorm中的均值中心化，仅进行方差的缩放，从而降低了计算成本。&lt;/p>
$$ \text{RMSNorm}(x) = \frac{x}{\sqrt{\frac{1}{d}\sum_{i=1}^{d} x_i^2 + \epsilon}} \odot \gamma $$
&lt;p>其中 $d$ 是维度数，$\gamma$ 是训练好的缩放张量。
在C++中实现时，首先使用AVX2的 &lt;code>_mm256_fmadd_ps&lt;/code> 等快速计算数组的平方和，然后乘以平方根的倒数（如 &lt;code>_mm256_rsqrt_ps&lt;/code> 指令）来进行优化。&lt;/p>
&lt;h3 id="42-rope-rotary-position-embedding">4.2 RoPE (Rotary Position Embedding)
&lt;/h3>&lt;p>这是一种将Token的位置信息作为张量空间中的旋转（Rotate）来应用的技术。可以将其视为复平面上的旋转，对向量 $x$ 的相邻维度对 $(x_1, x_2)$ 应用以下旋转：&lt;/p>
$$ \text{RoPE}(x, m) = \begin{pmatrix} x_{1} \cos(m\theta) - x_{2} \sin(m\theta) \\ x_{1} \sin(m\theta) + x_{2} \cos(m\theta) \end{pmatrix} $$
&lt;p>在这里，$m$ 是Token的绝对位置索引，$\theta$ 是预先计算好的基频。在ggml中，只需在构建推理图时添加 &lt;code>ggml_rope&lt;/code> 算子即可并行执行。&lt;/p>
&lt;h3 id="43-grouped-query-attention-gqa">4.3 Grouped-Query Attention (GQA)
&lt;/h3>&lt;p>在常规的多头注意力机制（MHA）中，Query、Key和Value各具有相同数量的头。然而，TinyLLaMA为了大幅减少内存带宽和KV缓存的消耗，采用了 &lt;strong>Grouped-Query Attention (GQA)&lt;/strong>。&lt;/p>
$$ \text{Attention}(Q, K, V) = \text{softmax}\left(\frac{Q K^T}{\sqrt{d_k}}\right) V $$
&lt;p>在GQA中，多个Query头共享一个Key/Value头。在C++实现中，在执行矩阵乘法 &lt;code>ggml_mul_mat&lt;/code> 之前，需要根据Query的数量将KV张量进行广播（Broadcast）操作。&lt;/p>
&lt;h3 id="44-swiglu-激活函数">4.4 SwiGLU 激活函数
&lt;/h3>&lt;p>在前馈网络（FFN）层中，使用SwiGLU代替GELU。&lt;/p>
$$ \text{SwiGLU}(x) = \text{Swish}(x W_{\text{gate}}) \otimes (x W_{\text{up}}) $$
$$ \text{Swish}(z) = z \cdot \sigma(z) = z \cdot \frac{1}{1 + e^{-z}} $$
&lt;p>在计算图中，通过组合 &lt;code>ggml_silu&lt;/code> 算子和 &lt;code>ggml_mul&lt;/code> 来表示。&lt;/p>
&lt;hr>
&lt;h2 id="5-使用ggml构建计算图与内存管理">5. 使用ggml构建计算图与内存管理
&lt;/h2>&lt;p>ggml采用“Define-and-Run”的方法，先构建用于推理的静态计算图，然后再进行评估（evaluate）。&lt;/p>
&lt;h3 id="51-ggml_context-与-arena-分配器">5.1 ggml_context 与 Arena 分配器
&lt;/h3>&lt;p>ggml最独特的地方在于，推理循环内完全不进行动态内存分配（如 &lt;code>malloc&lt;/code> 或 &lt;code>new&lt;/code>）的“Arena 分配（Arena Allocation）”。
初始化时分配一大块连续的内存区域（Arena），每次调用 &lt;code>ggml_new_tensor&lt;/code> 等函数时，都会递增这个区域的指针。当完成一个推理步骤后，只需将分配指针重置到初始位置，即可立即完成下一个推理步骤的内存分配。&lt;/p>
&lt;h3 id="52-构建图的具体示例">5.2 构建图的具体示例
&lt;/h3>&lt;p>在每个推理步骤中，会在内存中组装如下的计算图。&lt;/p>
&lt;div class="mermaid">graph TD
A["Token 输入 ID"] --> B["嵌入查找"]
B --> C["ggml_rms_norm"]
C --> D["Q / K / V 投影"]
D --> E["ggml_rope 位置编码"]
E --> F["KV 缓存存储"]
E --> G["KV 缓存加载"]
G --> H["自注意力机制"]
H --> I["缩放与 Softmax"]
I --> J["注意力输出"]
J --> K["输出投影"]
K --> L["残差连接相加"]&lt;/div>
&lt;hr>
&lt;h2 id="6-量化-quantization-与-windows--simd-优化">6. 量化 (Quantization) 与 Windows / SIMD 优化
&lt;/h2>&lt;p>如果用FP16处理TinyLLaMA (1.1B)，大约需要2.2GB的内存，但通过4位量化（如Q4_K），可以将其大幅压缩至约600MB左右。&lt;/p>
&lt;h3 id="61-块量化架构">6.1 块量化架构
&lt;/h3>&lt;p>ggml并不是对整个张量进行统一量化，而是以“块（Block）”为单位进行的。
在 &lt;code>Q4_0&lt;/code> 格式中，将32个FP16值组合成一个块。&lt;/p>
&lt;ul>
&lt;li>&lt;strong>缩悉因子（Scale factor）&lt;/strong>：1个FP16值（2字节）&lt;/li>
&lt;li>&lt;strong>量化数据&lt;/strong>：32个4位值（16字节）
通过这种方式，将局部异常值的影响降至最低。&lt;/li>
&lt;/ul>
&lt;h3 id="62-利用avx2加速点积运算">6.2 利用AVX2加速点积运算
&lt;/h3>&lt;p>当在Windows环境中为最新的x86 CPU进行编译时，可以利用 &lt;code>/arch:AVX2&lt;/code> 等编译器标志，SIMD处理流程如下：&lt;/p>
&lt;ol>
&lt;li>&lt;strong>加载&lt;/strong>：将4位量化数据从内存加载到256位的AVX寄存器中。&lt;/li>
&lt;li>&lt;strong>展开与解包&lt;/strong>：通过位掩码和移位运算，将4位值展开为Int8或Int16。&lt;/li>
&lt;li>&lt;strong>反量化&lt;/strong>：乘以缩放因子，转换为浮点数。&lt;/li>
&lt;li>&lt;strong>FMA运算&lt;/strong>：使用激活值和 &lt;code>_mm256_fmadd_ps&lt;/code>（融合乘加）并行执行乘累加运算。&lt;/li>
&lt;/ol>
&lt;hr>
&lt;h2 id="7-kv缓存的实现细节">7. KV缓存的实现细节
&lt;/h2>&lt;p>在自回归生成中，为了省略计算过去Token的Key和Value，必须使用“KV缓存（KV Cache）”。&lt;/p>
&lt;p>在C++中实现时的要点如下：&lt;/p>
&lt;ol>
&lt;li>&lt;strong>预先分配张量&lt;/strong>：为KV缓存初始化一个能够容纳最大上下文长度（例如：2048个Token）的巨大张量（推荐使用FP16）。&lt;/li>
&lt;li>&lt;strong>偏移复制&lt;/strong>：当执行针对Token位置 $N$ 的计算时，将该步骤中得到的K和V向量使用 &lt;code>ggml_cpy&lt;/code> 等方法存储到KV缓存张量的第 $N$ 行。&lt;/li>
&lt;li>&lt;strong>注意力计算时的视图（View）创建&lt;/strong>：在计算注意力时，创建一个仅指向从第0个到第 $N$ 个Token部分的“视图”，并将其传递给矩阵乘法。&lt;/li>
&lt;/ol>
&lt;hr>
&lt;h2 id="8-bpe-分词器与解码">8. BPE 分词器与解码
&lt;/h2>&lt;p>将输入字符串视为UTF-8的字节流，并与预先定义的词汇表进行匹配。在C++中，为了加速词汇表的搜索，通常会实现 &lt;strong>Trie树（前缀树）&lt;/strong> 或使用优先队列的算法。&lt;/p>
&lt;p>从LM Head输出的Logits，使用Temperature参数缩放概率，通过Top-K提取或Top-P（Nucleus Sampling）方法缩小候选范围，并使用随机数决定最终的下一个Token。&lt;/p>
&lt;hr>
&lt;h2 id="9-搭建c项目windows--powershell-环境">9. 搭建C++项目（Windows / PowerShell 环境）
&lt;/h2>&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt"> 1
&lt;/span>&lt;span class="lnt"> 2
&lt;/span>&lt;span class="lnt"> 3
&lt;/span>&lt;span class="lnt"> 4
&lt;/span>&lt;span class="lnt"> 5
&lt;/span>&lt;span class="lnt"> 6
&lt;/span>&lt;span class="lnt"> 7
&lt;/span>&lt;span class="lnt"> 8
&lt;/span>&lt;span class="lnt"> 9
&lt;/span>&lt;span class="lnt">10
&lt;/span>&lt;span class="lnt">11
&lt;/span>&lt;span class="lnt">12
&lt;/span>&lt;span class="lnt">13
&lt;/span>&lt;span class="lnt">14
&lt;/span>&lt;span class="lnt">15
&lt;/span>&lt;span class="lnt">16
&lt;/span>&lt;span class="lnt">17
&lt;/span>&lt;span class="lnt">18
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-cmake" data-lang="cmake">&lt;span class="line">&lt;span class="cl">&lt;span class="nb">cmake_minimum_required&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="s">VERSION&lt;/span> &lt;span class="s">3.14&lt;/span>&lt;span class="p">)&lt;/span>&lt;span class="err">
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="err">&lt;/span>&lt;span class="nb">project&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="s">TinyLLaMACpp&lt;/span>&lt;span class="p">)&lt;/span>&lt;span class="err">
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="err">
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="err">&lt;/span>&lt;span class="nb">set&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="s">CMAKE_CXX_STANDARD&lt;/span> &lt;span class="s">17&lt;/span>&lt;span class="p">)&lt;/span>&lt;span class="err">
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="err">
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="err">&lt;/span>&lt;span class="c"># 面向 Windows (MSVC) 的优化和 AVX2 标志的设置
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="c">&lt;/span>&lt;span class="nb">if&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="s">MSVC&lt;/span>&lt;span class="p">)&lt;/span>&lt;span class="err">
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="err">&lt;/span> &lt;span class="nb">add_compile_options&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="s">/O2&lt;/span> &lt;span class="s">/arch:AVX2&lt;/span> &lt;span class="s">/fp:fast&lt;/span>&lt;span class="p">)&lt;/span>&lt;span class="err">
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="err">&lt;/span> &lt;span class="nb">add_link_options&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="s">/STACK:8388608&lt;/span>&lt;span class="p">)&lt;/span>&lt;span class="err">
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="err">&lt;/span>&lt;span class="nb">else&lt;/span>&lt;span class="p">()&lt;/span>&lt;span class="err">
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="err">&lt;/span> &lt;span class="nb">add_compile_options&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="s">-O3&lt;/span> &lt;span class="s">-march=native&lt;/span> &lt;span class="s">-ffast-math&lt;/span>&lt;span class="p">)&lt;/span>&lt;span class="err">
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="err">&lt;/span>&lt;span class="nb">endif&lt;/span>&lt;span class="p">()&lt;/span>&lt;span class="err">
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="err">
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="err">&lt;/span>&lt;span class="nb">add_library&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="s">ggml&lt;/span> &lt;span class="s">OBJECT&lt;/span> &lt;span class="s">ggml/ggml.c&lt;/span> &lt;span class="s">ggml/ggml-alloc.c&lt;/span>&lt;span class="p">)&lt;/span>&lt;span class="err">
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="err">&lt;/span>&lt;span class="nb">target_compile_definitions&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="s">ggml&lt;/span> &lt;span class="s">PRIVATE&lt;/span> &lt;span class="s">GGML_USE_AVX2&lt;/span> &lt;span class="s">GGML_USE_F16C&lt;/span> &lt;span class="s">GGML_USE_FMA&lt;/span>&lt;span class="p">)&lt;/span>&lt;span class="err">
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="err">
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="err">&lt;/span>&lt;span class="nb">add_executable&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="s">main&lt;/span> &lt;span class="s">main.cpp&lt;/span>&lt;span class="p">)&lt;/span>&lt;span class="err">
&lt;/span>&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="err">&lt;/span>&lt;span class="nb">target_link_libraries&lt;/span>&lt;span class="p">(&lt;/span>&lt;span class="s">main&lt;/span> &lt;span class="s">ggml&lt;/span>&lt;span class="p">)&lt;/span>&lt;span class="err">
&lt;/span>&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;p>PowerShell 中的构建命令示例：&lt;/p>
&lt;div class="highlight">&lt;div class="chroma">
&lt;table class="lntable">&lt;tr>&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code>&lt;span class="lnt">1
&lt;/span>&lt;span class="lnt">2
&lt;/span>&lt;span class="lnt">3
&lt;/span>&lt;span class="lnt">4
&lt;/span>&lt;/code>&lt;/pre>&lt;/td>
&lt;td class="lntd">
&lt;pre tabindex="0" class="chroma">&lt;code class="language-powershell" data-lang="powershell">&lt;span class="line">&lt;span class="cl">&lt;span class="n">mkdir&lt;/span> &lt;span class="n">build&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="nb">cd &lt;/span>&lt;span class="n">build&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">cmake&lt;/span> &lt;span class="p">..&lt;/span> &lt;span class="n">-G&lt;/span> &lt;span class="s2">&amp;#34;Visual Studio 17 2022&amp;#34;&lt;/span> &lt;span class="n">-A&lt;/span> &lt;span class="n">x64&lt;/span>
&lt;/span>&lt;/span>&lt;span class="line">&lt;span class="cl">&lt;span class="n">cmake&lt;/span> &lt;span class="p">-&lt;/span>&lt;span class="n">-build&lt;/span> &lt;span class="p">.&lt;/span> &lt;span class="p">-&lt;/span>&lt;span class="n">-config&lt;/span> &lt;span class="n">Release&lt;/span>
&lt;/span>&lt;/span>&lt;/code>&lt;/pre>&lt;/td>&lt;/tr>&lt;/table>
&lt;/div>
&lt;/div>&lt;hr>
&lt;h2 id="10-总结">10. 总结
&lt;/h2>&lt;p>使用C++和ggml从零开始实现像TinyLLaMA这样的小规模AI模型的推理引擎，是揭开深度学习黑盒、学习底层硬件控制之美的绝佳机会。在充分体会利用内存映射进行零拷贝加载、SIMD优化、KV缓存构建等系统编程精髓的同时，让我们共同开拓边缘AI的未来。&lt;/p></description></item></channel></rss>