<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>GPU 推理 on 我的博客</title><link>https://blog.5616760.com/tags/gpu-%E6%8E%A8%E7%90%86/</link><description>Recent content in GPU 推理 on 我的博客</description><generator>Hugo -- gohugo.io</generator><language>zh</language><lastBuildDate>Fri, 09 Oct 2026 08:30:00 +0800</lastBuildDate><atom:link href="https://blog.5616760.com/tags/gpu-%E6%8E%A8%E7%90%86/index.xml" rel="self" type="application/rss+xml"/><item><title>Strata：把 1250 亿参数的 Qwen3.8-Flash-Next 装进你的游戏电脑</title><link>https://blog.5616760.com/0039.html</link><pubDate>Fri, 09 Oct 2026 08:30:00 +0800</pubDate><guid>https://blog.5616760.com/0039.html</guid><description>&lt;p&gt;一张 12 GB 的家用显卡，能不能跑一个本该住在有数百 GB 显存的服务器上的大模型？&lt;code&gt;Strata&lt;/code&gt; 给出的答案是：&lt;strong&gt;能，而且不是勉强跑起来，是跑得比人读得还快。&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;它不是去&amp;quot;缩小模型&amp;quot;，也不是把权重量化到不可用——它跑的是 &lt;strong&gt;Qwen3.8-Flash-Next&lt;/strong&gt;，一个 1250 亿参数的 MoE（混合专家）模型，由 &lt;strong&gt;24576 个小专家&lt;/strong&gt;组成，每写一个词只需要其中 10 个。Strata 做的事情，是把这个模型的&lt;strong&gt;计算摊到整台电脑上&lt;/strong&gt;：显卡管最重要的那部分，内存装下全部专家，CPU 在内存里就地算显卡没装的专家，SSD 只放一张大查找表。&lt;/p&gt;&#10;&lt;p&gt;它已经火了：截至本次快照，仓库 &lt;strong&gt;18465 star、1647 fork&lt;/strong&gt;，从 2026-09-24 创建到 2026-10-08，两周多一点。MIT 许可，C++ + CUDA/HIP 实现，Windows 和 Linux 都支持。&lt;/p&gt;&#10;&lt;p&gt;这篇不写安装教程（README 里那套双击 &lt;code&gt;START-HERE.bat&lt;/code&gt; 就够了），而是把它&lt;strong&gt;拆开看&lt;/strong&gt;：为什么 MoE 模型天然适合&amp;quot;摊到整台电脑&amp;quot;、三层内存到底各放什么、那个&amp;quot;先猜再检查&amp;quot;是怎么做到&lt;strong&gt;不牺牲质量还快 1.6–1.8 倍&lt;/strong&gt;的、为什么长文档能跑到每秒 1000+ token，以及它那套近乎苛刻的测量与工程纪律。&lt;/p&gt;&#10;&#10; &lt;blockquote&gt;&#10; &lt;p&gt;&lt;strong&gt;数据说明&lt;/strong&gt;：本文信息来自项目 GitHub 仓库（&lt;code&gt;Niko1221/Strata&lt;/code&gt;）的 &lt;code&gt;README.zh-CN.md&lt;/code&gt;、&lt;code&gt;docs/HOW_IT_WORKS.md&lt;/code&gt;、&lt;code&gt;docs/DETAILS.md&lt;/code&gt;、&lt;code&gt;docs/MODELS.md&lt;/code&gt;、&lt;code&gt;docs/BATCHING.md&lt;/code&gt;、&lt;code&gt;docs/MCP_SERVER.md&lt;/code&gt;、&lt;code&gt;docs/DISJOINT_EXPERT_CACHE.md&lt;/code&gt;、&lt;code&gt;docs/KV_PREFETCH.md&lt;/code&gt; 与 &lt;code&gt;AGENTS.md&lt;/code&gt;，数据快照时间为 &lt;strong&gt;2026-10-09&lt;/strong&gt;（仓库状态：主分支 &lt;code&gt;main&lt;/code&gt;，MIT 许可，18,465 star / 1,647 fork / 106 watch / 479 open issue，2422 个文件，主要语言 C++）。项目仍在快速迭代（引擎已迭代到 0.1.4x 区间），具体行为请以你所用版本与仓库最新文档为准。&lt;/p&gt;&#10;&#10; &lt;/blockquote&gt;&#10;&lt;h2 id="目录"&gt;目录&#10;&lt;/h2&gt;&lt;ol&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e4%b8%80%e5%ae%83%e6%98%af%e4%bb%80%e4%b9%88" &gt;它是什么&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e4%ba%8c%e8%a6%81%e8%a7%a3%e5%86%b3%e7%9a%84%e5%8f%aa%e6%9c%89%e4%b8%80%e4%bb%b6%e4%ba%8b%e6%98%be%e5%ad%98" &gt;要解决的只有一件事：显存&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e4%b8%89%e6%a0%b8%e5%bf%83%e6%80%9d%e8%b7%af%e6%8a%8a%e5%b7%a5%e4%bd%9c%e6%91%8a%e5%88%b0%e6%95%b4%e5%8f%b0%e7%94%b5%e8%84%91" &gt;核心思路：把工作摊到整台电脑&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e5%9b%9b%e4%b8%89%e5%b1%82%e5%86%85%e5%ad%98%e5%88%86%e5%b7%a5%e6%98%be%e5%8d%a1%e5%86%85%e5%ad%98ssd-%e5%90%84%e6%94%be%e4%bb%80%e4%b9%88" &gt;三层内存分工：显卡、内存、SSD 各放什么&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e4%ba%94moe-%e7%9a%84%e6%9c%ac%e8%b4%a824576-%e4%b8%aa%e4%b8%93%e5%ae%b6%e7%9a%84%e6%8c%89%e9%9c%80%e8%b0%83%e5%ba%a6" &gt;MoE 的本质：24576 个专家的按需调度&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e5%85%ad%e5%85%88%e7%8c%9c%e5%86%8d%e6%a3%80%e6%9f%a5mtp-%e6%8a%95%e6%9c%ba%e8%a7%a3%e7%a0%81" &gt;先猜再检查：MTP 投机解码&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e4%b8%83%e9%95%bf%e6%96%87%e6%9c%ac%e8%af%bb%e5%8f%968192-token-%e5%88%86%e5%9d%97%e4%b8%8e-pcie-%e4%b8%93%e5%ae%b6%e6%b5%81%e5%bc%8f" &gt;长文本读取：8192 token 分块与 PCIe 专家流式&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e5%85%ab%e5%ae%9e%e6%b5%8b%e9%80%9f%e5%ba%a6nvidia-%e4%b8%8e-amd" &gt;实测速度：NVIDIA 与 AMD&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e4%b9%9d%e6%a8%a1%e5%9e%8b%e9%80%89%e5%9e%8b4-%e4%b8%aa%e8%a7%84%e6%a0%bc--4-%e4%b8%aa%e7%89%88%e6%9c%ac" &gt;模型选型：4 个规格 × 4 个版本&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e5%8d%81%e4%b8%80%e9%94%ae%e5%ae%89%e8%a3%85%e4%bb%a5%e5%8f%8a%e8%ae%a9-ai-%e5%b8%ae%e4%bd%a0%e8%a3%85" &gt;一键安装，以及让 AI 帮你装&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e5%8d%81%e4%b8%80api-%e5%85%bc%e5%ae%b9%e5%b1%82openai--anthropic--responses" &gt;API 兼容层：OpenAI / Anthropic / Responses&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e5%8d%81%e4%ba%8c%e6%89%b9%e5%a4%84%e7%90%86%e4%b8%80%e6%ac%a1%e5%9b%9e%e7%ad%94%e5%a4%9a%e4%b8%aa%e8%af%b7%e6%b1%82" &gt;批处理：一次回答多个请求&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e5%8d%81%e4%b8%89%e5%b7%a5%e7%a8%8b%e6%b0%94%e8%b4%a8%e9%82%a3%e4%ba%9b-opt-in-%e7%8e%af%e5%a2%83%e5%8f%98%e9%87%8f" &gt;工程气质：那些 opt-in 环境变量&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e5%8d%81%e5%9b%9b%e6%88%90%e7%86%9f%e5%ba%a6%e8%af%84%e4%bc%b0" &gt;成熟度评估&lt;/a&gt;&lt;/li&gt;&#10;&lt;li&gt;&lt;a class="link" href="#%e5%8d%81%e4%ba%94%e7%bb%93%e8%af%ad" &gt;结语&lt;/a&gt;&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;hr&gt;&#10;&lt;p&gt;&lt;img alt="图：Strata 应用的 Monitor 标签页（左），旁边是一个正在写代码的编程智能体" loading="lazy" sizes="(max-width: 767px) calc(100vw - 30px), (max-width: 1023px) 700px, (max-width: 1279px) 950px, 1232px" src="https://blog.5616760.com/img/0039-001.jpg"&gt;&lt;/p&gt;&#10;&lt;h2 id="一它是什么"&gt;一、它是什么&#10;&lt;/h2&gt;&lt;p&gt;一句话定义：&lt;strong&gt;Strata 是一个在本机运行 MoE 大模型的推理引擎 + 一键安装器，让 Qwen3.8-Flash-Next 在普通家用电脑上跑起来，并暴露成一个 OpenAI / Anthropic 兼容的本地 API。&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;它要你接受的前提很朴素——&lt;strong&gt;一张 12 GB 以上显存的 NVIDIA 或 AMD 显卡，32 GB 以上内存，约 80 GB 硬盘&lt;/strong&gt;。除此之外，&amp;ldquo;安装程序会搞定&amp;rdquo;。&lt;/p&gt;&#10;&lt;p&gt;装好之后你得到的是：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;浏览器界面&lt;/strong&gt;：打开 &lt;code&gt;http://127.0.0.1:8080&lt;/code&gt;，里面有 &lt;strong&gt;Chat&lt;/strong&gt;（聊天）、实时 &lt;strong&gt;Monitor&lt;/strong&gt;（监控模型和你的 GPU/CPU/内存）、&lt;strong&gt;About&lt;/strong&gt;（设置和地址）；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;OpenAI 兼容 API&lt;/strong&gt;：给你的应用或编程智能体加一个提供商，base URL 填 &lt;code&gt;http://127.0.0.1:8080/v1&lt;/code&gt;，API key 和模型名随便填都行；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;Anthropic 兼容 API&lt;/strong&gt;：&lt;code&gt;/v1/messages&lt;/code&gt;，Claude Code 直接设 &lt;code&gt;ANTHROPIC_BASE_URL=http://127.0.0.1:8080&lt;/code&gt;；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;Codex CLI 兼容&lt;/strong&gt;：走 &lt;code&gt;/v1/responses&lt;/code&gt;；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;MCP 服务器&lt;/strong&gt;：让你的 AI 编程助手（Claude Code、Cursor、Copilot、Codex 等）一句话安装、启动、停止、测速 Strata。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;所有数据都留在你的电脑上。它不是云服务套壳，是一个真真正正在你本地算的引擎。&lt;/p&gt;&#10;&lt;h2 id="二要解决的只有一件事显存"&gt;二、要解决的只有一件事：显存&#10;&lt;/h2&gt;&lt;p&gt;理解 Strata，先理解它面对的&lt;strong&gt;只有一个约束&lt;/strong&gt;：&lt;/p&gt;&#10;&#10; &lt;blockquote&gt;&#10; &lt;p&gt;Qwen3.8-Flash-Next 这种级别的模型，本来运行在&lt;strong&gt;拥有数百 GB 显存&lt;/strong&gt;的服务器上。而你的显卡只有 12–24 GB。&lt;/p&gt;&#10;&#10; &lt;/blockquote&gt;&#10;&lt;p&gt;这就是全部问题。它&lt;strong&gt;不是&lt;/strong&gt;&amp;ldquo;如何让模型变聪明&amp;quot;的问题，也&lt;strong&gt;不是&lt;/strong&gt;&amp;ldquo;如何让模型跑得快&amp;quot;的问题——而是**&amp;ldquo;如何让它装得下&amp;rdquo;**的问题。&lt;/p&gt;&#10;&lt;p&gt;而 Qwen3.8-Flash-Next 恰好有一个特性让这件事变得可能：&lt;strong&gt;它是一个 MoE 模型&lt;/strong&gt;。MoE 的关键洞察是——模型里绝大多数权重，在写当前这一个词的时候&lt;strong&gt;根本用不到&lt;/strong&gt;。&lt;/p&gt;&#10;&lt;pre class="mermaid" style="visibility:hidden"&gt;flowchart TB&#10; subgraph P["问题：显存不够"]&#10; direction TB&#10; A1["服务器&lt;br/&gt;数百 GB 显存"] --&gt;|"普通模型&lt;br/&gt;全部权重常驻"| B["12-24 GB 家用显卡&lt;br/&gt;装不下"]&#10; A2["家用电脑&lt;br/&gt;RAM + SSD 可到上百 GB"] --&gt;|"MoE 模型&lt;br/&gt;每词只用少量专家"| C["能不能把不用的&lt;br/&gt;放到别处？"]&#10; end&#10; B --&gt; Q{"Strata 的答案"}&#10; C --&gt; Q&#10; Q --&gt; Y["摊到整台电脑：&lt;br/&gt;显卡放最常用的&lt;br/&gt;内存放全部专家&lt;br/&gt;SSD 放一张查找表"]&lt;/pre&gt;&lt;p&gt;这就是 Strata 的全部思路，一句话能说完，但把它做对需要非常多的工程。&lt;/p&gt;&#10;&lt;h2 id="三核心思路把工作摊到整台电脑"&gt;三、核心思路：把工作摊到整台电脑&#10;&lt;/h2&gt;&lt;p&gt;项目的官方比喻是&lt;strong&gt;厨房&lt;/strong&gt;：常用的东西放在台面上（显卡），其余的全部放储藏室（内存 + SSD），要用的时候再去取。&lt;/p&gt;&#10;&lt;pre class="mermaid" style="visibility:hidden"&gt;flowchart TB&#10; subgraph Kitchen["把电脑当厨房"]&#10; direction TB&#10; C["台面&lt;br/&gt;（显卡 VRAM）"] &#10; P["储藏室&lt;br/&gt;（RAM + SSD）"]&#10; end&#10; C --&gt;|"常用的专家&lt;br/&gt;随时可取"| W["每个词&lt;br/&gt;只调 10 个专家"]&#10; P --&gt;|"不常用的专家&lt;br/&gt;按需取用"| W&#10; W --&gt; OUT["写下一个词"]&lt;/pre&gt;&lt;p&gt;关键在最后一句：&lt;strong&gt;每个词只需要 10 个专家&lt;/strong&gt;。也就是说，模型不需要把 24576 个专家都放在显卡上——它只需要把最常用的那几千个放上去，其余放在内存里，CPU 和显卡&lt;strong&gt;同时&lt;/strong&gt;各自算自己负责的部分，谁也不用等谁。&lt;/p&gt;&#10;&lt;p&gt;这个思路对 &lt;strong&gt;NVIDIA（CUDA）和 AMD（HIP）完全一致&lt;/strong&gt;——同一个引擎，分别编译一次。&lt;/p&gt;&#10;&lt;h2 id="四三层内存分工显卡内存ssd-各放什么"&gt;四、三层内存分工：显卡、内存、SSD 各放什么&#10;&lt;/h2&gt;&lt;p&gt;这是全项目技术含量最高的一段。Strata 把整个模型按&amp;quot;谁用得多、谁用得少&amp;quot;切成了三层：&lt;/p&gt;&#10;&lt;table&gt;&#10;&#9;&lt;thead&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;存储层&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;放什么&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;具体内容&lt;/th&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/thead&gt;&#10;&#9;&lt;tbody&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;GPU（VRAM）&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;每个词都要用的 + 最常用的专家&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;Attention 与 DeltaNet mixer、gated-residual 权重、router、共享专家、输出头、MTP 草稿层；KV cache（从 64K 上下文起只留最常读的那部分，其余从内存流过来）；&lt;strong&gt;专家缓存&lt;/strong&gt;——把剩下 VRAM 填满最常用的专家，而且&lt;strong&gt;在对话过程中自适应&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;RAM&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;全部 24576 个专家（pinned）&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;CPU 用 AVX-512 / AVX2 内核（i-quant 用 ggml 的）&lt;strong&gt;就地&lt;/strong&gt;算显卡没装的专家，与显卡同时进行&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;SSD&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;一张 28.8 GB 的 n-gram 查找表&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;每个 token 只读其中几行，走操作系统缓存之外的无缓冲直读（&lt;code&gt;--ple-io direct&lt;/code&gt;）&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/tbody&gt;&#10;&lt;/table&gt;&#10;&lt;p&gt;这里有三个容易被忽略的细节：&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;① &amp;ldquo;多显存&amp;quot;比&amp;quot;快显卡&amp;quot;更重要。&lt;/strong&gt; 项目原话：每多 1 GB 显存，能多放约 700 个专家；而每多一个在显卡上的专家，就是 CPU 少算一个。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;② 专家缓存在线自适应。&lt;/strong&gt; 显卡上那个专家缓存不是装好就固定了，它会根据你正在聊的内容&lt;strong&gt;边用边学&lt;/strong&gt;哪些专家更常被调到。这是让它&amp;quot;越聊越顺&amp;quot;的关键。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;③ 显存少、显卡大的反向场景也有解。&lt;/strong&gt; 叫 &lt;strong&gt;low-RAM mode&lt;/strong&gt;：当内存装不下全部专家时，setup 改成从模型文件映射，RAM 只留显卡放不下的那部分。比如一台 32 GB 内存 + 24 GB 显存的机器，就能这样跑 Q2_0、IQ2_XS 和 Coder。&lt;/p&gt;&#10;&#10; &lt;blockquote&gt;&#10; &lt;p&gt;顺带一句：&lt;code&gt;MULTI_GPU.md&lt;/code&gt; 支持 2–3 张显卡分担同一个模型，甚至能做&lt;strong&gt;层切分&lt;/strong&gt;（layer split）。单卡不够，可以加卡。&lt;/p&gt;&#10;&#10; &lt;/blockquote&gt;&#10;&lt;h2 id="五moe-的本质24576-个专家的按需调度"&gt;五、MoE 的本质：24576 个专家的按需调度&#10;&lt;/h2&gt;&lt;p&gt;要真正理解 Strata 为什么能行，得回到 MoE 模型本身。它跟普通 Dense 模型（GPT-3、Llama 这类每个 token 都用全部权重）最大的区别是：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;Qwen3.8-Flash-Next 有 &lt;strong&gt;48 层&lt;/strong&gt;，每层 &lt;strong&gt;512 个专家&lt;/strong&gt;，共 &lt;strong&gt;24576 个&lt;/strong&gt;；&lt;/li&gt;&#10;&lt;li&gt;写每一个词时，&lt;strong&gt;每层只激活其中的 10 个专家&lt;/strong&gt;（top-10 路由）。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;pre class="mermaid" style="visibility:hidden"&gt;flowchart LR&#10; subgraph L["一层（共 48 层，每层 512 专家）"]&#10; direction TB&#10; R["Router&lt;br/&gt;给当前 token 打分"] --&gt; T["Top-10 选中&lt;br/&gt;10 个专家"]&#10; T --&gt; E1["专家 A"]&#10; T --&gt; E2["专家 B"]&#10; T --&gt; E3["专家 C"]&#10; T --&gt; EN["... 其余 7 个"]&#10; E1 --&gt; S["softmax 加权合并"]&#10; E2 --&gt; S&#10; E3 --&gt; S&#10; EN --&gt; S&#10; S --&gt; OUT["本层输出"]&#10; end&lt;/pre&gt;&lt;p&gt;这个结构的直接推论就是：&lt;strong&gt;在任何一刻，绝大多数专家是闲置的。&lt;/strong&gt; 那么把它们全部放在显卡上就是巨大的浪费。Strata 做的事情，就是把&amp;quot;闲置&amp;quot;的专家&amp;quot;放远一点&amp;rdquo;，用的时候再取。&lt;/p&gt;&#10;&lt;p&gt;但这里有个工程难题：&lt;strong&gt;&amp;ldquo;取&amp;quot;这个动作本身是要花时间的。&lt;/strong&gt; 如果每次取专家都要等 PCIe 或 SSD，那模型会慢到没法用。Strata 的解法是：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;显卡上放最常用的&lt;/strong&gt;——绝大多数词命中，不用取；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;内存里 CPU 就地算&lt;/strong&gt;——没命中显卡的，CPU 在内存里算，&lt;strong&gt;和显卡同时算&lt;/strong&gt;，谁也不用等谁；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;SSD 只放那张查找表&lt;/strong&gt;——每个 token 只读几行，走直读，基本不成为瓶颈。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h2 id="六先猜再检查mtp-投机解码"&gt;六、先猜再检查：MTP 投机解码&#10;&lt;/h2&gt;&lt;p&gt;这是 Strata 另一个让速度翻倍的核心技术。它的名字叫 &lt;strong&gt;MTP（Multi-Token Prediction）投机解码&lt;/strong&gt;，思路是：&lt;/p&gt;&#10;&#10; &lt;blockquote&gt;&#10; &lt;p&gt;&lt;strong&gt;一个小助手先猜接下来几个词，大模型一次性全部检查，保留正确的那些。&lt;/strong&gt;&lt;/p&gt;&#10;&#10; &lt;/blockquote&gt;&#10;&lt;pre class="mermaid" style="visibility:hidden"&gt;flowchart LR&#10; subgraph Guess["先猜"]&#10; G["小助手（MTP 草稿层）&lt;br/&gt;猜测接下来 3 个词"]&#10; end&#10; subgraph Check["再检查"]&#10; V["大模型一次过全部 48 层&lt;br/&gt;检查这 3 个词"]&#10; K{"同意哪些？"}&#10; end&#10; G --&gt; V&#10; V --&gt; K&#10; K --&gt;|"保留 2-3 个"| OK["一次前进了 2-3 个词"]&#10; K --&gt;|"重新生成"| NG["只保留被认可的"]&lt;/pre&gt;&lt;p&gt;几个关键事实：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;技术细节：模型自己的 &lt;strong&gt;MTP 层&lt;/strong&gt;草拟最多 3 个 token；一次过全部 48 层检查它们，&lt;strong&gt;平均每个验证窗口前进 2.4–3.2 个 token&lt;/strong&gt;；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;质量完全一样&lt;/strong&gt;——因为小助手只负责&amp;quot;猜&amp;rdquo;，&lt;strong&gt;每个词最终仍由大模型自己决定&lt;/strong&gt;。这就是它和&amp;quot;蒸馏成小模型&amp;quot;的本质区别；&lt;/li&gt;&#10;&lt;li&gt;效果：&lt;strong&gt;1.6–1.8 倍加速&lt;/strong&gt;；&lt;/li&gt;&#10;&lt;li&gt;还有一种叫 &lt;strong&gt;prompt lookup&lt;/strong&gt; 的补充：当回答在重复上下文时（比如改代码、引用原文），它从之前的副本里草拟最多 5 个 token。但这个只在&amp;quot;实测收益 &amp;gt; 成本&amp;quot;时才启用——&lt;strong&gt;代码编辑场景快 6–11%，其他文本不变&lt;/strong&gt;。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;这种&amp;quot;先猜再检查&amp;quot;的设计，本质是把&lt;strong&gt;串行的单步生成&lt;/strong&gt;变成&lt;strong&gt;并行的多步验证&lt;/strong&gt;，是用算力换延迟，而不是用质量换速度。&lt;/p&gt;&#10;&lt;h2 id="七长文本读取8192-token-分块与-pcie-专家流式"&gt;七、长文本读取：8192 token 分块与 PCIe 专家流式&#10;&lt;/h2&gt;&lt;p&gt;聊天快，读长文档也要快。Strata 的做法是：&lt;strong&gt;长文本分大块读入，每块最多 8192 个 token&lt;/strong&gt;（&lt;code&gt;--prefill auto&lt;/code&gt;，可以 opt-in 到 32768）。&lt;/p&gt;&#10;&lt;pre class="mermaid" style="visibility:hidden"&gt;flowchart TB&#10; P["长文档 / 代码库"] --&gt; C1["块 1&lt;br/&gt;(≤8192 token)"]&#10; P --&gt; C2["块 2"]&#10; P --&gt; C3["块 3"]&#10; C1 --&gt; L1["处理第 1 层 attention"]&#10; L1 --&gt; S1["第 2 层的专家&lt;br/&gt;通过 PCIe 流式上传到 GPU"]&#10; S1 --&gt; L2["处理第 2 层 attention&lt;br/&gt;（上传与计算重叠）"]&#10; L2 --&gt; N["继续下一层"]&#10; C1 --&gt; OUT["输出"]&#10; C2 --&gt; OUT&#10; C3 --&gt; OUT&lt;/pre&gt;&lt;p&gt;关键细节：&lt;strong&gt;下一层需要的专家，在当前层 attention 运行的同时，通过 PCIe 流式上传到显卡。&lt;/strong&gt; 这就是&amp;quot;预取&amp;rdquo;——计算和传输重叠，不让 PCIe 成为瓶颈。&lt;/p&gt;&#10;&lt;p&gt;效果：读长文档或代码库的速度&lt;strong&gt;超过每秒 1000 token&lt;/strong&gt;。而且&lt;strong&gt;第一条消息之后&lt;/strong&gt;，Strata 会保留对话，只读新增的内容，所以后续追问&lt;strong&gt;几秒内就开始回答&lt;/strong&gt;。&lt;/p&gt;&#10;&lt;p&gt;项目还特别说明：&lt;strong&gt;读入第一条消息时，大约每 30000 个 token 需要 1 分钟&lt;/strong&gt;（那是一次性成本，之后的消息很快）。&lt;/p&gt;&#10;&lt;h2 id="八实测速度nvidia-与-amd"&gt;八、实测速度：NVIDIA 与 AMD&#10;&lt;/h2&gt;&lt;p&gt;光说快不算数，Strata 项目最值得学习的一点是&lt;strong&gt;它把实测数据公开得非常彻底&lt;/strong&gt;。以下是两台普通游戏电脑的官方测量（一个 token 约等于 ¾ 个英文单词）：&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;NVIDIA：RTX 5070（12 GB）+ Ryzen 5 7600 + 64 GB 内存&lt;/strong&gt;&lt;/p&gt;&#10;&lt;table&gt;&#10;&#9;&lt;thead&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;规格&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th style="text-align: right"&gt;写回答（短对话）&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th style="text-align: right"&gt;读提示（32K token）&lt;/th&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/thead&gt;&#10;&#9;&lt;tbody&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;Q2_0&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;94 tokens/s&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;2,650 tokens/s&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;IQ2_XS&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;79 tokens/s&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;2,090 tokens/s&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;IQ3_XXS&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;62 tokens/s&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;1,750 tokens/s&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;IQ3_S&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;53 tokens/s&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;1,620 tokens/s&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;Coder&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;55 tokens/s&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;2,180 tokens/s&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/tbody&gt;&#10;&lt;/table&gt;&#10;&lt;p&gt;&lt;strong&gt;AMD：RX 9070 XT（16 GB）+ Ryzen 9 3900X + 47 GB 内存&lt;/strong&gt;&lt;/p&gt;&#10;&lt;table&gt;&#10;&#9;&lt;thead&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;规格&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th style="text-align: right"&gt;写回答（短对话）&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th style="text-align: right"&gt;读提示（32K token）&lt;/th&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/thead&gt;&#10;&#9;&lt;tbody&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;Q2_0&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;60 tokens/s&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;1,160 tokens/s&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;IQ2_XS&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;52 tokens/s&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;1,110 tokens/s&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;Coder&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;44 tokens/s&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;1,420 tokens/s&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/tbody&gt;&#10;&lt;/table&gt;&#10;&lt;p&gt;怎么读这张表？&lt;strong&gt;60 tokens/s 已经比你的阅读速度快了&lt;/strong&gt;。也就是说，用 Q2_0 在 RTX 5070 上聊天，&lt;strong&gt;回复出现的速度已经超过人眼能读完的速度&lt;/strong&gt;。&lt;/p&gt;&#10;&lt;p&gt;还有几个推论值得记：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;显存越大越快&lt;/strong&gt;：因为更多模型能放进显卡。项目估计 RTX 3090（24 GB）写回答能达到 &lt;strong&gt;约 100–140 tokens/s&lt;/strong&gt;；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;长上下文会慢一些&lt;/strong&gt;：128K 上下文时，Q2_0 从 94 降到 76 tokens/s，IQ2_XS 从 79 降到 63；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;4K 提示读得很快&lt;/strong&gt;：约 910–1,580 tokens/s；32K 提示在 Q2_0 上约 15 秒读完；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;每台电脑都不一样&lt;/strong&gt;：&lt;code&gt;START-HERE.bat --calibrate&lt;/code&gt; 会在你自己的机器上测几个引擎设置并保留最快的（约 15–30 分钟，慢卡更久）。项目实测，校准让 Coder 快了 7%。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&#10; &lt;blockquote&gt;&#10; &lt;p&gt;社区也有专门的 benchmark 模板（&lt;code&gt;docs/COMMUNITY_BENCHMARKS.md&lt;/code&gt;），项目鼓励你测完自己的机器后用 PR 分享。&lt;/p&gt;&#10;&#10; &lt;/blockquote&gt;&#10;&lt;h2 id="九模型选型4-个规格--4-个版本"&gt;九、模型选型：4 个规格 × 4 个版本&#10;&lt;/h2&gt;&lt;p&gt;Strata 跑一个模型，但有&lt;strong&gt;不同规格&lt;/strong&gt;（同一个模型压缩得更多或更少）和&lt;strong&gt;不同版本&lt;/strong&gt;（原版、编程版、微调版）。安装程序会按你的内存推荐一个，这里把选择逻辑讲清楚。&lt;/p&gt;&#10;&lt;h3 id="按内存选规格"&gt;按内存选规格&#10;&lt;/h3&gt;&lt;table&gt;&#10;&#9;&lt;thead&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;你的内存&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;选&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;原因&lt;/th&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/thead&gt;&#10;&#9;&lt;tbody&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;32 GB&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;Coder&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;装得下，专为代码打造（若显卡 24 GB，Q2_0 和 IQ2_XS 也能跑）&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;48 GB&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;IQ2_XS&lt;/strong&gt;（或 Q2_0，最快）&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;更大的规格装不下&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;64 GB&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;IQ2_XS&lt;/strong&gt;（推荐），或 IQ3_XXS / IQ3_S&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;所有规格都装得下；IQ3_S 最好也最慢&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;96 GB 或以上&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;IQ3_S&lt;/strong&gt;，或 Unsloth 的 UD-IQ4_XS&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;开着其他程序也能放下最大的规格&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/tbody&gt;&#10;&lt;/table&gt;&#10;&lt;p&gt;四个规格的 RAM+VRAM 需求和速度对比：&lt;/p&gt;&#10;&lt;table&gt;&#10;&#9;&lt;thead&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;规格&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th style="text-align: right"&gt;RAM+VRAM 需求&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;速度&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;质量&lt;/th&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/thead&gt;&#10;&#9;&lt;tbody&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;Q2_0&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;37.6 GB&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;最快&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;好&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;IQ2_XS&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;39.2 GB&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;快&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;更好（&lt;strong&gt;推荐&lt;/strong&gt;）&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;IQ3_XXS&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;47.0 GB&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;较慢&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;很棒&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;IQ3_S&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;54.8 GB&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;最慢&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;最佳：在公开测试上与完整模型一致（仅原版模型）&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/tbody&gt;&#10;&lt;/table&gt;&#10;&lt;p&gt;规格越小越快，越大越聪明一些。三个较小规格的下载是 66–76 GB；首次启动还会拉取 MTP 草稿层（约 6 GB，开图像再加 1 GB）。&lt;/p&gt;&#10;&lt;h3 id="四个版本"&gt;四个版本&#10;&lt;/h3&gt;&lt;p&gt;&lt;strong&gt;① Qwen3.8-Flash-Next（原版）&lt;/strong&gt;——四个规格都有，支持图像输入，可选实验性 speed projection。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;② Coder&lt;/strong&gt;——ISTA-DASLab 的编程版。它&lt;strong&gt;只保留每层 512 个专家中的 256 个&lt;/strong&gt;，按代码（含 agentic 和图像）数据挑选，丢掉另一半。&lt;strong&gt;达到完整模型 SWE-bench Verified 分数的 91%（LiveCodeBench 99%），由作者测得。&lt;/strong&gt; 只有一个规格（IQ1_M），分片 1 是 &lt;strong&gt;29.6 GB&lt;/strong&gt;，所以 32 GB 内存就能跑，64 GB 上能跑 262K 上下文，读长提示最快。&lt;/p&gt;&#10;&#10; &lt;blockquote&gt;&#10; &lt;p&gt;⚠️ 代价：去掉一半专家后，&lt;strong&gt;代码以外的能力变弱，包括中文和其他中日韩文本&lt;/strong&gt;。项目明确提到 issue #438：中文回答出现错误或循环，而英文正常。&lt;strong&gt;一般用途，或内存允许时，请选保留全部专家的规格（Q2_0、IQ2_XS 或 IQ3_S）。&lt;/strong&gt;&lt;/p&gt;&#10;&#10; &lt;/blockquote&gt;&#10;&lt;p&gt;&lt;strong&gt;③ Swift 1.5&lt;/strong&gt;——UkisAI 的微调版，&lt;strong&gt;回答前思考的时间短得多&lt;/strong&gt;，你能更早拿到答案，质量基本不变。每个 token 速度相同，RAM 需求与同规格原版接近（没有 IQ3_S）。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;④ Unsloth UD-IQ4_XS&lt;/strong&gt;——Unsloth 的约 4-bit 版本，质量介于 IQ3_S 和 UD-Q4_K_XL 之间。下载 94 GB，专家 59.5 GB。内存少于约 80 GB 时，回答时要从 SSD 读其中一部分（NVMe SSD 有帮助）。&lt;/p&gt;&#10;&lt;p&gt;另有实验性的 &lt;strong&gt;UD-Q4_K_XL&lt;/strong&gt;（最接近完整模型，但下载 111 GB、专家 77 GB 装不进内存，64 GB 电脑上每秒只有 7–8.5 token），以及需手动设置的 &lt;strong&gt;OrcaRouter Uncensored IQ3_XXS&lt;/strong&gt;。&lt;/p&gt;&#10;&lt;h3 id="装不下怎么选-low-ram-mode"&gt;装不下怎么选？—— low-RAM mode&#10;&lt;/h3&gt;&lt;p&gt;一台&lt;strong&gt;大显卡 + 小内存&lt;/strong&gt;的机器怎么办？&lt;code&gt;START-HERE.bat --setup --low-ram on|off&lt;/code&gt; 可以覆盖这个选择。比如：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;32 GB 内存 + 24 GB 显存 → 能跑 Q2_0、IQ2_XS、Coder；&lt;/li&gt;&#10;&lt;li&gt;32 GB 内存 + 12–16 GB 显存 → 只能跑 Coder（显卡太小，很多专家要从 SSD 来，会慢很多，setup 会明确告诉你）。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h2 id="十一键安装以及让-ai-帮你装"&gt;十、一键安装，以及让 AI 帮你装&#10;&lt;/h2&gt;&lt;p&gt;Strata 的安装设计得很&amp;quot;反技术&amp;rdquo;。&lt;strong&gt;Windows 双击 &lt;code&gt;START-HERE.bat&lt;/code&gt;，Linux 运行 &lt;code&gt;./setup.sh&lt;/code&gt;&lt;/strong&gt;，NVIDIA 和 AMD 步骤完全一样。安装程序会识别你的显卡、装好对应引擎，然后问你几个问题（哪个模型、哪个规格、上下文多大、是否识别图片）——&lt;strong&gt;每次直接按回车就是推荐选项&lt;/strong&gt;。&lt;/p&gt;&#10;&lt;p&gt;之后它会下载模型（约 70 GB）并启动。下载中断了？再运行一次即可，&lt;strong&gt;它会从中断的地方继续&lt;/strong&gt;。&lt;/p&gt;&#10;&lt;h3 id="让-ai-帮你装"&gt;让 AI 帮你装&#10;&lt;/h3&gt;&lt;p&gt;这才是最妙的部分。如果你在用 AI 编程助手（Claude Code、Cursor、Codex、Copilot 等），把下面这段粘贴给它：&lt;/p&gt;&#10;&lt;div class="highlight"&gt;&lt;pre tabindex="0" style="color:#f8f8f2;background-color:#272822;-moz-tab-size:4;-o-tab-size:4;tab-size:4;-webkit-text-size-adjust:none;"&gt;&lt;code class="language-text" data-lang="text"&gt;&lt;span style="display:flex;"&gt;&lt;span&gt;Set up Strata on this PC for me: https://github.com/Niko1221/Strata - follow docs/AI_SETUP.md in that repository.&#10;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;它会检查你的显卡、内存和硬盘，选出合适的模型，安装并启动，再告诉你怎么连接你的应用。&lt;/p&gt;&#10;&lt;h3 id="mcp-服务器ai-助手直接管理-strata"&gt;MCP 服务器：AI 助手直接管理 Strata&#10;&lt;/h3&gt;&lt;p&gt;更进一步，Strata 提供了一个 &lt;strong&gt;MCP 服务器&lt;/strong&gt;（&lt;code&gt;tools/strata_mcp.py&lt;/code&gt;）——&lt;strong&gt;一个只用标准库的 Python 文件&lt;/strong&gt;，所以它在 setup 创建 &lt;code&gt;.venv&lt;/code&gt; 之前就能用。你把它加进 AI 助手一次，就能用大白话指挥它：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&amp;ldquo;Install Strata for this PC.&amp;rdquo;&lt;/li&gt;&#10;&lt;li&gt;&amp;ldquo;Start Strata.&amp;rdquo; / &amp;ldquo;Stop Strata.&amp;rdquo;&lt;/li&gt;&#10;&lt;li&gt;&amp;ldquo;Is Strata running? How much VRAM does it use?&amp;rdquo;&lt;/li&gt;&#10;&lt;li&gt;&amp;ldquo;Which Strata model fits my PC?&amp;rdquo;&lt;/li&gt;&#10;&lt;li&gt;&amp;ldquo;Strata didn&amp;rsquo;t start - what does the log say?&amp;rdquo;&lt;/li&gt;&#10;&lt;li&gt;&amp;ldquo;How fast is Strata on this PC?&amp;quot;（一次简短测速）&lt;/li&gt;&#10;&lt;li&gt;&amp;ldquo;How do I connect Open WebUI / the OpenAI SDK / Claude Code to Strata?&amp;rdquo;&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;它暴露的工具：&lt;/p&gt;&#10;&lt;table&gt;&#10;&#9;&lt;thead&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;工具&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;做什么&lt;/th&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/thead&gt;&#10;&#9;&lt;tbody&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;strata_status&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;是否有模型在跑（模型、引擎版本、上下文、忙/闲、VRAM 与 RAM 占用）；已装了什么；这台电脑的硬件（OS、CPU、RAM、GPU、page file、可用磁盘）；setup 推荐什么&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;strata_models&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;setup 提供的每个 family 和 size，含下载体积、所需 RAM、是否装得下、是否已安装、推荐上下文长度&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;strata_install&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;无交互后台运行 setup；无 &lt;code&gt;confirm: true&lt;/code&gt; 时只返回计划；再次调用显示进度；&lt;code&gt;cancel: true&lt;/code&gt; 取消&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;strata_start&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;后台启动已装模型并等待它响应；50 秒未就绪返回 &amp;ldquo;loading&amp;rdquo;&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;strata_stop&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;通过服务器自身 API 卸载模型，然后结束它启动的服务&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;strata_logs&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;服务器日志、引擎日志或 setup 日志的最后几行&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;strata_benchmark&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;发一个固定短请求（greedy、关闭 thinking），报告输出和提示的 tokens/s&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;strata_connect_info&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;OpenAI 和 Anthropic 的 base URL、模型 id、是否需要 key，以及 Claude Code、Codex、OpenAI SDK、curl、Cursor、Continue、Open WebUI 的连接设置&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/tbody&gt;&#10;&lt;/table&gt;&#10;&lt;p&gt;它支持 Claude Code、Claude Desktop、Cursor、VS Code（Copilot agent mode）、Codex CLI 以及任何其他 MCP 客户端，传输用 stdio，说的 MCP 版本是 2025-06-18（也兼容 2025-03-26 和 2024-11-05）。&lt;/p&gt;&#10;&lt;h2 id="十一api-兼容层openai--anthropic--responses"&gt;十一、API 兼容层：OpenAI / Anthropic / Responses&#10;&lt;/h2&gt;&lt;p&gt;Strata 之所以能&amp;quot;无缝替换云服务&amp;rdquo;，是因为它&lt;strong&gt;同时兼容三套主流 API&lt;/strong&gt;：&lt;/p&gt;&#10;&lt;table&gt;&#10;&#9;&lt;thead&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;你想连的东西&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;base URL / 设置&lt;/th&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/thead&gt;&#10;&#9;&lt;tbody&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;OpenAI SDK / 任何 OpenAI 兼容客户端&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;http://127.0.0.1:8080/v1&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;Claude Code&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;ANTHROPIC_BASE_URL=http://127.0.0.1:8080&lt;/code&gt;（走 &lt;code&gt;/v1/messages&lt;/code&gt;）&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;Codex CLI 及其他用 Responses API 的应用&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;/v1/responses&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/tbody&gt;&#10;&lt;/table&gt;&#10;&lt;p&gt;几个使用细节：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;API key 和模型名随便填都行&lt;/strong&gt;——它本机跑，不需要验证；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;思考&lt;/strong&gt;：在聊天菜单或应用的 &amp;ldquo;reasoning effort&amp;rdquo; 里选 &lt;strong&gt;off、low、medium、high&lt;/strong&gt;。off 最快，high 最适合难题；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;图片&lt;/strong&gt;：安装时对 &amp;ldquo;Images?&amp;rdquo; 选是，然后在聊天里点 Picture，或在应用里附上图片。&lt;strong&gt;AMD 显卡在 Linux 上通过处理器识别图片，Windows 上暂时还不行&lt;/strong&gt;；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;从手机或另一台电脑访问&lt;/strong&gt;：&lt;code&gt;START-HERE.bat --setup --host 0.0.0.0 --api-key &amp;lt;secret&amp;gt;&lt;/code&gt;——&lt;strong&gt;一定要设 key&lt;/strong&gt;；&lt;/li&gt;&#10;&lt;li&gt;默认情况下 Strata &lt;strong&gt;一次只回答一个请求&lt;/strong&gt;，其他排队。想同时回答多个，见下一节。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;h2 id="十二批处理一次回答多个请求"&gt;十二、批处理：一次回答多个请求&#10;&lt;/h2&gt;&lt;p&gt;默认单请求队列。用 &lt;code&gt;&amp;quot;parallel&amp;quot;: N&lt;/code&gt;（引擎参数 &lt;code&gt;--batch N&lt;/code&gt;，也叫 &lt;code&gt;--slots N&lt;/code&gt;），引擎会同时保持最多 N 个对话并&lt;strong&gt;一起解码&lt;/strong&gt;：&lt;/p&gt;&#10;&lt;pre class="mermaid" style="visibility:hidden"&gt;flowchart LR&#10; subgraph B["一次验证窗口"]&#10; direction TB&#10; V["一次过全部 48 层"] --&gt; S1["会话 1 的一个 token"]&#10; V --&gt; S2["会话 2 的一个 token"]&#10; V --&gt; S3["会话 3 的一个 token"]&#10; end&#10; B --&gt;|"共享的稠密权重、共享专家、输出头"| EFF["每个会话的专家&lt;br/&gt;共享的只读一次"]&lt;/pre&gt;&lt;p&gt;关键收益：&lt;strong&gt;每个验证窗口携带每个对话的一个 token&lt;/strong&gt;，所以多个会话共享的稠密权重、共享专家、输出头&lt;strong&gt;只需要读一次&lt;/strong&gt;。配合跨多张显卡的层切分和 &lt;code&gt;--batch-groups&lt;/code&gt;，各卡还能同时处理不同会话。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;但它是有代价的&lt;/strong&gt;：每个槽位的 session 都要占 VRAM（32K 上下文 + 8-bit KV 是 0.56 GiB/槽）。所以 setup &lt;strong&gt;只在专家大多能装进 VRAM 时&lt;/strong&gt;推荐开启并行。在专家主要在 CPU 上跑的卡上，并行只改善&lt;strong&gt;延迟&lt;/strong&gt;（没人等一整段回答），单请求反而更慢 11–24%（专家缓存变小了）。&lt;/p&gt;&#10;&lt;p&gt;一个很有工程味道的设计——&lt;strong&gt;协作式抢占&lt;/strong&gt;：当一个更短的请求在等时，服务端发 &lt;code&gt;BYIELD&lt;/code&gt;，长请求在下一个块边界停下、已读的部分复制进槽位、短请求插入，长请求再从槽位继续。&lt;strong&gt;每请求最多两次。&lt;/strong&gt;&lt;/p&gt;&#10;&lt;p&gt;另一个容易被低估的点：&lt;strong&gt;每个槽位就是一个对话缓存。&lt;/strong&gt; 已完成回答的槽位保留它持有的内容（提示、回答、以及提示最后一次轮次边界处的 checkpoint）。同一对话的下一轮会回到那个槽位，引擎直接把状态复制回去（短对话 50–60 ms）&lt;strong&gt;而不是重读历史&lt;/strong&gt;——即使用户把回答里的 thinking 从历史里丢掉了（checkpoint 匹配到新轮次）。&lt;/p&gt;&#10;&lt;h2 id="十三工程气质那些-opt-in-环境变量"&gt;十三、工程气质：那些 opt-in 环境变量&#10;&lt;/h2&gt;&lt;p&gt;Strata 最打动人的，可能不是它能跑多大模型，而是它对**&amp;ldquo;哪些东西默认关掉&amp;rdquo;**的克制。这些 opt-in 环境变量，每一个背后都是一次真实的取舍：&lt;/p&gt;&#10;&lt;table&gt;&#10;&#9;&lt;thead&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;开关&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;干什么&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;实测收益 / 代价&lt;/th&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/thead&gt;&#10;&#9;&lt;tbody&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;STRATA_DISJOINT_ADAPT=1&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;避免助手卡和主卡重复存放同一专家&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;观测到 &lt;strong&gt;1900–2000 个重复槽位&lt;/strong&gt;；两台改装的 RTX 3080 20 GB，生成提速 &lt;strong&gt;15.5%&lt;/strong&gt;、请求时间降 &lt;strong&gt;12.2%&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;STRATA_KV_PREFETCH=1&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;长上下文 KV 部分在内存时，让下一层上传与当前层计算重叠&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;32K：预填充 &lt;strong&gt;-5.3%&lt;/strong&gt;；64K：&lt;strong&gt;-4.1%&lt;/strong&gt;；8K 无改善，解码无提速&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;STRATA_RING_BYTES&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;按字节给打包的流式环形缓冲区定尺寸&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;32K 提示下 IQ3_XXS &lt;strong&gt;+18.5%&lt;/strong&gt;（1500 槽缓存），Coder +3%，IQ3_S 不变；4K 提示不变&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;STRATA_BATCH_MTP=1&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;批处理时每槽每窗口验证一个 MTP 提案&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;RTX PRO 5000 实测 &lt;strong&gt;+31%~39%&lt;/strong&gt; 总吞吐（2–4 客户端）&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;STRATA_STAGE_TRIM=1&lt;/code&gt; / &lt;code&gt;--trim-stage-weights&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;层切分时每卡只加载自己那层的稠密权重&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;省下的 VRAM 给专家缓存&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;STRATA_BATCH_DECODE_SHARE=0.5&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;预填充每个块之后解码的时间比例&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;默认 0.5：长提示拖慢其他请求但不完全停住它们&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;--ple-io direct&lt;/code&gt; / &lt;code&gt;--ple-io ram&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;SSD 查找表走无缓冲直读，还是整表进内存&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;默认 &lt;code&gt;direct&lt;/code&gt;（为 SSD 设计）；机械盘用 &lt;code&gt;ram&lt;/code&gt;（issue #605）&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;STRATA_PREFILL_CPU_SHARE&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;单 NVIDIA GPU 上 CPU 分担预填充&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;默认开&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;STRATA_PARALLEL_SOLO=0&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;关闭&amp;quot;槽位独占时回到 solo 路径&amp;quot;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;默认每请求最多两次回到 solo&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/tbody&gt;&#10;&lt;/table&gt;&#10;&lt;p&gt;&lt;strong&gt;这里值得单独讲讲 SSD 上那张查找表。&lt;/strong&gt; 它是 28.8 GB 的 &lt;strong&gt;PLE（Prompt Lookup Engine）n-gram 表&lt;/strong&gt;，默认 &lt;code&gt;IQ4_NL&lt;/code&gt; 格式。引擎&lt;strong&gt;按 GGUF 里存的格式&lt;/strong&gt;读它：IQ4_NL（默认）、Q4_0、Q5_0、Q5_1、Q8_0、FP8（E4M3 带 scale）或 BF16。&lt;/p&gt;&#10;&lt;p&gt;项目对压缩格式的质量损失做了非常严谨的测量——在 4000 个随机行上对比 checkpoint 自己的 BF16 表：&lt;/p&gt;&#10;&lt;table&gt;&#10;&#9;&lt;thead&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;格式&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th style="text-align: right"&gt;表大小&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th style="text-align: right"&gt;平均每行误差&lt;/th&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/thead&gt;&#10;&#9;&lt;tbody&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;Q8_0&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;54 GB&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;&lt;strong&gt;0.53%&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;FP8&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;—&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;2.64%&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;Q5_1&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;—&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;3.78%&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;Q5_0&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;—&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;4.25%&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;IQ4_NL&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;&lt;strong&gt;28.8 GB&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;7.60%&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;Q4_1&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;—&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;7.80%&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;Q4_0&lt;/strong&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;—&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td style="text-align: right"&gt;8.55%&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/tbody&gt;&#10;&lt;/table&gt;&#10;&lt;p&gt;再在 Q2_0 模型上、700 个 teacher-forced token 里对比 KL 散度：&lt;code&gt;Q5_0 0.0117 / Q5_1 0.0121 / Q8_0 0.0125 / FP8 0.0128 / Q4_0 0.0140 / IQ4_NL 0.0146&lt;/code&gt;，&lt;strong&gt;perplexity 都在 BF16 的 1% 以内&lt;/strong&gt;。&lt;/p&gt;&#10;&#10; &lt;blockquote&gt;&#10; &lt;p&gt;结论很有意思：&lt;strong&gt;改动这张表对 2-bit 模型的移动大约都是 0.012，所以这些格式很难区分。&lt;/strong&gt; 于是 setup 不提供换表的选项——它只改变喂给引擎的是哪个 GGUF。这种&amp;quot;知道什么时候不值得折腾&amp;quot;的判断，本身就是工程成熟度的体现。&lt;/p&gt;&#10;&#10; &lt;/blockquote&gt;&#10;&lt;h2 id="十四成熟度评估"&gt;十四、成熟度评估&#10;&lt;/h2&gt;&lt;p&gt;拉回现实，客观看一下这个项目：&lt;/p&gt;&#10;&lt;table&gt;&#10;&#9;&lt;thead&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;维度&lt;/th&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;th&gt;现状&lt;/th&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/thead&gt;&#10;&#9;&lt;tbody&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;活跃度&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;strong&gt;18,465 star / 1,647 fork&lt;/strong&gt; / 106 watch / &lt;strong&gt;479 个开放 issue&lt;/strong&gt;；2026-09-24 创建，2026-10-08 仍有提交&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;仓库规模&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;2422 个文件，主要语言 C++，约 22 MB（不含模型），有 &lt;code&gt;src/&lt;/code&gt;、&lt;code&gt;include/&lt;/code&gt;、&lt;code&gt;bench/&lt;/code&gt;、&lt;code&gt;tools/&lt;/code&gt;、&lt;code&gt;serve/&lt;/code&gt;、&lt;code&gt;tests/&lt;/code&gt;、&lt;code&gt;sycl/&lt;/code&gt; 等完整工程结构&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;引擎迭代&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;已迭代到 0.1.4x 区间，文档里大量引用具体版本号（如 0.1.39、0.1.41）和 issue/PR 编号&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;测试纪律&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;src/kernels/&lt;/code&gt; 里有大量 &lt;code&gt;*_parity.cpp&lt;/code&gt;（对偶校验测试）和 &lt;code&gt;*_test.cpp&lt;/code&gt;；&lt;code&gt;bench/results/&lt;/code&gt; 按日期记录了每一次基准&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;文档&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;&lt;code&gt;docs/&lt;/code&gt; 下有 46 个文件，从 &lt;code&gt;HOW_IT_WORKS&lt;/code&gt;、&lt;code&gt;DETAILS&lt;/code&gt;、&lt;code&gt;MODELS&lt;/code&gt; 到 &lt;code&gt;MULTI_GPU&lt;/code&gt;、&lt;code&gt;MCP_SERVER&lt;/code&gt;、&lt;code&gt;BATCHING&lt;/code&gt;，还有正式论文 &lt;code&gt;docs/paper/Strata-Paper.pdf&lt;/code&gt;&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&#9;&#9;&lt;tr&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;许可&lt;/td&gt;&#10;&#9;&#9;&#9;&#9;&#9;&lt;td&gt;MIT（Strata 本体）；模型文件有自己的许可；&lt;code&gt;third_party/ggml&lt;/code&gt; MIT；网页字体 SIL OFL 1.1&lt;/td&gt;&#10;&#9;&#9;&#9;&lt;/tr&gt;&#10;&#9;&lt;/tbody&gt;&#10;&lt;/table&gt;&#10;&lt;p&gt;&lt;strong&gt;已经验证过的&lt;/strong&gt;：在两台不同的游戏电脑（NVIDIA 与 AMD）上都有完整实测；&lt;code&gt;bench/results/&lt;/code&gt; 记录了从 2026-09-24 到 2026-10-01 的多轮基准（RTX 3090 + EPYC Milan、社区 RTX 5090、2× RTX PRO 4500、SYCL 等）。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;仍待完善/值得注意的边界&lt;/strong&gt;：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;Coder 的中文较弱&lt;/strong&gt;（issue #438：中文回答出错或循环，英文正常）——项目自己写在文档里，没藏着；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;AMD 在 Windows 上还不能识别图像&lt;/strong&gt;（Linux 上走 CPU）；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;479 个开放 issue&lt;/strong&gt; 说明项目还在快速迭代，也说明边界不少；&lt;/li&gt;&#10;&lt;li&gt;大量性能优化仍是 &lt;strong&gt;opt-in&lt;/strong&gt; 的（默认关），说明作者对&amp;quot;默认行为稳定&amp;quot;的执念很强。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;&lt;strong&gt;适合谁用&lt;/strong&gt;：有一张 12 GB 以上显存显卡、想把大模型留在本机、在意数据不出门、愿意接受命令行和安装脚本的技术型用户；尤其是已经在用 Claude Code / Cursor / Codex 这类 AI 编程助手、想给它们配一个本地模型的人。&lt;/p&gt;&#10;&lt;p&gt;&lt;strong&gt;不太适合&lt;/strong&gt;：没有独立显卡（只有核显）、显存低于 12 GB、或内存少于 32 GB 的机器；希望开箱即用、不想碰任何脚本的普通用户。&lt;/p&gt;&#10;&lt;h2 id="十五结语"&gt;十五、结语&#10;&lt;/h2&gt;&lt;p&gt;&lt;code&gt;Strata&lt;/code&gt; 最打动我的地方，是它把一件&amp;quot;看起来不可能&amp;quot;的事情做成了，而且&lt;strong&gt;把每一步为什么这么做都讲清楚了&lt;/strong&gt;：&lt;/p&gt;&#10;&lt;ul&gt;&#10;&lt;li&gt;&lt;strong&gt;该利用的利用&lt;/strong&gt;——MoE 模型&amp;quot;每词只调 10 个专家&amp;quot;的特性，是它敢把专家拆到三层内存的根基；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;该重叠的重叠&lt;/strong&gt;——MTP 投机解码让&amp;quot;猜+验证&amp;quot;并行，PCIe 专家流式让&amp;quot;上传+计算&amp;quot;并行，KV 预取让&amp;quot;下一层上传+当前层计算&amp;quot;并行。&lt;strong&gt;它几乎在每一个可能卡住的地方都放了重叠&lt;/strong&gt;；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;该保守的保守&lt;/strong&gt;——所有性能优化默认关，需要你显式打开；setup 只在你内存允许时才推荐并行；&lt;code&gt;--calibrate&lt;/code&gt; 让你在自己机器上实测而不是盲信文档数字；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;该测量的测量&lt;/strong&gt;——从 2-bit 模型的 KL 散度到 n-gram 表的每行误差，从 NVIDIA 到 AMD，从 4K 到 262K 上下文，&lt;strong&gt;每一个数字都标了测速环境和版本&lt;/strong&gt;；&lt;/li&gt;&#10;&lt;li&gt;&lt;strong&gt;该承认的承认&lt;/strong&gt;——中文在 Coder 上不行就写 #438，AMD Windows 暂不支持图像就直接说明，装不下就诚实告诉你会慢多少。&lt;/li&gt;&#10;&lt;/ul&gt;&#10;&lt;p&gt;一个能把&amp;quot;12 GB 显卡跑 1250 亿参数模型&amp;quot;这件事，拆成&lt;strong&gt;三层内存分工 + 两处并行 + 一套严谨测量&lt;/strong&gt;的项目，比一个声称&amp;quot;全面支持、无所不能&amp;quot;的项目更值得信任。这种&lt;strong&gt;知道自己每一步在哪、为什么这么选&lt;/strong&gt;的克制，是它最像样的工程特质。&lt;/p&gt;&#10;&lt;hr&gt;&#10;&#10; &lt;blockquote&gt;&#10; &lt;p&gt;&lt;strong&gt;免责声明&lt;/strong&gt;：本文为个人学习性质的项目文档解读，不构成对该软件的推荐、担保或安全评估。项目仍在快速迭代，文中数据为 2026-10-09 快照，具体行为请以你所用版本与仓库最新文档为准。涉及大模型部署、显存占用与系统资源消耗的操作，请自行评估风险，注意模型文件体积（66–111 GB）与首次启动的资源占用。&lt;/p&gt;&#10;&#10; &lt;/blockquote&gt;&#10;</description></item></channel></rss>