☰
Strata 性能基准与论文导读:125B MoE在消费级硬件上的极限测量与瓶颈分析
2026/10/2 7:19:45 网站建设 项目流程

Strata 性能基准与论文导读:125B MoE在消费级硬件上的极限测量与瓶颈分析

【免费下载链接】StrataQwen3.8-Flash-Next on any consumer hardware: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.项目地址: https://gitcode.com/gh_mirrors/strata11/Strata

Strata 是一款让 125B 参数的 Qwen3.8-Flash-Next(MoE 架构)模型跑在单张 12-24 GB 消费级显卡上的开源推理引擎。本文带你读懂它的性能基准数据:在 RTX 5070 上,它以 60-95 tokens/s 的速度"写出"回答,比人眼阅读还快;同时深入论文与基准实验,剖析专家缓存、KV 流式传输、投机解码等关键机制背后的瓶颈与取舍。

一次提示词,Strata 在 RTX 5070 上运行(IQ3_S 量化,128K 上下文)生成的体素宝塔花园

为什么 125B 模型能塞进一台游戏 PC

传统上,125B 模型需要数百 GB 显存的服务器。Strata 的核心思路是把整台电脑当成"一台机器"来分配工作:

  • GPU(显存):注意力计算 + 最常用的"专家"缓存;
  • 内存(RAM):存放全部 24,576 个专家,CPU 与 GPU并行计算缺失的专家;
  • SSD:存放 28.8 GB 的 n-gram 查找表,每个 token 只读几行。

这个"GPU / 内存 / SSD"三级分层架构是论文(docs/paper/Strata-Paper.pdf)的主线,完整细节见 docs/DETAILS.md 的How it works一节。

Strata 应用的 Monitor 页签:实时显示 GPU 负载、VRAM、专家缓存命中情况(左),右侧是模型正在编写代码的编码智能体

实测速度:一张表看懂 RTX 5070 的表现

以下数据来自引擎 0.1.26,测试机为 RTX 5070(12 GB)+ Ryzen 5 7600 + 64 GB DDR5,完整原始数据在 bench/results/2026-09-29-speed-0126/matrix.json。

读取提示词速度(Prompt,tokens/s)

模型4K32K64K128K
Q2_01,2992,1712,1262,107
IQ2_XS(推荐)1,2562,0921,7541,752
IQ3_S(质量最高)9131,6241,6401,443
Coder(代码特化)1,5832,1772,2362,208

生成回答速度(Output,tokens/s)

模型4K32K64K128K
Q2_093.081.876.273.7
IQ2_XS78.676.363.762.7
IQ3_S53.348.346.345.5
Coder55.154.953.243.0

两个关键观察:

  1. 上下文越长,输出越慢(93 → 45 tokens/s):注意力需要读取越来越大的 KV 缓存,同时 VRAM 被 KV 挤占,能缓存的专家变少;
  2. VRAM 比显卡本身更重要:显存里每多放 1 GB 约可多缓存 700 个专家,每个"GPU 上命中的专家"都是 CPU 不用做的计算。RTX 3090(24 GB)预计可达 100-140 tokens/s,完整估算表见 docs/DETAILS.md 的Other GPUs。

瓶颈分析:三次关键优化的测量证据

1️⃣ Prompt 读取:从 572 到 1,290 tokens/s(2.2 倍)

bench/results/2026-09-28-prefill-speed/README.md 记录了引擎 0.1.13 的逐步优化,每一步都量化了收益:

优化手段32K Prompt 结果(Q2_0)
扩大分块(2,048 → 8,192,--prefill auto)791 → 973
PLE 块按整块计算而非逐 token981 → 1,053
使用量化 MMQ 内核(int8 张量核心,免反量化)1,052 → 1,130
下一层专家通过 PCIe 流式预取(与当前层注意力重叠)1,130 →1,290

瓶颈定位非常清晰:PCIe 带宽与计算的重叠程度决定 prompt 速度——让"专家搬运"藏在"注意力计算"背后,是消费级硬件上最划算的隐藏成本手段。

2️⃣ KV 缓存:流式传输 vs 4-bit 压缩的取舍

长上下文下 KV 缓存是显存杀手。Strata 给出两条路线:

  • KV 流式(默认,64K 以上):KV 缓存放内存,只把注意力要读的部分留在 VRAM。Q2_0 在 262K 上下文下从 50.9 → 62.6 tokens/s(VRAM 内专家从 1,589 → 3,872 个)。代价是每 token 约 13.7 KB 内存(128K 时约 1.7 GB)。
  • Q4_0 KV(可选):4-bit 量化让 KV 内存减半,128K 下快约 4%,但长文档困惑度恶化 8-12%——bench/results/2026-09-27-kv-q4/README.md 的 teacher-forced 对比显示 4-bit 的 KL 散度是 int8 的 2.6-4.2 倍。因此 8-bit 仍是默认值。

这体现了一个典型的工程权衡:省显存的量化会损失精度,而"把数据搬到内存"几乎无损——所以论文优先选择前者。

3️⃣ 双卡分层:+18-20% 的 Prompt 加速,但第三张卡是负收益

bench/results/2026-09-29-layer-split/README.md 在 RTX 5080 + 3090 上扫描了分层切分点 K(每卡各持 24 层中的一段):

配置Prompt 28KDecode(代码)
5080 单独1,974105.2
5080 + 3090,K=262,357(+19%)109.7
5080 + 3090 + 2080 Ti1,84789.6

两个反直觉的结论:① 专家缓存命中率很快饱和(98-100%),决定速度的是"每层 GPU 时间",所以把层挪去更快的卡才有效;② 加入第三张慢卡(2080 Ti)反而拖慢整体——它单层 3.1 ms/窗口的开销超过了它多缓存的专家收益。--layer-split auto会用逐层时间 × 卡数预测所有切分方案,自动选择最快的一种。

论文导读:如何阅读 Strata-Paper.pdf

docs/paper/Strata-Paper.pdf 是全部数字的来源,建议按以下路线阅读:

  1. 架构章节(配合 docs/paper/tiers.svg 的三级分层图):理解"专家在 GPU/内存/SSD 的分布"这一核心抽象,以及 24,576 个专家中每 token 只激活 10 个的 MoE 特性如何成为可能;
  2. 投机解码章节:模型自带的 MTP 层一次草拟最多 3 个 token,48 层一遍检查——平均每次通过 2.4-3.2 个 token,这就是 1.6-1.8 倍加速的来源;重复文本(代码编辑、引用)还会启用prompt lookup追加草拟,代码场景再快 6-11%;
  3. 测量附录:每个公开数字(包括本文表格)的测试条件都在此,复现方法参考 bench/results/ 下按日期组织的各轮基准。

如何测量你自己的机器

不同 PC 差异显著,Strata 提供校准工具:START-HERE.bat --calibrate(Linux 用./setup.sh --calibrate)会在 5-10 分钟内实测三个关键参数并保留更快配置:

  • --pcie-frac:缺失专家中复制到 GPU 的比例(取决于 PCIe 带宽 vs CPU 速度);
  • --spec-min-p:草拟层的置信度门槛;
  • --pool-workers:CPU 专家计算线程数(大小核 CPU 上更少可能更快)。

官方测试机上它让 Coder 模型快了 7%。

总结:消费级硬件跑 125B 的三个启示

  • 内存分层比单卡堆料更有效:显存每多 1 GB ≈ 多缓存 700 个专家,直接减少 CPU 负担;
  • 隐藏延迟(PCIe 预取、计算重叠)是最大加速来源:prompt 速度 2.2 倍的提升几乎全部来自"让搬运藏在计算背后";
  • 量化是有价格的:4-bit KV 省一半显存但长文档精度损失 8-12%,无损方案(KV 流式)优先。

所有基准原始数据(bench/results/2026-09-29-speed-0126/README.md、bench/results/2026-09-28-prefill-speed/README.md、bench/results/2026-09-29-layer-split/README.md)与完整技术细节(docs/DETAILS.md)都随仓库公开,欢迎对照论文交叉验证。

【免费下载链接】StrataQwen3.8-Flash-Next on any consumer hardware: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.项目地址: https://gitcode.com/gh_mirrors/strata11/Strata

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询