Strata 性能基准与论文导读:125B MoE在消费级硬件上的极限测量与瓶颈分析
【免费下载链接】StrataQwen3.8-Flash-Next on any consumer hardware: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.项目地址: https://gitcode.com/gh_mirrors/strata11/Strata
Strata 是一款让 125B 参数的 Qwen3.8-Flash-Next(MoE 架构)模型跑在单张 12-24 GB 消费级显卡上的开源推理引擎。本文带你读懂它的性能基准数据:在 RTX 5070 上,它以 60-95 tokens/s 的速度"写出"回答,比人眼阅读还快;同时深入论文与基准实验,剖析专家缓存、KV 流式传输、投机解码等关键机制背后的瓶颈与取舍。
一次提示词,Strata 在 RTX 5070 上运行(IQ3_S 量化,128K 上下文)生成的体素宝塔花园
为什么 125B 模型能塞进一台游戏 PC
传统上,125B 模型需要数百 GB 显存的服务器。Strata 的核心思路是把整台电脑当成"一台机器"来分配工作:
- GPU(显存):注意力计算 + 最常用的"专家"缓存;
- 内存(RAM):存放全部 24,576 个专家,CPU 与 GPU并行计算缺失的专家;
- SSD:存放 28.8 GB 的 n-gram 查找表,每个 token 只读几行。
这个"GPU / 内存 / SSD"三级分层架构是论文(docs/paper/Strata-Paper.pdf)的主线,完整细节见 docs/DETAILS.md 的How it works一节。
Strata 应用的 Monitor 页签:实时显示 GPU 负载、VRAM、专家缓存命中情况(左),右侧是模型正在编写代码的编码智能体
实测速度:一张表看懂 RTX 5070 的表现
以下数据来自引擎 0.1.26,测试机为 RTX 5070(12 GB)+ Ryzen 5 7600 + 64 GB DDR5,完整原始数据在 bench/results/2026-09-29-speed-0126/matrix.json。
读取提示词速度(Prompt,tokens/s)
| 模型 | 4K | 32K | 64K | 128K |
|---|---|---|---|---|
| Q2_0 | 1,299 | 2,171 | 2,126 | 2,107 |
| IQ2_XS(推荐) | 1,256 | 2,092 | 1,754 | 1,752 |
| IQ3_S(质量最高) | 913 | 1,624 | 1,640 | 1,443 |
| Coder(代码特化) | 1,583 | 2,177 | 2,236 | 2,208 |
生成回答速度(Output,tokens/s)
| 模型 | 4K | 32K | 64K | 128K |
|---|---|---|---|---|
| Q2_0 | 93.0 | 81.8 | 76.2 | 73.7 |
| IQ2_XS | 78.6 | 76.3 | 63.7 | 62.7 |
| IQ3_S | 53.3 | 48.3 | 46.3 | 45.5 |
| Coder | 55.1 | 54.9 | 53.2 | 43.0 |
两个关键观察:
- 上下文越长,输出越慢(93 → 45 tokens/s):注意力需要读取越来越大的 KV 缓存,同时 VRAM 被 KV 挤占,能缓存的专家变少;
- VRAM 比显卡本身更重要:显存里每多放 1 GB 约可多缓存 700 个专家,每个"GPU 上命中的专家"都是 CPU 不用做的计算。RTX 3090(24 GB)预计可达 100-140 tokens/s,完整估算表见 docs/DETAILS.md 的Other GPUs。
瓶颈分析:三次关键优化的测量证据
1️⃣ Prompt 读取:从 572 到 1,290 tokens/s(2.2 倍)
bench/results/2026-09-28-prefill-speed/README.md 记录了引擎 0.1.13 的逐步优化,每一步都量化了收益:
| 优化手段 | 32K Prompt 结果(Q2_0) |
|---|---|
扩大分块(2,048 → 8,192,--prefill auto) | 791 → 973 |
| PLE 块按整块计算而非逐 token | 981 → 1,053 |
| 使用量化 MMQ 内核(int8 张量核心,免反量化) | 1,052 → 1,130 |
| 下一层专家通过 PCIe 流式预取(与当前层注意力重叠) | 1,130 →1,290 |
瓶颈定位非常清晰:PCIe 带宽与计算的重叠程度决定 prompt 速度——让"专家搬运"藏在"注意力计算"背后,是消费级硬件上最划算的隐藏成本手段。
2️⃣ KV 缓存:流式传输 vs 4-bit 压缩的取舍
长上下文下 KV 缓存是显存杀手。Strata 给出两条路线:
- KV 流式(默认,64K 以上):KV 缓存放内存,只把注意力要读的部分留在 VRAM。Q2_0 在 262K 上下文下从 50.9 → 62.6 tokens/s(VRAM 内专家从 1,589 → 3,872 个)。代价是每 token 约 13.7 KB 内存(128K 时约 1.7 GB)。
- Q4_0 KV(可选):4-bit 量化让 KV 内存减半,128K 下快约 4%,但长文档困惑度恶化 8-12%——bench/results/2026-09-27-kv-q4/README.md 的 teacher-forced 对比显示 4-bit 的 KL 散度是 int8 的 2.6-4.2 倍。因此 8-bit 仍是默认值。
这体现了一个典型的工程权衡:省显存的量化会损失精度,而"把数据搬到内存"几乎无损——所以论文优先选择前者。
3️⃣ 双卡分层:+18-20% 的 Prompt 加速,但第三张卡是负收益
bench/results/2026-09-29-layer-split/README.md 在 RTX 5080 + 3090 上扫描了分层切分点 K(每卡各持 24 层中的一段):
| 配置 | Prompt 28K | Decode(代码) |
|---|---|---|
| 5080 单独 | 1,974 | 105.2 |
| 5080 + 3090,K=26 | 2,357(+19%) | 109.7 |
| 5080 + 3090 + 2080 Ti | 1,847 | 89.6 |
两个反直觉的结论:① 专家缓存命中率很快饱和(98-100%),决定速度的是"每层 GPU 时间",所以把层挪去更快的卡才有效;② 加入第三张慢卡(2080 Ti)反而拖慢整体——它单层 3.1 ms/窗口的开销超过了它多缓存的专家收益。--layer-split auto会用逐层时间 × 卡数预测所有切分方案,自动选择最快的一种。
论文导读:如何阅读 Strata-Paper.pdf
docs/paper/Strata-Paper.pdf 是全部数字的来源,建议按以下路线阅读:
- 架构章节(配合 docs/paper/tiers.svg 的三级分层图):理解"专家在 GPU/内存/SSD 的分布"这一核心抽象,以及 24,576 个专家中每 token 只激活 10 个的 MoE 特性如何成为可能;
- 投机解码章节:模型自带的 MTP 层一次草拟最多 3 个 token,48 层一遍检查——平均每次通过 2.4-3.2 个 token,这就是 1.6-1.8 倍加速的来源;重复文本(代码编辑、引用)还会启用prompt lookup追加草拟,代码场景再快 6-11%;
- 测量附录:每个公开数字(包括本文表格)的测试条件都在此,复现方法参考 bench/results/ 下按日期组织的各轮基准。
如何测量你自己的机器
不同 PC 差异显著,Strata 提供校准工具:START-HERE.bat --calibrate(Linux 用./setup.sh --calibrate)会在 5-10 分钟内实测三个关键参数并保留更快配置:
--pcie-frac:缺失专家中复制到 GPU 的比例(取决于 PCIe 带宽 vs CPU 速度);--spec-min-p:草拟层的置信度门槛;--pool-workers:CPU 专家计算线程数(大小核 CPU 上更少可能更快)。
官方测试机上它让 Coder 模型快了 7%。
总结:消费级硬件跑 125B 的三个启示
- 内存分层比单卡堆料更有效:显存每多 1 GB ≈ 多缓存 700 个专家,直接减少 CPU 负担;
- 隐藏延迟(PCIe 预取、计算重叠)是最大加速来源:prompt 速度 2.2 倍的提升几乎全部来自"让搬运藏在计算背后";
- 量化是有价格的:4-bit KV 省一半显存但长文档精度损失 8-12%,无损方案(KV 流式)优先。
所有基准原始数据(bench/results/2026-09-29-speed-0126/README.md、bench/results/2026-09-28-prefill-speed/README.md、bench/results/2026-09-29-layer-split/README.md)与完整技术细节(docs/DETAILS.md)都随仓库公开,欢迎对照论文交叉验证。
【免费下载链接】StrataQwen3.8-Flash-Next on any consumer hardware: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.项目地址: https://gitcode.com/gh_mirrors/strata11/Strata
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考