Strata 的设计旨在让用户在消费级笔记本电脑和台式机 GPU 上运行参数高达 125B 的Qwen3.8-Flash-Next 模型;
Strata 的核心思想是把一个 125B 参数的 MoE 模型分层放到整块 PC 上运行:GPU 存注意力/常用专家,RAM 存放全部 24,576 个专家并由 CPU 并行计算未命中部分,SSD 存 n-gram 表;再用 MTP handle测 + prompt lookup 的投机解码加速,由 serve/server.py 通过 stdin/stdout 协议驱动 strata 引擎进程对外提供 API。
⭐ 1. 核心观点(Strata 的性能表现)
- Strata 在 Qwen 3.8 Flash Next 上的表现极其强劲,作者在本地测试后表示“惊艳”
- 作者此前自己尝试实现类似的 MoE 推理引擎,但效果远不如 Strata
- 硬件配置:2×RTX 3090 + 64GB DDR5,在短上下文下可达100 t/s decode,比 vLLM 的 60–70 t/s 快且更安静
- Strata 支持实验性上下文扩展,作者测试了 200K、400K、900K、512K 等多种上下文,均能稳定运行
- 作者计划继续做长时间基准测试与 needle retrieval 测试
⭐ 2. 社区整体反馈(大量用户实测)
🚀 性能普遍显著提升
- 多名用户反馈:Strata 的 prompt processing 和 decode 速度远超预期,尤其在高上下文下仍保持高 TPS(如 900K 上下文)
- 双 3090 用户普遍报告性能“天差地别”,上下文处理能力显著增强
- 单卡用户也能获得显著提升,如单 3090 在 128K context 下可达41 t/s decode / 650 t/s prefill。
🔧 多 GPU 扩展性
- 多 GPU 扩展目前表现不错,PP(prefill)速度几乎线性翻倍:1 GPU 1000 t/s → 2 GPU 2000 t/s
- 但也有用户指出非对称 GPU 配置会互相拖慢性能
🧠 模型质量反馈
- 多名用户认为 Flash Next 的质量接近甚至略优于 27B dense 模型,但速度快得多
- 有用户在法律文档任务中发现 Strata 给出的结构化方案比 Opus 5.5 更有效
⭐ 3. 安装、配置与兼容性讨论
🖥️ 系统与硬件兼容性
- Strata 当前主要支持NVIDIA / AMD GPU,Intel Arc(如 B70)支持正在开发中
- 多名用户在DDR3 / DDR4 / DDR5平台上均获得良好表现,甚至有人认为 DDR3 Xeon + 好 GPU 也能跑出惊人结果
- 高内存带宽平台(如 WRX80)被认为非常适合 Strata,因为专家层驻留在系统 RAM 中
⚙️ 安装问题与解决方案
- 有用户在 Linux 下遇到安装脚本与 venv 冲突,需要手动调整
- 多名用户通过 DeepSeek/OpenCode 自动调参成功解决加载失败问题
⭐ 4. 上下文扩展(Context Extension)讨论
- Strata 的实验性上下文扩展是本帖最受关注的功能之一。
- 多用户实测:
- 163K、180K、200K、256K、261K、400K、512K、900K等上下文均可稳定运行。
- 高上下文下仍保持高 prefill TPS(如 2000–3000 t/s)
- 但也有人指出:上下文越大,decode TPS 会下降,这是正常现象
⭐ 5. 与其他引擎的对比
vLLM
- vLLM 在同配置下通常只有 60–70 t/s decode,且 GPU 风扇噪音大
- Strata 在多卡下更快、更安静,推理负载分布更均匀(CPU、存储也参与)
llama.cpp
- llama.cpp 可运行 Flash Next,但速度明显慢于 Strata(如 14→11 t/s)
ninfer
- ninfer 在单 3090 上 decode 可达 60 t/s,但上下文能力不如 Strata(128K vs 256K+)。
⭐ 6. 社区共识(总结)
- Strata 是目前消费级硬件上运行 Qwen 3.8 Flash Next 的最强方案之一。
- 高上下文能力(200K–900K)+ 高 TPS(prefill 可达 2000–3000 t/s)是其最大优势。
- 多 GPU 扩展性良好,但仍有优化空间。
- 模型质量接近 27B dense,但速度远快于 dense。
- 项目非常年轻,更新极快,未来潜力巨大。
GitHub - Niko1221/Strata: Qwen3.8-Flash-Next on any consumer hardware: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input. · GitHub