☰
Strata 完全指南:让125B MoE大模型在12GB游戏显卡上以60-95 tok/s本地运行
2026/10/2 6:57:32 网站建设 项目流程

Strata 完全指南:让125B MoE大模型在12GB游戏显卡上以60-95 tok/s本地运行

【免费下载链接】StrataQwen3.8-Flash-Next on any consumer hardware: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.项目地址: https://gitcode.com/gh_mirrors/strata11/Strata

Strata 是一款免费开源的大模型本地推理引擎,让 1250 亿参数的 MoE 模型Qwen3.8-Flash-Next在普通游戏电脑上跑起来:一张 12GB 显存的 NVIDIA 显卡 + 64GB 内存,Windows/Linux 一键安装,写答案的速度达60-95 tok/s——比你阅读还快。它自带网页聊天界面,并对外提供 OpenAI / Anthropic 兼容的本地 API。

本文将带你快速搞懂:Strata 为什么快、如何选模型、三步装好、以及怎么接入自己的应用。

12GB 显卡真的跑得动 125B 大模型吗?

跑得动。官方在 RTX 5070(12GB)+ Ryzen 5 7600 + 64GB 内存上实测:

模型规格写答案(短对话)写答案(128K 上下文)读取长提示
Q2_093 tok/s74 tok/s2,170 tok/s
IQ2_XS79 tok/s63 tok/s2,090 tok/s
IQ3_XXS62 tok/s49 tok/s1,750 tok/s
IQ3_S53 tok/s46 tok/s1,620 tok/s
Coder(IQ1_M)55 tok/s43 tok/s2,180 tok/s
  • 写答案:回复流式出现的速度;读取长提示:处理长文档、代码库的速度(32K token 提示实测)。
  • 显存越大越快:RTX 3090(24GB)预估可达100-140 tok/s(完整数据见 docs/DETAILS.md)。

这个 125B MoE 大模型的能力也绝非玩具——下面是它一次性写出的体素宝塔花园网页,浏览器直接可玩:

Strata 大模型引擎的工作原理

125B MoE 模型通常需要数百 GB 显存的服务器。Strata 的秘诀是把模型24,576 个"专家(expert)"分摊到整台电脑——而每个词只需要其中 10 个:

  • 🎮显卡(GPU):承担每个词都要做的计算,并缓存最常用的一两千个专家,边用边学习哪些最常用;
  • 🧠内存(RAM):装下全部专家。某个词需要显卡上没有的专家时,CPU 与 GPU并行处理,互不等待;
  • 💾SSD:存一张大查找表,每个词只读取其中几行。

再叠加"猜测-校验"(投机解码):模型内置的小助手先猜接下来几个词,大模型一次性批量校验,保留猜对的——一步产出多个词,不损失质量的情况下提速 1.6-1.8 倍。长文档以 8,192 token 为一块整块读取,这就是 1,000+ tok/s 的来源。

完整技术细节见 docs/DETAILS.md,带全部测量数据的论文见 docs/paper/Strata-Paper.pdf。

如何选择模型?先看内存,再看显卡

同一模型有不同的"压缩档位":

模型规格内存+显存需求速度质量
Q2_037.6 GB最快好
IQ2_XS39.2 GB快更好(⭐ 推荐)
IQ3_XXS47.0 GB较慢很好
IQ3_S54.8 GB最慢最佳(与原始模型公开测试持平)

选型口诀:看内存,不只看显卡——64GB 内存四个规格全装得下;48GB 选 Q2_0 / IQ2_XS;只有 32GB 内存就选Coder。显卡越大越快,但不会降低内存需求。

另外两个值得考虑的选项:

  • Coder(ISTA-DASLab 精简版):删掉一半专家、保留写代码最需要的,29.6GB 首片,32GB 内存即可运行,达到原模型 91% 的 SWE-bench Verified 得分,长提示读取速度全场最快;
  • Swift 1.5:少思考 63% 思考 token、回答快 1.8 倍的微调版,质量基本不变。

拿不准?选IQ2_XS;主要写代码选Coder。

一键安装步骤:从零到跑起来只要 3 步

硬件需求一览(唯一要自己动手装的是 NVIDIA 显卡驱动,580 及以上版本):

部件要求
显卡NVIDIA RTX 20/30/40/50 系列,12GB 显存起(8GB 可跑但慢)
内存推荐 64GB(32GB 可跑 Coder)
磁盘约 80GB 空闲,强烈建议 SSD(首次启动快得多)
系统Windows 10/11 或 Linux

Windows 安装:

  1. 下载项目解压(或克隆仓库):

    git clone https://gitcode.com/gh_mirrors/strata11/Strata
  2. 双击 START-HERE.bat;

  3. 回答 4 个问题(全部直接按回车即选推荐项):模型版本与压缩档位、上下文长度、是否启用图片理解、实验性速度选项。

之后自动下载(模型约 70GB,支持断点续传)并自动启动,浏览器会打开http://127.0.0.1:8080。

⚠️首次启动时电脑可能卡 1-3 分钟(正在把 35-55GB 加载进内存并锁定),完全正常,别关窗口。之后每次启动只需 30-90 秒,关掉窗口即停止模型。

Linux 安装:同样一键,运行 setup.sh:

./setup.sh

4 种日常使用方式

  1. 浏览器(最推荐):http://127.0.0.1:8080,三个标签页——Chat(流式回答、可折叠的思考过程、图片理解)、Monitor(模型状态 + GPU/CPU/内存/磁盘实时监控,如上图)、About(设置与 API 地址);
  2. 终端聊天:.venv\Scripts\python chat.py,支持/image <路径>发图、/think low|high调思考深度,代码见 chat.py;
  3. API 接入你自己的应用:添加为 "OpenAI 兼容" provider,base URL 填http://127.0.0.1:8080/v1,API key 与模型名任意;用 Anthropic API 的应用填http://127.0.0.1:8080/v1/messages。服务端代码在 serve/server.py;
  4. 手机/局域网访问:START-HERE.bat --setup --host 0.0.0.0 --api-key <secret>,即可在别的设备上使用。

几个好用的细节:

  • 思考深度:off / low / medium / high 四档,off 最快,high 适合难题,在聊天页菜单或/think设置;
  • 请求处理:一次回答一个请求;会话首条消息会完整读取(约每分钟 30,000 token),之后的追问秒级启动。

进阶玩法:多显卡与性能调优

  • 🚀双/三张 NVIDIA 显卡:START-HERE.bat会自动列出你的显卡并询问是否按层分摊(流水线并行)。实测 RTX 5080 + RTX 3090 组合读取长提示快 18-20%,详见 docs/MULTI_GPU.md;
  • 🎯为你的电脑调参:START-HERE.bat --calibrate,花 5-10 分钟测量并保留最快的引擎配置(官方测试让 Coder 提速 7%);
  • 🖥️AMD 显卡(实验性):Linux 下./setup.sh --backend hip,支持 RX 7900 XT/XTX,见 docs/AMD_HIP.md。

常见问题速查

现象怎么办
首次启动电脑卡死正常现象,等 1-3 分钟,别关窗口
下载/安装中断再运行START-HERE.bat,自动续传
很慢且磁盘灯狂闪空闲内存不足:关闭其他程序,或换 Q2_0 / IQ2_XS
提示端口 8080 被占用Strata 已在运行,找到它的窗口即可
"提示超出上下文长度"开新对话,或用SETUP.bat调大上下文
"引擎意外停止"多为内存不足,重发消息即可,引擎会自动重启

完整排障表见 docs/DETAILS.md。

延伸阅读

  • 📊 全部实测与预估速度数据:bench/results/
  • 📄 技术细节全解(API、图片、低内存模式):docs/DETAILS.md
  • 📚 论文(含全部测量数据):docs/paper/Strata-Paper.pdf
  • 📌 官方入口:README.md

【免费下载链接】StrataQwen3.8-Flash-Next on any consumer hardware: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input.项目地址: https://gitcode.com/gh_mirrors/strata11/Strata

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询