8G 5070笔记本 也能跑 35B MoE模型!FreeToken+CCSwitch+Codex构建完全本地化的 AI 编程工作流
2026/9/2 7:53:57 网站建设 项目流程

前言


前两天读到论文FreeToken: Efficient Edge‑Native MoE Serving with Bandwidth‑Adaptive Execution,这是 UC Berkeley 与 MIT 联合开源的端侧 MoE 推理系统。

和传统方案必须把全部专家预加载进显存不同,FreeToken 将完整专家权重放在系统内存,只在显存开辟一块 LRU 高速缓存,仅保留近期高频访问的专家。结合带宽自适应调度机制,它会根据任务类型动态激活对应的专家:编码场景优先调度编码相关专家,文本生成则切换到通用文本专家,不需要把全部专家常驻显存,显著降低显存压力。

传统 MoE 推理要求预加载全部专家,显存开销极高,消费级硬件很难驾驭大参数量 MoE 模型。FreeToken 还会实时感知 PCIe 带宽、内存吞吐与设备算力,对未命中缓存的专家做 GPU‑CPU 混合计算,无需修改模型权重即可完成推理。

在我的笔记本(RTX5070 8G 显存 + 32G 内存)上实测,可以顺利跑通 Qwen3.6‑35B‑A3B,生成速度可达15 token/s,在笔记本已经具备实用的本地推理能力。

然后我尝试将 API 接入 CC Switch,搭配 Codex 调用本地模型,并在codex上成功执行相关自动化任务。

教程:

一. 安装freetoken

freetoken github 地址:GitHub - FlashML-org/FreeToken · GitHub

freetoken 官网地址: FreeToken — Bring Frontier to Edge | FlashML

下载安装后,电脑会报病毒,关掉微软安全中心的病毒检测就好了

安装完成后进入以下界面:

freetoken在使用之前需要安装引擎,一键安装即可注意,大概7个G左右,默认目录是安装在c盘,

C:\Users\用户名\AppData\Local\FreeToken

在该文件夹中创建python虚拟环境,安装torch,cuda等相关库用于推理

安装引擎的时候可以同步下载可用模型,freetoken会根据你的电脑硬件选择合适的模型供你下载,目前我的是只支持Qwen3.6-35B-A3B-NVFP4等这些小模型,点击下载。

默认安装在C盘,如果C盘空间不大,可以在设置中更改模型目录

等待python环境和模型权重下载好了之后,就可以尝试启动模型,在控制台可以调试相关参数,并尝试对话。

完成freetoken的部署

二. codex安装

codex下载地址:https://chatgpt.com/zh-Hans-CN/codex/

点击下载windows版,双击exe文件,完成安装,安装完成之后,桌面没有显示,去开始菜单中找到该应用,如果有chatgpt的账号,可以使用科学上网登录chatgpt账号来使用codex进行自动化任务。chatgpt有免费使用额度。

如果使用别的AI 模型,那么就要用到API 服务商,可以使用CC Switch实现服务商的切换。

三. 安装CC Switch

CC Switch官网:https://ccswitch.io/zh/

安装完成之后打开界面是这样

选中codex,点击 “+”号,创建路由

我们这里使用自定义配置,

供应商名称:随便写
api-key:随便写

api请求地址:打开freecode,复制第一个链接

注意,我这里的端口号改过了,如果端口占用可以在设置中更改端口号

默认模型可以点击右侧的下载

选中freecode使用的模型

其他的地方按照cc switch默认配置

在最后的配置中,应用通用配置勾选掉

点击设置

打开路由开关

完成配置,然后打开codex,可以看到左下角

完成相关配置,并能够成功运行

在本地能够成功运行,我得硬件配置慢。4分钟生成了一篇出师表。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询