☰
dsh-our-free-model 思考强度原理全解:为什么用输出预算而不是 reasoning_effort
2026/10/8 19:44:27 网站建设 项目流程

dsh-our-free-model 思考强度原理全解:为什么用输出预算而不是 reasoning_effort

【免费下载链接】dsh-our-free-model在 dsh 里装上这个插件即可,无需登录、注册或填 API Key,就能使用包括 DeepSeek V4.1 Flash、Kimi K3 在内的前沿模型——完全免费,不限量。 All you do is install this plugin in dsh: no login, no sign-up, no API key — the frontier models are just there, DeepSeek V4.1 Flash and Kimi K3 among them. Completely free, with no usage cap.项目地址: https://gitcode.com/gh_mirrors/ds/dsh-our-free-model

在 dsh 里装上 dsh-our-free-model 插件后,无需登录、注册或填 API Key,就能免费、不限量地使用 DeepSeek V4.1 Flash、Kimi K3 等前沿模型。除了免费,它还有一个容易被忽略的细节:思考强度(Effort)是真的能生效的——而且实现方式与大多数客户端不同,用的不是常见的reasoning_effort参数,而是一套「输出 token 预算」机制。本文带你弄清楚这套思考强度预算的原理和来龙去脉。

什么是思考强度:三档真实的输出预算

在输入框的 Effort 菜单中,思考强度分三档,每一档都对应一个硬性输出 token 上限:

档位中文输出预算含义
Light精简2 048简短的思考,出答案最快
Balanced均衡8 192足够走完一次正常的推理
Deep深思模型上限模型的全部输出能力

这三档的定义就在 src/effort.js 中,默认档位是balanced。

有一个特殊规则:对于思考无法关闭的模型(如 MiMo V2.6),三档预算会整体翻倍为 4 096 / 16 384 / 模型上限。为什么翻倍?往下看,答案藏在一个实测数据里。

疑点:reasoning_effort 为什么不能用?

按惯例,控制思考深度最自然的做法是把reasoning_effort: "low" | "medium" | "high"之类的字符串发给上游。项目团队先做了实测(探针脚本见 scripts/probes/reasoning-effort-probe.mjs 和 scripts/probes/effort-repeat-sampling.mjs),结论出人意料:

  • 免费车道的网关接受reasoning_effort、thinking.budget_tokens、enable_thinking、thinking_budget这些字段,然后全部忽略;
  • 对三个不同名义档位反复采样,思考 token 数量在统计上无法区分——甚至出现过low档比xhigh档产出更多思考 token 的情况;
  • 未识别的字段偶尔还会直接引发上游 503 错误。

换句话说:传reasoning_effort就像对不听话的调度器喊口号——口号照单全收,行为纹丝不动。

💡 插件的一条设计准则:提供一个无效控件,比不提供控件更糟。一个假装在调思考深度、实际毫无作用的 Effort 菜单,只会误导用户。

真正起作用的唯一阀门:max_tokens 输出预算

实测发现,该车道上真正被执行的只有max_tokens(输出上限),而思考量与它直接挂钩:把上限压到 64 token,思考输出就从约 397 token 降到约 63 token;放宽上限,思考随之变多(多组方言对照实验见 scripts/probes/budget-dialects.mjs)。

于是插件的思考强度设计变得非常直白:

  1. 用户选的档位 → 换算成一个真实的输出 token 上限;
  2. 以max_tokens的形式硬性下发给上游;
  3. 留痕的思考 token 随档位单调上升——每一档都是可测量、可验证的差异。

预算解析的核心逻辑在 src/effort.js 的budgetFor():档位上限、模型容量、会话设置取三者中的最小值,且任何情况下不低于 512 token(MIN_BUDGET),保证回答本身一定放得下。整条链路还有专门的回归测试 scripts/effort-test.mjs 守护。

为什么「思考不可关闭」的模型要翻倍?

一个容易踩的坑:思考 token 和可见回答共享同一个输出上限。

以思考无法关闭的mimo-v2.6-flash-free为例,实测一天 92 次调用中,82% 的输出 token 都是思考。当「均衡」档的上限是 8192 时,思考往往先吃掉大头,留给正文的只有约 1500 token——长回答大约每三次就有一次被截断(length结尾)。

解法很直接:这类模型每一档预算翻倍(系数见 ALWAYS_THINKING_FACTOR),让「精简」档留给正文的空间,约等于一个能彻底不思考的模型在「精简」档下的空间。设置页的每张模型卡上也标注了每档实际下发的数值,所见即所得。

两条车道,两种语义

需要区分的是:免费车道(匿名网关)走的是上面这套 token 阶梯;而 EAC 与 Kilo 渠道的模型自己声明了档位菜单(Off / Low / Medium / High),网关会把模型自己的 effort 字段真正透传上游——此时插件只做映射,不再另设预算阶梯(实现见 src/effort.js 的声明菜单分支)。所以你在不同渠道看到的档位菜单不一样,是正常的:菜单形状跟着模型声明走。

一句话总结

  • reasoning_effort在免费车道上是无效操作——上游收而不理,档位之间无差异;
  • 输出 token 预算(max_tokens)才是被真正执行的阀门,思考量随之单调变化;
  • 三档 Light / Balanced / Deep 就是三个真实预算,思考不可关闭的模型整体翻倍;
  • 若回答被截断,切到 Deep 或调高「单次输出上限」即可。

更多细节可在仓库 README 的「为什么用预算,而不是 reasoning_effort」一节(README.md)与 docs/issue-30-heatmap.md 等文档中查看。

【免费下载链接】dsh-our-free-model在 dsh 里装上这个插件即可,无需登录、注册或填 API Key,就能使用包括 DeepSeek V4.1 Flash、Kimi K3 在内的前沿模型——完全免费,不限量。 All you do is install this plugin in dsh: no login, no sign-up, no API key — the frontier models are just there, DeepSeek V4.1 Flash and Kimi K3 among them. Completely free, with no usage cap.项目地址: https://gitcode.com/gh_mirrors/ds/dsh-our-free-model

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询