Hermes WebUI 多模型管理与切换:3 步配好,会话内随时换
2026/9/9 15:29:00 网站建设 项目流程

Hermes WebUI 多模型管理与切换:3 步配好,会话内随时换

【免费下载链接】hermes-webuiHermes WebUI: The best way to use Hermes Agent from the web or from your phone!项目地址: https://gitcode.com/GitHub_Trending/he/hermes-webui

桌面同时挂着 OpenAI 和 Ollama 的 key,要在三个标签页、三套客户端、三份配置之间来回切,模型切换不该这么累。Hermes WebUI 是 Hermes Agent 的浏览器端,它的多模型管理把所有提供商收进同一个模型选择器,会话里随时可换。下面按真实使用顺序展开:首启配置、会话内换模型、算成本账。

🚀 30 秒配好第一个模型

首次启动 Hermes WebUI 会进入设置向导,四步:系统检查 → 选提供商 → 工作区与默认模型 → 可选密码,走完就能开聊。

向导按"需要填多少信息"把提供商分成三类:

  • 快速开始:OpenRouter、Anthropic、OpenAI,只填 API Key 和模型。
  • 开放/自托管:Ollama、LM Studio、自定义 OpenAI 兼容服务,填Base URL和模型,Key 可留空。
  • 专业:Gemini、DeepSeek、Z.AI/GLM、xAI 等,填提供商 Key 和默认模型。

模型服务器不在同一台机器时,Base URL 最容易填错:

# LM Studio / Ollama 与本机同机 http://127.0.0.1:1234/v1 # LM Studio http://127.0.0.1:11434/v1 # Ollama # Docker Desktop 里访问宿主机 LM Studio http://host.docker.internal:1234/v1

注意 Docker 里的localhost指向容器自身而不是宿主机,模型服务跑在容器外时别写 127.0.0.1。向导保存前会先探测<Base URL>/models端点,成功后模型下拉框自动填充;失败则卡在这一步,直接告诉你失败原因——DNS 解析失败、连接被拒、超时或 HTTP 错误。更多细节见 onboarding 文档。

🧭 按任务挑模型:4 个场景直接抄

结论先行:模型列表已经齐了,问题在于选哪个。Hermes WebUI 的模型选择器按提供商分组,展示所有已配置提供商的模型,照下面四个场景选就行。

写代码。选 Claude 系或 OpenAI Codex,工具调用精准、推理链清晰,适合多文件重构和定位疑难 bug。追求速度就把推理强度降到 medium。

做创作。选想象力输出强的模型,推理强度拉高到 high 或 xhigh,让它多想一会儿,这个场景质量优先于速度。

跑本地。Ollama 或 LM Studio 指到本机,数据不出机器,Key 都不用配。内部文档、个人数据这类隐私敏感任务,默认走这条路。

控成本。日常问答挂便宜模型,重要任务再切大模型;月底打开 Insights 对账,看看模型组合到底花在哪一档。

🔁 会话内换模型,上下文不断

Composer 底部的模型下拉是一个动态入口,你做了什么、系统就响应什么:

  • 点开模型下拉 → 列表不是静态文件,系统从各提供商实时拉取,新上线或下线的模型自动出现和消失,整体按提供商分组。
  • 输入关键词 → 列表实时过滤,直接跳到目标模型。
  • 对话中途切换模型 → 历史与上下文原样保留,Hermes WebUI 发一条 toast 提示本次切换,聊天头部同步显示当前模型与实时 TPS。
  • 原模型缺失或不可用 → 系统自动降级到安全默认模型,composer 会标出正在生效的哪个默认值,不用你自己猜。
  • 切到不属于当前提供商的模型 → 弹出提供商/模型不匹配警告,防止请求被静默发错地方。

切换的关键是上下文不断:会话历史、工作区、记忆都挂在会话与档案上,模型只是可替换的执行人,随时换。

🗂 一套档案,多副面孔:Profile 隔离

Hermes WebUI 支持多档案(profile),一台服务器挂多个独立"人格":每个档案有自己的提供商配置、模型列表、记忆、工作区和定时任务,顶栏下拉切换时不重启服务,模型列表、记忆、cron、工作区全部跟着刷新。

给"项目 A 用 Claude、项目 B 跑 Ollama"的场景:为两个项目各建一个档案,分别配默认模型和工作区,切换项目就是顶栏点一下。给团队分级的场景:把不同档案分给不同成员,.env 里的密钥按档案隔离,互相切不到对方的凭证。

并发场景也安全:档案级的上下文 home 覆盖机制让并行 worker 不会互相踩配置。

🩹 模型掉链子时怎么办

先别慌,这几种情况 Hermes WebUI 都有兜底:

  • 模型缺失或不可用:自动降级到安全默认模型,composer 明确标注正在生效的默认值,对话不中断。
  • 提供商/模型不匹配:toast 警告;会话元数据会显示实际服务的模型与 failover 路径,能看出请求去了哪。
  • 配额耗尽:错误卡片展示详情(例如 Codex 的配额错误卡片),到 composer 换一个提供商的模型重试即可。
  • 流式中途断网:SSE 通道按退避策略自动重连,断开后可按会话重新拉取,已有内容不丢。
  • 设置时探测失败:向导直接拦住保存,并给出具体错误——DNS 失败、连接被拒、超时、HTTP 错误或响应格式异常。

更多诊断信息见 troubleshooting 文档。

💰 看清花了多少钱、跑了多快

Insights 面板就是账单。打开后先看四个数字:会话数、消息数、token 总量、估算成本。

下面一张每日 token 趋势图按输入/输出分色,再往下是模型明细表:每个模型的会话数、token 数、估算成本和占比,谁贵谁便宜一目了然。

速度也看得见:聊天头部的 TPS 徽章随 token 流实时更新,对比哪个模型快。系统状态同样在这里,CPU、内存、磁盘占用是实时快照,本地模型跑在哪个资源上是瓶颈时看一眼就知道。

🛠 排障速查

模型列表为空

  • 先查Base URL:是否以/v1结尾、是否可达;Docker 内把localhost换成host.docker.internal或局域网 IP。
  • 测试连接/models探测会给出具体失败原因。
  • 本地服务没开 Key?API Key 留空即可,多数 Ollama / LM Studio 部署就是这样。

切换失败

  • 目标模型不在选择器里?说明该提供商的实时发现没返回它,重新核对 Base URL。
  • 弹出不匹配警告?换回该提供商分组内的模型。

响应变慢

  • 看聊天头部 TPS 徽章,确认慢在哪个模型。
  • 本地模型先确认是否同机,网络有没有绕 Docker NAT。
  • 把推理强度从 high 降到 medium,或换一个更轻的模型。

外部改了 auth 文件?不用手动清缓存:刷新页面后,模型选择器的数据会自动刷新。

🧰 进阶工具箱

四步接入自定义 OpenAI 兼容端点:在设置面板Providers区选择自定义/自托管类型;填Base URL(以/v1结尾)和可选 API Key;点测试连接,通过即探测/v1/models成功、模型列表自动填充;保存后新提供商的模型出现在所有选择器里。全程不用改config.yaml

参数:composer 里有推理强度选择器(low/medium/high/xhigh),/reasoning命令可随时改;设置面板还有最大输出 token 等参数。温度这类生成参数在 Hermes Agent 的config.yaml里配,WebUI 负责模型选择与切换这一层。

三套组合直接抄:代码审查——Claude + 低推理强度 + 专注工作区;创意头脑风暴——高想象力模型 + 高推理强度;本地隐私——Ollama 档案 + 无外部 Key。

📍 路线图一瞥

近期计划都围着模型管理本身转:统一 WebUI/CLI/Gateway 三处的提供商与模型解析、为模型管理做独立模态框、档案与运行时模型对齐;长期则是 Insights 监控套件做深,以及把 Hermes WebUI 暴露为 MCP server。完整清单见 ROADMAP.md。

✅ 三步走

  1. 跑一遍 bootstrap 启动 Hermes WebUI,走完四步向导,选定第一个主力提供商。
  2. 再加一个提供商(比如 Ollama),在会话里练一次不丢上下文的切换。
  3. 打开 Insights 对账,看哪个模型慢、哪个模型贵,回头调默认模型和档案组合。

第一步行完,换模型就只是点一下下拉框的事。

【免费下载链接】hermes-webuiHermes WebUI: The best way to use Hermes Agent from the web or from your phone!项目地址: https://gitcode.com/GitHub_Trending/he/hermes-webui

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询