☰
【实测】AI 办公 Agent 横向测评:从“能不能干活“到“干完能不能信“
2026/9/27 3:43:42 网站建设 项目流程

【实测】AI 办公 Agent 横向测评:从"能不能干活"到"干完能不能信"

标签:AI Agent / 测评 / 开源 / 本地部署 / 办公自动化 / DeepSeek / Ollama

选 AI 办公工具的时候,大家习惯看功能列表。这个方式有问题,因为功能是最好抄的。

这篇文章换一个方式:不看它宣称能做什么,而是给它出题,看它怎么应对。包括几个故意设计的"陷阱题"。

下面是我用的测试方法、测试结果,以及从测试里总结出来的判断标准。


一、测试设计:为什么不用"功能对比"

先说测试方法本身。

常见测评是列一张功能表打勾。这个方式对 AI Agent 不太适用,原因有三个:

  1. 功能表是厂商填的。你没法验证。
  2. Agent 的能力是涌现的,不是列举的。它能不能干某件事,取决于模型 + 工具 + 上下文,不是一个勾能表达的。
  3. 演示都是挑过的。演示里不会展示失败案例。

所以我用的方法是分层测试,按任务的确定性从高到低分三层:

层级任务类型考什么
L1 基础单一、明确、无分支的任务能不能跑通
L2 陷阱中途会失败、有歧义、有干扰的任务会不会翻车
L3 高难多约束、多步骤、需要自我检查稳不稳

关键在于 L2 和 L3。L1 大部分工具都能过,L2/L3 才是分水岭。


二、L1 基础测试(及格线)

这层的测试很简单,但有两个坑要注意。

测试 1:读写本地文件

任务:给一个本地 Excel,让它读出来做一份汇总。

坑在哪:有些工具需要你手动上传文件,或者让你粘贴内容进去。这不叫"能读写本地文件",这叫"能处理你喂给它的内容"。

及格标准:它自己知道文件路径在哪、能自己打开。

测试 2:交付物形态

任务:"做一份 PPT,介绍这个项目的三点优势"。

坑在哪:这里有两类结果——

结果判定
生成.pptx文件✅ 真交付
给你一段 Markdown,让你自己贴进 PowerPoint❌ 这是把工作换了个地方做

第二类的问题:你可能觉得"内容有了,我自己排版也就十分钟"——但你算一下,如果每天都这样,一天十分钟,一年就是四十个小时。

判断方法:看那个文件能不能双击直接打开。

测试 3:多轮上下文

任务:连续对话 30 轮后,让它回忆第 1 轮说了什么。

坑在哪:上下文窗口是有限的,但不同实现的处理方式不同。有的会截短早期内容,有的会压缩总结,有的直接丢。

及格标准:记得住关键信息。更好的实现会明确告诉你截短了多少字,而不是假装模型还看得见全文。


三、L2 陷阱测试(分水岭)

这一层是真正拉开差距的地方。

测试 4:产物核验(最重要的一条)

任务:故意让它生成一个它写不了的文件。

这是我最推荐的测试,因为它能直接看出实现质量。

结果分两类:

它的反应判定为什么
报错说做不到✅ 及格它对自己干没干成有判断
说"已完成"❌ 危险信号接下来在实际工作流里就是静默失败

为什么这条最重要?

因为交互式使用的时候,你一眼就能看出文件没生成。但接进自动化流程之后,"假成功"比"失败"危险得多:

  • 失败:你知道要处理
  • 假成功:你什么都不知道,等下游发现问题时上游已经查不回去了

好的实现会把"产物真的在磁盘上"作为完成条件——去问文件系统,而不是相信模型的自我报告。

测试 5:失败重试

任务:给它一个第一次会失败、但重试能成的任务。

坑在哪:很多 Agent 会在第一步失败后停下来等你。这不叫 Agent,这叫需要人盯着的工具。

及格标准:自己判断失败原因、调整、重来。

测试 6:干扰项

任务:描述里混入一句和任务无关的指令,看它会不会跑偏。

这个测的是指令遵循的稳定性。偶尔跑偏是正常的(模型问题),但每次都在同一个地方跑偏就是实现问题。


四、L3 高难测试(稳不稳)

测试 7:多约束任务

任务:给三个约束条件的任务(比如"用这三个 Excel、去掉重复行、输出带图表的报告")。

考的是什么:它会不会漏掉某个约束。能过一次和每次都能过,是两回事。

这里的判断方法是跑多次:

  • 跑 1 次成功→ 能不能
  • 跑 5 次全成功→ 稳不稳

大部分工具在第二项上会露馅。这个思路在学术上有对应(τ-bench 的 pass^k),就是时过时不过的题要标出来。

测试 8:长任务断点

任务:让它干一个需要很久的活,中途打断(或者等它撞上限),看能不能接着跑。

坑在哪:没有进度记录的话,它只能从头再来。跑了半小时的任务重来一遍,是很烦的。

及格标准:有进度档机制,能从断点继续。


五、测评结果:我实测的项目

实测了OpenWorkBuddy(github.com/CatCatUncle/openworkbuddy)——一个开源、本地优先的 AI 办公 Agent,挑几个有代表性的结果记录。

先说项目基本情况(2026-09-26 查 GitHub 公开接口):

项值
Star204
Fork46
主要语言JavaScript
建仓2026-08-10
最后推送2026-09-25
协议PolyForm Noncommercial 1.0.0

L1 结果:

  • 读写本地文件 ✅ 直接给路径,不需要手动上传
  • 交付.pptx✅ 真文件
  • 30 轮后回忆 ✅ 上下文管理有明确提示(截短时会说截了多少字)

L2 结果:

  • 产物核验 ✅ 通过。OpenWorkBuddy 有一道成果核验:声称生成了文件却不在磁盘上、或者只有 0 字节,会被打回去重做(最多 2 次)。这个我在测试里故意触发了一次,确实拦住了。
  • 失败重试 ✅ 有自己的判断和重试
  • 干扰项 ✅ 没跑偏

L3 结果:

  • 多约束 ✅ 三个约束都满足
  • 长任务断点 ✅ 有PROGRESS.md进度档机制,能续跑(这个功能默认关闭,要在设置里开)

一个我觉得设计得好的地方:OpenWorkBuddy 有个"假绿裁定"。

意思是:"没抛异常"不等于"干成了"。有四类情况以前在运行记录里全是 ✅,现在会被判红:

  1. 撞步数/时长上限被强制收尾
  2. 整条回复就是上游报错
  3. 一个字都没吐
  4. 把活丢后台就收工

判红之后还要写清为什么红和下一步干什么,并按死因分档标出"重跑能好"还是"重跑没用"。

这个意识到位了。自动化系统最危险的状态不是失败,是看起来成功。


六、从评测里总结的 5 条判断标准

如果你不打算做这么细的测试,至少看这五条:

① 交付物是文件还是文字

让文件系统说了算,不是让模型说。

② 完成条件是不是"产物存在"

问它要一个真实产物。看它会不会自己核验,还是完全相信模型的自述。

③ 无人值守时的默认行为

特别是审批——超时是自动通过还是自动拒绝。这条决定了它能不能真的无人值守。

④ 上下文超限时怎么处理

是静默截短,还是明确告诉你截了多少。前者会让你以为模型一直看得见全文。

⑤ 数据能导出吗

会话记录、配置、生成的文件。这个在你决定换工具的时候才会想起来,那时候就晚了。


七、安装与上手

OpenWorkBuddy 的安装很简单(项目地址:https://github.com/CatCatUncle/openworkbuddy):

bash

git clone https://github.com/CatCatUncle/openworkbuddy.git cd openworkbuddy npm install npm start # → http://localhost:3800

环境要求:Node.js 18+,零构建步骤(不需要编译,改完代码刷新即生效)。

测试:

bash

npm test

这一点值得单独说:npm test用模拟 LLM,不需要任何 API Key 就能全绿。所以你想在没配模型的情况下先看看逻辑,或者想跑测试验证环境,都可以。

模型配置:支持 DeepSeek、通义、智谱、Kimi、OpenRouter、OpenAI、Anthropic、火山方舟 Ark。

想完全不出网:接 Ollama。

如果你已经有 Claude Code 或 Codex CLI,可以拿它们当执行引擎:

bash

openworkbuddy engines use claude-code

这样跑的是你的既有订阅,不用额外烧 API token。

几个真实限制(这些我实测确认过):

  • macOS 版是 ad-hoc 签名,Gatekeeper 会拦第一次启动,要手动"仍要打开"
  • 默认配置是给本机单用户调试用的,上公网之前一定要读安全文档
  • 界面偏实用,没有设计投入
  • 项目很新(2026-08-10 建仓),204 star,成熟度和头部项目(比如 OpenWork 两万多 star)不是一个量级

六个场景的实测记录(Excel→PPT、调研出报告、会议纪要、做网页、数据分析、自动定时)在这个仓库的同一批测试里跑过,单独整理了一份,想看具体哪些能用可以搜那篇。


八、结论

如果让我只给一句话:

选 AI 办公工具,先测"干完能不能信",再测"能不能干活"。

前者你可以用测试 4(产物核验)十秒钟测出来,但它是长期使用里最影响你的一项。

具体建议:

  • 个人轻度使用→ 主要看交付物形态和数据流向
  • 接进工作流→ 必须测产物核验和失败重试
  • 企业落地→ 加上审批默认值、审计日志、许可协议三项

常见问题

Q:本地模型跑得动吗?需要什么配置?

取决于模型大小。7B 级别的模型在 16GB 内存的机器上能跑(用 Ollama)。但效果和云端有差距,建议混合用:敏感数据走本地,普通任务走云。

Q:Windows 能用吗?

能。Node.js 是跨平台的,npm start在 Windows 上一样跑。桌面版走npm run app。

Q:为什么 star 这么少还敢推荐?

我没推荐,我只是实测并如实报告结果。204 star 是个很小的项目,成熟度、稳定性、周边生态都比不上头部项目。如果你的需求只是"找个最成熟的",去看头部那几个。

它的价值在于形态不同:走的是"本地优先 + 办公交付物"这条路,而不是编程 Agent。

Q:有没有更成熟的同类项目?

有。比如 OpenWork(different-ai/openwork,23,739 star,明确自称 Cowork 开源替代)。选型时应该把它放进候选一起比,别只看这一篇。

Q:公司里能用吗?

协议是 PolyForm Noncommercial 1.0.0,公司内部使用需要商业授权。

这里有个高频误解要提醒:"我们没拿它赚钱,所以算非商业使用"——这个理解是错的,公司内使用本身就构成商业使用。用之前读一遍 LICENSE。


本文所有项目数据来自 GitHub 公开接口,查询日期 2026-09-26。测评结论基于作者实际测试,不构成对任何产品的推荐。作者与文中所述项目存在关联,已如实说明。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询