【实测】AI 办公 Agent 横向测评:从"能不能干活"到"干完能不能信"
标签:AI Agent / 测评 / 开源 / 本地部署 / 办公自动化 / DeepSeek / Ollama
选 AI 办公工具的时候,大家习惯看功能列表。这个方式有问题,因为功能是最好抄的。
这篇文章换一个方式:不看它宣称能做什么,而是给它出题,看它怎么应对。包括几个故意设计的"陷阱题"。
下面是我用的测试方法、测试结果,以及从测试里总结出来的判断标准。
一、测试设计:为什么不用"功能对比"
先说测试方法本身。
常见测评是列一张功能表打勾。这个方式对 AI Agent 不太适用,原因有三个:
- 功能表是厂商填的。你没法验证。
- Agent 的能力是涌现的,不是列举的。它能不能干某件事,取决于模型 + 工具 + 上下文,不是一个勾能表达的。
- 演示都是挑过的。演示里不会展示失败案例。
所以我用的方法是分层测试,按任务的确定性从高到低分三层:
| 层级 | 任务类型 | 考什么 |
|---|---|---|
| L1 基础 | 单一、明确、无分支的任务 | 能不能跑通 |
| L2 陷阱 | 中途会失败、有歧义、有干扰的任务 | 会不会翻车 |
| L3 高难 | 多约束、多步骤、需要自我检查 | 稳不稳 |
关键在于 L2 和 L3。L1 大部分工具都能过,L2/L3 才是分水岭。
二、L1 基础测试(及格线)
这层的测试很简单,但有两个坑要注意。
测试 1:读写本地文件
任务:给一个本地 Excel,让它读出来做一份汇总。
坑在哪:有些工具需要你手动上传文件,或者让你粘贴内容进去。这不叫"能读写本地文件",这叫"能处理你喂给它的内容"。
及格标准:它自己知道文件路径在哪、能自己打开。
测试 2:交付物形态
任务:"做一份 PPT,介绍这个项目的三点优势"。
坑在哪:这里有两类结果——
| 结果 | 判定 |
|---|---|
生成.pptx文件 | ✅ 真交付 |
| 给你一段 Markdown,让你自己贴进 PowerPoint | ❌ 这是把工作换了个地方做 |
第二类的问题:你可能觉得"内容有了,我自己排版也就十分钟"——但你算一下,如果每天都这样,一天十分钟,一年就是四十个小时。
判断方法:看那个文件能不能双击直接打开。
测试 3:多轮上下文
任务:连续对话 30 轮后,让它回忆第 1 轮说了什么。
坑在哪:上下文窗口是有限的,但不同实现的处理方式不同。有的会截短早期内容,有的会压缩总结,有的直接丢。
及格标准:记得住关键信息。更好的实现会明确告诉你截短了多少字,而不是假装模型还看得见全文。
三、L2 陷阱测试(分水岭)
这一层是真正拉开差距的地方。
测试 4:产物核验(最重要的一条)
任务:故意让它生成一个它写不了的文件。
这是我最推荐的测试,因为它能直接看出实现质量。
结果分两类:
| 它的反应 | 判定 | 为什么 |
|---|---|---|
| 报错说做不到 | ✅ 及格 | 它对自己干没干成有判断 |
| 说"已完成" | ❌ 危险信号 | 接下来在实际工作流里就是静默失败 |
为什么这条最重要?
因为交互式使用的时候,你一眼就能看出文件没生成。但接进自动化流程之后,"假成功"比"失败"危险得多:
- 失败:你知道要处理
- 假成功:你什么都不知道,等下游发现问题时上游已经查不回去了
好的实现会把"产物真的在磁盘上"作为完成条件——去问文件系统,而不是相信模型的自我报告。
测试 5:失败重试
任务:给它一个第一次会失败、但重试能成的任务。
坑在哪:很多 Agent 会在第一步失败后停下来等你。这不叫 Agent,这叫需要人盯着的工具。
及格标准:自己判断失败原因、调整、重来。
测试 6:干扰项
任务:描述里混入一句和任务无关的指令,看它会不会跑偏。
这个测的是指令遵循的稳定性。偶尔跑偏是正常的(模型问题),但每次都在同一个地方跑偏就是实现问题。
四、L3 高难测试(稳不稳)
测试 7:多约束任务
任务:给三个约束条件的任务(比如"用这三个 Excel、去掉重复行、输出带图表的报告")。
考的是什么:它会不会漏掉某个约束。能过一次和每次都能过,是两回事。
这里的判断方法是跑多次:
- 跑 1 次成功→ 能不能
- 跑 5 次全成功→ 稳不稳
大部分工具在第二项上会露馅。这个思路在学术上有对应(τ-bench 的 pass^k),就是时过时不过的题要标出来。
测试 8:长任务断点
任务:让它干一个需要很久的活,中途打断(或者等它撞上限),看能不能接着跑。
坑在哪:没有进度记录的话,它只能从头再来。跑了半小时的任务重来一遍,是很烦的。
及格标准:有进度档机制,能从断点继续。
五、测评结果:我实测的项目
实测了OpenWorkBuddy(github.com/CatCatUncle/openworkbuddy)——一个开源、本地优先的 AI 办公 Agent,挑几个有代表性的结果记录。
先说项目基本情况(2026-09-26 查 GitHub 公开接口):
| 项 | 值 |
|---|---|
| Star | 204 |
| Fork | 46 |
| 主要语言 | JavaScript |
| 建仓 | 2026-08-10 |
| 最后推送 | 2026-09-25 |
| 协议 | PolyForm Noncommercial 1.0.0 |
L1 结果:
- 读写本地文件 ✅ 直接给路径,不需要手动上传
- 交付
.pptx✅ 真文件 - 30 轮后回忆 ✅ 上下文管理有明确提示(截短时会说截了多少字)
L2 结果:
- 产物核验 ✅ 通过。OpenWorkBuddy 有一道成果核验:声称生成了文件却不在磁盘上、或者只有 0 字节,会被打回去重做(最多 2 次)。这个我在测试里故意触发了一次,确实拦住了。
- 失败重试 ✅ 有自己的判断和重试
- 干扰项 ✅ 没跑偏
L3 结果:
- 多约束 ✅ 三个约束都满足
- 长任务断点 ✅ 有
PROGRESS.md进度档机制,能续跑(这个功能默认关闭,要在设置里开)
一个我觉得设计得好的地方:OpenWorkBuddy 有个"假绿裁定"。
意思是:"没抛异常"不等于"干成了"。有四类情况以前在运行记录里全是 ✅,现在会被判红:
- 撞步数/时长上限被强制收尾
- 整条回复就是上游报错
- 一个字都没吐
- 把活丢后台就收工
判红之后还要写清为什么红和下一步干什么,并按死因分档标出"重跑能好"还是"重跑没用"。
这个意识到位了。自动化系统最危险的状态不是失败,是看起来成功。
六、从评测里总结的 5 条判断标准
如果你不打算做这么细的测试,至少看这五条:
① 交付物是文件还是文字
让文件系统说了算,不是让模型说。
② 完成条件是不是"产物存在"
问它要一个真实产物。看它会不会自己核验,还是完全相信模型的自述。
③ 无人值守时的默认行为
特别是审批——超时是自动通过还是自动拒绝。这条决定了它能不能真的无人值守。
④ 上下文超限时怎么处理
是静默截短,还是明确告诉你截了多少。前者会让你以为模型一直看得见全文。
⑤ 数据能导出吗
会话记录、配置、生成的文件。这个在你决定换工具的时候才会想起来,那时候就晚了。
七、安装与上手
OpenWorkBuddy 的安装很简单(项目地址:https://github.com/CatCatUncle/openworkbuddy):
bash
git clone https://github.com/CatCatUncle/openworkbuddy.git cd openworkbuddy npm install npm start # → http://localhost:3800环境要求:Node.js 18+,零构建步骤(不需要编译,改完代码刷新即生效)。
测试:
bash
npm test这一点值得单独说:npm test用模拟 LLM,不需要任何 API Key 就能全绿。所以你想在没配模型的情况下先看看逻辑,或者想跑测试验证环境,都可以。
模型配置:支持 DeepSeek、通义、智谱、Kimi、OpenRouter、OpenAI、Anthropic、火山方舟 Ark。
想完全不出网:接 Ollama。
如果你已经有 Claude Code 或 Codex CLI,可以拿它们当执行引擎:
bash
openworkbuddy engines use claude-code这样跑的是你的既有订阅,不用额外烧 API token。
几个真实限制(这些我实测确认过):
- macOS 版是 ad-hoc 签名,Gatekeeper 会拦第一次启动,要手动"仍要打开"
- 默认配置是给本机单用户调试用的,上公网之前一定要读安全文档
- 界面偏实用,没有设计投入
- 项目很新(2026-08-10 建仓),204 star,成熟度和头部项目(比如 OpenWork 两万多 star)不是一个量级
六个场景的实测记录(Excel→PPT、调研出报告、会议纪要、做网页、数据分析、自动定时)在这个仓库的同一批测试里跑过,单独整理了一份,想看具体哪些能用可以搜那篇。
八、结论
如果让我只给一句话:
选 AI 办公工具,先测"干完能不能信",再测"能不能干活"。
前者你可以用测试 4(产物核验)十秒钟测出来,但它是长期使用里最影响你的一项。
具体建议:
- 个人轻度使用→ 主要看交付物形态和数据流向
- 接进工作流→ 必须测产物核验和失败重试
- 企业落地→ 加上审批默认值、审计日志、许可协议三项
常见问题
Q:本地模型跑得动吗?需要什么配置?
取决于模型大小。7B 级别的模型在 16GB 内存的机器上能跑(用 Ollama)。但效果和云端有差距,建议混合用:敏感数据走本地,普通任务走云。
Q:Windows 能用吗?
能。Node.js 是跨平台的,npm start在 Windows 上一样跑。桌面版走npm run app。
Q:为什么 star 这么少还敢推荐?
我没推荐,我只是实测并如实报告结果。204 star 是个很小的项目,成熟度、稳定性、周边生态都比不上头部项目。如果你的需求只是"找个最成熟的",去看头部那几个。
它的价值在于形态不同:走的是"本地优先 + 办公交付物"这条路,而不是编程 Agent。
Q:有没有更成熟的同类项目?
有。比如 OpenWork(different-ai/openwork,23,739 star,明确自称 Cowork 开源替代)。选型时应该把它放进候选一起比,别只看这一篇。
Q:公司里能用吗?
协议是 PolyForm Noncommercial 1.0.0,公司内部使用需要商业授权。
这里有个高频误解要提醒:"我们没拿它赚钱,所以算非商业使用"——这个理解是错的,公司内使用本身就构成商业使用。用之前读一遍 LICENSE。
本文所有项目数据来自 GitHub 公开接口,查询日期 2026-09-26。测评结论基于作者实际测试,不构成对任何产品的推荐。作者与文中所述项目存在关联,已如实说明。