☰
Agent = Model + Harness:真正的护城河在模型之外
2026/10/1 8:25:33 网站建设 项目流程

Harness 边界

模型能力在拉平。能不能上线、敢不敢交给用户,取决于模型之外那一层。

Agent = Model + Harness Harness = 上下文管理 + 工具接口 + 约束 + 验证 + 纠正

Harness 是 Agent 边界内、模型之外的运行与治理层。它协调 Model 与 Environment,不包括 Environment 本身。工具定义、调用适配器、沙箱权限与重置属于 Harness;沙箱内变化的文件与进程、外部数据库、网页、用户、物理世界属于 Environment。仿真环境与 Agent 同进程部署,概念上仍是 Environment。


模型 / 上下文 / 工具

LLM 是决策核心,上下文决定观测空间,工具决定动作空间。模型固定时,扩展观测与动作空间往往比等模型升级更有效。很多任务不可解,不是模型不够强,而是观测缺失或动作不可用。

上下文经常是决定性因素。消融实验里,去掉工具定义或工具执行结果,会直接夺走行动与闭环能力;去掉其他部分,代价取决于信息能否从当前观测重建。

Manus 以隔离云端沙盒扩大动作空间。OpenClaw 借 WhatsApp、Telegram、Slack、Discord、iMessage 等已有消息渠道收发任务,本地 Gateway 连接 Google Drive、Notion 与本地文件系统,同时扩触达面和本地动作面。产品能力演进,很大程度上是观测空间与动作空间的演进。

通用 Agent 的共同特征:开放式动作空间、内部思考、持续交互。


工具体系

按职责分五类:

感知:搜索引擎、文件系统、API/数据库,提供观测

执行:代码执行、文件操作、系统命令、外部 API,改变环境状态

协作:委托子 Agent、关键点请求人类确认、多 Agent 协调

事件触发:邮件、定时、Webhook——外部事件驱动 Agent 启动,属于 Environment 向 Agent 提供观察的通道

用户沟通:主动向用户传递进展或信息

设计原则:通用基础能力用于组合与探索;高风险、强业务规则操作用专用工具约束。

模型与工具之间唯一通道是接口。接口模糊会被模型放大成系统性错误。要从 Agent 视角设计 ACI(Agent-Computer Interface),而不是传统程序员 API 视角——命名与参数要直观,易误用处从设计上消除错误可能(防呆,Poka-yoke)。


Harness 的重心

上下文管理 + 工具接口让 Agent 能做事;约束、验证、纠正让它不做错事。早期框架重心在前者,生产系统重心在后者。

Claude Code 是典型:文件读写、命令执行、搜索等工具只占小部分,大量代码是流程状态管理、多层上下文压缩、权限分类、熔断器、错误恢复。这里的熔断器指连续错误触发的自动停止重试。

行业在从「能做事」转向「可靠地做事」。Harness 工程因此成为核心竞争力。


工程范式:五层包含

提示工程 → 上下文工程 → Harness 工程 → Loop 工程 → Graph 工程。

层层包含:提示工程是上下文工程的子集,上下文工程是 Harness 的子集,Harness 是 Loop 的子集,Loop 是 Graph 的子集。单个 Agent 循环只是执行图中的一个节点。

上下文工程:系统化管理模型可见的全部信息(系统指令、工具定义、对话历史、外部知识)

Harness 工程:Agent 如何组织模型运行并与环境交互(上下文与工具接口 + 约束/验证/纠正/反馈/恢复)

Loop 工程:跨轮次持续自主运转——谁发现下一件事、何时验证、何时真正完成

Graph 工程:把 Agent 循环、确定性程序、人工审批编排成显式执行图;节点承担能力,边规定路由与依赖,结构化状态沿边传递并在关键边界持久化

LangChain 在 Terminal Bench 2.0 上得分从 52.8% 到 66.5%(30 名开外 → 前 5)。模型未变,变的是 Harness:自动检查执行结果、检测重复循环、优化思考策略。

模型能力趋同后,竞争优势在模型之外。


三个原则

保持简单。从最简方案开始,必要时才加复杂度。直接 API 调用优于复杂框架,清晰代码优于聪明抽象。每多一层抽象,调试就多一个盲区。

保持透明。规划步骤、执行日志、决策轨迹要可见。黑箱错误既无法定位也无法纠正;透明也是建立用户信任的前提。

设计好 ACI。从 Agent 视角设计接口,而非程序员视角。SIM 卡缺角、微波炉门未关不加热,都是「用设计消除错误」。


编排:从简单到复杂

顺序:单次 LLM 调用 → 工作流 → 自主 Agent。能通过优化提示词与上下文示例解决的,不要上 Agent;能清晰分解为固定子任务的,用工作流;需要动态决策与灵活路径的,才用自主 Agent。

权衡:Agent 系统通常用延迟和成本换更好的任务性能,需谨慎评估是否值得。

工作流优势是流程控制与安全性——关键步骤用代码强制(如「付款前不能预订」),执行路径确定,提示注入或模型错误最多影响当前节点,攻击面被限制在节点内。局限是缺乏变通:预设流程未覆盖的情况只能走异常分支或交还人类。

自主 Agent执行路径由环境反馈实时决定。自主不等于无限制,必须有停止条件:调用最终输出工具、模型返回无工具调用的响应、遇到错误、达到最大轮数。否则易死循环或过度执行。部署需沙盒测试、护栏、监控,关键决策点加人机检查点。

实践中二者常混合:合规关键流程用工作流,灵活决策切自主。n8n 可在同一系统中混用工作流节点与自主 Agent 节点。

主流框架在编排模式、开发方式和适用场景上的差异大致如下:


护栏三层 + 人工干预

单个护栏不够,需多层组合。同时警惕误拒绝:降低危险请求放行率时,可能误伤合法但形式敏感的任务(授权安全测试、模型蒸馏研究等)。评估护栏不能只测「该拦的是否拦住」,还要测「该放的是否完成」。

按被绕过难度分三层(越靠下越不依赖模型判断,越难被一次攻击穿透):

上下文层管模型能看到什么,在内容进入上下文前拦截:相关性分类器、安全分类器(越狱 vs 提示注入)、内容审核、基于规则的保护(黑名单、长度限制、正则)。代表实践是 Anthropic Constitutional Classifiers:规则驱动生成合成训练数据;提问与回答联合判断;轻量探针全量扫 + 强分类器复审。结构性上限:同一上下文内的 Agent 难以判断自己是否已被注入,故该层只能降低成功率,给不出保证。

执行层管模型能做什么,在动作生效前验证。核心是工具风险评级(可逆性、权限等级、财务影响 → 低/中/高),高风险需额外审查或人工确认。关键:复核必须由上下文之外的机制完成(独立审查进程、最小权限凭证、沙盒隔离、人在回路),否则会与被注入的 Agent 一起沦陷。输出本身也是动作:PII 过滤、输出验证同属此层。

数据层管世界最终能被改成什么样:行级安全策略、约束与校验器、受控视图与存储过程、无法伪造的访问上下文。价值在于不依赖上两层是否正确——即使提示注入得手、生成代码漏写权限判断,越权仍会被拒绝。

人工干预触发时机:超过失败阈值(重试/操作次数上限);高风险操作(大额退款、不可逆付款等)。部署早期尤为重要,用于识别失败模式、建立评估周期。客户服务升级人工客服,Coding Agent 交还控制权给开发者。


模型选型

开源 vs 闭源:闭源(GPT/o、Claude)能力更强;场景要求不高时开源更务实——成本低、可私有化、可微调,适合成本敏感或数据合规场景。

策略边界:基准测试具备某能力 ≠ 产品允许调用。各厂商对网络安全、蒸馏、提取、隐私、高风险操作策略不同;同一任务在聊天产品、Coding Agent、API 中结果可能不同。选型要在真实任务上测:模型是否愿意执行、接口是否暴露所需能力、服务条款是否允许。业务关键任务准备人工接管或合规模型兜底。

思考能力:绝大多数 Agent 需要支持 Reasoning 的模型。多步思考、工具选择等复杂决策,不带思考的模型表现很差。仅极少数场景例外(单步简单任务、固定位置 GUI 点击)。

输出速度与多模态:Agent 多轮推理,每轮需等输出完成才能继续。20 轮推理、每轮慢 2s = 端到端多等 40s。需理解图片/音频/视频时,多模态是硬性要求,模型间差异大。


模型即 Agent

Kimi K3:强化学习写进参数的是决策——何时调用工具、调用哪个、传什么参数、结果后是否继续、如何串联长链调用。工具实现仍在框架侧(web_search、code_runner、沙盒、结果回传)。编排循环没有消失,而是从客户端移到服务端,决策权交给模型。突出优势是长链工具调用稳定性:200~300 次连续调用仍保持思考一致性(多数模型数十次后退化)。开源,软件工程与 Agent 基准可与顶尖闭源比肩,说明 RL 赋予原生 Agent 能力这条路线有效。

GPT-5.6:自由格式工具调用(API 中 type: “custom”),允许模型直接发送原始文本(Python 代码、SQL),省去 JSON 转义。传统方式需将参数打包为严格 JSON。


Harness 会被模型吃掉吗

Rich Sutton《苦涩的教训》:研究者反复将领域理解编码进系统,短期见效,长期输给可随算力与数据扩展的通用方法(搜索与学习)。以此衡量,Harness 中的约束、验证、纠正有多少属于人类先验、终将被内化?

立场:方向认同,节奏务实。

方向上,模型会持续吃掉 Harness——工具调用、长程规划曾靠外部编排,如今已是原生能力。节奏上,远比想象慢:训练以月计,模型无法一次内化真实业务中的全部约束与偏好。

模型此刻的能力边界,就是 Harness 此刻的价值所在。模型做不稳的先由 Harness 补上;模型每内化一层,Harness 卸下一层,转而兜底新的能力前沿。


五个设计模式(全书反复出现)

提议者—审核者(Proposer-Reviewer):产出与评判由不共享上下文的角色分别承担;评判方只看产物(渲染结果、测试输出、结构化参数),不看产出方推理过程。前提是自审不可靠——同一上下文中的模型难发现自身盲区,也难判断是否已被注入。后续章节用它更新知识、做工具调用事前审批与事后验证、评估 UI、审核更新提案。

渐进式披露(Progressive Disclosure):不把全部信息一次性放进上下文,先给可检索目录,再按需加载细节。同时优化上下文预算与选择精度。Agent Skills、分层检索、主动工具发现、分页截断都是其变体。

只增不改(Append-only):状态以追加方式演进,已写内容不回头修改。换可缓存、可重放、可审计。KV Cache 前缀稳定性是其性能形态——改动越靠前,作废缓存越多。事件式记忆、工具 schema 追加到轨迹末尾而非插回前缀,同属此纪律。

边界集 + 保留集(Boundary Set + Retention Set):任何修改都要同时在「应当改变的样本」与「不应当影响的样本」上验证。只测前者会把过拟合当进步,只测后者会把无效修改当安全。回归任务、训练与评估隔离、更新提案验证都建立在此。

最小 diff + 可回滚:每次修改尽量小、带来源、可单独回滚,使归因成为可能。知识更新、代码补丁、Prompt 与程序更新都遵循此条。上下文内适应、外部产物更新、参数更新三条路径,正是按可回滚程度从高到低排列。


本章要点

Agent = 决策核心 + 观测空间 + 动作空间;模型固定时,扩展观测/动作是主要杠杆

上下文是决定性因素:消融实验显示,去掉工具定义或工具执行结果会直接夺走行动与闭环能力

Harness 是竞争力所在:生产系统绝大部分代码在实现约束、验证、纠正

编排顺序:先提示词,再工作流,最后自主 Agent

安全是架构问题:护栏按被绕过难度分上下文层、执行层、数据层,后续安全讨论挂在此骨架上

五个设计模式贯穿全书:提议者—审核者、渐进式披露、只增不改、边界集+保留集、最小 diff+可回滚

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询