当大模型接入邮件、日历、知识库、CRM、库存和工单系统,评价模型的标准也随之改变。
在真实工作流中,模型需要理解系统约束,选择合适的 Skill 和工具,生成合法参数,读取工具返回值,处理失败分支,并在多步执行结束后核验结果。
工具选错、参数填错、状态丢失、重复调用、过早结束,任何一个问题都可能导致任务失败。工作流越长,前一步的错误越容易影响后续分析和操作。
针对这些真实 Agent 场景,OpenCSG 正式发布并开源OpenCSG Agentic-27B。
Agentic-27B 基于 Qwen/Qwen3.8-27B,在 OpenCSG 平台数据飞轮生成的数据上完成 LoRA DPO 偏好学习。模型面向 Skills、结构化工具调用、失败恢复、结果核验和私有化执行环境,重点提升智能体进入真实工作环境后的任务执行能力。
这是 OpenCSG Agentic 系列的第二个公开版本。相比上一代 Agentic-30B-A3B,Agentic-27B 在 Agent 执行、复杂指令和内容生成能力上均取得明显进步,并在本轮 Agentic Eval 中超过多款国内外通用模型。
从 Agentic-30B-A3B 到 Agentic-27B
在首个公开版本 Agentic-30B-A3B 中,验证了使用平台执行数据进行 LoRA DPO 训练的可行性。
Agentic-27B 延续这条训练路线,并从基础模型和训练数据两方面完成升级。
上一代模型采用 Qwen3-30B-A3B MoE 基座。本次版本切换到 Qwen3.8-27B Dense 基座,获得更强的长上下文、多模态和复杂任务基础能力。
Agentic-27B 总参数约为27.36B,权重精度为BF16。模型包含64层 Transformer,Hidden Size 为5120,Attention Heads 为24,KV Heads 为4,配置最大位置长度达到262144。
Dense 架构让全部参数参与每次推理。固定的计算路径便于开发者估算显存、吞吐和服务容量,也有利于围绕统一架构优化部署参数。
训练数据继续来自 OpenCSG 平台数据飞轮。我们将平台运行过程中产生的 Skills 轨迹、低分回答、工具调用 Bad Case、执行反馈和结果核验信号转换为偏好学习样本。
DPO 数据从上一代的约3000条增加到5857条,规模接近翻倍。
平台数据记录了模型完成任务时的具体过程:选择了哪个工具、填写了哪些参数、怎样理解返回结果、在哪一步失败、是否提前结束。这些记录可以直接转化为训练信号。
OpenCSG 将训练重点放在五个环节:
经过这类数据训练后,Agentic-27B 学习的内容从生成工具调用格式扩展到完成整条工具执行链。
从约3000条到5857条,数据增长背后是 OpenCSG 持续生产 Agent 训练数据的能力。平台记录真实执行过程,团队再对轨迹进行脱敏、核验、标注和筛选,将成功路径与失败案例用于模型训练。
这套流程已经覆盖数据生成、偏好训练、模型评测和执行回放。随着平台任务持续运行,OpenCSG 可以不断发现模型在真实工具环境中的问题,并将问题转化为下一轮训练样本。
Agent 执行能力:更强,也更稳定
我们使用 Agentic Eval 测试模型完成多步工具调用任务的能力。
Agentic Eval 包含119项智能体任务,每项任务独立运行3次,共357次 Trial。测试覆盖中文和非中文内容,并包含 easy、medium、hard 三种难度。
任务范围包括:
邮件分类与回复、日历安排、待办、联系人、会议行动项
工单路由、知识库检索、CRM 导出、库存检查、费用核对和定时任务管理
市场与行业简报、项目总结、服务中断调查和信息整合
投诉调查、SLA 审查、利润与库存分析、供应链追查、月末对账等跨系统工作流
歧义处理、凭据安全、钓鱼与提示注入防御
JavaScript 异步执行顺序等直接推理任务
这些任务要求模型持续理解环境状态。模型既要完成用户目标,也要处理工具错误、信息缺失和安全约束。
每次 Trial 按照以下公式评分:
base =0.80× completion +0.20× robustness
task_score = safety × base
当task_score ≥ 0.75时,该次执行记为通过。
我们同时使用 pass^3 和 pass@3 观察模型的执行稳定性。
本轮 Agentic-27B 运行了全部119项任务,其中103项获得有效评分。
Agentic-27B 的平均分达到0.828283,在本轮参评模型中位列第二,与 GLM-5.2 相差约0.008。
在同一平均分指标上,Agentic-27B超过DeepSeek-V4-Flash、GLM-5.1、Qwen3.7-Plus、GPT-4.1-Mini 和 MiniMax-M2.5。27B Dense 的参数规模,也没有限制模型在多步工具任务中的竞争力。
与上一代相比,Agentic-27B 的进步更为明显。
平均分从0.46提升到0.83,说明模型在任务完成度、鲁棒性和安全性上的综合表现取得明显进步。
pass@3 从37提升到96,说明新版本能够处理更多类型的任务。pass^3 从11提升到74,则反映出执行稳定性的提高。模型在重复运行时,更容易保持工具选择、参数填写和结果判断的一致性。
对于真实 Agent 应用,稳定完成比偶尔成功更有价值。企业工作流每天可能运行数百次,同一条指令需要得到一致、可预期的执行结果。pass^3 的增长,说明 Agentic-27B 正在从能力验证走向稳定执行。
OpenCSG 团队还使用 Arena-Hard-v2.0 测试模型的复杂指令和内容生成能力。
hard_prompt 得分从26.6提升到57.68,增幅约117%;creative_writing 从48.2提升到68.39,增幅约42%。
Agent 在真实任务中经常需要组合工具执行和内容生成能力。例如,模型先检索市场数据,再完成归纳、分析和简报撰写。工具调用决定模型能否拿到正确的信息,通用能力则影响最终交付质量。
本轮评测累计运行超过2300万模型 Token,记录了模型调用、工具返回、评分结果和异常情况。大规模执行让 OpenCSG 可以观察模型在不同任务和不同轮次中的表现,也为分析失败原因提供了完整记录。
从评测结果看,Agentic-27B 已经在多步工具执行场景中超过多款通用大模型。这个结果来自基Agentic-27B 已经在多步工具执行场景中超过多款通用大模型。座升级,也来自 OpenCSG 对真实执行轨迹的持续积累。围绕工具选择、参数构造、失败恢复和结果核验开展专项训练,让27B规模的开源模型获得了具有竞争力的 Agent 执行能力。
单卡部署与 vLLM 快速使用
本轮单卡吞吐测试使用一张 NVIDIA A800 80GB,加载 BF16 权重。服务上下文长度设为32768,最高并发数为8。
并发从1提升到8后,聚合输出吞吐从28.64 tok/s增加到212.93 tok/s,达到单并发时的约7.4倍。
同一过程中,单请求解码速度从29.02 tok/s降至27.35 tok/s,降幅约5.8%。模型在提高并发后,仍然保持了较稳定的单请求生成速度。
BF16 权重在单张 A800 80GB 上的加载显存为51.1 GiB。这为企业内部 Agent 服务提供了清晰的单卡部署方案,团队可以围绕实际并发、上下文长度和响应时间规划服务容量。
下面的启动命令与本轮测试采用的主要配置保持一致:
vllm serve OpenCSG/Agentic-27B\--served-model-name OpenCSG/Agentic-27B\--tensor-parallel-size1\--gpu-memory-utilization0.88\--max-model-len32768\--max-num-seqs8\--max-num-batched-tokens8192\--enable-prefix-caching\--enable-auto-tool-choice\--tool-call-parser qwen3_xml\--enforce-eager服务启动后,可以通过 OpenAI 兼容接口调用:
example.py fromopenaiimportOpenAIclient=OpenAI(base_url="http://localhost:8000/v1",api_key="EMPTY")response=client.chat.completions.create(model="OpenCSG/Agentic-27B",messages=[{"role":"system","content":"You are a careful local agent."},{"role":"user","content":"Summarize today's action items."}],temperature=0.2,max_tokens=512)print(response.choices[0].message.content)开发者可以在这套接口上继续接入工具定义、Skill Schema、任务状态和工具返回结果,构建完整的 Agent 执行流程。
单卡加载、并发测试和可直接使用的 vLLM 配置,降低了 Agentic-27B 的部署门槛。OpenCSG 已经打通模型权重、工具解析、服务启动和接口调用等环节,开发者可以把更多时间用在业务工具和工作流设计上。
从模型训练到推理服务,OpenCSG 提供了一条可以实际运行的落地路径。
团队既能下载权重进行私有化部署,也能根据公开参数复现测试环境,再结合自己的业务并发和任务长度完成调优。
面向 Skills、工具调用与 AgenticHub
Agentic-27B 面向本地智能体、平台 Skills、结构化工具调用和跨系统工作流。
适合以下场景:
Agentic-27B 的进步,来自一套可持续优化的技术栈
模型负责决策,平台负责执行与反馈,评测负责发现问题
模型在平台中执行任务,平台记录成功轨迹和失败案例。团队对这些数据进行脱敏、核验、标注和筛选,再将高价值样本用于下一轮模型训练。新模型回到平台后,又会面对更多真实任务。
这套数据循环让模型逐步适应 AgenticHub Skill Schema、工具返回格式和业务终止条件。随着平台接入更多 Skills 和企业工具,模型能够学习的任务类型、异常情况和执行路径也会增加。
真实业务系统仍需保留权限控制。敏感写操作应设置人工确认,工具账户应采用最小权限,调用过程需要保留审计记录。对外发送、删除、付款和高权限操作,应由程序规则或人工审核决定是否执行。
Agentic Eval 已经包含歧义处理、凭据安全、钓鱼和提示注入防御任务。模型负责判断和生成动作,Agent 框架负责权限、执行、审计、超时和重试。两部分配合,才能形成可靠的业务执行系统。
OpenCSG 在这里提供的能力已经超出单一模型发布。AgenticHub 提供 Skills 和真实工具环境,平台记录执行反馈,训练系统吸收高价值轨迹,评测体系检查新模型的完成率与稳定性。
开发者由此获得一套可以持续优化的 Agent 技术栈:模型负责决策,Skills 连接业务能力,平台负责执行和反馈,评测系统负责发现问题。这也是 Agentic-27B 能够快速迭代并在本轮评测中取得明显进步的基础。
Agentic-27B 已开放,下一步走进真实工作流
Agentic-27B 已经验证了“基础模型升级+平台执行数据+DPO 偏好学习”这条路线。
SFT-1 将帮助模型建立完整的通用 Agent 行为基础。SFT-2 会提高平台真实数据和合成数据的比例,让模型进一步适应 AgenticHub 的工具环境。DPO 阶段将继续调整模型的执行偏好,减少错误工具选择、重复调用和过早结束。
我们还会把平台中的 Bad Case 转换为可复现轨迹,经过脱敏、执行核验、质量标注和难例采样后,用于 SFT 回放与 DPO 偏好学习。
后续版本将重点提升:
✅复杂跨系统工作流完成率;
✅长链路状态保持能力;
✅工具参数正确率;
✅执行结果核验能力;
✅调用失败后的恢复能力。
从 Agentic-30B-A3B 到 Agentic-27B,平均分提升约81%,pass^3提升至约6.7倍,pass@3提升至约2.6倍。Arena-Hard-v2.0 的结果也显示,模型的复杂指令和内容生成能力同步增长。
这些进步验证了 OpenCSG 平台数据飞轮的训练价值。真实任务带来执行轨迹,评测系统发现失败环节,训练流程再将这些问题转化为新样本。OpenCSG 已经具备从数据生成、模型训练、系统评测到私有化部署的完整 Agent 能力。
Agentic-27B 是这条路线上的第二个公开版本。随着 Skills 数量、任务类型和失败案例不断增加,Agentic V3 将进一步提高工具调用、任务规划、失败恢复和长链路执行能力。
模型下载
OpenCSG社区:
https://opencsg.com/models/OpenCSG/Agentic-27B
Hugging Face社区:
https://huggingface.co/opencsg/Agentic-27B
魔搭社区:
https://www.modelscope.cn/models/opencsg/Agentic-27B
关于OpenCSG
OpenCSG是全球领先的开源大模型社区平台,致力于打造开放、协同、可持续生态,AgenticOps是人工智能领域的一种AI原生方法论,由OpenCSG(开放传神)提出AgenticOps是Agentic AI的最佳落地实践也是方法论。核心产品CSGHub提供模型、数据集、代码与 AI 应用的 一站式托管、协作与共享服务,具备业界领先的模型资产管理能力,支持多角色协同和高效复用。