华为云 Skills 实战:从新项目上云到运维排障,一个 Agent 全搞定
67 个即装即用技能、12 大域全覆盖、纯 Markdown 驱动——云资源管理正在从「控制台点鼠标」变成「对 AI 说人话」。
引言
管理云资源最头疼的是什么?
不是不会用 API,也不是记不住命令——而是场景的碎片化。
一个「新项目上云」,要在 VPC、ECS、RDS、ELB、DNS 之间来回切换,每个产品线一个控制台页面。
一个「运维排障」,得从监控看到日志,从日志追到慢查询,从 SQL 查到 DWS 诊断——每一步都可能跨 3~4 个产品。
传统做法:开多个浏览器标签页,不断切换,人工拼信息。
华为云 Skills 的做法:对 Agent 说一句话,自动编排多个技能完成完整工作流。
场景一:新项目上云 —— 7 步全自动完成环境搭建
❗ 传统方式
团队新项目需要一套完整的云环境。传统流程是这样:
- 登录华为云控制台 → 进入 VPC 服务 → 手动创建 VPC、子网、安全组
- 切换到 ECS 控制台 → 创建两台 ECS 实例 → 配置密钥对 → 开通弹性 IP
- 再到 RDS 控制台 → 创建数据库实例 → 配置白名单
- 去 ELB 控制台 → 创建负载均衡器 → 配置监听器和后端服务器组
- 打开 CCE 控制台 → 创建集群 → 配置节点
- 进 OBS 控制台 → 创建桶 → 设置权限
- 再到 DNS 控制台 → 添加域名解析记录
预估耗时:2~3 天(含等待资源创建、配置反复调整)
✅ Skills 方式
你只需要在 AI Agent 里按步骤说自然语言,Agent 自动调用对应 Skill 执行:
| 步骤 | 你的指令 | Agent 调用的 Skill | 效果 |
|---|---|---|---|
| ① 网络规划 | 「创建一个 VPC,北京四,CIDR 192.168.0.0/16」 | vpc-query | VPC + 子网 + 安全组规则一键就绪 |
| ② 计算节点 | 「开两台 2C4G 的 ECS,配好免密登录」 | ecs-passwordless-login | ECS 实例创建 + SSH 公钥注入 + 免密验证 |
| ③ 数据库 | 「创建一个 RDS MySQL 8.0 实例」 | rds-query | RDS 实例创建 + 参数组配置 |
| ④ 负载均衡 | 「给应用配一个公网 ELB,后端挂这两台 ECS」 | elb-instance-manage | ELB 实例 + 监听器(HTTP:80)+ 后端服务器组 + 健康检查 |
| ⑤ 容器集群 | 「创建一个 CCE 集群,托管微服务」 | cce-cluster-management | Kubernetes 集群 + node 池就绪 |
| ⑥ 对象存储 | 「建一个 OBS 桶放静态资源」 | obs-bucket-create | OBS 桶创建 + 权限策略 |
| ⑦ 域名解析 | 「把 api.example.com 解析到 ELB」 | dns-records | DNS 记录集(A 记录)生效 |
关键差异
| 维度 | 传统方式 | Skills 方式 |
|---|---|---|
| 操作界面 | 7 个不同控制台页面 | 同一对话框 |
| 操作方式 | 逐页点菜单 → 填表单 → 等 | 自然语言指令 |
| 总耗时 | 2~3 天(含等待和切页面) | ~30 分钟对话式完成 |
| 重复操作 | 每次项目都要再来一遍 | 下次直接复用对话记录 |
| 学习成本 | 每个产品线都要熟悉 | 会说话就行 |
Agent 实际做了些什么?
这 7 步背后,Agent 自动编排了 7 个不同的 Skill。但每个 Skill 之间并不是孤立的——Agent 会自动传递上下文:
对话过程中 Agent 自动记住的信息: ├── 区域:cn-north-4(第①步设定,后续全部继承) ├── VPC ID:xxx(第①步创建,第③④⑤⑦步自动传入) ├── 子网 ID:xxx(第①步创建,第④⑤步自动传入) ├── ECS 实例 ID:xxx, xxx(第②步创建,第④步自动挂载到 ELB) └── ELB 公网 IP:xxx.xxx.xxx.xxx(第④步创建,第⑦步自动作为 DNS 目标)这就是Skills 组合的价值——不是 7 个独立操作,而是一次完整的上下文字航。
场景二:运维排障 —— 5 步根因定位
❗ 传统方式
凌晨 3 点收到告警:「线上数据库响应变慢,CPU 冲到 90%」。
排障流程:
- 打开 CES 监控控制台 → 查 ECS 监控面板 → 确认 CPU 峰值时间
- 切换到 RDS 控制台 → 找慢查询日志 → 导出 → 人工分析 SQL
- 再去 LTS 控制台 → 按时间搜 error 日志 → 查看上下文
- 如果涉及数据仓库,还要开 DWS 控制台 → 查资源监控
- 综合信息判断根因 → 修复
每次排障至少 30 分钟 ~ 1 小时,而且在多个页面之间反复切,很容易遗漏信息。
✅ Skills 方式
你坐在电脑前,对 Agent 说一句:
「线上 RDS 响应变慢了,帮我排查一下。」
Agent 自动启动一个5 步排障流程:
| 步骤 | Agent 自动执行 | 调用的 Skill | 输出 |
|---|---|---|---|
| ① 监控扫描 | 查 ECS + RDS 最近 1 小时的监控数据 | ces-ecs-monitoring+ecs-alert | 「CPU 在 02:15 从 20% 飙升至 88%,持续至今」 |
| ② 慢查询 | 拉 RDS 慢查询日志,按耗时排序 | rds-query | 「TOP 3 慢 SQL,最慢一条执行了 8.2 秒——全表扫描」 |
| ③ 日志追踪 | 按时间窗口搜 LTS error 日志 | lts-log-query | 「02:15~02:20 集中出现 DB 连接超时错误」 |
| ④ 深度诊断(可选) | 如涉及 DWS,检查资源瓶颈 | dws-cpu-diag/dws-mem-diag/dws-io-diag | 「IO 队列深度达到 32,磁盘吞吐饱和」 |
| ⑤ SQL 分析 | 用 SQL Check 分析慢 SQL 执行计划 | dws-sql-check | 「SELECT * FROM orders WHERE status=1未命中索引,建议加联合索引 (status, create_time)」 |
最终 Agent 汇总报告:
🕐 排障报告(生成时间:30 秒) 【根因】orders 表 status 字段缺少索引,导致全表扫描 【影响】02:15 起 CPU 飙升至 88%,DB 连接池被慢查询耗尽 【建议】执行 CREATE INDEX idx_orders_status_time ON orders(status, create_time); 【验证】索引添加后预计查询时间从 8.2 秒降至 < 10ms排障效率对比
| 维度 | 传统方式 | Skills 方式 |
|---|---|---|
| 信息获取 | 逐页翻控制台,手动拼信息 | Agent 跨服务聚合输出 |
| 分析判断 | 凭经验猜测根因 | SQL Check 给出执行计划分析 |
| 耗时 | 30 分钟 ~ 1 小时 | 30 秒 ~ 5 分钟 |
| 报告 | 人工整理 | 自动生成结构化排障报告 |
| 复现 | 下次还得再来一遍 | 对话记录可复用为 Runbook |
为什么能做到?—— Skills 的设计哲学
这两个场景并不是想象中的「未来」。它们基于的 Skills 已经全部发布在华为云 Skills 门户上。
核心技术原理
┌─────────────────────────────────────┐ │ 你:「帮我查一下 RDS 慢查询」 │ └──────────────┬───────────────────────┘ │ 自然语言 ▼ ┌─────────────────────────────────────┐ │ AI Agent 层 │ │ · 意图识别 → 匹配 Skill keywords │ │ · 加载 SKILL.md → 组装 CLI 命令 │ │ · 执行 → 格式化输出 │ └──────────────┬───────────────────────┘ │ hcloud CLI 命令 ▼ ┌─────────────────────────────────────┐ │ Skill 层(67 个即装即用技能) │ │ · 一份 SKILL.md = 一个云能力 │ │ · 零代码,纯文档驱动 │ │ · CLI 升级即自动同步新能力 │ └──────────────┬───────────────────────┘ │ HTTPS API ▼ ┌─────────────────────────────────────┐ │ 华为云 API(全球可用区) │ └─────────────────────────────────────┘每个 Skill 就是一份Markdown 文件。例如huawei-cloud-rds-query的 SKILL.md 里定义了:
- 它能做什么(自然语言描述)
- 什么时候触发它(keywords 标签)
- 对应的 hcloud CLI 命令是什么(完整命令模板)
- 参数如何填写(参数说明 + 默认值)
- 常见错误怎么处理(FAQ 部分)
Agent 读了这个文件,就「学会」了怎么操作 RDS。
而当多个 Skill 被编排在一起时,Agent 会像人的大脑一样自动传递上下文——上一部的输出成为下一步的输入。
零代码维护
| 维度 | 传统 SDK 方案 | Skills 方案 |
|---|---|---|
| 代码量 | 591 个文件 / 56,402 行 | 0 行代码 |
| 维护方式 | 逐个升级 SDK 包 | hcloud update自动同步 |
| 单次查询耗时 | ~30 秒(含 SDK 初始化) | ~0.2 秒 |
| 新 API 支持 | 手动扩展代码库 | CLI 升级即同步 |
| 技能数量 | N/A | 67 个(持续增长) |
下一步
立即体验
访问skills.huaweicloud.com浏览全部 67 个技能。
安装方式
在支持 Skills 的 AI Agent 中安装:
# 以 Hermes Agent 为例skillhubinstallhuawei-cloud-vpc-query--dir~/.hermes/skills/ skillhubinstallhuawei-cloud-rds-query--dir~/.hermes/skills/ skillhubinstallhuawei-cloud-dns-records--dir~/.hermes/skills/装好后,直接对 Agent 说:
「帮我把新项目的云环境搭起来——VPC + 两台 ECS + RDS + ELB,北京四区。」
一个命令都不用记。
场景中的技能均已上架,欢迎到 skills.huaweicloud.com 发现更多组合。
也欢迎在评论区分享你日常最频繁的云操作场景——也许下一批 Skill 就是为你做的。