Agent 数字分身身份模块(Identity Module)实战指南:用 voice.md 与 brand.md 为 AI 固化个人品牌与内容风格
【免费下载链接】Agent-Skills-for-Context-EngineeringA comprehensive collection of Agent Skills for context engineering, multi-agent architectures, and production agent systems. Use when building, optimizing, or debugging agent systems that require effective context management.项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-Skills-for-Context-Engineering
导读
在 AI 辅助创作时代,"写得不像自己"是个人品牌自动化的最大痛点。本文以开源仓库 Agent Skills for Context Engineering 中 Digital Brain 示例的Identity Module(身份模块)为主线,讲解如何用一套目录化、可被 Agent 解析的 Markdown/YAML/XML 文件,将个人的语气风格(voice)、品牌定位(brand)、核心价值观(values)与多平台简介(bio-variants)固化为结构化上下文。读完本文,你将掌握该模块的文件职责划分、Agent 加载顺序、可复用提示词模板,以及它背后的上下文工程原理(渐进式披露、注意力预算、Voice First 原则),并可直接套用这套骨架搭建自己的数字分身。
Identity Module 在 Digital Brain 中的定位
Digital Brain 是仓库中一个"面向创始人、创作者和构建者的个人操作系统"示例,采用模块化目录架构,包含identity/、content/、knowledge/、network/、operations/与agents/六个领域模块(见 README.md)。
其中identity/是唯一在任何对外表达前必须被读取的模块。在 SKILL.md 中,它被标记为 "Critical for Content",并有一条硬性规则:
Always read
identity/voice.mdbefore generating any content.
原因在于:个人品牌的核心资产不是某一条爆款内容,而是可复现的一致性——无论由谁(人类或 Agent)来写,输出的文字都应当听起来像同一个人。Identity Module 正是把"这个人是谁、怎么说话、坚持什么"编码为 Agent 可读取的结构化上下文,让一致性不再依赖提示词里的偶然描述。
该模块的入口说明文件 IDENTITY.md 以 frontmatter 声明了自身用途:"Personal brand, voice, values, and positioning. Reference before creating any content or representing the user externally."(个人品牌、声音、价值观与定位;在创建任何内容或对外代表用户之前参考。)即它是一个强制前置模块。
文件结构与职责划分
IDENTITY.md 用一张表格定义了模块内每个文件的职责,这是整个模块的骨架,原文完整保留如下:
| File | Purpose |
|---|---|
voice.md | Tone, style, writing patterns(语气、风格、写作模式) |
brand.md | Positioning, topics, audience(定位、主题、受众) |
values.yaml | Core beliefs and principles(核心信念与原则) |
bio-variants.md | Different bio lengths for platforms(面向不同平台的简介变体) |
prompts/ | Reusable prompts for content generation(可复用的内容生成提示词) |
对应到仓库中的真实路径为:
- identity/voice.md——语气与风格的核心档案;
- identity/brand.md——品牌策略与内容支柱;
- identity/values.yaml——价值观与决策框架;
- identity/bio-variants.md——各平台简介变体;
- identity/prompts/content-generation.xml 与 identity/prompts/reply-generator.xml——两个可复用提示词模板。
这种"一个领域一个目录、目录内再分层"的组织方式,正是 Digital Brain 上下文工程原则的体现:模块隔离(Module Separation)保证内容创作任务永远不需要加载网络或运营数据,从而把注意力预算花在刀刃上。
何时使用:Agent 的触发规则
IDENTITY.md 明确了四个典型使用场景,构成 Agent 的"路由表":
- 写任何内容:先读
voice.md(这是唯一正确的顺序); - 新建平台主页:查
bio-variants.md获取对应平台的字数限制与写法; - 战略决策:参考
values.yaml校准立场与取舍; - 内容选题:咨询
brand.md确认是否落在内容支柱内。
这套规则与 SKILL.md 中的触发词体系衔接:当用户说"write a post"、"my voice"、"content ideas"时,Agent 首先激活 Digital Brain skill,随后按 IDENTITY.md 的指引加载身份模块。换句话说,IDENTITY.md 是技能激活后的第一跳路由指令。
Agent 指令与强制加载顺序
IDENTITY.md 内嵌了一段<instructions>指令块,规定了 Agent 在为用户创作内容时必须遵守的流程,原文如下:
When creating content for the user: 1. ALWAYS read voice.md before drafting 2. Match the energy level, vocabulary, and structural patterns 3. Avoid words/phrases listed in "never use" section 4. Incorporate signature phrases naturally 5. Check brand.md for topic relevance这五条指令翻译成工程约束就是:
- 顺序不可逆:
voice.md必须在草稿前读取,杜绝"先写后校"; - 三要素对齐:能量层级、词汇表、结构模式全部以 voice.md 为准;
- 负向约束:
never use清单是硬性过滤条件,比正向指令优先级更高; - 自然融入:签名短语必须"自然"出现,防止生硬堆砌;
- 主题校验:选题必须与 brand.md 的内容支柱对齐。
同样的规则在 AGENT.md 中被提升为项目级 Core Rules 的第一条,并在 SKILL.md 的 Guidelines 中再次出现("Voice First: Always readidentity/voice.mdbefore any content generation")。同一规则在三个层级重复出现,这不是冗余,而是上下文工程中的"关键指令冗余"策略——确保无论 Agent 从哪个入口进入,都不会错过这条约束。
Voice Quick Reference:理解 voice.md 的七个区块
IDENTITY.md 指出 voice.md 是核心资产,并提示 Agent 应内化四类关键元素:沟通风格(正式/随意的光谱)、签名短语与词汇、结构模式(帖子格式、钩子)、要强调与要避免的主题。
深入阅读 voice.md 可以看到一个完整的语气档案模板,共七个区块:
1. 核心声音画像(Core Voice Profile)
- 个性快照:用 2~3 句话描述沟通个性,例如示例占位符"Direct and energetic with a bias toward action...";
- 声音属性评分表:用 1~10 分量化五个维度——正式↔随意、严肃↔俏皮、技术↔简单、内敛↔外放、谦逊↔自信。分数化的好处是 Agent 可将其作为明确的数值约束参与生成与自检。
2. 写作模式(Writing Patterns)
- 句式结构:短句还是复合句、一行一个观点、是否善用换行强调;
- 段落风格:每段最多几句、何时用列表;
- 钩子模式:开篇套路,如热评式"Unpopular opinion: X"、故事式"Last week I..."、提问式"Ever noticed how...?"。
3. 词汇表(Vocabulary)
以 YAML 结构分三类:
phrases: # 签名短语,例如 "Here's the thing"、"Let me break it down" use_often: # 高频词,例如 leverage、ship、iterate avoid: # 禁用词,例如 synergy、circle back、过度使用 emojiavoid清单是负向约束的落地形式,也是生成质量自检的过滤器。
4. 平台适配(Platform Adaptations)
为 Twitter/X(更短)、LinkedIn(更专业)、长文/博客/Newsletter(可展开)分别标注差异化的平台规则。
5. 内容格式(Content Formats)
定义线程结构模板(钩子→背景→主体→takeaway→CTA)以及热评、故事、教学三类帖子模板,供 Agent 直接套用。
6. 实例(Examples)
存放 2~3 篇"最能代表你声音"的真实写作样例,作为 Agent 少样本参考(few-shot examples)。
7. 反模式(Anti-Patterns)
明确列出"听起来不像你"的写法,例如过度正式的商务腔、过度 hedging("I think maybe perhaps...")、无实质的标题党。
从上下文工程角度看,voice.md 的设计遵循 SKILLS-MAPPING.md 中引用的高信号原则:"Find the smallest possible set of high-signal tokens that maximize the likelihood of some desired outcome."——只记录区分性模式(签名短语、反模式),而不是泛泛的写作建议;同时通过文件体积上限(模块指令文件控制在 100 行以内)防止上下文退化(context rot)。
品牌层:brand.md 与 values.yaml
如果说 voice.md 管"怎么说",那么 brand.md 和 values.yaml 管"说什么、为什么说"。
brand.md:定位、受众与内容支柱
结构上包含九大节:品牌一句话定位(One-Liner)、30 秒电梯演讲、起源故事、目标受众(主受众以 YAML 描述画像/痛点/愿景/聚集地,副受众分段描述)、内容支柱、独特价值主张、品牌声音对齐、竞争定位与增长策略。
其中最关键的工程化设计是内容支柱(Content Pillars):
- 主支柱(80% 内容):用户有权威的主题,用表格给出 Pillar / Description / Example Angles;
- 副支柱(20% 内容):补充性邻接主题;
- 禁区主题(Off-Limits):刻意回避的话题。
Agent 在选题时必须对照支柱表做匹配校验(如 content-workflow 示例中的building_in_public ✓ MATCH),不匹配则不应创作或需要用户确认。
values.yaml:决策框架
以结构化 YAML 表达:core_values(名称/含义/实践)、beliefs(强观点)、contrarian_views(反主流观点+理由)、non_negotiables(绝不逾越的底线)、principles(按内容创作/商业/人际关系分组的行事原则)、decision_framework(不确定时怎么办、优先级排序、取舍准则)。
这些字段对 Agent 的意义在于:当生成内容遇到立场判断或利益冲突时,可以直接查询 values.yaml 作出与用户价值观一致的选择,而不是凭空猜测。例如non_negotiables中的"不推广没用过的产品""不对个人进行公开负面评论",会直接影响回复生成器的输出边界。
可复用提示词:prompts/ 下的两个 XML 模板
content-generation.xml:主内容生成器
content-generation.xml 是一个带版本号的 XML 主提示词,在description中明确要求"Load voice.md and brand.md before using"。其结构包含:
<context>:以{{USER_NAME}}、{{USER_DESCRIPTION}}等变量注入身份,并要求生成前先读 voice.md、brand.md,以及最近的成功帖文;<voice_guidelines>:由 voice.md 填充的{{VOICE_LEVEL}}(正式/随意级别)、签名短语与禁用词;<output_requirements>:{{CONTENT_FORMAT}}、{{TARGET_PLATFORM}}、{{TARGET_LENGTH}}、{{INCLUDE_CTA}}四个输出参数;<quality_checks>:四道自检问题——听起来像本人吗?与内容支柱一致吗?对目标受众有价值吗?语气适配平台吗?
这套变量占位符的设计让同一个模板可以在不改动骨架的情况下,通过替换变量适配任意内容任务。
reply-generator.xml:互动回复生成器
reply-generator.xml 专门处理评论、私信、提及等互动场景,核心设计是语境分类的语调校准:
<tone_calibration> <public_reply>Slightly more polished, brand-aware</public_reply> <dm_reply>More casual, direct, personal</dm_reply> <comment_reply>Concise, appreciative, engaging</comment_reply> </tone_calibration>同时内置五条回复原则(匹配对方能量、提供增量价值、社交平台简短/私信更详细、异议时尊重且建设性、适当引用共同上下文),并要求输出 2~3 个候选回复(标准版、更随性版、可延续对话版)。
两个 XML 模板对应 README.md 中"XML 用于复杂提示词"的格式约定:XML 的命名节结构(instructions/context/output)天然适合 Agent 解析,且易于做合法性校验。
上下文工程原理如何支撑身份模块
Identity Module 并非孤立的模板集合,其设计深度嵌入了仓库的核心技能。根据 SKILLS-MAPPING.md 的映射,可归纳为四点:
| 上下文工程技能 | 在身份模块中的体现 |
|---|---|
context-fundamentals | 渐进式披露 + 注意力预算:任务只加载所需文件——写内容加载 identity 模块(约 400 tokens),从不加载整个 Digital Brain(约 5000 tokens) |
memory-systems | voice.md 作为语义记忆保存风格模式;posts.jsonl 作为发布历史供回顾分析 |
context-optimization | 模块隔离保证身份数据独立;just-in-time loading让 IDENTITY.md 仅在该模块相关时加载;引用深度最多两跳 |
context-degradation | 单一事实源:声音只存在于 voice.md,目标只存在于 goals.yaml,杜绝重复导致的指令冲突;文件大小上限防止上下文腐败 |
在 examples/content-workflow.md 的完整创作流程示例中,这条链路被量化为:SKILL.md(约 50 tokens,路由)→identity/IDENTITY.md(约 80 tokens,模块指令)→identity/voice.md(约 200 tokens,声音模式)→identity/brand.md(扫描支柱,约 150 tokens,主题校验),总计约 650 tokens,对比加载整个大脑约 5000 tokens,省去了 87% 的上下文开销。这就是身份模块存在的工程意义:用最小的 token 成本,换取最大的一致性收益。
实战:一次完整的"以本人声音写帖子"流程
结合 IDENTITY.md 的指令与 content-workflow.md,一次标准创作流程如下:
- 激活:用户输入 "Help me write a thread about lessons from building in public",Agent 识别为内容创作任务;
- 读 voice.md(强制):提取
formal_casual: 7/10、签名短语"Here's the thing"、avoid: ["synergy", "circle back"]等约束; - 读 brand.md(校验):确认
building_in_public是内容支柱,target_audience: Early-stage technical founders; - 参考历史:扫描
content/posts.jsonl,发现该支柱下故事式线程表现最好(如 likes 234、reposts 45); - 套用模板:用
content/templates/thread.md作为骨架,按钩子→背景→要点→takeaway→CTA 成稿; - 声音对齐自检:逐条核对签名短语是否自然出现、是否使用禁用词、语气是否匹配 7/10 的随意度;
- 发布后记录:将成品与指标 append-only 写入
content/posts.jsonl,形成下一轮创作的历史参考。
值得注意的是,这套流程在发布环节还体现了 Identity Module 与 Content Module 的联动:身份决定"怎么表达",内容模块决定"发什么、效果如何",历史表现又会反过来优化未来内容的表达侧重。
上手清单:用这套骨架搭建你的身份模块
仓库中的身份模块是一个待填充的模板骨架(所有关键字段均为[PLACEHOLDER: ...]占位符),这正是其刻意设计——据 SKILLS-MAPPING.md 所述,用占位符而非示例,是为了避免"AI 味"(AI slop),强制用户个性化。搭建步骤:
- 填充 voice.md:先写 2~3 句个性快照,再对五个声音属性打分,随后列出签名短语、常用词、禁用词、钩子模式,最后贴上 2~3 篇代表作作为少样本;
- 填写 brand.md:确定一句话定位、主受众画像、80/20 内容支柱与禁区主题;
- 校准 values.yaml:明确非协商底线与决策框架,这将决定 Agent 的立场边界;
- 准备 bio-variants.md:按各平台字数限制写好 160 字 Twitter 简介、120 字 LinkedIn 标题、50/150 字演讲者简介等,并拆分可复用的凭证块/个人化块/CTA 块用于混搭;
- 按需定制 prompts/:把两个 XML 模板中的
{{USER_NAME}}、{{VOICE_LEVEL}}等变量替换为实际值,即可投入使用。
需要特别说明的适用前提:该模板面向使用 Claude Code 等支持 skill 机制、且具备文件系统读写能力的 Agent 环境;JSONL 数据文件为追加式写入(append-only),修改状态时应标记"status": "archived"而非删除,以保留模式分析所需的完整历史。
结语
Identity Module 是 Digital Brain 中将"人格"工程化的范本:voice.md 解决"怎么说",brand.md 解决"说什么",values.yaml 解决"为什么",bio-variants.md 解决"在哪说",prompts/ 解决"如何稳定地自动说"。它把上下文工程中的渐进式披露、注意力预算与模块隔离从抽象原则落地为可直接套用的文件结构与 Agent 指令。对于任何希望在 AI 辅助下维持真实、一致、可规模化的个人品牌输出的人来说,这套身份模块骨架都值得直接移植。
【免费下载链接】Agent-Skills-for-Context-EngineeringA comprehensive collection of Agent Skills for context engineering, multi-agent architectures, and production agent systems. Use when building, optimizing, or debugging agent systems that require effective context management.项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-Skills-for-Context-Engineering
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考