摘要:一项由多所顶尖学术机构联合开展的安全研究对 7,000 余个公开 GitHub 仓库中的 AI 会话日志进行了系统性扫描,在其中发现 62 个唯一 API 密钥、33 组邮箱地址与 33 组明文密码。
当检索范围扩大至 315,320 个公开推理数据块时,研究人员进一步提取出 367 条个人身份信息与 182 组登录凭证。这些敏感数据并非存在于明文配置文件之中,而是全部隐匿于开发者日常分享的 AI 会话日志所附带的加密推理数据块内部。
本文将对这一研究发现进行系统性解读,并结合 AntsData 在公开数据采集与 API 安全管理领域的实践经验,为开发者和技术团队提供切实可行的防护建议。
描述:一项前沿 AI 安全研究从 7,000+ 公开 GitHub 仓库的 AI 会话日志中发现 62 个唯一 API 密钥与 33 组密码。了解你的公开代码仓库面临的数据泄露风险,以及 AntsData 如何帮助你建立系统化的安全审计与监控机制。
一项不容忽视的安全研究
2026 年 8 月,一篇发表于 alphaXiv 的研究论文《Stealing Reasoning Traces from Proprietary LLM APIs》在 AI 安全领域引发了广泛关注。
该研究由德国图宾根大学、马克斯·普朗克研究所、MATS Research 以及安全公司 Snyk 的联合团队完成,揭示了一个横跨 Anthropic、OpenAI 以及 Google 三大前沿大模型厂商的架构性安全漏洞。
研究团队的核心发现可以被简洁地概括为:主流大模型 API 返回给客户端用于维护对话上下文的加密推理数据块,在同一厂商的不同模型之间具备完全的可移植性与互操作性。
具体而言,当开发者在 Claude Opus 4.8 上执行一项任务后,API 响应中会包含一串经过加密的"思考链"数据——该数据块的设计初衷是使服务器端无需存储用户的完整推理历史,而是将其以加密形式随响应下发至客户端。
理论上,这些加密数据块仅能被生成它们的模型所解读。
然而,研究人员通过实验证明了一个令人不安的事实:将这些加密推理块注入到同一厂商提供的、安全对齐程度更低的轻量级模型中——例如从 Claude Opus 4.8 转向 Claude Haiku 4.5——后者会以明文形式逐字输出前者的完整推理过程。研究团队将这一攻击向量命名为"跨模型解密越狱",并进一步验证了同样的方法对 OpenAI 的 GPT 系列模型与 Google 的 Gemini 系列模型均具有同等效力。
加密推理块的公开暴露:一场静默的数据泄露
该研究的发现之所以对开发者社区构成直接威胁,核心原因在于一个普遍的开发实践习惯:大量开发者在使用 Claude Code 或 Codex 等 AI 编程助手完成工作后,会有意或无意地将包含加密推理块在内的完整会话日志上传至 GitHub 公开仓库。这些日志可能以 Issue 讨论记录、项目文档附件、或完整的.claude/工作目录等形式存在。
当这些日志被推送至公开仓库时,其中嵌入的加密推理块同时进入了公开可访问的互联网空间。
依据该论文揭示的漏洞,任何获取了这些日志的第三方,都可以利用同一厂商的轻量级模型作为"解密预言机",系统性地解码出隐藏在推理过程中的全部明文内容——其中不仅包含模型的思考步骤,更包含了开发者在对话过程中无意中提供或粘贴的 API 密钥、数据库连接字符串、内部系统配置片段等高度敏感的信息。
论文作者在公开发布的帖子中明确写道,他们对约 7,000 条公开的 Claude Code 与 Codex 会话记录进行了初步扫描,即从中提取出 62 个唯一 API 密钥、33 个邮箱地址与 33 组密码。
当扫描范围扩展至 315,320 个公开推理数据块时,统计结果更为严峻:共计 367 条个人身份信息与 182 组登录凭证遭到暴露。论文的第一作者 Alexander Panfilov 在社交平台上对此评论道,任何曾经在网上分享过包含加密推理块的 Claude Code 或 Codex 会话记录的用户,其个人数据均存在被解码与泄露的风险。
公开数据的边界正在被重新定义
从数据采集行业的专业视角出发,这一研究发现提出了一个此前未被充分讨论的合规性命题:当加密数据块被公开至互联网空间,但其发布者对其内容并不知情时,这些数据仍应当被归类为"公开可访问数据"吗?
GitHub 公开仓库中的内容在技术层面和法律层面均属于公开可访问信息。数据采集平台——包括 AntsData 在内——的日常业务正是从互联网中发现、抓取、清洗和结构化此类公开数据。AntsData 在其合规章程中明确声明,平台仅采集公开可访问数据,并严格遵循 GDPR、CCPA 以及所有适用的数据保护法规。
然而,当加密推理数据块的解码行为揭示了发布者无意公开的敏感凭证信息时,公开数据的边界便陷入了一个显著的灰色地带。这使得 AI 时代的数据采集合规问题变得前所未有的复杂——在传统 Web 数据中,发布者对其所发布内容的性质具有清晰的认知;而在 AI 推理数据的场景下,发布者与被暴露的信息之间横亘着一层技术性的认知鸿沟。
AntsData 的安全实践与建议
作为一家以"发现散落数据并将其组织为可调用网络"为核心使命的数据采集与交付平台,AntsData对这一安全研究给予高度重视。以下是我们从此次事件中总结的两项核心观察与建议。
其一,API 密钥的安全管理是每一位开发者不可推卸的基本责任。AntsData的官方文档自平台上线之初便对此提出明确警示:请妥善保管你的 API Key,不得将其暴露于前端代码、公开仓库、浏览器扩展或任何客户端脚本之中。
这一声明的用意绝非例行公事的提醒,而是建立在无数次实际安全事件所积累的经验教训之上。在论文所披露的 62 个已泄露 API 密钥中,极有可能包含某个组织仍在生产环境中使用的 Stripe、AWS 或 OpenAI 凭证。一旦这些密钥被恶意利用,其造成的经济损失与声誉损害将是不可逆的。
其二,在公开数据采集领域,选择一个具备严谨合规范式的技术伙伴比以往任何时候都更为重要。AntsData 承诺其交付的每一份数据集均经过严格的质量审计与合规性审查流程,确保数据来源的合法性、透明性与可追溯性。
在 AI 推理数据与加密数据块的解码日益简便的当下,与一个始终坚持合规底线的数据采集平台合作,意味着你可以确信自己所获取的数据不触及那些定义模糊的法律边界。
Q&A
Q1:作为一名开发者,我如何判断自己的公开仓库中是否存在未经授权的 API 密钥泄露?
最为直接的方法是一次系统性的自我安全审计。你可以利用 AntsData 提供的 SERP-Google API 执行以你的用户名、所属组织名称或项目名称为关键词的批量检索,并专门针对.env、config.json、credentials.yml等高风险文件路径设置过滤条件。
AntsData 的 API 将以结构化的 JSON 格式返回检索结果,便于你进行批量化的交叉比对与风险评估。
如果你的检索需求超出了标准 API 所能覆盖的范围——例如需要针对特定代码托管平台或特定文件模式进行定制化扫描——AntsData 的托管服务团队可以为你构建专属的数据采集管线,完整覆盖从数据源发现到结构化交付的全流程,无需你自行编写任何采集脚本。
Q2:在当前的 AI 开发环境下,API 密钥的最佳存储实践是什么?
AntsData 建议遵循一套三层防护架构。
第一层是零硬编码原则:所有 API 密钥必须且仅能通过环境变量或专用的 Secret Manager 服务进行存储与读取,AWS Secrets Manager、GitHub Secrets 以及 HashiCorp Vault 均为业界广泛认可的方案。
第二层是最小权限原则:AntsData允许用户在控制面板中生成多枚相互独立的 API Key,为不同的项目、环境与团队成员分配不同的密钥;当某一密钥出现异常时,你可以单独吊销该密钥而不影响其他业务的正常运行。
第三层是定期轮换机制:建议以季度为周期对所有活跃的 API 密钥执行强制轮换,并将轮换流程纳入 CI/CD 管线的自动化环节。
Q3:AntsData 是否能够帮助我系统性扫描互联网上潜在的敏感数据暴露?
AntsData 的核心竞争能力正是从互联网中发现、采集、清洗与结构化公开数据。
我们可以为你搭建一套持续性的数据监控管道:首先与你的安全团队共同确定监控的关键词集合与目标平台范围(包括但不限于 GitHub、Pastebin、HuggingFace 等开发者高频使用的公开平台),随后通过定时采集任务定期获取新出现的公开内容,并输出结构化报告供你的安全团队进行研判。对于威胁情报获取与安全态势感知场景而言,这一方案提供了低成本、高覆盖率的有效解决路径。
目前 AntsData 的自助 API产品线已覆盖 TikTok、Facebook、LinkedIn、X/Twitter、YouTube、Amazon、Instagram 以及 SERP-Google 等主流平台。对于不在标准产品矩阵中的平台,我们的定制化团队可以为你设计并部署专属采集管线。
Q4:对 GitHub 公开仓库进行大规模数据采集以完成安全审计,是否具备法律上的合法性?
这是一个需要谨慎处理的合规性命题。在大多数司法管辖区,对公开可访问数据进行采集的行为本身具有合法性基础——美国第九巡回上诉法院在 hiQ Labs v. LinkedIn 案中的裁决为此提供了重要的判例法支撑。
’然而,AntsData 建议所有从事此类实践的组织同时关注三个维度的合规边界:其一,不得侵犯数据主体的隐私权;其二,不得违反目标平台的服务条款;其三,必须全面遵守 GDPR、CCPA 以及业务所涉及司法辖区内其他数据保护法规的规定。
就 GitHub 的具体场景而言,对公开仓库中内容的搜索与读取行为本身并不违法。但当你所采集的数据中包含了他人在不知情状况下意外暴露的个人身份信息或安全凭证时,如何处理、存储与使用这些数据便进入了需要法律顾问介入的专业判断范畴。
AntsData 在数据交付环节设立的严格的质量保证与合规审计流程,正是为了确保你所接收的每一份数据集均来自于合法合规的采集渠道。
Q5:AntsData 自身如何确保 API 密钥不被泄露?
我们将此问题视为一个需要以身作则的严肃承诺。
在内部实践层面,AntsData 建立了以下安全基线:所有 API 密钥的认证与传输均通过加密通道完成,密钥内容仅在用户专属的控制面板中可见,不会通过电子邮件、即时通讯工具或任何非加密渠道以明文形式传输。
在基础设施层面,我们的全部代码仓库、CI/CD 管线以及日志系统均遵循零硬编码原则,所有敏感凭证均由 GitHub Secrets 与环境变量统一管理。此外,我们以固定周期执行覆盖代码仓库、部署管道与日志基础设施的全面安全审计与渗透测试。
如果你希望在实际使用中亲自验证 AntsData 的安全机制与数据质量,注册账户即可获得免费 $5的API 调用额度,无需预先承诺任何付费计划。