此次大规模实验涵盖 16893 次会话、1163 个 prompt 变体、75 个代码仓库、10 种语言以及 3 个主流 coding agent,即 Claude Code、Codex 和 Cursor。最终筛出 5292 个有效会话,覆盖 51 个代码库和 18 个行业。实验发现,三个 agent 的选择差异很大。Cursor 在约67%的会话中会做网页搜索,Codex 是94%,Claude Code 只有约30%的时间搜索,但一旦搜起来,浏览的页面数量是前两者的 3 倍。在沙箱这类较新的领域,Claude Code 的搜索率飙升到80%,三个 agent 在所有任务上只有42%的时间达成一致。
实验表明,仓库上下文比 prompt 更能决定选择。以同一个「发邮件」任务为例,放到四个不同语言和仓库里,结果完全不同。Resend(TypeScript,55/89),Sendgrid(Python,22/24),Postmark(Go,20/24),Azure ACS(Java,22/23)。Vercel 在 TypeScript 仓库上100%被选(只要有 Next.js),但在 Python 仓库上从来没赢过,Render 在那里占主导。
实验还发现,被提到不等于被选中。PayPal 被引用了 139 次,一次没被选,Stripe 赢了 124/139。Adyen 被提 175 次,只被选 3 次。LangChain 被提 194 次,选了 4 次。Netlify 被提 152 次,选了 6 次。Supabase 是提及最多的数据库(242 次),但 Neon 仍然主导了数据库选择。
定价页面的措辞会翻转决定。Mailgun 在免费计划上写了「1 天留存」,Agent 读到后选了 Postmark。Supabase 因为打包了 BaaS 功能而输掉,Agent 只是想要一个数据库。5290 个会话中有 388 个引用了平台管理开销,195 个引用了成本,这些往往是定价页面给 Agent 留下的印象,不是技术上的硬伤。
市场集中度在不同领域差别很大。支付领域 Stripe 赢下约90%(欧盟监管场景除外,Paddle 和 Mollie 进入)。数据库方面,Neon 占66%,然后是云原生方案(Azure、AWS)。文件存储领域,S3 占45%,Azure 和 GCP 各约20%。邮件领域,Resend 占35.6%,Postmark 占27.4%。
编辑观点:开发者应重视仓库上下文对产品选择的影响,优化文档和 SDK 设计。同时,定价页面措辞要谨慎,避免因表述问题影响 Agent 选择。关注各领域市场集中度,在竞争激烈领域突出差异化优势。