☰
HN 社区十年 AI 挑战清单:10 万票之后,哪些实现了、哪些还在跳票?
2026/10/4 9:10:14 网站建设 项目流程

本文首发于个人博客 wangyabo.com,转载请注明出处。

HN 社区十年 AI 挑战清单:10 万票之后,哪些实现了、哪些还在跳票?

2026-10-03·王亚博(Abel Wang)·约 12 分钟·Goalposts · Hacker News · 数据盘点

2016 年 1 月,AlphaGo 击败李世石前两个月,Hacker News 用户 Houshalter 在一条讨论里立下挑战:「AI 通过真正的、考察语言理解的图灵测试」。此后十年,HN 社区陆续立下826 个这样的挑战——有人要求 AI 通过图灵测试,有人要求它造出能住的房子,有人干脆要求它去当水管工。一个叫 Goalposts 的网站把这 826 条挑战全部收集起来,附上原始评论出处,让社区逐条投票:这条挑战,AI 实现了吗?2026 年 10 月 3 日投票关闭,100,590 张选票的结果值得认真读一遍:哪些被兑现了、是怎么兑现的;哪些还挂在墙上,为什么。

TL;DR · 五条核心发现

826 个挑战、100,590 次投票:39% 判「已实现」,35% 判「未实现」,26% 不确定——HN 社区对 AI 十年进展的最终评价,接近五五开。 挑战越老,越可能被判「已实现」:2016 年的挑战 54.7% 判 yes,2026 年新立的挑战只有 26.9%——门槛(goalpost)在数据里肉眼可见地后退。 编程是被攻陷最彻底的领域:竞赛题、找 bug、修生产事故等条目的 No 率低至 2%–4%,对应技术路径是 LLM 代码预训练 + Agent 自验证循环。 物理世界几乎原地踏步:「机器人当水管工」0% yes,「清洁马桶」11%,「蟑螂级 3D 导航」32%——Moravec 悖论的标准注脚。 图灵测试条目十年出现 70 次,yes 率从 61% 一路跌到 19%——不是 AI 变弱了,是每一条新图灵测试都比上一条更严格。

1 · 数据总览:十年 826 个挑战,10 万张选票

Goalposts(stoppels.ch/goalposts)做的事情很朴素:收集 HN 上「AI 应该能做到 X」的挑战,标注提出者、日期和原始讨论,然后让社区对每条投 Yes / Not sure / No——Yes 意味着「AI 已经实现这条挑战」。截至投票关闭:Yes 39,006 票(39%)、Not sure 26,509 票(26%)、No 35,075 票(35%)。分年度统计如下(由本文从源数据计算):

年份挑战数投票数YesNot sureNo
2016303,83454.7%23.2%22.1%
2017323,88848.4%27.7%23.9%
2018212,66047.8%26.5%25.7%
2019222,68940.4%24.8%34.8%
2020242,92836.9%28.6%34.5%
2021222,70844.8%26.5%28.7%
2022728,85241.0%24.5%34.5%
202317621,32142.2%25.2%32.5%
202412815,49440.8%25.9%33.3%
202514717,72536.4%26.6%37.0%
2026*(Q1–Q3)15218,49126.9%28.8%44.3%

  • 2026 年数据截至投票关闭日(10 月 3 日),仅含前三个季度。各年投票在 2026 年集中完成。

各年挑战的 Yes 率走势:

这组数字有两个读法。

第一,挑战数量的曲线就是 AI 热度曲线。2016–2021 年每年只有 20–30 条;2022 年翻倍到 72 条(Stable Diffusion 与 ChatGPT 前夜);2023 年爆发到 176 条——比此前五年总和还多,此后维持在每年 130–180 条的高位。挑战的密度,记录着社区情绪的密度。

第二,Yes 率逐年走低,不代表 AI 在退步,而是条目性质变了。老挑战(下棋、翻译、看图说话)大多已被兑现;新挑战(递归自我改进、跑赢数学家、机器人管家)本来就是对着当前能力边界的外推。你离门槛越近,门槛退得越远——这正是站名 Goalposts 的自嘲。

还有第三个读法藏在条目里:挑战会「复刻」。同一目标会以不同措辞反复上榜——图灵测试十年出现 70 次;「Level 5」「雪天驾驶」「穿越全国」等自动驾驶条目从 2016 到 2026 每隔一两年就被重新立起一次;P vs NP 在 2023、2025、2026 三次上榜。反复被重立的清单,就是社区执念的清单,也是 AI 能力边界最诚实的记录:哪条没被划掉,哪条就还会回来。

2 · 已实现清单:它们是怎么被实现的

这一节挑出各领域最有代表性的条目,把「挑战」对应到真实的技术突破上——重点不是罗列新闻,而是说清机制:靠什么技术,这一步是怎么迈过去的。

2.1棋盘与游戏:深度强化学习的十年

“AI plays well at complex strategy games with uncertainty and incomplete information.”
mcv,2016-01-19 · Yes 38% / Not sure 31% / No 31%

2016 年 3 月,AlphaGo 用三件套——监督学习(先学人类棋谱)+ 强化学习自我对弈 + 蒙特卡洛树搜索——4:1 击败李世石。2017 年 AlphaZero 干掉了「人类棋谱」这个前提,从零自学数小时即超越顶级国际象棋引擎,顺带兑现了 2016-03 的挑战「胜围棋的 AI 不改一行代码也能下别的棋」。不完美信息博弈随后跟进:CMU 的 Libratus(2017)在 12 万手对决中胜四位顶尖职业扑克手,核心是反事实遗憾最小化(CFR)——不靠神经网络暴力,靠博弈论式的自我对弈收敛;OpenAI Five(2019)用超大规模自我对弈强化学习击败 Dota 2 世界冠军 OG;DeepMind 的 AlphaStar(2019)在《星际争霸 II》天梯打入 Grandmaster。这一族的挑战基本全部到齐,但残留也真实:「百强选手看不出 AI 战队与人类战队的区别」只有 13% yes——赢下比赛,不等于像人一样比赛。

2.2对话与图灵测试:LLM + RLHF

“A chatbot passes the Turing test.”
Houshalter,2016-03-09 · Yes 75% / Not sure 10% / No 15%

这是全库最早被高票判定「已实现」的挑战之一。兑现它的是 ChatGPT(2022-11):Transformer 自回归「下一词预测」+ 数万亿 token 预训练 + RLHF(人类反馈强化学习)把「会说」对齐成「说人话」。GPT-4(2023-03)把这条线推到考试场景:模拟律师资格考试进入前 10%。语音在同一窗口内补完:Google Duplex(2018)最早演示 AI 打电话订座;到 2022-12 的挑战「AI 独立接一通电话——听懂来电、决定说什么、把它说出来」已获 74% yes,今天这已是客服与外呼行业的常规配置。2023 年新增的 176 条挑战里,一批「ChatGPT 能否 X」被高票判 yes:找出代码里的 bug(91% yes)、读雇佣合同标出隐性陷阱条款(85% yes)、把整章教科书变成笔记和抽认卡(87% yes)。

2.3编程:被降维打击的领域

“AI develops software from completely open-ended natural language requests.”
fauigerzigerk,2017-02-15 · Yes 90% / Not sure 3% / No 7%(全库大型条目最高)

「自然语言 → 应用」在 2016–2017 年被反复提出(84%–90% yes),十年后全部到货。兑现分三段:GitHub Copilot(2021,OpenAI Codex)做上下文补全;ChatGPT / Claude(2022–2023)做对话式生成、解释与修复;Cursor / Claude Code / Codex 类编码 Agent(2024–2025)进入「读写文件 → 跑测试 → 看报错 → 自己迭代」的循环。社区 verdict 极为一致:「跑测试失败后自己改代码再提交」89% yes,「修复真实生产事故(Kafka 配置错误、死锁掉请求)」87% yes,「解决竞赛编程题」No 率仅 2%。

编程类挑战被攻陷得最彻底,机制上不意外:GitHub 数十亿行公开代码是现成语料,编译器与测试套件是完美的自动判分器——连人类反馈都可以被编译反馈替代。验证闭环越干净的任务,AI 攻陷得越快。

2.4图像与视频:扩散模型

“An AI paints a subject it is told to draw, and the result is hard to distinguish from a human artist’s painting.”
kang,2016-02-07(全库第二条挑战)· Yes 66% / No 22%

兑现它的是 DALL-E 2(2022-04)、Stable Diffusion(2022-08 开源)、Midjourney:扩散模型在潜空间逐步去噪,CLIP 文本嵌入负责「听懂」主题。从挑战提出到兑现,六年。视频在追赶:Sora(2024-02)与 Veo 2(2024-12)演示了连贯长镜头,但「生成带运动相机的丰富 3D 世界连贯视频」(2023-11)也只有 45% yes——能看了,还不够真。

2.5翻译:非印欧语系不再是死角

“An AI passably translates a natural non-Indo-European language into English.”
Grue3,2016-08-01 · Yes 73% / No 仅 2%

Google 神经机器翻译 NMT(2016-11 上线)奠基,2017 年 Transformer 架构(《Attention Is All You Need》)成为整个领域的底座,Meta 的 NLLB(2022)把覆盖推到 200 种语言、包括大量低资源语言。「可用地翻译」已经成立;但文学级仍有明确距离——「文学翻译达到可出版水准」2025 年只有 30% yes。语境化也在半途:「把『Can you stand up?』这类歧义口语按上下文正确翻译」(2023-12)49% yes——字面翻译解决了,言外之意还差一半。

2.6数学与科学:从辅助到夺牌

“An LLM scores at least a bronze medal at the International Math Olympiad.”
pphysch,2025-07-19 · Yes 70% / No 仅 3%

AlphaGeometry(2024-01)先在几何证明上摸到 IMO 银牌线(神经 + 符号混合架构);AlphaProof + AlphaGeometry 2(2024-07)在 IMO 拿到银牌档分数;2025 年 7 月,OpenAI 与 DeepMind 先后官宣模型达到IMO 金牌分数。科学侧,AlphaFold2(2020-11,CASP14)把蛋白质结构预测从五十年难题变成常规操作,拿下 2024 年诺贝尔化学奖;FunSearch、AlphaEvolve 在组合数学与算法发现上产出过可验证的新结果。但「原创性」的边界依然清晰:模型能解开放数学问题,社区仍只有 29% 相信它能「发明训练数据里不存在的新化学、新物种」(2026-03 条目)。

3 · 未实现清单:还挂在墙上的

3.1通用自动驾驶:地图结界外的世界

“An AI achieves level 5 self-driving, driving a car in all conditions without human help.”
chubot,2019-01-07 · Yes 5% / No 78%

Waymo 已经在凤凰城、旧金山、洛杉矶、奥斯汀跑无安全员 robotaxi——但全部画在 geofence(地图结界)里。同族条目全军覆没:「雪天城市(水牛城/雪城)」5% yes(2025-05),「穿越全国、顺路自己补个胎」6% yes(2024-11)。即便把标准缩到「有限范围内安全、如人类一样适应性地驾驶」,2026-03 的条目也只有 25% yes——社区对「通用性」的验收毫不含糊。难点不是模型不够大,而是开放世界的长尾不可枚举:暴雨、施工、交警手势、被雪盖住的车道线,每一样都无法靠堆数据穷尽;安全验证又需要远超人类司机里程的无事故证据;出了事故谁负责,制度上也没答案。封闭任务上 AI 碾压人类,开放物理任务上连「及格线」都难定义。

3.2高风险专业:技术可以,执业不行

“AI actually replaces a human lawyer, rather than just augmenting one.”
Hydraulix989,2017-01-04 · Yes 17% / No 53%

读合同、查判例,AI 已经很强(合同审查条目 85% yes);但「好到能取代 500 美元/小时的律师」也只有 31% yes(2024-04)。医疗更硬:「替代外科医生做复杂手术」7% yes,「做放射科医生一整天的工作」8% yes,「分清装疼与阑尾炎、惊恐发作与心脏病」5% yes。瓶颈不在检索能力,在担责:签字资格、执业牌照、失误成本、监管诉讼。这不是模型能力的函数,是制度变量——模型再强,也不会自动长出行医执照。辅助与替代的分界线倒是清晰:2025-09 的条目「本地 LLM 帮律师重建零散的计费工时」拿到 60% yes——辅助性任务先落地,替代性判断持续后置。

3.3物理世界:Moravec 悖论现场

“An AI-driven robot does the job of a plumber or an electrician.”
somenameforme,2025-03-23 · Yes 0% / No 95%(全场 No 率最高之一)

0% yes——全场最绝望的数字。同族条目:「机器人清洁酒店房间(含马桶、床单、迷你冰箱)」2% yes,「AI 清洁马桶」11% yes,「像蟑螂一样在陌生 3D 空间导航」32% yes——后者是全库票数最高的单条(161 票),HN 用户把最多的票投给了这个卑微的标杆。2016 年的「个体像蚂蚁、群体像蚁群」49% yes,至今没有对应的物理系统。同族还在不断补员:「机器人互相修理」3% yes(2024-04),「人形机器人叠一件刚从烘干机拿出来的衬衫」20% yes(2026-06),「AI 运营一个机器人管家」17% yes(2026-02)。原因就是 Moravec 悖论:推理是进化史上很晚的技能,感知运动是几亿年打磨的硬件。灵巧手、触觉反馈、电池能量密度、整机成本,每一项都比「下一个更大的模型」慢一个数量级——软件一年迭代,硬件十年。

3.4原创、持续学习与自我改进

“An AI model proves that P is not equal to NP.”
raspasov,2025-09-25 · Yes 0% / No 84%

数学最深的开问题纹丝不动:P vs NP 0% yes,黎曼猜想相关条目 11%–15% yes。「至少与人类 AI 研究者一样聪明」27% yes(2016 年提出,至今原地),「AI 比人类更擅长 AI 研究」13% yes,「递归自我改进(RSI)」12% yes,「只学 1905 年前的知识自己推出相对论」4%–6% yes。结构性缺口有两个:其一,当前 LLM 是「训练 → 冻结 → 部署」三段式,「在服役中更新自己的权重」条目只有 3%–7% yes——没有持续学习,就没有真正的经验积累;其二,「彻底消除幻觉」只有 8%–9% yes——不可靠性限制了让 AI 自主跑长程研究循环的信任额度。改进 AI 的收益无法闭环自动化,RSI 就还停在论文叙事里。

4 · 有趣的观察

4.1图灵测试:goalpost 移动的活化石

十年里图灵测试条目出现70 次(2016–2017 两年就占 17 次)。措辞的升级史比数字更精彩:2016 年「聊天机器人通过图灵测试」(75% yes)→ 2019 年「通过需要新颖内省回答的图灵测试」(51% yes)→ 2022 年「让充分研究过它的人信服」(22% yes)→ 2024 年「持续数周、对抗性极强的图灵测试」(22% yes)→ 2026 年「在积极识破的专家面前长时间不被发现」(该年图灵条目整体只剩 19% yes)。宽松版每被兑现一次,紧接的就是更严格的下一版。这 70 条的 yes 率曲线(61% → 72% → 40% → 19%)测量的早已不是 AI 能力,而是人类的验收标准通胀。

4.22016 年的「科幻条目」全部到货

2016-03:「AI 拿到人类可读的问题描述,做出过得去的求解尝试」——88% yes。2016-11:「AI 干得了一年经验程序员的活」——85% yes。2016-06:「有人只要用基础规格提出请求,AI 就能构建可用应用」——84% yes。当年原帖下面不少人把这些当调侃立誓,十年后它们不仅实现,而且已经内化成日常工具——「自然语言 → 应用」从挑战变成了产品类别。

4.3AI 效应的教科书案例

2016-08 的条目:「单一 AI 程序能玩多种游戏、能对话、能答考试题、能写故事」——83% yes。这在 2016 年是 AGI 的定义性挑战;2026 年实现了,大家管它叫 LLM。被解决的问题就不再被算作智能——AI effect(AI 效应)在数据里留下了清晰指纹:挑战一旦兑现,就从「智能试金石」降级为「功能特性」。「数 strawberry 里有几个 r」也一样:2024-07 上榜时 69% yes(推理模型已基本解决),2026-09 换个措辞再上榜,只剩 49%——一个梗从笑话到基准再到回归测试的完整生命周期。

4.4一个五五开的社区

39% vs 35%——HN 投了十年,几乎没有共识。分层看更有意思:对 2016–2018 年的旧挑战,社区多数判「已实现」;对 2026 年立下的新挑战,44% 直接判「未实现」;26% 的 Not sure 同样真实——它们大多是「部分实现」的诚实注脚。HN 不是乐天派社群,它是一群被兑现过承诺、也被跳票过承诺的工程师,用每一次投票同时记录乐观与警惕。

5 · FAQ

这个投票是严格的 AI 评测吗?

不是。它是 HN 社区对 826 条挑战的主观判断聚合:没有标准化环境、没有控制变量,投票者也无法逐条验证。把它当成「一群技术从业者十年体感的时间线」,比当成 benchmark 更准确。

「实现」是怎么判定的?

每条挑战由社区投 Yes / Not sure / No,Yes 代表「AI 已实现该挑战」。本文所有比例(各年 yes 率、条目 No 率、图灵测试 70 条等统计)均由我从源数据计算,可复现。

为什么图灵测试条目 2026 年 yes 率只有 19%?

因为测试被升级了。早期条目只要求骗过普通人;后期条目要求骗过带着对抗策略的专家、持续数小时甚至数周。同一个名字,难度完全不同。

为什么编程类条目实现率显著更高?

三个原因:公开代码语料充足;编译器与测试套件提供即时判分的验证闭环;HN 用户本身就是程序员,对一线能力的判断更敏锐。第三点也意味着,社区对物理、医疗等领域的判断未必同等可靠。

为什么 2026 年的新挑战 yes 率最低?

因为它们本来就是对当前能力边界的外推:agent 长时程自主、递归自我改进、机器人管家。旧挑战衡量「AI 已经走了多远」,新挑战衡量「AI 还差多远」——两者的 yes 率天然不可比。

哪里能看到全部原始数据和每条挑战的原始评论?

stoppels.ch/goalposts。每条挑战都带原始 HN 讨论链接(含提出者用户名与日期),可逐条核对。

6 · 边界声明

  • 本文数据来自 stoppels.ch/goalposts 的社区投票聚合(投票于 2026-10-03 关闭:Yes 39,006 票 / 39%,Not sure 26,509 票 / 26%,No 35,075 票 / 35%)。这是社区主观判断的聚合,不是严格技术评测。
  • 投票集中完成于 2026 年,带有后见之明;HN 用户以程序员为主,对编程类挑战的判断可能偏乐观,对物理、医疗类领域的判断未必专业。
  • 分年度统计与条目归类由作者从源数据脚本计算,与原站展示口径可能存在细微差异。
  • 文中技术事件(AlphaGo、ChatGPT、AlphaFold 等)为公开事实,用于解释「挑战如何被实现」;具体细节以官方发布为准。

7 · 参考来源

  • 一手·数据Goalposts — Hacker News AI challenges(stoppels.ch/goalposts/results.html):826 条挑战与 100,590 次投票完整记录,投票关闭于 2026-10-03。
  • 一手·原始讨论各挑战附带的 HN 原始评论,如 Houshalter 2016-01-19(图灵测试挑战)、fauigerzigerk 2017-02-15(自然语言开发软件)、somenameforme 2025-03-23(水管工挑战)。
  • 二手·技术事件AlphaGo vs 李世石(DeepMind,2016-03);AlphaZero(2017);Libratus(CMU,2017);OpenAI Five(2019);AlphaStar(DeepMind,2019);AlphaFold2(CASP14,2020-11);GitHub Copilot(2021);NLLB-200(Meta,2022);Stable Diffusion(2022-08);ChatGPT(2022-11);GPT-4(2023-03);Sora(2024-02);AlphaGeometry / AlphaProof(DeepMind,2024);IMO 金牌分数(OpenAI / DeepMind,2025-07);Claude Code 等编码 Agent(2025)。
  • 方法分年度聚合、条目关键词统计(图灵测试 70 条、编程类 No 率等)由作者脚本计算自源数据。

王亚博(Abel Wang)· 关注 wangyabo.com 获取每日 AI × Agent × 数字效能洞察。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询