AI 给自己设计了一块芯片,跑 10 个大模型:瓶颈居然不在算力
大厂们正在把几百亿美元砸进 GPU 集群,堆算力、堆电、堆带宽。
而在 GitHub 上,有个仓库走的是另一条路:指令集、编译器、模拟器、SystemVerilog 硬件,全由 AI 代理参与设计,最后焊进一块真实的 PCIe 卡里,跑 10 个模型。
它叫 openTPU,在 Hacker News 上拿了 251 分、308 条评论(讨论帖),仓库目前 248 颗 star(GitHub)。它的前身是同一个人做的 auto-arch-tournament,那是一个让 AI 代理互相比赛做架构的 tournament。
这个项目只问两个问题:AI 代理在硬件设计上到底能走多远,能不能造出一块跑自己推理的芯片。
先看清楚它不是什么
它不是一个 PPT,也不是一个只跑仿真的玩具。
整个加速器住在一个可以「从头读到尾」的 monorepo 里:SystemVerilog 写的硬件、自己定义的指令集、比特级一致的 ISA 模拟器、一门内核语言和它的编译器,以及驱动真实 PCIe 卡的主机程序。README 里的分层图很直白——上面是 Python 内核,往下是编译器、ISA、模拟器与 RTL,再往下是 FPGA 板卡,最后是主机软件。
它甚至刻意做得很简单:没有缓存,没有隐藏调度,每一次数据搬运都是一条指令。所以一次运行的 trace 就能解释它为什么快——这在一个「性能玄学」满天飞的领域里,反而稀有。
成绩单:一块 Kintex-7 卡,10 个模型
硬件是一块 Inspur YPCB-00338 卡,Xilinx Kintex-7 xc7k480t,两路 DDR3,峰值 17.1 GB/s。跑的是真权重,不是随机初始化。
int8 权重下的解码速度,挑几个看(实测数据与测量方法):
- LFM2.5-230M:59.0 tok/s
- Qwen3-0.6B:21.6 tok/s
- Qwen3.5-2B:8.02 tok/s
- SmolLM3-3B:5.00 tok/s
表下面有一句话比所有速度都值钱:卡上产出的 token 和模拟器比特级一致。硬件和软件模型互相验证,claim 才有底。Mixture-of-Experts 模型也能跑:LFM2.5-8B-A1B(85 亿参数、激活 17 亿)10.6 tok/s,专家不命中时从主机存储流式补进卡的 DRAM 槽位。
瓶颈不在算力,在内存带宽
README 里最诚实的一句是:解码是 DRAM 受限的。
每生成一个 token,就要把所有权重从内存里读一遍。卡上实测吃到了 DDR3 峰值的 82%–94%。也就是说,这台机器大部分时间在等内存,不是在算。
于是最大的加速空间,不在乘法器,而在「少读点字节」。
他们把 4-bit 权重一路做进了 ISA、模拟器和矩阵单元(docs/quant.md):格式是 FP4(E2M1)+ 两级块缩放,每权重 4.25 bit。质量上接近 NVIDIA 的 NVFP4(4.5 bit),明显好于 MXFP4,在三个小模型上对 fp32 的平均 KL 是 0.19 / 0.16 / 0.12。
代价也写清楚了:0.2B–0.8B 这种小模型上,4-bit 让困惑度从 23.5(fp32 与 int8 一致)涨到 28.3。省三分之一字节、解码快 40%–45%,精度损失明码标价——这种「把代价摆在台面上」的写法,比只报最好看的那一栏可靠得多。
评论区在吵另一件事
HN 上最热的那个问题,来自一个自称「软件人」的网友:为什么大厂不干脆把前沿模型烧进芯片?
回答相当现实:
- 模型 SOTA 迭代比芯片设计和流片快(zdragnar):你得锁定某个模型好几年才回本,同时还得继续烧钱追新模型。
- 拿掩模是真门槛(thesz):掩模开发常常要半年,且产线产能紧张,实验性项目很难排上队(skeskinen)。
- 有人举反例(ohazi):Taalas(官网)就在做 model-on-a-chip,8 个月前宣称第二代硅平台会是一款中等规模的推理 LLM,后来据称被 AMD 收购(slowin)。
- 也有人纠正误区(voxelghost):FPGA 并不是「更快」,频率通常不高,片上内存也比同价位 GPU 少,快慢取决于你的布局设计。
这场争论其实解释了 openTPU 的价值:它不指望赢过 GPU。它把「从 Python 里的一次 matmul,到板卡上的每一根线」整条路径摊开给你看,还配了个 profiler(Lens),可以在浏览器里回放一个 Qwen3 解码步,把 floorplan 上每个单元在每个周期是在忙、在等 DRAM、还是在等另一条指令全画出来。
写在最后
看得越细越会发现,这类项目的价值不在跑分。
它把三样东西放上同一张桌子:一套让 AI 参与硬件设计的流程、一份比特级可验证的实现、一台「慢但完全透明」的机器。对做推理优化的人来说,最后一样可能比多 20% 的吞吐更有用——因为你清楚每个周期去哪了。
想上手的话,除了那块卡,其余部分都能在笔记本上跑:pip install -e .,下个小模型,otpu-chat --backend isa就能在模拟器里对话(仓库)。