这两年但凡是做AI基础设施的人,聊到算力瓶颈,几乎都绕不开“光计算”。GPU堆到单卡四五百瓦,机柜里的散热方案越来越夸张,而模型参数还在肉眼可见地膨胀。很多人第一次看到光计算芯片论文时的第一反应是:这东西能做出来,但离真正能用,恐怕还有十万八千里。胡小永、杨起帆、龚旗煌等团队发表在eLight上的可重构多功能集成光计算芯片,就是把这个问题往前推了一大步的核心工作之一:同一颗芯片,可以被程序配置来做不同的光学运算功能,而不只是对单一任务进行硬编码。这篇文章我想用做硬件和计算架构的视角,把这个工作背后的几件事彻底拆开聊一聊:为什么可重构这么关键、芯片里的光学单元到底怎么实现“编程”、以及从这颗芯片到真正的产品,中间还横着哪些坑。
1. 算力瓶颈的本质:为什么大家开始认真押注光计算
先说一个很多人忽略的事实:传统电子芯片的算力增长,这些年其实是靠“堆量”硬撑过来的。单颗芯片的面积越来越大,互联层数越来越多,但单位面积上能跑出的性能增长,早就没有过去那种指数级的想象力了。在这个背景下,光计算被反复提起,不是没有道理的。
1.1 摩尔定律放缓背后的三大电学瓶颈
电子计算机的运算能力之所以撞墙,核心原因可以拆成三个,这三件事都跟“用电子搬运信息”这件事本身有关。
第一是功耗密度。晶体管越小,单位面积发热越集中,而电子在导线里流动本身就有电阻损耗。到了7nm以下工艺,漏电流问题越来越难压,芯片的功耗密度已经接近物理极限。一个直观的数据:主流AI加速卡的单卡功耗早就超过400W,很多在做大模型训练的公司,机房建设成本有一大半要花在散热和供电上。换句话说,我们不是没有算力,而是算力的“热成本”已经贵到离谱了。
第二是互联带宽。电信号传输有一个天然的困境:导线间距越小,串扰越大;频率越高,损耗越严重。你可以把PCB和芯片内的金属当作一根根“水管”,电信号就是水,频率高了水波容易互相干扰。所以电子芯片想要提高吞吐量,要么加通道数,要么提频率,而两个方向都面临严重的物理约束。
第三是时间延迟。电子芯片做数据搬运时,信号在导线里的传播速度受介电常数影响,远低于光速。大规模芯片内部的全局互连,有时候时延占比比计算本身还要高。这也是为什么AI计算要拼命搞片上存储器、搞近存计算——很大程度是在跟“电线太长”做斗争。
这三个瓶颈叠加起来,结论其实很清晰:电子计算不是不能继续涨,但每一分算力增长都要付越来越夸张的功耗和成本代价。
1.2 光计算真正擅长的领域:线性代数而非通用逻辑
这里必须讲清楚一个点:光计算从来不是要取代CPU或者GPU去跑各类通用指令,它擅长的其实是深度学习推理背后那类大规模线性代数运算。
人工智能模型里最吃算力的运算,本质上是矩阵乘法和卷积,也就是一堆乘加操作。而光学的“本性”恰恰是做线性操作:一束光进入一个干涉结构,分束、叠加、干涉,这个过程天然就是在执行线性变换。你可以把光路理解成一个“不用通电的模拟计算器”,它一次性对国家级的矩阵运算做并行处理,而不需要像电子芯片那样逐时钟周期地取数、计算、存回。
更关键的是,光的干涉本身就是复数域操作,也就是同时携带振幅和相位信息。传统电子芯片计算复数值要拆成两路实值分别处理,而光学系统用一个物理量就能自然承载。对信号处理、光学层析、部分通信算法这类本来就在复数域工作的任务来说,光计算可以说是“降维打击”。
当然光计算也有很明显的短处:非线性操作很难做,精度目前赶不上数字电路,存储运算结果也麻烦。所以整个业界对光计算的共识是,它要跟电子系统配合,光学做的是矩阵运算这类“重活”,电子负责控制和逻辑,而不是彻底替代电子。
2. 可重构设计的价值:一台能编程的光学处理器,而非一堆专用光芯片
理解了光计算为什么有前途,接下来就要面对一个尴尬的问题:过去十几年,学术界做出了很多种光计算芯片,主流模式是“做一个功能,投一次版,流片回来调几个月”。这种模式最致命的地方在于,每个功能都得重新设计一版芯片。
2.1 专用光芯片的老问题:功能固定、成本高、升级难
在可重构光计算芯片出现之前,大部分光神经网络芯片的架构是这样定的:假设我要做一个手写数字识别网络,我会先确定网络有几层、每层多少神经元、每层权重是什么,然后把权重矩阵“雕刻”进芯片的光学结构里。比如用一组固定分束比的定向耦合器、固定长度的相移器,让光一进去就能按预设的权重干涉出结果。
这种方案在实验室里效果不错,因为它把最难的部分——芯片制备——一次性搞定,后面只需要对准、耦合、测量就行。但它有三个非常现实的困扰。
第一个是应用场景变了就得重新投片。你今天做MNIST能用,明天客户说要跑语音识别,矩阵规模不一样、网络拓扑不一样,整块芯片作废。第二个是非线性变化无法适配:算法每层权重是训练出来的,模型微调之后芯片就得改版。第三个则是制造成本被极度放大,每次流片都是高额成本,小规模团队根本玩不起。
所以光计算从实验室走向实用,第一步必须解决“通用性”问题。而通用性的答案,在最底层就是可重构。
2.2 “可重构”到底重构了什么
可重构光计算芯片里的“重构”,不是在软件层面换个函数库,而是从物理层面改变光信号运算的行为。
这套系统里通常有一排排光学干涉单元,叫马赫-曾德尔干涉仪,也就是MZI。每个MZI里面都带一个相移器,通过加电压或电流改变材料折射率,就能控制两束光的相位差。也就是说,每个MZI单元就不再是固定分光比的静态器件,而是一个“光学权重旋钮”。当你把这些旋钮组合在一起,整块芯片就成了一个大尺寸的光学矩阵处理阵列。
外部再配一个电控系统,把已经训练好的神经网络权重矩阵映射成每个相移器上的一组电压,这组电压会带动热光调制或载流子注入调制,把权重写进光路里。之后你输入一组光信号,芯片前向传输一遍,输出光信号经过相干探测,就得到了一次矩阵-向量乘法的结果。
这个思路类比一下就很清楚了。传统专用芯片就像一块印刷好的电路板,焊点焊死了,改功能等于重新制版。可重构图芯片更像一台示波器:前面板上有无数旋钮,仪器本身能做很多种测量,你要什么功能就按什么旋钮。
2.3 多功能不是“叠加”,而是同一套资源在不同配置下的复用
团队这项工作的另一个关键词是“多功能”。这个多功能不是说芯片里同时放了三套独立的光学电路,分别干三种事,而是同一套光学单元,通过不同的相位配置,可以完成完全不同的运算功能。
这是一个非常聪明的资产复用思路。同一组MZI阵列,当我把相移器设置成一组特定的正交矩阵参数时,它能做离散傅里叶变换;换一组参数,它就变成了一个卷积神经网络的全连接层;再换一组参数,它又可以执行逻辑门运算或者多通道信号处理任务。这背后的数学原理并不复杂:MZI阵列本质上就是一个可编程的线性变换网络,只要调节参数量足够大,它能表示的线性变换空间就非常广。深度学习、信号处理、光学计算里面经常用的傅里叶变换、小波变换,本质上都是某一类特定的幺正矩阵,而这套可编程线路可以通过配置把这类矩阵精确地实现出来。
这样的设计让晶圆面积得到了最大程度利用,也让同一颗芯片可以在不同时刻服务于不同任务,非常契合数据中心里面多业务并存的真实需求。
3. 芯片内部的技术原理拆解:光学单元如何完成可编程计算
说清楚了宏观思路,接下来就到了技术细节层面:这颗芯片到底是怎么工作的。
3.1 MZI:可编程光学计算的最小积木
MZI的前半段是一个50:50分束器,把输入光分成两路,一路经过一个可以调节的相移器,然后两路在第二个50:50分束器处重新合束。两束光相位差不同,合束后的输出功率分配就不同。所以你只要控制相移量θ,就能连续调节这一级MZI“透过去多少、拐弯多少”,这个比例就可以用来编码一个权重的实数部分。
在理论仿真里,一个无损MZI的传输矩阵通常可以写成这样:
import numpy as np def mzi_matrix(theta): """ 简化版MZI传输矩阵。 theta是顶部相移器的相位值,单位rad。 输出是一个2x2矩阵,本质上是某个特殊酉矩阵。 """ half_split = np.array([ [np.sqrt(0.5), 1j * np.sqrt(0.5)], [1j * np.sqrt(0.5), np.sqrt(0.5)] ]) phase_shift = np.diag([1.0, np.exp(1j * theta)]) return half_split @ phase_shift @ half_split # 举例:相移量为pi时,光基本从另一条臂输出 print(mzi_matrix(np.pi).round(4))看到这里你就明白了,一个MZI就是个“光学权重旋钮”,可以连续调节输出比例。但一个旋钮只能做一个标量乘法,想要计算一个矩阵乘法,得把非常多的MZI单元串成一个网格。
3.2 从单单元到大规模阵列:权重矩阵如何映射进光路
光计算芯片里最经典的网络结构是“三角阵列”或者“矩形阵列”。这两种结构本质上是把任意一个N×N的酉矩阵分解成N(N-1)/2个MZI单元的级联。
这个思想在光计算领域非常出名,它基于线性代数里一个古老的分解定理:任何一个酉矩阵,都可以分解成一串Givens旋转矩阵的乘积。每一个Givens旋转矩阵,恰好也就对应一个MZI的传输特性。所以整套流程非常清爽:训练软件端取得目标权重矩阵W,先将它做矩阵分解,得到一系列MZI相移参数;然后把这些参数转换成电压,写入电路;输入光信号后,芯片直接硬件执行矩阵乘法。
这里值得多说一句:为什么一定是这样的分解?因为物理上的光波导只能做局部耦合,不能直接让第1号输入和第8号输入在任意位置发生干涉,必须通过一层一层局部结构拼出全局的矩阵变换。这个道理跟数字芯片里的“全连接层通过大量乘法器拼出来”是完全一致的。
3.3 复数权重的天然优势与“负数”问题
电子芯片做AI推理时,处理负数需要单独的符号位和电路逻辑,而光计算里,负数的表达本质上是相位。比如把相位旋转π,光场振幅就变成了原来的一半再取负值。干涉过程中,同相叠加增强、反相叠加削弱的物理现象,天然实现了正负数的加减运算。
更进一步,光计算还能天然表达复数权重。复数在深度学习和信号处理里有大量应用场景,比如光学相干层析、雷达信号处理、频域均衡器,都天然工作在复数域。电子芯片做复数乘加,消耗四倍甚至更多的乘法器资源,而光学芯片只要调调相位,一个物理过程就完成了。这是光计算最惊艳的优势,但也是引出一堆工程麻烦的地方——因为相位控制精度,直接决定了计算结果对不对。
3.4 相位校准与反馈控制:可重构背后的隐形工程
写进论文里的可重构芯片,看起来很美:配置电压,改个相位,功能就变了。但实际用起来,最头疼的就是相位的可靠性。
硅光波导对温度极其敏感,温度每变化1℃左右,光在波导里走过的相位可能就漂移好几度。你上午校好的矩阵,下午机房空调温度变了,计算结果就可能开始出错。所以真实的可重构光计算芯片,外围必然要搭配一整套监控和反馈系统。常见做法是在芯片上设计一些辅助的“监控光探针”,周期性地输入已知校准信号,然后根据输出偏差实时修正相移器电压。
这一步做得好不好,决定了芯片是“实验室能跑通”还是“工程上能稳定用”。胡小永、杨起帆、龚旗煌团队这次的工作之所以受到关注,很大程度就是在可重构的稳定性和功能切换的速度上做出了实质性的验证结果,而这两点恰恰是过去很多论文选择性忽略的部分。
4. 主流光计算技术路线对比:为什么可重构MZI路线值得关注
光计算芯片不是只有MZI这一条路。目前学术界和产业圈里比较主流的路线,大致还有微环阵列、相变材料、衍射光学元件和散射介质这几种。放在一起对比,会更容易看出可重构MZI方案的位置。
4.1 微环谐振器阵列路线
微环阵列是另一种非常热门的方案。微环是一个环形波导,当满足谐振条件时,特定波长的光会在环里不断循环,和直通波导里的光发生干涉。通过热光调谐微环的谐振波长,就能实现权重编码。
微环方案的优点在于功耗低、单位面积更小,适合做大规模集成。但它对制造精度和温度控制极其敏感,一个微环的谐振波长偏移一点点,整个阵列就乱套了。更麻烦的是,微环的频谱响应是周期性的,对波长使用限制较大,这让它在多波长并行计算上有优势,但也使得系统设计复杂度上了一个台阶。
4.2 相变材料与忆阻光开关路线
相变材料路线比较新,它利用的是硫系化合物等材料在不同相态下的折射率差异。材料在晶态和非晶态之间切换时,光学性质会产生巨大变化,相当于一个“光学的非易失存储器”。
这类芯片最诱人的地方是:权重写进去之后不需要持续供电维持,掉电不丢失,还能长期稳定。不过目前的问题也很明显,相变前后的损耗较大、相变速度受限、可擦写次数还有待提升。它更像一个“光学存储计算一体”的长期方向,短期做成大规模商用芯片还有距离。
4.3 衍射光学与散射介质路线
衍射光学路线在学术界同样很受欢迎,它通过设计多层相位掩膜板,让光经过薄膜后直接产生特定的衍射图案,相当于把神经网络的权重分布在空间上。这一路线优点是可以很容易做三维大规模并行,但缺憾是:相位掩膜板一旦加工完毕,就很难再调节。也就是说,这类方案天生固定功能,几乎不具备可重构能力。
4.4 一条表格看清几条路
我顺手整理了一张表格,方便对比:
| 技术路线 | 可重构性 | 主要优势 | 主要挑战 | 适用场景 |
|---|---|---|---|---|
| MZI阵列 | 强(软件可调相位) | 精度高、功能丰富、基于成熟硅光工艺 | 尺寸大、控制复杂、功耗较高 | 通用矩阵运算、神经网络推理 |
| 微环阵列 | 中(可调谐振) | 面积小、集成密度高 | 温度敏感、制造容差严 | 大规模线性变换、滤波 |
| 相变材料 | 中(非易失) | 功耗低、掉电不丢失 | 寿命、损耗、速度受限 | 专用存储内计算 |
| 衍射/散射介质 | 弱(固定掩膜) | 高吞吐、低成本 | 功能固化、无法更新 | 专用光学加速硬件 |
从这张表能看出来,MZI路线在“通用性”和“工程成熟度”之间取得了比较好的平衡。它不需要像微环那样对付超窄带宽谐振,也不需要像相变材料那样等待材料科学突破,唯一的代价就是芯片面积和一整套高精度驱动电路,而这些在当前的半导体工艺条件下是可以承受的。
5. 从论文到量产:集成光计算芯片工程化的真正门槛
每次看完这类论文,很多人都会兴奋地觉得“光计算马上要替代GPU了”。我的看法向来比较冷静:论文证明了原理和核心工艺可行性,但从样品到产品,还有好几道硬门槛要跨。这里挑几个最要命的说说。
5.1 封装与耦合:芯片外光子进出的第一道难关
集成光计算芯片再强,计算也必须由外部光源输入光信号。那么问题来了:自由空间里的光,怎么进入只有几个微米宽的硅波导,且损耗要尽量低?
目前常用的方案是端面耦合和光栅耦合。端面耦合器做得比较准的时候,耦合损耗可以压到每端1dB以内甚至更低,但这对光学封装精度要求极高,纳米级别的错位都会带来明显劣化。光栅耦合器对对准精度要求稍低一些,但带宽窄、损耗稍大。
更叫人头疼的是多通道并行。如果你想用多个波长或空间模式同时输入,那封装时要对准的不再是一根光纤,而是一排密集光纤阵列。这一排位置偏差要在亚微米级别才有戏。很多实验室芯片测试时能跑出好效果,但一到产业级的量产封装环节,良率立刻掉得让人怀疑人生。
5.2 热漂移与相位稳定性:光学编程的“记忆”难题
硅的热光系数很高,温度稍微变一变,材料折射率就跟着变,光程差随之漂移。MZI可重构芯片要在环境中长期工作,就必须把相位锁定在设定值,否则你调的权重“记不住”。
我见过不少团队踩过这个坑:仿真的时候权重矩阵写得明明白白,上芯片实测时,校准完一个小时再测,精度就掉了两三个比特。解决办法只有两个方向,要么靠温度控制把所有波导稳定在同一个温度点,要么靠实时反馈调节。前者会推高系统功耗,后者需要额外的监控光路和高速控制电路。现实中的系统通常是两套方案混合使用:粗调靠温控板,细调靠反馈回路。可重构光芯片真正成熟之前,这一关谁都绕不过去。
5.3 驱动电路与调度软件:光芯片要配一个电控大脑
你可能想不到,一颗光计算芯片真正的调试工作量,有一半以上其实是在电学部分。几千个MZI单元就需要几千路控制电压或电流,每一路都要求低噪声、高稳定、可快速更新。这些DAC通道如果设计得不好,电源纹波会直接耦合到相位调制器上,导致计算噪声飙升。
另一方面,权重写入算法也不能随便应付。把一个N×N的矩阵分解成MZI相位参数,需要做矩阵求逆和奇异值分解,这里面有数值误差;更麻烦的是每个MZI的实际相移曲线不是理想的直线,存在非线性失真,所以每颗芯片出厂前都要做一次“标定”,把控制电压和实际相位之间的对应关系建表存入驱动系统。这一步做得越精细,芯片的计算精度就越高。
说句实话,现在做光计算芯片的团队,招人的时候最难找的既不是光学工程师也不是深度学习科学家,而是能写低延迟调度算法、同时能画高精度模拟电路的多面手工程师。
5.4 良率、测试与成本:被忽视的产业现实
硅光本身的模态透镜芯损耗已经很低,工艺成熟度也在不断提升,但大规模MZI阵列对整颗芯片的均匀性要求极高。一个阵列里哪怕只有几个单元的相位响应异常,整个矩阵精度就会受到显著影响。这意味着晶圆级测试必须覆盖海量相位控制通道,测试时间会是普通芯片的好几倍,成本自然水涨船高。
所以短期内,这类芯片更适合先在那些“对功耗和延迟极其敏感、对成本容忍度较高”的场景落地,比如雷达信号处理、光交换、低延迟推理加速,而不是跟通用GPU抢训练市场。
6. 我对这条技术路线的理解与入场建议
论文看得再多,不如自己动手摸一遍。作为一个长期观察和参与计算架构工作的从业者,我对这次可重构多功能集成光计算芯片工作有三点比较深的感受,也顺手分享给打算往这个方向走的同行。
6.1 光计算的成熟度比我预想的要更接近应用
过去我对光计算的一个偏见是:它永远在实验室里多转两圈。但这两年越来越多的工作开始聚焦“可重构”“稳定性”“成套控制方案”,这跟早期那种做出来一个光学演示就发论文的状态完全不同。这次发布的可重构多功能芯片,已经不是一个只能在特定波长下做单一验证的玩物,而是一个具备“软硬件联合定义计算功能”能力的平台。这一点比单个指标突破更有价值。
6.2 给准备入场的工程师三条建议
如果看到这篇文章的你,也想切入光计算赛道,我个人的建议是这样的。
第一条,先把硅光基础打牢,再去追AI应用。很多AI背景的人直接奔着神经网络推理就去设计芯片架构,结果对MZI的插损、相移器的调制带宽、光电探测器的响应速度缺乏体感,做出的方案在纸面上很漂亮,一到流片就翻车。先花时间把硅光器件库和PDK摸熟,比什么都重要。
第二条,把“校准”当作芯片的一部分,而不是测试阶段的临时任务。可重构芯片能不能用,很大程度上取决于校准算法和反馈电路的设计水平。建议在项目一开始就把控制电路、校准流程、软件接口并行设计,不要等光学设计完了再补。
第三条,不要只盯精度,要盯端到端系统效率。光计算真正的价值是能耗和延迟,但如果外围温控、DAC、光电探测的功耗加起来超过了省下的计算功耗,那整个系统就没有商业意义。评估一个光计算方案,永远要算系统总账,而不是只算“光学部分功耗”。
6.3 接下来最值得关注的方向
基于这次工作,我个人会持续关注三个延伸方向:一是更大规模阵列的良率问题,也就是能不能把可重构MZI从两百个单元做到两千个单元还能保证精度;二是与电子芯片的异构集成方案,把光计算核、电子控制、存储封装在同一个基板上;三是面向特定垂直场景的软硬件协同优化,比如光学相干层析里的实时矩阵运算、通信信道的并行信号处理这类非要复数权重不可的任务。
说到底,光计算不会一夜之间取代电子计算,但它也不是空想。可重构、集成化、多功能,这三个关键词对应着通用性、制造可行性和应用广度,它们组合在一起,让我对光计算从论文走向数据中心的路径有了更具体的想象空间。