☰
麦肯锡2026技术趋势05_应用专用半导体_研究解读
2026/10/7 20:15:19 网站建设 项目流程

AI 推理时代的芯片分工:麦肯锡 2026 年“应用专用半导体”研究解读

麦肯锡《Technology Trends Outlook 2026》技术趋势解读系列 · 第 5 篇

摘要

麦肯锡将“应用专用半导体”(Application-specific semiconductors)列为第五项技术趋势,强调专用芯片正在与模型、软件、内存、网络和数据中心运行方式共同设计。推动这一变化的重要力量,是 AI 推理需求增长及其工作负载分化:不同任务对吞吐量、响应时间、内存和通信具有不同要求。报告显示,相关股权投资显著增长,采纳进入规模化扩展阶段,但工作负载稳定性、封装与内存供给,以及技术更新速度仍构成关键不确定性。本文分析专用加速器与可编程 GPU 的取舍,解释芯片性能为何依赖编译工具、数据流和互联,并提出评价完整使用周期经济性的框架。本文认为,专用化能否创造持续价值,取决于真实负载、系统交付与累计使用量能否共同支撑设计和迁移投入。未来竞争更可能表现为不同计算角色之间的分工,以及围绕具体任务形成的跨企业协同。

关键词:应用专用半导体;ASIC;AI 推理;GPU;软硬件共同设计;HBM;芯粒;芯片经济性

一、这一趋势的核心:为实际工作负载安排更合适的硬件

假设一家平台同时运行三种 AI 服务:在线对话、批量资料处理和推荐排序。它们都可以被称为 AI 计算,但需要的资源并不相同。

在线对话关注用户等待时间;批量处理更重视单位时间完成多少工作;推荐系统还可能大量访问特定数据结构。业务高峰、输入长度和模型更新,也会改变硬件负载。

这是用于解释机制的假设场景。它说明,选择芯片之前,需要先理解计算在什么条件下发生。

麦肯锡将应用专用半导体定义为针对特定计算工作负载优化的芯片。在 AI 领域,它们越来越需要与软件、内存架构、网络基础设施及数据中心运行方式共同设计。[1,第 50 页]

这种专用化早已存在于汽车、工业和消费电子等领域。AI 带来的变化,是工作负载增长、模型更新与商业化要求共同推动了更深层的计算架构调整。[1,第 50 页]

第四项趋势讨论模型能力如何进入规模化服务;第五项进一步讨论,在服务需求已经形成之后,硬件应怎样承担不同计算角色。

因此,本文把这一趋势理解为一项匹配问题:模型和业务提出要求,芯片与系统提供能力,软件组织实际执行,最终通过任务结果和完整成本评价匹配是否有效。

峰值算力只是这个过程中的一个条件。工作负载是否适合架构,数据能否及时到达,软件能否有效执行,以及设备是否得到充分使用,同样决定实际收益。

二、理解专用化:计算目标与编程灵活性

讨论这一趋势时,需要区分硬件优化目标与可编程程度。产业中常用的“GPU 与专用芯片”比较,是对不同设计侧重点的概括,并不意味着两者之间存在完全排他的技术边界。

GPU 是可编程的并行处理器,现代 AI GPU 也包含针对矩阵等运算优化的计算单元。应用专用集成电路(ASIC)则围绕特定应用类别设计,但仍可能通过编译器和程序支持不同模型。

计算角色常见设计侧重点在 AI 系统中的作用
CPU多种控制与软件任务的执行能力数据处理、任务编排、系统控制及部分模型计算
GPU可编程并行计算与成熟的软件生态多种训练、推理及其他并行负载
AI 专用加速器与 ASIC特定运算、数据流或工作负载类别的效率在适用任务中优化计算、内存、通信与能耗

上表是本文的功能归纳,具体产品的能力范围与灵活性,需要分别评价。

专用化也可以发生在不同层次。一个芯片可能重点优化矩阵运算,另一个可能重点优化特定数据访问方式;整套系统还可以针对大规模互联、固定时延或高并发服务设计。

这使“专用芯片是否优于 GPU”难以获得脱离场景的统一答案。需要说明比较的是哪类模型、什么输入、怎样的并发,以及什么质量和时延条件。

通用性与效率之间确实存在取舍,但取舍程度取决于设计。有些专用系统保留较强的可编程能力,有些则更依赖明确的数据流与算子范围。实际使用中,还需要观察软件与硬件共同提供了怎样的适应空间。

本文认为,更有解释力的研究问题是:在给定任务与更新预期下,专用优化获得了多少收益,又引入了多少适配、维护与迁移成本?

三、投资与人才数据:增长显著,但应保留统计边界

报告中的发展信号如下。

指标报告结果解读时需要注意什么
2024 年股权投资75 亿美元按报告定义统计的资本活动
2025 年股权投资416 亿美元约为上一年的 5.5 倍,不能换算成产品收入或制造支出
相关岗位公告变化2024—2025 年增长 22%反映统计范围内的招聘恢复与扩张
2025 年岗位职能结构研发占 82%包含研究、软件、数据与工程等技术建设工作
企业采纳评级4:规模化扩展中覆盖数据中心、云环境与企业负载,主要采用者仍是大型云服务商

资料来源:报告正文第 51、53—54 页。其中,5.5 倍为依据报告数值进行的近似计算。

报告的投资数据包含私募与公开市场资本活动以及相关并购等交易,明确不包含企业资本开支和运营支出。[1,第 3 页] 因而,这些数字更适合用来观察资金进入相关企业的程度。

人才变化则需要同时看近期与较长时期。报告指出,招聘正在从 2022 年之后的收缩中恢复;设计、硬件和光学工程等岗位仍低于 2022 年水平,而研究工程师与解决方案架构师需求有所增长。[1,第 53 页]

因此,最近一年的增长,并不说明所有岗位都在持续扩张。这些变化也不能单独证明某类传统岗位已被 AI 替代。

研究活动评分还有另一层边界。报告认为,相关论文活动没有明显加速,但部分创新可能发生在发表激励较弱的企业内部。[1,第 51 页] 这是一种解释,不能由论文曲线直接计算企业内部创新产出。

同样,关键词活动的相对评分,不能直接作为一个产业整体技术水平或商业成熟程度的测量。[1,第 3 页]

本文据此认为,这一章显示的是资本关注、技术建设与采用范围在扩大。它没有证明所有新架构都能持续获得客户,也没有证明专用化在所有负载上具有经济优势。

四、推理需求的分化,怎样改变芯片设计

报告援引预测认为,到 2030 年,推理可能占全部数据中心需求的 30%—40%,并成为 AI 计算中的主要负载。[1,第 51 页] 这是未来需求情景,不能当作已经实现的市场结构。

这一预测背后的机制值得分析。模型训练完成之后,面向用户和企业的持续调用,会形成长期运行负载。随着应用范围扩大,设计目标也会更加关注效率、时延与完整服务成本。

但“推理”本身并不是一种完全一致的计算任务。

1. 同一语言模型请求,也包含不同计算阶段

大语言模型生成通常可以区分输入处理和逐步生成。前者常称为预填充(prefill),主要处理已有提示;后者称为解码(decode),持续生成新的 token。token 是模型处理文本的基本计量单元,与汉字或单词并不一一对应。

两个阶段的计算形态和资源要求有所不同。较长输入可以形成较大的并行计算需求;逐步生成则需要持续访问权重、缓存等数据。它们受到计算、内存与调度影响的程度,会随模型、批量和上下文变化。

工作部分主要需要处理什么评价时应关注什么
输入处理提示、资料与上下文的计算输入长度、计算组织与首个 token 时延
逐步生成连续生成及相关状态访问内存与缓存使用、每步时延与并发
模型内部或跨设备通信分布式计算所需的数据交换互联带宽、通信安排与计算等待
外部工具与任务编排检索、调用、状态和流程管理整体等待、任务执行与系统协调

上表是本文对服务过程的分析归纳,具体系统未必把这些部分分别部署。

DistServe 研究提供了一个相关案例。它把输入处理与解码分配到不同 GPU,按照首个 token 与每个输出 token 的时延要求,联合安排资源、并行策略和阶段间通信。[2]

该研究在其评估条件中证明了分阶段组织资源的价值。它主要研究 GPU 服务系统,能够帮助解释为何需要先拆解负载,不能直接作为某种 ASIC 已经全面优于 GPU 的证据。

2. 不同应用,又会进一步改变优化目标

实时交互、离线批处理、推荐排序和现场设备推理,关注的资源与服务目标可能不同。模型的结构、数据精度和输入形式,也会改变计算安排。

即使是同一模型,低并发交互与高并发批量运行,也可能需要不同设置。提高设备利用率的方式,未必满足严格的用户等待要求。

因此,推理增长会创造专用优化的机会,同时要求产业面对更复杂的负载组合。企业需要确定哪些需求可以持续、哪些计算模式足够重复,以及哪些部分适合进入硬件设计。

本文认为,专用化的重要条件之一,是能够从变化的应用中识别可复用的计算规律。应用名称相同,并不自动说明底层负载保持不变。

五、软硬件共同设计:芯片优势怎样被实际执行出来

报告把处理器、内存、网络与软件的共同设计,视为竞争的重要方向。[1,第 52 页] 这意味着设计目标需要在系统层面确定。

1. 数据流和互联,会影响计算单元能否持续工作

一个计算单元具备较高运算能力,但如果数据读取或设备间交换无法跟上,就会出现等待。单独增加计算能力,可能不足以改善整体任务表现。

因此,架构需要同时考虑哪些数据可以重复使用,数据存放在哪里,怎样传递,以及计算和通信能否有效配合。

Google 的 TPU v4 研究展示了一种共同设计方式:系统包含针对依赖嵌入表示的模型设计的 SparseCore,也通过光交换技术调整互联拓扑。[3] 它说明,优化可以发生在专门计算模块和整个系统连接方式上。

这是 2023 年公开的技术研究,用于理解设计机制。本文不把其中的特定性能结果作为 2026 年不同产品之间的统一排名。

这一案例还揭示了专用化与适应性的关系。优化某些计算模式,同时保留能够调整连接与执行方式的机制,有机会扩大架构的适用范围。实际收益仍需要在对应负载中检验。

2. 编译器和运行系统,是硬件能力进入模型执行的桥梁

芯片提供计算与数据处理能力,模型则需要通过软件安排实际执行。编译器、运行时、计算库与调试工具,因此成为专用系统的重要部分。

AWS 的 Neuron 官方资料显示,支持 Trainium 与 Inferentia 的软件栈包含编译器、运行时、训练与推理库,以及监测、性能分析和调试工具。[4]

这说明,专用硬件作为可使用的产品,需要一整套软件支持。能够运行某个模型,与在业务要求下高效运行,还需要进一步区分。

迁移过程中,组织可能需要处理计算操作的支持、数值精度、模型并行、数据布局和服务接口。模型版本发生变化后,也需要重新观察质量、性能和资源使用。

因此,硬件选型应评价软件与模型的实际配合,而不能只确认某个框架名称出现在支持列表中。

3. 共同设计还涉及不同企业之间的知识与责任

模型开发者了解计算需求和更新计划,芯片设计者了解资源与实现约束,云服务商掌握运行负载和服务组织。这些信息往往分布在不同企业。

报告明确指出,芯片企业、云服务商与模型开发者的边界正在变化,重要架构决策越来越需要跨企业协作。[1,第 50、55 页]

本文认为,这种协作的关键,是把未来需求转化为可检验的设计目标:优化什么负载,保留怎样的变化余地,何时能够交付,以及用什么结果评价系统。

如果这些判断缺少共同依据,局部性能改善就可能与实际客户需求脱节。共同设计的价值,最终仍要由可交付、可持续运行的系统证明。

六、内存、封装与互联:为什么芯片性能越来越依赖系统连接

报告把高带宽内存、芯粒、先进封装和硅光列为支撑这一趋势的重要技术。[1,第 50、52、55 页] 它们分别处理数据访问、模块组合和通信等问题,作用需要区分。

1. 内存容量与带宽,对应不同需求

容量关系到能够存放多少权重、缓存和状态;带宽关系到单位时间能够传递多少数据。容量足够的系统,仍可能受到读取速度约束;高带宽系统也需要满足模型与并发所需的容量。

因此,设计应共同考虑容量、带宽、访问方式、能耗与成本。不同负载的优化重点可能不同,不能只增加其中一项指标。

高带宽内存(HBM)是数据中心 AI 系统的重要路径。实际架构还可以使用不同层次的内存与缓存,边缘设备和大型数据中心也不必采用同一种配置。

2. 芯粒与先进封装,扩大了模块组合的空间

芯粒(chiplet)将不同功能的芯片模块组合为系统。它为逻辑、接口和其他功能的分工与复用提供了空间,同时要求模块之间具有有效连接。

台积电的 CoWoS 资料显示,其先进封装技术可以组合多个逻辑芯片与 HBM 堆叠,以支持高性能计算和内存带宽需求。[5] 这个例子说明,封装已经直接参与系统性能形成。

模块化也需要处理互联、供电、散热和测试。采用更多模块,可能增加组合能力,也可能带来新的整合问题。

UCIe 联盟为封装内芯粒互联提供了覆盖物理接口、协议和软件模型的标准。[6] 标准化有助于建立连接与兼容的共同依据;具体产品仍需要完成性能、可靠性和制造条件的验证。

因此,芯粒生态的价值需要通过实际组合和交付体现。能够定义接口,与能够稳定制造并运行完整系统,仍是不同阶段。

3. 光通信的价值,需要回到具体连接环节

报告讨论了硅光在提高带宽、降低数据传输能耗方面的作用。[1,第 50、55 页] 其意义在于为部分数据通信提供新的实现路径。

评价时,需要明确改进发生在哪里:芯片之间、设备之间,还是更大规模的网络连接;还需要把相关器件、控制与维护投入计入系统。

本文认为,这些技术的共同方向,是减少计算过程中数据访问与传递造成的约束。但它们各自面对的工程条件不同,不能由一种连接技术的进展推导整套系统已经解决所有瓶颈。

七、专用芯片的经济性:效率收益能否覆盖额外投入

专用化可能改善适用负载的效率,也会产生设计、软件、验证和部署投入。其经济性需要覆盖完整使用过程。

1. 先确定比较条件,再解释性能结果

硬件性能比较应说明模型、输入、数据精度、并发、响应要求与软件配置。改变这些条件,可能改变不同系统之间的表现。

MLPerf Inference 为基准指定数据集、质量目标与测试场景,并区分不同比较规则:Closed 类别要求使用与参考实现相同的模型,Open 类别允许改变模型或重新训练。[7]

这些规则说明,性能数字需要与其测试条件一起阅读。标准基准可以提供可比较的证据,企业实际负载则还需要单独评价。

吞吐量与用户等待也应分别观察。系统每秒可以处理更多请求,并不直接说明每个请求更快;在严格响应要求下,能够有效服务的请求数量可能不同。

本文建议在相同业务目标下比较通过质量验收、并满足响应要求的任务产出,再计算所需成本与资源。这样更容易将芯片表现连接到实际价值。

2. 固定投入,需要累计使用量来覆盖

可以用一个简化关系说明专用化的经济条件:

覆盖额外固定投入所需的累计任务量 = 额外固定投入 ÷ 每个合格任务节约的运行成本。

这个关系假设单位节约保持稳定,并且两种方案满足可比的质量和时延要求。固定投入与运行成本需要分开计算,避免重复计入。

假设某组织采用专用系统,新增 100 万元适配与部署投入,每个合格任务的其他运行成本减少 0.02 元,那么需要累计约 5,000 万个任务,才能覆盖这项额外投入。如果实际节约只有 0.005 元,就需要约 2 亿个任务。

这是本文提出的假设例子,不是报告中的市场成本,也不是芯片研发报价。它说明,单位效率优势能否形成总体收益,取决于实际节约与累计使用量。

完整评价还需要考虑投入时间、设备利用率、需求波动、升级、故障和价格变化。若模型变化缩短了适用周期,原本预期的任务量可能无法实现;若系统能够持续承接可比负载,固定投入就更容易得到分摊。

因此,专用芯片的经济价值,不只发生在完成单次计算时,也发生在它能够持续适配多少实际工作上。

3. 采用专用芯片,有不同投入门槛

报告把大型云服务商视为主要采用者,同时指出企业采用正在逐步扩大。[1,第 54 页] 企业进入这一趋势,可以有不同方式。

采用路径主要需要组织什么重点评价什么
通过云服务使用专用硬件服务接入、模型适配与运行管理真实价格性能、服务条件与迁移能力
采购商业化专用系统设备部署、软件支持与运维利用率、系统兼容、升级与完整成本
自行设计或参与定制芯片芯片、软件、制造与客户需求协同需求规模、稳定性、交付周期与累计投入

上表是本文的管理分析框架。三种路径的能力要求和风险承担不同,采纳等级为 4,并不意味着多数企业都需要自行设计芯片。

对于芯片开发方,投入还包含设计验证、制造、封装测试、软件工具和客户导入。获得可以工作的芯片,是重要进展;形成客户愿意持续使用的系统,还需要后续交付能力。

八、云服务商的定制芯片,怎样改变产业分工

报告指出,定制芯片正在从内部优化能力,扩展为面向客户的竞争方式。[1,第 52 页] 这会改变芯片、模型与云服务之间的关系。

1. 大型平台有机会把真实负载带入设计

持续服务大量客户的平台,可以积累模型、并发、输入和运行条件方面的信息。它们也可能拥有较大的使用规模,使专用优化获得更多分摊机会。

这种优势不仅来自资金,还来自设计与真实负载之间的连接。平台能够让芯片设计围绕具体需求展开,并通过软件和服务安排扩大使用范围。

不过,内部效率改善怎样传递给客户,需要另行观察。客户获得的是服务,其价格、支持、可用性与迁移条件,并不完全由芯片制造成本决定。

因此,“平台拥有定制芯片”和“客户获得更好的任务经济性”之间,还存在商业与系统层面的转换。

2. 模型开发者也可能同时使用多种硬件

Anthropic 在 2025 年 10 月公布了扩大 Google Cloud 使用、包括至多 100 万个 TPU 的计划。其公告同时说明,计算策略覆盖 Google TPU、Amazon Trainium 和 NVIDIA GPU 三类平台。[8]

这里引用的是当时公布的计划和策略,不把规划数量视为截至本文核对日已经全部交付的容量。

这个案例展示了一个重要方向:采用专用硬件,可以与保留其他平台同时发生。不同平台之间可能形成资源、模型与服务的分工,而非要求所有任务立即迁移到同一种架构。

多平台安排也会增加软件适配、评价与运维工作。它的价值,需要通过实际交付、服务能力和完整成本证明。

3. 新架构的商业化,需要持续客户与生态支持

报告提到推理加速、内存优化、晶圆级计算和硅光等创新方向,也列举 Cerebras、Groq 和 SambaNova 等参与者。[1,第 50—51 页]

这说明行业正在探索多种计算路径。架构多样性提供了新的优化机会,但资本进入并不能保证所有设计都能形成长期市场。

本文认为,新架构需要同时证明三件事:针对什么负载有价值,客户能否顺利使用,以及模型与需求变化后能否继续交付。性能展示、软件支持和客户采用,应形成相互验证的过程。

九、人才与供应链:专用化需要跨环节的交付能力

报告的人才数据具有启发性:相关岗位中,61% 要求云计算,56% 要求机器学习;C++ 人才供给需求比约为 9.2,而优化与 GPU 技能分别约为 0.1。[1,第 54 页]

这些比例基于报告的数据与技能识别方法,主要来源于英语国家,不能直接当作某个地区的缺口,也不能机械解释为“九成相关岗位无法招聘”。[1,第 3 页]

它们提示的是能力组合的差异。掌握编程语言,与能够理解模型负载、编写高效计算实现、安排内存与并行,并验证系统表现,不是同一层次的能力。

专用芯片发展仍然需要 GPU 与优化经验,也说明技术路径之间存在知识联系。理解既有系统的瓶颈,往往有助于确定新的设计目标。

因此,组织需要协调模型、编译、芯片、系统和客户使用方面的知识。各团队应能够解释,局部改进怎样影响整体表现,哪些条件已经验证,哪些仍属于假设。

1. 供应链分散,需要覆盖实际依赖环节

报告把制造集中、内存与封装供给、网络,以及电力和热限制列为不确定性。[1,第 54—55 页]

芯片能够完成设计,并不直接说明制造、内存、封装与系统交付都已准备好。供应链评价需要覆盖实际依赖的各个环节。

增加某一环节的地区选择,能够改善部分安排;整套系统的供给能力,则需要看其他配套条件。交付时间通常由多个环节共同决定。

2. 芯片开发周期,需要与模型和客户更新协调

报告强调基础设施投入与技术快速变化之间的取舍。[1,第 55 页] 专用设计需要预先判断负载,但模型和客户要求可能在交付之前继续变化。

因此,设计需要明确哪些计算模式相对稳定,哪些部分允许软件调整,哪些变化需要重新配置或开发。适应能力应成为产品评价的一部分。

这不意味着所有专用架构都会因模型更新失去价值。影响取决于优化对象、可编程空间和软件支持。组织需要通过实际更新检验它的延续能力。

本文据此认为,专用半导体的交付优势,来自技术、供应与需求信息的持续协调。一次成功设计,还需要在制造、部署和迭代中被继续实现。

十、如何评价麦肯锡的判断,并检验未来发展

报告的贡献,是把推理需求、专用设计、先进封装、软件支持和产业合作联系起来。它没有把芯片性能完全归结为计算单元数量,也明确保留了负载稳定性和使用周期经济性等不确定性。[1,第 50、52、55—56 页]

但读者仍需要区分资本活动、研究案例、厂商性能说明与实际客户收益。它们回答不同问题,不能直接连成已经被证实的商业因果链。

本文认为,专用半导体的方向性机会较明确:当负载具有足够规模与可识别的计算规律,系统优化就可能产生持续收益。具体架构能否获得这些收益,则取决于软件、供给、使用量和变化条件。

未来一至两年,可以重点观察以下四个判断。这些判断属于作者分析,不是报告已经证实的结论。

第一,异构分工会继续成为重要部署方式。不同推理阶段和应用可能需要不同资源。可以观察系统是否依据实际负载分配硬件,以及这种分配能否改善合格任务产出和完整成本。

第二,软件支持与模型更新能力会更直接影响新芯片的采用。硬件优势需要通过编译、运行和服务实现。可以观察模型导入所需时间、升级后的质量与性能,以及客户持续运行是否顺畅。

第三,内存、封装与互联的价值,会随实际瓶颈变化。当计算单元主要等待数据与通信时,改善连接可能具有更大作用。可以观察系统等待、带宽使用和供给条件,而非只统计新增计算能力。

第四,专用化的商业筛选会更重视使用周期内的适配能力。架构需要在足够任务量中形成收益,也需要承接模型与需求变化。可以观察客户采用是否持续、适配工作是否可控,以及固定投入能否通过实际使用覆盖。

这些判断也需要随证据更新。若某类负载长期稳定,较深的专用化可能更有利;若模型和任务变化更快,保留灵活性可能更重要;若软件与互联改善扩大了适用范围,原有取舍也会发生变化。

前瞻分析应关注这些条件如何演变,而不是预先宣布某一种芯片将赢得全部计算任务。

结语

应用专用半导体的兴起,体现了 AI 从能力建设走向持续运行之后,对效率、响应和资源使用提出的更具体要求。

专用芯片的价值,需要由工作负载、数据流、软件工具、内存、封装与互联共同实现。设备能够完成计算,还需要进一步证明客户能够以合理成本持续获得所需结果。

本文认为,这一趋势的核心评价单位,应当是使用周期内持续完成的合格任务。模型变化、累计使用量、服务要求和系统支持,都影响专用化收益是否能够延续。

未来更有机会形成持续优势的参与者,是能够把需求判断、架构设计与完整交付连接起来的组织。它们既要理解如何优化计算,也要理解这些优化在什么条件下值得长期使用。

参考资料与口径说明

本文主要依据用户提供的麦肯锡 2026 年 9 月版报告,解读第 5 项技术趋势,正文第 50—56 页,并结合第 3 页研究方法。页码指报告印刷页码,对应 PDF 文件页序第 52—58 页和第 5 页。补充资料用于核对服务组织、芯片架构、软件支持、封装标准与评价方法,核对日期为 2026 年 10 月 3 日。

文中的假设场景、功能分类、经济性关系、费用示例、采用路径与前瞻判断属于作者分析。历史技术论文保留其测试和时间范围;企业公告按其原始计划与表述理解;性能比较以具体任务和评价条件为前提。

  1. McKinsey & Company.Technology Trends Outlook 2026. September 2026, sixth edition. “Application-specific semiconductors”, pp. 50–56; research methodology, p. 3. 本文主要依据用户提供的 PDF。

  2. Zhong, Y., et al.DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving.OSDI 2024. 用于理解推理阶段分离、服务时延与资源配置的关系。

  3. Jouppi, N. P., et al.TPU v4: An Optically Reconfigurable Supercomputer for Machine Learning with Hardware Support for Embeddings. arXiv:2304.01433;ISCA 2023. 用于理解专用计算模块与互联共同设计。

  4. Amazon Web Services.What is AWS Neuron?. 官方技术文档。用于核对 Trainium 与 Inferentia 的软件栈组成。

  5. Taiwan Semiconductor Manufacturing Company.CoWoS. 官方技术资料。用于理解逻辑芯片、HBM 与先进封装的组合。

  6. UCIe Consortium.Specifications. 官方标准说明。用于核对封装内芯粒互联的标准化范围。

  7. MLCommons.MLPerf Inference: Datacenter. 官方基准说明。用于核对质量目标、场景与比较规则。

  8. Anthropic.Expanding our use of Google Cloud TPUs and Services. October 23, 2025. 用于核对 TPU 扩容计划及多芯片平台策略。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询