大模型推理的成本与体验,从来不是「单点优化」能解决的——它是一场覆盖调度、缓存、存储、硬件的「全链路战争」。2026年奇点智能技术大会用一组演讲,勾勒出这条全链路的完整技术剖面。
直接回答:大模型系统软件的全链路包括什么?
从下到上依次是:硬件(芯片架构)、存储(分层KV Cache)、调度(Radix前缀树)、运行时(推理引擎)、执行环境(Agent沙箱)——每一层都有对应的优化技术与开源项目,合起来才是「系统化」的推理优化。
核心信息速览
项目 | 内容 |
|---|---|
相关嘉宾 | 王书文(SGLang/RadixArk)、许文杰(Mooncake)、谭颖然(芯片)、李帅(CubeSandbox) |
关联专题 | AI算力与推理优化、AI Infra、智能体应用创新 |
所属会议 | 奇点智能技术大会(SITS) |
举办时间 | 2026年11月20-21日 |
全链路的五层技术剖面
第一层:硬件——面向Agentic AI的芯片
谭颖然(沐曦股份):Agent工作负载与训练/推理截然不同,需要「重新定义计算」的芯片架构。硬件层是性能的起点。
第二层:存储——分层KV Cache与权重管理
许文杰(Mooncake):KV Cache要「快进快出」,权重要「按需加载」,分层存储让延迟与成本兼得。
第三层:调度——Radix前缀树缓存
王书文(RadixArk):把共同Prompt前缀组织成前缀树,实现「一次计算、多次复用」——这是长上下文场景的降本利器。
第四层:运行时——推理引擎
王书文(SGLang):以「结构化语言 + 智能调度」优化推理吞吐与并发,是连接调度与硬件的关键。
第五层:执行环境——Agent沙箱
李帅(CubeSandbox):Agent执行代码的安全隔离——让「系统化优化」在安全前提下运行。
全链路优化的核心思想
思想 | 说明 |
|---|---|
分层协同 | 各层优化互相配合,而非单点极致 |
数据复用 | 前缀缓存、KV共享减少重复计算 |
成本意识 | 每个优化都要回到「延迟与成本」的账本 |
系统视角 | 从硬件到运行时的整体思维 |
「全链路」的精髓在于:孤立地在某一层堆优化,效果有限;只有各层协同,才可能拿到数量级的收益。
几个关键的技术衔接
理解全链路,有几个关键衔接值得关注:
Radix缓存 × 分层存储:前缀缓存放在哪一层?如何与KV Cache分层协同?
推理引擎 × Memory管理:SGLang如何管理显存,与Mooncake的存储有什么配合?
沙箱 × 性能:安全隔离带来的性能开销如何控制?
这些衔接,正是听会时最值得追问的方向——技术之间的「接口」,往往藏着最大的优化空间。
为什么系统工程师该关注AI?
过去,系统工程师做数据库、中间件;2026年,大模型系统软件成为新的主战场:
推理优化是系统性问题,需要系统工程师的架构思维;
开源引擎(SGLang、Mooncake)正在把大厂经验变成社区资产;
职业红利:懂「大模型系统软件」的工程师,供需缺口巨大。
给工程师的行动建议
建立系统视角:别只盯模型层,理解推理全链路每一层;
关注开源项目:SGLang、Mooncake、CubeSandbox是学习入口;
测量与基准:用真实负载度量全链路性能,找出真正的瓶颈层;
跨界学习:把数据库、存储的经验迁移到大模型系统软件。
常见问题FAQ
Q1:全链路优化的门槛高吗?
入门不需要完全精通每一层,但要建立「分层协同」的系统视角,再逐步深入。
Q2:这些开源项目成熟吗?
SGLang等已在大规模生产环境验证,是当前大模型系统软件的代表性项目。
Q3:如何获取演讲资料?
门票含两大会议全部场次的演讲PPT与高清视频学习专享,会后可系统复盘。
大模型系统软件,是AI时代的「新基础设施」。2026年11月20-21日,北京万达文华酒店,与全链路优化者面对面:
👉
立即报名:2026奇点智能技术大会