很多人看到:GPT 支持 128K token、Claude 支持 200K token这种标语,会认为上下文窗口越长,模型能力越强。但实际上,并不是这么简单。窗口长度只是上限。能不能用,才是能力。
以下是几个比较核心的问题:
- KV Cache 能不能存得下
- 显存成本是否可接受
- Attention 计算是否还能承受
今天我们从技术原理聊聊:为什么长上下文越来越难。
- 什么是上下文窗口?
============
先理解一下大模型的输入。
比如:
用户:请阅读下面100页论文,然后总结核心观点: [论文内容]这些文本会经过:文本 -> Tokenizer -> Token序列 -> [“请”, “阅读”, “下面”, …]
假设:1 token ≈ 0.75个英文单词,1个中文字符≈1~2 token。那么,一篇10万字中文文档,可能约有 150000 token
模型需要一次性处理:
Input: x1 x2 x3 ... x150000这个长度,就是:Context Window(上下文窗口)
- 为什么长上下文需要 KV Cache?
======================
理解 KV Cache,需要先理解 Transformer Attention。
Transformer核心:
其中:
- Q(Query):当前token的问题
- K(Key):历史token的信息索引
- V(Value):历史token的信息内容
例如:
输入:我今天去了北京,那里天气很好。
生成:所以我觉得北京…
模型需要知道:“北京” 来自前面的文本。
Attention需要保存:
北京对应的K,V 天气对应的K,V 去了对应的K,V ...这些就是:KV Cache
- KV Cache为什么越来越大?
===================
假设,一个模型参数量有70B,Transformer层有80层,Attention heads维度64, head dimension为128。
每个token需要保存的维度:K:64 × 128; V:64 × 128。
那么,一个token 需要:2 × 64 ×128 = 16384个float
如果是FP16 类型,那么一个token:16384 × 2≈32KB
现在, token 和 KV Cache的关系:
- 1万个token -> 10000 ×32KB ≈320MB
- 10万个token -> 100000×32KB ≈3.2GB
- 100万个token ≈32GB
注意:这只是KV Cache!还没算:模型参数、激活、batch和 optimizer等。
所以:百万token上下文,对显存压力巨大。
- 长文本的瓶颈及解决办法
==============
4.1 长文本瓶颈之一:显存
很多人认为:模型参数越大,占显存越多。其实推理阶段,长上下文时, KV Cache可能超过模型参数。所以现在很多优化,本质都是减少KV Cache。
作为减少KV Cache的重要技术,Group Query Attention(GQA) 的主要思想是:多个Q共享一个K/V,这样就可以减少KV Cache。
现在很多模型都采用了GQA,如:Llama 3、 Qwen、Mistral。
4.2 长文本第二个瓶颈:Attention计算复杂度
在做 Attention的时候,如果 token数量=N,那么计算量大概是:O(N^2),也就是说,长度增加的话,计算量平方增长。所以,传统Attention 很难支持无限长文本。
做了大量的优化之后,有些模型支持百万token:
- 稀疏Attention (Sparse Attention),减少了计算量
- 使用Sliding Window Attention,只关注附近窗口。
- FlashAttention,对GPU memory access进行了优化。
写在最后
真正的大模型未来不是无限扩大Context Window,而是让模型拥有类似人的记忆系统。
长上下文窗口只是“大脑容量”,KV Cache决定“短期记忆成本”,而Memory/RAG决定“长期智慧”。
真正强大的模型,不是记住所有东西,而是知道什么时候该回忆什么。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~