当主流模型把上下文窗口从几万 token 推向百万量级,“把整份资料库塞进提示词”似乎第一次变得可行。于是问题随之而来:既然模型能一次读完所有材料,检索增强生成(RAG)是否还有存在的必要?答案没那么简单——窗口变大改变的是边界条件,而不是问题的本质。
上下文变长,改变的是什么
百万级窗口最直接的价值,是让跨文档、跨章节的整体推理成为可能。过去需要靠切片和召回拼凑的长篇分析,如今可以一次性交给模型。这确实削弱了 RAG 在单次问答场景里的独占地位,也让一些轻量应用可以省掉检索链路。
RAG 解决的不只是“装不下”
很多人把 RAG 理解为上下文不够用时的权宜之计,这低估了它的作用。检索承担的是数据治理、权限隔离、实时更新与可溯源引用等职责,这些与窗口大小无关。企业知识库每天都在变化,把全部内容反复塞进提示词既不经济,也无法做到按用户权限裁剪。
- 权限与合规:不同角色只能看到被授权的片段;
- 时效性:新增与修订的内容需要即时生效;
- 可验证:答案要能指回具体出处。
长上下文自身的约束
窗口的标称长度与有效利用长度往往不是一回事,信息越靠近中间越容易被忽略。同时,输入越长,推理成本与首字延迟越高,在高频调用场景下并不划算。把大量无关内容一并喂给模型,还可能稀释关键信号、拉低回答质量。
更可能的走向是融合而非替代
务实的架构正在把两者叠加:先用检索把候选范围收敛到可控规模,再交给长上下文模型做整体理解与推理。检索负责“找得准、管得住”,长窗口负责“看得全、想得深”,二者是分工而不是竞争。查询改写、重排序与工具调用等环节也会继续演化。
结语
到 2026 年,RAG 大概率不会消失,而是从“唯一解”变成“默认组件之一”。简单、静态、小规模的场景可能被长上下文直接吞并,而涉及权限、更新与审计的复杂系统仍离不开检索。真正被替代的,是那些只会做粗放切片的低质量检索实现。