Context Engineering:让 LLM 在百万 token 里不丢重点
1M token 的 context window 听起来很美,但 Chroma 2025 年 7 月的研究告诉我们:18 个前沿 LLM 没有任何一个能在填满窗口前保持性能——GPT-4o 从 99.3% 掉到 69.7%,只用了 32K token。号称"百万上下文"是容量数字,不是能力数字。
过去两年 LLM 厂商在 context window 上的军备竞赛:4K → 32K → 128K → 200K → 1M。Gemini 1.5 Pro、Llama 4 Scout 喊出 10M。但 2025 年的研究彻底揭穿了这种营销幻觉:有效工作上下文往往比广告数字小 10-100 倍。
这篇文章围绕"context engineering"展开——它不是 prompt engineering 的升级版,而是一整套管理 LLM 上下文的工程方法论。从底层机制到实战技巧,让你搞清楚:
- 为什么模型 context 越大,反而越笨
- “Lost in the Middle” 是什么,为什么致命
- 四种 context 操作策略(Write / Select / Compress / Isolate)
- 何时用 RAG、何时用长 context、何时用 sub-agent

