长上下文模型的技术挑战与优化路径
长上下文为什么重要? 长上下文是Agent的基础设施。Agent需要记住长对话历史、处理长文档、执行多步推理——这些都依赖模型处理超长上下文的能力。从4K到1M,上下文窗口的扩展正在改变AI应用的可能性边界。 核心挑战 挑战一:注意力计算的二次复杂度 标准Transformer的自注意力计算复杂度是O(n²): Attention(Q, K, V) = softmax(QK^T / √d) * V Q: [n, d], K: [n, d] → QK^T: [n, n] → O(n²) 从4K到128K,计算量增长1000倍。直接外推不可行。 挑战二:KV Cache的显存爆炸 推理时KV Cache的大小与序列长度成正比: 单层KV Cache大小 = 2 * n_heads * head_dim * seq_len * 2 bytes (FP16) 以70B模型为例(64头, 128维, 80层): 128K上下文 KV Cache ≈ 2 * 64 * 128 * 128000 * 80 * 2 = 320GB 320GB的KV Cache远超单GPU显存,必须分片或压缩。 挑战三:长程信息衰减 即使能处理长上下文,模型对中间部分的信息利用效率也在下降——这被称为"Lost in the Middle"现象: ...