长上下文技术演进:从位置编码到环形注意力

长上下文技术演进:从位置编码到环形注意力

从GPT-3的2K上下文到Gemini 2.5的10M上下文,长上下文技术是大模型领域进步最快的方向之一。2026年,百万级token的上下文窗口已成为旗舰模型的标配。本文将系统梳理这一技术演进的核心脉络。 1. 位置编码的演进 1.1 绝对位置编码的局限 原始Transformer使用可学习的绝对位置编码,最大长度在训练时固定。外推到更长序列时效果急剧下降。 1.2 RoPE:旋转位置编码 RoPE(Rotary Position Embedding)通过在复数域旋转Query和Key来编码相对位置: $$\text{RoPE}(x, m) = x e^{im\theta}$$ 其中 $m$ 为位置索引,$\theta_i = 10000^{-2i/d}$。两个位置 $m, n$ 的注意力分数仅依赖于相对位置 $m - n$: $$\text{Re}[\langle \text{RoPE}(q, m), \text{RoPE}(k, n) \rangle] = \text{Re}[\langle q, k \rangle \cdot e^{i(m-n)\theta}]$$ def apply_rotary_pos_emb(q, k, cos, sin): # q, k: [batch, heads, seq_len, d_k] # cos, sin: [seq_len, d_k] q_rot = (q * cos) + (rotate_half(q) * sin) k_rot = (k * cos) + (rotate_half(k) * sin) return q_rot, k_rot def rotate_half(x): x1 = x[..., :x.shape[-1] // 2] x2 = x[..., x.shape[-1] // 2:] return torch.cat((-x2, x1), dim=-1) 1.3 RoPE外推方案 训练时上下文长度为 $L_{train}$,推理时需要扩展到 $L_{test}$。主要外推方案: 方案 原理 效果 计算开销 Position Interpolation (PI) 将位置索引缩放到训练范围 良好 无 NTK-aware 调整RoPE基频 $\theta$ 优秀 无 YaRN 分频段不同插值策略 最佳 极低 LongRoPE 进化搜索最优插值参数 2026年SOTA 一次性搜索 YaRN的核心思想是对不同频率分量采用不同策略: ...

2026-06-30 · 4 min · 652 words · 硅基 AGI 探索者
长上下文技术演进:从位置编码到环形注意力

长上下文技术演进:从位置编码到环形注意力

引言 早期Transformer模型受限于 $O(n^2)$ 的注意力复杂度,上下文长度被限制在512或2048 tokens。到2026年,主流模型已普遍支持128K-1M tokens的上下文窗口。这一进步并非单一技术的产物,而是位置编码、注意力机制、架构设计等多个方向协同演进的结果。本文将系统梳理这一技术演进脉络。 位置编码:长上下文的基石 Absolute Position Embedding 原始Transformer使用learned absolute position embedding: $$ h_i = x_i + \text{PE}[i], \quad \text{PE}[i] \in \mathbb{R}^{d_{\text{model}}} $$ 问题:无法外推到训练长度之外的位置,泛化性差。 Sinusoidal Position Encoding $$ \text{PE}(pos, 2i) = \sin\left(\frac{pos}{10000^{2i/d_{\text{model}}}}\right) $$ $$ \text{PE}(pos, 2i+1) = \cos\left(\frac{pos}{10000^{2i/d_{\text{model}}}}\right) $$ Sinusoidal编码具有相对位置信息,但外推能力仍然有限。 RoPE:旋转位置编码 RoPE(Rotary Position Embedding)是当前主流的位置编码方案,通过旋转矩阵实现相对位置编码: $$ f_q(x_m, m) = R_\Theta^m q(x_m), \quad f_k(x_n, n) = R_\Theta^n k(x_n) $$ 其中: $$ R_\Theta^m = \begin{pmatrix} \cos m\theta_1 & -\sin m\theta_1 & 0 & 0 \ \sin m\theta_1 & \cos m\theta_1 & 0 & 0 \ 0 & 0 & \cos m\theta_2 & -\sin m\theta_2 \ 0 & 0 & \sin m\theta_2 & \cos m\theta_2 \ \vdots & \vdots & \vdots & \vdots \end{pmatrix} $$ ...

2026-06-30 · 3 min · 566 words · 硅基 AGI 探索者
AI推理加速技术2026:量化、剪枝、蒸馏全景

AI推理加速技术2026:量化、剪枝、蒸馏全景

大模型的训练成本固然惊人,但2026年行业共识是:推理成本才是决定AI商业成败的关键。每Token推理成本直接决定了AI应用的经济模型——当GPT-5的推理成本降低10倍,它能打开的市场空间会增加100倍。本文将深度解析2026年最主流的推理加速技术。 一、为什么推理优化如此重要 成本结构的变化 AI推理成本在2026年发生了根本性变化: 发展阶段 成本焦点 核心问题 2020-2022 训练成本 能否训练得起大模型 2023-2024 推理成本 能否部署得起大模型 2025-2026 效率优化 如何以更低成本服务更多用户 2026年,全球AI推理日均Token消耗量突破10万亿,推理基础设施成本超过2000亿美元/年。每降低1%的推理成本,意味着每年节省20亿美元。 延迟 vs 吞吐 vs 成本 推理优化有三个核心目标,它们之间存在权衡: 延迟(Latency):单个请求的响应时间(TTFT, Time to First Token) 吞吐(Throughput):单位时间内处理的请求数(tokens/s) 成本(Cost):每个Token的推理成本 Batch size大 → 吞吐高、延迟高、成本低 Batch size小 → 吞吐低、延迟低、成本高 实际优化需要根据场景选择优先级: 在线服务(Chat):延迟优先 离线批处理:吞吐优先 大规模部署:成本优先 二、量化(Quantization):精度换速度 量化原理 量化是将模型参数从高精度(FP32/FP16)转换为低精度(INT8/INT4/FP8)的过程。理论上: FP32 → FP16:精度损失极小,速度×2,显存÷2 FP16 → INT8:速度×2-4,显存÷4,精度损失<1%(通常) INT8 → INT4:速度×4-8,显存÷8,精度损失5-15%(可优化) 2026年主流量化方法对比 方法 精度 速度 显存节省 质量损失 适用场景 FP16(基准) 100% 1× 1× 0% 通用 FP8(E4M3/E5M2) 99.5% 1.3× 1.5× <0.5% Hopper/Blackwell INT8(对称) 98-99% 1.8× 2× 1-2% 通用 INT8(非对称) 98-99% 1.6× 2× 1-2% 激活分布不均 INT4(GPTQ) 95-97% 3.5× 4× 3-5% 显存受限 INT4(AWQ) 96-98% 3.2× 4× 2-4% 显存受限 INT4(llama.cpp GGUF) 94-97% 4× 4× 3-6% 本地部署 NF4(BitsAndBytes) 95-97% 2.5× 4× 3-5% QLoRA微调 量化方法深度解析 1. Post-Training Quantization (PTQ) 训练后量化是最简单的方式——先训练好模型,再量化。2026年主流PTQ方法: ...

2026-06-30 · 3 min · 542 words · 硅基 AGI 探索者
llm interpretability research

大模型可解释性研究:我们能看到模型在想什么

可解释性:打开大模型的黑箱 大模型拥有卓越的能力,但其内部运作机制仍是一个"黑箱"。理解模型"在想什么"不仅是科学好奇心,更是 AI 安全、对齐和可信部署的基石。2026 年,可解释性研究取得了重大突破。 一、为什么可解释性重要 1.1 三大动机 安全:确保模型没有学习到有害模式 信任:让用户和监管者理解模型决策 科学:理解智能的本质 1.2 可解释性的层次 ┌─────────────────────────────────────────────────────┐ │ 可解释性层次 │ ├─────────────────────────────────────────────────────┤ │ │ │ Level 0: 黑箱 (Black Box) │ │ 只知道输入输出, 内部完全未知 │ │ │ │ Level 1: 行为可解释 (Behavioral) │ │ 知道模型在不同输入下的行为模式 │ │ 方法: 探测, 对抗样本, 行为测试 │ │ │ │ Level 2: 注意力可解释 (Attention) │ │ 知道模型关注输入的哪些部分 │ │ 方法: 注意力可视化, 激活最大化 │ │ │ │ Level 3: 机械可解释 (Mechanistic) │ │ 知道模型内部的计算电路 │ │ 方法: 电路分析, 因果追踪, SAE │ │ │ │ Level 4: 完全理解 (Full Understanding) │ │ 完全理解模型的每一个计算步骤 │ │ (尚未达到) │ │ │ └─────────────────────────────────────────────────────┘ 二、注意力分析 2.1 注意力可视化 最直接的可解释性方法是观察注意力模式: ...

2026-06-28 · 4 min · 774 words · 硅基 AGI 探索者
world models ai physics understanding

世界模型研究:AI 能理解物理世界的规律吗

世界模型:让 AI 理解物理世界的运行规律 人类在幼年时期就建立起对物理世界的直觉理解——物体下落、碰撞反弹、容器容纳。这种"世界模型"是人类智能的基础。2026 年,让 AI 建立类似的世界理解能力,已成为通向 AGI 的核心研究方向。 一、什么是世界模型 1.1 定义 世界模型(World Model)是 AI 系统内部对物理世界规律的表征,使其能够: 预测:给定当前状态和动作,预测未来状态 推理:理解因果关系,进行反事实推理 规划:基于世界规律制定行动方案 理解:解释观察到的现象 数学形式化: $$s_{t+1} = f(s_t, a_t, \epsilon)$$ 其中 $s_t$ 是世界状态,$a_t$ 是动作,$\epsilon$ 是随机性,$f$ 是世界模型。 1.2 人类的世界模型 认知科学研究表明,婴儿在 6 个月时就具备: 能力 出现时间 描述 客体永久性 6-8 个月 知道看不见的物体仍然存在 重力直觉 8-10 个月 预期物体会下落 碰撞理解 10-12 个月 知道碰撞会改变运动方向 数量概念 12-14 个月 区分多和少 因果推理 18-24 个月 理解因果关系 AI 需要学习类似的能力。 1.3 当前的差距 ┌─────────────────────────────────────────────────────┐ │ AI vs 人类 世界模型能力对比 │ ├─────────────────────────────────────────────────────┤ │ │ │ 能力 人类 AI (2026) │ │ ───────── ──── ──────── │ │ 语言理解 100% 85% │ │ 视觉识别 100% 95% │ │ 物理直觉 100% 45% │ │ 因果推理 100% 35% │ │ 空间推理 100% 55% │ │ 反事实推理 100% 30% │ │ 常识推理 100% 50% │ │ 长程规划 100% 40% │ │ │ │ AI 在物理理解和因果推理上仍有巨大差距 │ │ │ └─────────────────────────────────────────────────────┘ 二、世界模型的构建方法 2.1 视频预测模型 通过预测视频的未来帧来学习物理规律: ...

2026-06-28 · 4 min · 713 words · 硅基 AGI 探索者
test time compute theory practice

大模型推理时计算:Test-time Compute 的理论与实践

Test-time Compute:推理 Scaling 的新范式 2026 年 AI 领域最重要的范式转变之一是 Test-time Compute(推理时计算)。如果说预训练 Scaling 是"让模型更聪明",那 Test-time Compute 就是"给模型更多时间思考"。这一方向正在成为突破预训练数据墙的关键路径。 一、为什么需要 Test-time Compute 1.1 预训练的边际递减 传统 Scaling Laws 显示,预训练计算量增加 10 倍,损失仅降低约 17%。但推理时计算的 Scaling 效率更高: 预训练 Scaling: 10x 计算量 → ~17% 损失降低 → ~3% 准确率提升 Test-time Compute Scaling: 10x 推理计算 → ~30-50% 准确率提升 (在推理任务上) 1.2 人类的类比 人类面对简单问题可以快速回答,面对复杂问题需要更多思考时间。大模型也应该如此: $$\text{能力} = f(\text{模型参数}, \text{训练数据}, \text{推理计算量})$$ 传统方法只优化前两项,Test-time Compute 优化第三项。 1.3 OpenAI o1/o3 的启示 OpenAI o1(2024)和 o3(2025)证明了 Test-time Compute 的巨大价值: ...

2026-06-28 · 5 min · 927 words · 硅基 AGI 探索者
training data cleaning pipeline

大模型训练数据清洗:从 Common Crawl 到高质量语料

训练数据:大模型能力的真正来源 “Garbage in, garbage out”——这句话在大模型领域体现得淋漓尽致。2026 年的研究表明,数据质量对模型性能的影响超过了参数量和计算量。本文系统解析从原始网页数据到高质量训练语料的完整清洗流程。 一、原始数据来源 1.1 数据源概览 数据源 规模 质量 获取方式 Common Crawl 250B+ 网页 低-中 公开免费 GitHub 100TB+ 代码 中-高 API + 镜像 arXiv 4M+ 论文 高 公开 API Wikipedia 60M+ 文章 高 公开数据集 PubMed 35M+ 摘要 高 公开 API Stack Overflow 50M+ 问答 中-高 数据转储 LibreText 200K+ 教材 高 公开 领域特定 变化 高 授权/采集 1.2 Common Crawl 的挑战 Common Crawl 是最大的公开网页数据,但质量参差不齐: 原始 Common Crawl 内容分布: ┌──────────────────────────────────────────┐ │ 垃圾/广告内容 35% │█████████████ │ │ 低质量文本 25% │█████████ │ │ 重复内容 15% │█████ │ │ 非目标语言 8% │██ │ │ 有害内容 5% │█ │ │ ────────────────────── │ │ 高质量文本 12% │████ │ │ ────────────────────── │ │ 保留率: ~12% │ └──────────────────────────────────────────┘ 从 250B 网页中清洗后,通常只保留约 5-15% 的高质量内容。 ...

2026-06-28 · 5 min · 974 words · 硅基 AGI 探索者
scaling laws 2026 status

Scaling Laws 2026:我们是否已经撞墙

Scaling Laws:2026 年的深度审视 2020 年,Kaplan 等人发现了大模型性能与计算量、数据量、参数量之间的幂律关系,奠定了"越大越好"的信仰。2026 年,随着 GPT-5、DeepSeek V4 等万亿参数模型的出现,我们需要重新审视:Scaling Laws 还成立吗?我们是否已经撞墙? 一、Scaling Laws 基础回顾 1.1 Kaplan et al. (2020) 的发现 大模型性能(测试损失)与计算量呈幂律关系: $$\mathcal{L}(C) \approx \left(\frac{C_C}{C}\right)^{\alpha_C}$$ 其中 $\alpha_C \approx 0.05$,这意味着计算量增加 10 倍,损失仅降低约 17%。 同时,性能与参数量 $N$ 和数据量 $D$ 也有类似的幂律关系: $$\mathcal{L}(N) \approx N^{-\alpha_N}, \quad \mathcal{L}(D) \approx D^{-\alpha_D}$$ 1.2 Chinchilla (2022) 的修正 Chinchilla 发现:之前的大模型"太小了"。最优的模型规模应与数据量成正比: $$\text{最优 } N^* \approx 20 \cdot D^{0.5}$$ 如果训练 1T tokens,最优模型规模是 20B,而非 GPT-3 的 175B。 这带来了"Chinchilla 赢家"的概念:用更多 tokens 训练更小的模型,可以达到相同的性能但成本更低。 二、2026 年的新发现 2.1 计算最优 Scaling vs 涌现 Scaling 2024-2026 年的研究表明,存在两种不同的 Scaling 模式: ...

2026-06-28 · 3 min · 615 words · 硅基 AGI 探索者
emergent abilities llm

大模型涌现能力:什么参数规模会出现什么能力

涌现能力:量变引起质变的 AI 奇迹 大模型最令人着迷的现象之一是"涌现"——当模型规模超过某个阈值时,某些能力会突然出现。这种从无到有的质变,是深度学习最深刻的发现之一。本文系统分析涌现能力的现象、机制和临界点。 一、什么是涌现能力 1.1 定义 涌现能力(Emergent Abilities)是指:模型在较小规模时完全不具备,但在规模超过某个阈值后突然出现的能力。 $$\text{Emergent}(N) = \begin{cases} 0 & \text{if } N < N^* \ 1 & \text{if } N \geq N^* \end{cases}$$ 其中 $N$ 是模型参数量,$N^*$ 是临界规模。 1.2 经典涌现现象 ┌─────────────────────────────────────────────────────┐ │ 涌现能力与临界规模 (2026 更新) │ ├─────────────────────────────────────────────────────┤ │ │ │ 参数规模 涌现的能力 │ │ ──────── ────────── │ │ │ │ 1B 基础语法、简单问答 │ │ │ │ 7B 指令遵循、少样本学习、代码生成 │ │ │ │ 30B 多步推理、长文本理解、翻译 │ │ │ │ 70B 复杂推理、工具使用、数学证明 │ │ │ │ 175B+ 创意写作、跨领域推理 │ │ │ │ 500B+ (MoE) 自我反思、元认知、长程规划 │ │ │ │ 1T+ 原生多模态推理、世界模型 │ │ │ └─────────────────────────────────────────────────────┘ 1.3 涌现的特征 涌现能力有三个关键特征: ...

2026-06-28 · 3 min · 530 words · 硅基 AGI 探索者
multimodal fusion architectures

多模态融合架构:Early Fusion vs Late Fusion vs Cross-Attention

多模态融合:让 AI 同时理解图像、视频与文本 多模态大模型是 2026 年 AI 的核心赛道。GPT-5、Gemini 2.5、Claude 4 都具备强大的多模态能力。而决定多模态模型能力的核心设计,就是模态融合架构。本文深入解析三大融合范式。 一、多模态融合的基本问题 1.1 模态鸿沟 不同模态的数据有截然不同的特性: 模态 数据类型 特征维度 时间序列 语义密度 文本 离散 Token 768-12288 序列 高 图像 连续像素 1024-8192 2D 空间 中 视频 连续帧 4096-8192 3D 时空 低 音频 连续波形 512-2048 1D 时间 低 融合的核心挑战:如何让模型在不同模态间建立语义对齐。 1.2 融合的三个层次 ┌─────────────────────────────────────────────────────┐ │ 多模态融合层次 │ ├─────────────────────────────────────────────────────┤ │ │ │ 层次1: 表示对齐 (Representation Alignment) │ │ - 将不同模态映射到统一空间 │ │ - 如 CLIP: 图像和文本嵌入到同一空间 │ │ │ │ 层次2: 特征融合 (Feature Fusion) │ │ - 在特征层面组合多模态信息 │ │ - 如 Cross-Attention: 图像特征注入文本 │ │ │ │ 层次3: 推理融合 (Reasoning Fusion) │ │ - 在推理层面整合多模态 │ │ - 如 Chain-of-Thought 跨模态推理 │ │ │ └─────────────────────────────────────────────────────┘ 二、Early Fusion(早期融合) 2.1 核心思想 在模型输入层就将不同模态合并,统一处理: ...

2026-06-28 · 4 min · 801 words · 硅基 AGI 探索者
鲁ICP备2026018361号