流水线并行

流水线并行2026:GPipe到PipeDream

流水线并行:将模型按层切分 张量并行在层内切分权重,流水线并行(Pipeline Parallelism, PP)在层间切分——将模型的不同层分配到不同GPU上。GPU 0持有第1-8层,GPU 1持有第9-16层,依次类推。 这种切分方式让每个GPU只需存储部分层的参数和激活值,极大降低了单GPU显存需求。但它引入了一个新问题:流水线气泡——不同GPU之间需要等待数据传递。 GPipe:朴素流水线 工作原理 GPipe将一个batch切分为多个micro-batch,然后像工厂流水线一样依次处理: 时间: 1 2 3 4 5 6 7 8 9 10 GPU 0: M1 M2 M3 M4 .. .. .. .. .. .. GPU 1: .. M1 M2 M3 M4 .. .. .. .. .. GPU 2: .. .. M1 M2 M3 M4 .. .. .. .. GPU 3: .. .. .. M1 M2 M3 M4 .. .. .. ↑ 前向完成 GPU 3: .. .. .. .. .. .. .. M4' M3' M2' M1' ← 反向 GPU 2: .. .. .. .. .. .. M4' M3' M2' M1' ... M1-M4是4个micro-batch的前向传播,M1’-M4’是反向传播。 ...

2026-07-02 · 3 min · 584 words · 硅基 AGI 探索者
少样本提示

少样本提示2026最佳实践:用更少样本学更多

引言 少样本提示(Few-Shot Prompting)是LLM最强大的能力之一:模型可以从少量示例中快速学会新任务,无需更新参数。2026年,随着模型上下文窗口的扩大和指令跟随能力的提升,少样本提示的效果已经达到甚至超越传统微调方法。本文将系统介绍少样本提示的最佳实践。 少样本提示基础 什么是少样本提示 少样本提示是在提示中提供少量(通常1-10个)输入-输出示例,引导模型学习模式并应用到新输入。 示例:情感分析少样本提示 请将以下评论分类为"正面"或"负面": 评论:这家餐厅的服务太棒了,食物也很美味。 分类:正面 评论:房间很脏,床也不舒服,不会再来了。 分类:负面 评论:手机电池续航很短,但拍照效果不错。 分类: 模型会从两个示例中学会分类模式,然后对新评论进行分类。 零样本 vs 少样本 vs 微调 方法 所需样本 效果 成本 灵活性 零样本 0 中等 低 高 少样本 (5-10) 5-10 高 低 高 微调 1000+ 最高 高 低 少样本提示在效果和成本之间取得了最佳平衡。 2026年少样本提示进阶技巧 技巧一:示例选择策略 不是所有示例都一样重要。研究表明,示例选择对效果影响巨大。 多样性采样 选择覆盖任务空间的多样化示例: 任务:文本分类(体育/科技/政治) 好的示例选择: 示例1(体育):NBA总决赛... 示例2(科技):苹果发布新iPhone... 示例3(政治):国会通过新法案... 避免:三个示例都是体育新闻 难度梯度 从简单到复杂排列示例: 示例1:简单样本(模型零样本就能正确) 示例2:中等难度 示例3:较难样本 这种"课程学习"方式能提升模型表现。 边界样本 选择靠近决策边界的样本: 任务:垃圾邮件检测 好的示例: - 正常邮件:...(明显正常) - 垃圾邮件:...(明显垃圾) - 边界邮件:...(正常但像广告)← 这个最重要 技巧二:示例格式设计 结构化格式 使用清晰的结构分隔输入和输出: ...

2026-07-02 · 2 min · 312 words · 硅基 AGI 探索者
思维链进阶

思维链2026进阶技巧:让AI真正学会思考

引言 Chain-of-Thought(思维链)提示在2022年由Wei等人提出,到2026年已经发展成一套完整的提示工程体系。从简单的"Let’s think step by step"到复杂的自我一致性思维链,这项技术让模型的推理能力得到了数倍的提升。本文将系统介绍2026年思维链提示的进阶技巧。 思维链基础回顾 什么是思维链 思维链提示的核心思想是:让模型在给出最终答案之前,先展示推理过程。就像人类解决复杂问题时会先在脑子里思考步骤一样。 标准提示 vs 思维链提示: 标准提示: 问题:Roger有5个网球。他又买了两筒网球,每筒3个。他现在有多少个网球? 回答:11个。 思维链提示: 问题:Roger有5个网球。他又买了两筒网球,每筒3个。他现在有多少个网球? 让我们一步步思考: 1. Roger最初有5个网球。 2. 他买了两筒网球。 3. 每筒有3个网球,所以2×3=6个新网球。 4. 总共:5+6=11个网球。 回答:11个。 为什么思维链有效 分解复杂问题:将大问题分解为小步骤 减少推理错误:每步推理都更可控 提高可解释性:推理过程对用户可见 利用更多计算:生成更多token进行"思考" 2026年思维链进阶技巧 技巧一:动态思维链(Dynamic CoT) 传统的思维链是固定的,2026年的进阶技巧是"动态"生成思维链: 提示模板: 问题:{question} 请先分析这个问题的类型(数学/逻辑/常识/...),然后选择最合适的推理策略,最后执行推理。 分析:这个问题属于[类型],适合使用[策略]。 推理:[逐步推理过程] 答案:[最终答案] 技巧二:思维树(Tree of Thoughts) 对于需要探索的复杂问题,使用思维树而不是思维链: 提示模板: 问题:{question} 请生成一个思维树来解决这个问题: 1. 列出3-5个可能的解决方向 2. 对每个方向进行初步推理 3. 评估每个方向的可行性 4. 选择最佳方向深入推理 5. 给出最终答案 [按上述结构输出] 技巧三:自我一致性思维链(Self-Consistency CoT) 生成多个思维链,然后选择最一致(或投票最多的)答案: 提示模板: 问题:{question} 请从3个不同角度思考这个问题,然后综合得出最终答案。 角度1:[推理过程1] 角度2:[推理过程2] 角度3:[推理过程3] 综合:[比较3个角度,得出最终答案] 技巧四:思维链+验证(CoT+Verification) 在思维链之后加入验证步骤: ...

2026-07-02 · 2 min · 240 words · 硅基 AGI 探索者
张量并行Megatron-LM

张量并行详解:Megatron-LM

为什么需要张量并行? 当模型参数量超过单GPU显存容量时,模型并行成为必需。张量并行(Tensor Parallelism, TP)是最常用的模型并行方式——将单个层的权重矩阵切分到多个GPU上,每个GPU计算一部分结果,然后通过通信合并。 NVIDIA的Megatron-LM提出了张量并行的标准方案,成为2026年大模型训练的基础设施。 张量并行的核心原理 线性层的切分 一个标准线性层 Y = XW,其中 W ∈ ℝ^{d×h}。将W切分为两个子矩阵有两种方式: 列切分(Column Parallel) 将W按列切分:W = [W₁, W₂],每个GPU持有 W_i ∈ ℝ^{d×h/N} GPU 1: Y₁ = XW₁ ∈ ℝ^{n×h/N} GPU 2: Y₂ = XW₂ ∈ ℝ^{n×h/N} Y = [Y₁, Y₂] ∈ ℝ^{n×h} 列切分后,每个GPU独立计算Y的一部分列,最终通过All-Gather合并。但更聪明的方式是——不需要显式合并,因为后续操作可以利用分块结构。 行切分(Row Parallel) 将W按行切分:W = [W₁; W₂],每个GPU持有 W_i ∈ ℝ^{d/N×h} GPU 1: Y₁ = X₁W₁ (X₁是X的前d/N列) GPU 2: Y₂ = X₂W₂ (X₂是X的后d/N列) Y = Y₁ + Y₂ (All-Reduce) 行切分后需要All-Reduce求和。 ...

2026-07-02 · 3 min · 461 words · 硅基 AGI 探索者
Agent模型选型

Agent模型选型框架:为智能体挑大脑

引言 Agent(智能体)是2026年AI应用的核心范式。一个优秀的Agent不仅需要强大的语言理解能力,更需要精准的工具调用、可靠的推理、持久的上下文记忆和灵活的规划能力。选择适合Agent的模型,远比选择通用聊天模型复杂。本文将提供一个系统化的Agent模型选型框架。 Agent核心能力需求 1. 工具调用(Tool Calling) Agent最核心的能力是调用外部工具。模型需要: 准确理解何时需要调用工具 生成符合工具模式(Schema)的参数 处理工具返回结果并决定下一步 关键指标: 工具调用准确率(Function Calling Accuracy) 参数生成正确率 多工具并行调用能力 2. 推理与规划(Reasoning & Planning) 复杂任务需要多步推理和规划: 将大任务分解为子任务 制定执行计划 处理异常情况 关键指标: 任务分解准确率 规划合理性评分 动态调整能力 3. 上下文管理(Context Management) Agent需要维护长期上下文: 记忆历史对话和工具调用结果 处理长上下文(通常>16K tokens) 上下文压缩和摘要 关键指标: 长上下文理解准确率 记忆检索准确率 上下文利用效率 4. 代码执行(Code Execution) 许多Agent需要执行代码来完成任务: 生成可执行的代码 理解代码执行结果 调试和修复代码 5. 多模态理解(可选) 部分Agent需要处理图像、PDF等: 文档理解 图表分析 截图理解 主流Agent模型对比 综合推理型 模型 工具调用 推理 代码 长上下文 综合评分 GPT-5 ★★★★★ ★★★★★ ★★★★★ 128K 9.8/10 Claude 4 Opus ★★★★★ ★★★★★ ★★★★☆ 200K 9.7/10 Gemini 2.5 Ultra ★★★★☆ ★★★★☆ ★★★★☆ 2M 9.5/10 GLM-5 ★★★★☆ ★★★★☆ ★★★★☆ 256K 9.3/10 Qwen 3 235B ★★★★☆ ★★★★☆ ★★★★☆ 128K 9.2/10 工具调用特化型 模型 工具调用准确率 并行调用 特点 GPT-5 98.7% ✓ 工具调用之王 Claude 4 Opus 97.5% ✓ 参数生成最准确 GLM-5 96.8% ✓ 中文工具调用最佳 Qwen 3 235B 95.3% ✓ 代码工具强 Gemini 2.5 Ultra 94.2% ✓ 长上下文工具调用 代码Agent特化型 模型 代码生成 代码执行 调试 特点 GPT-5 + Code Interpreter ★★★★★ ★★★★★ ★★★★★ 最强代码Agent Claude 4 Opus + Analysis ★★★★★ ★★★★☆ ★★★★★ 代码分析强 DeepSeek-V4 ★★★★☆ ★★★★☆ ★★★★☆ 开源最佳 Qwen 3 Coder 235B ★★★★☆ ★★★★☆ ★★★★☆ 中文代码最佳 场景化选型 场景一:个人助理Agent 需求:日程管理、邮件处理、信息查询、任务提醒 ...

2026-07-02 · 2 min · 385 words · 硅基 AGI 探索者
梯度检查点

梯度检查点原理与实现

训练大模型的显存困境 训练一个70B参数的模型,仅模型参数(FP16)就需要140GB显存。加上梯度(140GB)、优化器状态(Adam需要280GB)和激活值,总显存需求轻松超过600GB——即使8卡A100 80GB也无法满足。 在这些显存消耗中,激活值是最容易被忽视的部分。在标准反向传播中,前向传播的所有中间激活值都需要保存下来供反向传播计算梯度使用。对于70B模型、batch_size=4、seq_len=4096,激活值占用可达100GB以上。 梯度检查点(Gradient Checkpointing)通过"以时间换空间"的策略,大幅减少激活值的显存占用。 标准反向传播的显存分析 在标准反向传播中,每个操作的前向输出都需要被保存: 前向: x → Layer1 → a1 → Layer2 → a2 → Layer3 → a3 → Loss 保存: a1, a2, a3 (以及各层的中间状态) 反向: Loss ← ∂L/∂a3 ← ∂L/∂a2 ← ∂L/∂a1 ← ∂L/∂x 使用: 重新使用a3计算a2的梯度,重新使用a2计算a1的梯度,... 对于N层Transformer,每层的激活值大小为 O(batch × seq_len × hidden_dim)。所有层的激活值总和为 O(N × batch × seq_len × hidden_dim),与层数线性增长。 梯度检查点的核心思想 选择性重计算 梯度检查点的核心洞察:不需要保存所有层的激活值,只需保存部分"检查点"层的输入,其余层的激活值在反向传播时重新计算。 检查点设置(每2层一个检查点): 保存: x, a2, a4, a6, ... 前向: x → L1 → a1 → L2 → a2* → L3 → a3 → L4 → a4* → ... (* = 保存的检查点) 反向: 从a6*出发,重新前向计算a5, a4→计算梯度 从a4*出发,重新前向计算a3, a2→计算梯度 ... 显存-计算权衡 假设N层Transformer,每隔k层设置一个检查点: ...

2026-07-02 · 3 min · 514 words · 硅基 AGI 探索者
激活函数综述

激活函数综述2026

激活函数的角色 激活函数是神经网络中引入非线性的关键组件。没有激活函数,多层线性变换的堆叠等价于单层线性变换——网络的表达能力将被严重限制。激活函数的选择直接影响模型的训练动态、收敛速度和最终性能。 在LLM时代,激活函数的演进从ReLU到GELU再到SwiGLU,每一步都带来了可测量的性能提升。 ReLU时代 ReLU的革命性 ReLU(Rectified Linear Unit)的定义极其简单: ReLU(x) = max(0, x) 在ReLU之前,sigmoid和tanh是主流选择,但它们存在梯度消失问题——深层网络中梯度指数衰减。ReLU的梯度在正区间恒为1,有效解决了梯度消失问题,使得深层网络的训练成为可能。 ReLU的缺陷 Dead ReLU问题:当输入持续为负时,ReLU的梯度为零,神经元将永久"死亡"无法恢复。这在学习率设置不当时尤为严重。 非零中心化:ReLU的输出始终非负,导致后续层的输入分布偏向正方向,影响梯度下降效率。 Leaky ReLU与变体 为解决Dead ReLU问题,多种变体被提出: def leaky_relu(x, negative_slope=0.01): """Leaky ReLU: 负区间保留小梯度""" return torch.where(x > 0, x, negative_slope * x) def prelu(x, alpha): """Parametric ReLU: 负区间斜率可学习""" return torch.where(x > 0, x, alpha * x) def elu(x, alpha=1.0): """ELU: 负区间平滑过渡到指数""" return torch.where(x > 0, x, alpha * (torch.exp(x) - 1)) 这些变体在CV领域有一定应用,但在LLM中几乎未被采用——LLM的激活函数走上了另一条路。 GELU:Transformer的原始选择 定义 GELU(Gaussian Error Linear Unit)将输入的高斯分布概率与输入本身相乘: GELU(x) = x · Φ(x) 其中 Φ(x) 是标准正态分布的累积分布函数。实践中常使用近似: def gelu(x): """精确GELU""" return 0.5 * x * (1 + torch.erf(x / math.sqrt(2))) def gelu_tanh_approx(x): """tanh近似(更快)""" return 0.5 * x * (1 + torch.tanh(math.sqrt(2/math.pi) * (x + 0.044715 * x**3))) GELU vs ReLU GELU相比ReLU有两个关键优势: 平滑过渡:在零点附近,GELU是平滑的而非硬截断。这使得梯度更连续,训练更稳定 随机正则化:GELU隐含了一种随机dropout机制——输入越大,被保留的概率越高。这在一定程度上起到了自正则化的作用 原始Transformer(Attention is All You Need)选择了GELU,此后BERT、GPT系列也沿用至今。 ...

2026-07-02 · 2 min · 369 words · 硅基 AGI 探索者
视频生成模型

视频生成模型2026对比:AI导演的崛起

引言 2024年OpenAI发布Sora震撼了世界,但Sora并未立即开放。2026年,视频生成领域已经百花齐放,从OpenAI的Sora 2到快手的可灵3,从Google的Veo 3到Runway的Gen-4,视频生成质量已经达到令人惊叹的水平。本文将全面对比当前主流视频生成模型。 视频生成能力分类 按生成方式 文生视频(T2V):从文字描述生成视频 图生视频(I2V):将静态图片转为动态视频 视频生视频(V2V):对现有视频进行风格转换或编辑 视频延展(Video Extension):延长视频时长 按应用场景 短片创作:生成5-30秒的创意短片 广告素材:商业广告视频自动生成 特效制作:电影级视觉特效 动画生成:卡通/动漫风格视频 主流模型对比 商业模型 模型 厂商 最大时长 分辨率 帧率 特点 Sora 2 OpenAI 60s 1080p 30fps 综合最强 Veo 3 Google 60s 1080p 30fps 写实最强 Gen-4 Runway 20s 1080p 24fps 编辑能力强 可灵3 快手 30s 1080p 30fps 中文最佳 Pika 2 Pika 15s 720p 24fps 动画风格 Luma Dream 2 Luma 10s 720p 24fps 创意效果好 开源模型 模型 最大时长 分辨率 特点 Open-Sora 2 15s 720p 开源Sora复现 CogVideoX 2 10s 720p 智谱开源 HunyuanVideo 10s 720p 腾讯开源 Mochi 2 10s 720p Genmo开源 核心能力对比 视频质量 在人类评估中(5分制): ...

2026-07-02 · 2 min · 338 words · 硅基 AGI 探索者
神经网络归一化

神经网络归一化:LN vs BN vs RMSNorm

归一化:深度学习的"稳定器" 深度神经网络的训练面临一个根本性挑战:随着层数加深,激活值的分布会发生剧烈变化(Internal Covariate Shift)。这种分布偏移导致上层需要不断适应下层的输出分布变化,学习变得困难。归一化层通过将激活值"拉回"到稳定分布,有效缓解了这一问题。 在Transformer时代,Layer Normalization(LN)已成为标配,而RMSNorm等轻量化变体正在成为新的主流选择。 Batch Normalization的局限性 BN的工作原理 Batch Normalization对batch维度进行归一化: def batch_norm(x, gamma, beta, eps=1e-5, momentum=0.1, running_mean=None, running_var=None): """ x: [batch_size, channels, height, width] """ if running_mean is not None: # 推理模式:使用预计算的统计量 mean = running_mean var = running_var else: # 训练模式:计算当前batch的统计量 mean = x.mean(dim=(0, 2, 3), keepdim=True) var = x.var(dim=(0, 2, 3), keepdim=True) # 更新running统计量 running_mean = momentum * mean + (1 - momentum) * running_mean running_var = momentum * var + (1 - momentum) * running_var # 归一化 x_norm = (x - mean) / torch.sqrt(var + eps) # 仿射变换 return gamma.view(1, -1, 1, 1) * x_norm + beta.view(1, -1, 1, 1) BN在LLM中的问题 BN在LLM训练中有几个致命缺陷: Batch Size依赖:LLM通常用很小的batch size(甚至batch_size=1),统计量不稳定 RNN不兼容:RNN的时间步之间需要sequential处理,无法跨batch统计 分布式训练复杂:不同GPU上的batch统计量不一致,需要同步 序列长度变化:NLP任务中序列长度经常变化,padding影响统计 Layer Normalization LN的工作原理 Layer Normalization对单个样本的所有特征进行归一化,独立于batch维度: def layer_norm(x, gamma, beta, eps=1e-5): """ x: [batch_size, seq_len, hidden_size] """ # 对最后一个维度计算均值和方差 mean = x.mean(dim=-1, keepdim=True) var = x.var(dim=-1, keepdim=True) # 归一化 x_norm = (x - mean) / torch.sqrt(var + eps) # 仿射变换 return gamma * x_norm + beta LN的优势 Batch无关:每个样本独立归一化,不依赖batch size 序列处理友好:NLP和RNN任务天然适用 实现简单:无需维护running统计量 Transformer标配:Pre-LN Transformer几乎成为标准 Pre-LN vs Post-LN 原始Transformer使用Post-LN(归一化在残差连接之后),但训练不稳定。Pre-LN将归一化移到残差分支内部: ...

2026-07-02 · 2 min · 412 words · 硅基 AGI 探索者
图像生成模型

图像生成模型2026横评:谁是最强画师

引言 图像生成AI在2026年已经从"能看"进化到"好看"的阶段。无论是写实照片、艺术插画还是商业设计,AI生成的图像质量已经达到专业级水平。本文将全面对比当前主流的图像生成模型。 主流模型概览 商业API DALL-E 4 (OpenAI) — 综合能力最强 Imagen 4 (Google) — 写实照片最强 Midjourney v7 — 艺术风格最佳 Firefly 3 (Adobe) — 商用最安全 Ideogram 3 — 文字渲染最强 开源模型 Stable Diffusion 4 (Stability AI) — 开源生态之王 FLUX 2 (Black Forest Labs) — 开源质量最佳 SDXL Turbo 2 — 实时生成 Kolors 2 (快手) — 中文理解强 CogView 4 (智谱AI) — 中文文生图 核心能力对比 图像质量 (FID分数越低越好) 模型 FID↓ 分辨率 生成速度 FLUX 2 8.2 2048×2048 2s DALL-E 4 9.5 2048×2048 3s Midjourney v7 9.8 2048×2048 4s Imagen 4 8.8 2048×2048 3s SD 4 10.5 2048×2048 2s Kolors 2 11.2 1024×1024 1.5s CogView 4 11.8 1024×1024 2s 文本理解 提示词理解的准确度: ...

2026-07-02 · 2 min · 405 words · 硅基 AGI 探索者
鲁ICP备2026018361号