LLM剪枝技术

LLM剪枝2026:结构化vs非结构化

剪枝:去除冗余参数 神经网络的过参数化是公认的事实——大量参数对输出的贡献微乎其微。剪枝(Pruning)通过移除这些"冗余"参数来减少模型大小和计算量。 在LLM时代,剪枝面临新的挑战:模型规模巨大使得重新训练成本高昂,且LLM的参数分布与传统CNN有显著不同。2026年的剪枝研究集中在如何在不重训或少量微调的前提下实现高稀疏率。 非结构化剪枝 基本原理 非结构化剪枝将单个权重置零,不改变模型结构。最经典的方法是幅度剪枝(Magnitude Pruning)——移除绝对值最小的权重: def magnitude_prune(weight, sparsity=0.5): """幅度剪枝:将最小幅度的权重置零""" # 计算阈值 threshold = torch.quantile(weight.abs().flatten(), sparsity) # 创建掩码 mask = (weight.abs() > threshold).float() # 应用掩码 return weight * mask, mask 稀疏模式 非结构化剪枝产生的稀疏模式是"随机"的——零权重分布在矩阵的任意位置。这种模式虽然理论上能减少参数量,但在标准GPU上无法获得实际加速——因为稀疏矩阵的乘法效率远低于密集矩阵。 2:4稀疏 NVIDIA Ampere及以后架构支持2:4结构化稀疏——每4个连续元素中恰好2个为零。这种模式有硬件原生支持,可以获得约2倍加速: def apply_2_4_sparsity(weight): """应用2:4稀疏模式""" output = weight.clone() # 将权重重排为 [N, 4] 的块 blocks = output.view(-1, 4) for i in range(blocks.shape[0]): block = blocks[i].abs() # 保留最大的2个,其余置零 top2_indices = block.topk(2).indices mask = torch.zeros(4, device=weight.device) mask[top2_indices] = 1 blocks[i] *= mask return output.view_as(weight) 2:4稀疏是非结构化和结构化之间的折中——有一定的结构约束(硬件加速),但保持了一定的灵活性。 SparseGPT SparseGPT是2023年提出的LLM后训练剪枝方法,能在不需要重训的情况下将模型稀疏化到50%: def sparsegpt_prune(layer, calibration_data, sparsity=0.5): """SparseGPT单层剪枝""" W = layer.weight.data # [out, in] H = compute_hessian(layer, calibration_data) # [in, in] H += torch.eye(H.shape[0]) * 0.01 # 正则化 # 逐列处理 for i in range(W.shape[1]): # 计算每个权重的"重要性"分数 importance = W[:, i].abs() ** 2 / H[i, i] # 选择保留的权重 n_keep = int(W.shape[0] * (1 - sparsity)) keep_indices = importance.topk(n_keep).indices # 对非保留权重进行补偿 mask = torch.zeros(W.shape[0], device=W.device) mask[keep_indices] = 1 # 重建误差补偿 err = (W[:, i] * (1 - mask)) / H[i, i] W[:, i+1:] -= err.unsqueeze(1) @ H[i, i+1:].unsqueeze(0) # 应用掩码 W[:, i] *= mask layer.weight.data = W SparseGPT的核心创新是在剪枝的同时通过重建补偿来减少精度损失——类似于GPTQ的思想,但用于剪枝而非量化。 ...

2026-07-02 · 3 min · 437 words · 硅基 AGI 探索者
语音模型对比

语音模型2026对比:从ASR到TTS再到语音克隆

引言 语音AI在2026年迎来了质的飞跃。语音识别准确率已超越人类速记员,语音合成的自然度达到以假乱真的水平,实时语音对话的延迟降至200ms以内。本文将全面对比当前主流的语音AI模型。 语音识别(ASR) 主流模型 模型 厂商 WER(英文) WER(中文) 特点 Whisper 4 OpenAI 2.1% 3.5% 综合最强 Gemini Audio Google 3.5% 4.2% 多语言 Paraformer v3 阿里 - 2.8% 中文最佳 SenseVoice v3 阿里 3.2% 3.1% 情感识别 WeNet 3 出门问问 4.5% 4.1% 开源 Whisper 3 OpenAI 4.8% 6.2% 开源经典 中文ASR对比 在真实场景(会议、电话、播客)的中文识别: Paraformer v3: WER 2.8% — 中文ASR之王,对方言和口音适应性强 SenseVoice v3: WER 3.1% — 能同时识别语音内容情感 Whisper 4: WER 3.5% — 综合能力强 WeNet 3: WER 4.1% — 开源最佳 实时性对比 模型 延迟(ms) 流式支持 适用场景 Paraformer v3 150 ✓ 实时字幕 Whisper 4 streaming 300 ✓ 会议记录 Gemini Audio 200 ✓ 实时对话 SenseVoice v3 180 ✓ 情感分析 方言与口音 在方言识别上: ...

2026-07-02 · 2 min · 390 words · 硅基 AGI 探索者
LLM蒸馏技术

LLM蒸馏技术2026实践

为什么LLM需要蒸馏? 训练一个超大模型(如700B)然后部署它,成本极其高昂。知识蒸馏(Knowledge Distillation)提供了一条务实的路径:先用大模型(Teacher)的输出作为信号训练小模型(Student),让小模型在更小参数量下接近大模型的性能。 2026年,蒸馏已经成为大模型工程化的标准环节。DeepSeek-V3、Qwen-3等模型都大量使用了蒸馏技术,将超大模型的能力迁移到可部署的尺寸。 蒸馏的理论基础 软标签的信息优势 硬标签(one-hot)只包含"正确答案"的信息,而软标签(softmax概率分布)还包含"错误答案之间的关系"。例如,在分类"猫"时,软标签可能同时给出"狗"的概率0.1——这告诉Student模型"猫和狗在某种特征上是相似的"。 这种"暗知识"(Dark Knowledge)是蒸馏有效性的核心。Teacher模型的输出分布包含了其学到的类别间关系,这些信息在硬标签中完全丢失。 温度参数 温度T控制软标签的"软度": soft_label = softmax(logits / T) 高温使分布更平滑(暴露更多暗知识),低温使分布更尖锐(接近one-hot)。实践中T通常设置为2-10。 LLM蒸馏的主要方法 1. Logit级蒸馏 最经典的蒸馏方式——Student直接学习Teacher的输出概率分布: def logit_distillation_loss(student_logits, teacher_logits, labels, T=4.0, alpha=0.7): """ student_logits, teacher_logits: [batch, seq_len, vocab_size] labels: [batch, seq_len] T: 温度参数 alpha: 蒸馏损失权重 """ # 蒸馏损失:KL散度 student_log_probs = F.log_softmax(student_logits / T, dim=-1) teacher_probs = F.softmax(teacher_logits / T, dim=-1) distill_loss = F.kl_div( student_log_probs.reshape(-1, student_logits.size(-1)), teacher_probs.reshape(-1, teacher_logits.size(-1)), reduction='batchmean' ) * (T ** 2) # 梯度缩放补偿 # 任务损失:交叉熵 task_loss = F.cross_entropy( student_logits.reshape(-1, student_logits.size(-1)), labels.reshape(-1) ) return alpha * distill_loss + (1 - alpha) * task_loss 关键点: KL散度损失需要乘以 T² 来补偿温度对梯度的影响 alpha控制蒸馏与任务学习的平衡 需要Teacher和Student的词表对齐 2. 序列级蒸馏(Sequence-Level KD) 不让Student逐token模仿Teacher,而是让Student学习Teacher生成的完整序列。具体做法是先用Teacher生成大量数据,然后用这些数据训练Student: ...

2026-07-02 · 3 min · 438 words · 硅基 AGI 探索者
边缘部署模型

边缘部署模型选型:让AI在终端跑起来

引言 随着AI应用场景的不断扩展,越来越多的需求要求模型在终端设备上运行——手机、平板、车载系统、IoT设备甚至可穿戴设备。边缘部署不仅能解决延迟和隐私问题,还能大幅降低云端成本。2026年,端侧AI模型已经从"能跑"进化到"好用"的阶段。本文将为你提供全面的边缘部署选型指南。 边缘部署的价值与挑战 核心价值 低延迟:无需网络往返,毫秒级响应 隐私保护:数据不离开设备 离线可用:无网络环境下正常运行 成本低:无API调用费用 个性化:模型可以根据用户数据本地微调 主要挑战 算力受限:移动设备的计算能力有限 内存限制:手机通常只有8-16GB内存 功耗约束:持续推理会消耗电池 存储空间:模型需要适配设备存储 散热问题:长时间运行会导致过热 边缘设备分类 手机端 平台 AI算力(TOPS) 可用内存 推荐模型规模 iPhone 16 Pro 35 8-12GB ≤4B (INT4) 骁龙8 Gen4 45 12-16GB ≤7B (INT4) 天玑9500 40 12-16GB ≤7B (INT4) 边缘计算设备 设备 AI算力(TOPS) 内存 推荐模型规模 Jetson Orin Nano 40 8GB ≤7B (INT4) Jetson Orin NX 100 16GB ≤13B (INT4) 树莓派5 ~5 8GB ≤3B (INT4) RK3588 6 16GB ≤3B (INT4) 车载平台 平台 AI算力(TOPS) 内存 推荐模型规模 NVIDIA Drive Thor 1000 64GB ≤34B (INT4) 高通SA8650 48 32GB ≤13B (INT4) 地平线J6 128 32GB ≤13B (INT4) 端侧模型选型 1-3B级别:超轻量 适用场景:简单对话、文本分类、基础问答 ...

2026-07-02 · 3 min · 436 words · 硅基 AGI 探索者
模型量化影响

量化对性能影响2026实测:精度与效率的平衡术

引言 模型量化是LLM部署中最重要的优化手段之一。通过降低模型参数的精度,可以大幅减少显存占用和提升推理速度。但量化也带来了精度损失的代价。2026年,量化技术已经从简单的INT8发展到了INT4、INT2甚至更低位宽,新的量化方法如GPTQ、AWQ、GGUF等层出不穷。本文将通过实测数据揭示量化对性能的真实影响。 量化方法概述 主流量化方案 方法 位宽 特点 适用场景 FP16 16bit 基准精度 GPU推理基准 BF16 16bit 动态范围大 训练+推理 INT8 8bit 精度损失小 生产环境 INT4 (GPTQ) 4bit 精度损失中等 消费级GPU INT4 (AWQ) 4bit 激活感知 生产环境 INT4 (GGUF) 4bit CPU友好 CPU推理 INT3 3bit 精度损失大 极致压缩 INT2 2bit 实验性 研究用途 量化方法对比 GPTQ: 基于二阶信息的量化,逐层校准,适合GPU推理 AWQ: 激活感知量化,保护重要权重,精度损失更小 GGUF: llama.cpp格式,支持CPU/GPU混合推理 SmoothQuant: 平滑激活值分布,适合INT8量化 QLoRA: 量化+LoRA微调,训练时量化 实测模型 本次测试使用以下模型: Llama 4 70B — Meta开源 Qwen 3 72B — 阿里开源 GLM-5 32B — 智谱开源 DeepSeek-V4 671B (MoE) — 深度求索开源 Mistral 7B v0.4 — Mistral AI 精度损失实测 MMLU-Pro 模型 FP16 INT8 INT4(GPTQ) INT4(AWQ) INT3 Llama 4 70B 82.1% 81.3%(-0.8) 78.5%(-3.6) 79.8%(-2.3) 72.3%(-9.8) Qwen 3 72B 84.5% 83.7%(-0.8) 81.2%(-3.3) 82.1%(-2.4) 75.6%(-8.9) GLM-5 32B 86.2% 85.3%(-0.9) 82.5%(-3.7) 83.8%(-2.4) 76.8%(-9.4) DeepSeek-V4 85.8% 85.1%(-0.7) 82.3%(-3.5) 83.5%(-2.3) 76.2%(-9.6) Mistral 7B 65.2% 64.3%(-0.9) 61.5%(-3.7) 62.8%(-2.4) 55.3%(-9.9) 关键发现: ...

2026-07-02 · 2 min · 371 words · 硅基 AGI 探索者
量化技术对比

量化技术对比:INT4/INT8/FP8

量化:用更少的比特做更多的事 LLM的参数量从7B到671B不断增长,但GPU显存的增长速度远跟不上。量化是缓解这一矛盾最直接的技术——用更少的比特表示模型参数和激活值,在不修改模型架构的前提下减少显存占用和加速推理。 2026年,量化技术已经形成了从INT4到FP8的完整谱系,每种精度都有其适用场景和工程权衡。 量化的基本原理 对称量化 将浮点数映射到整数的固定范围。以INT8为例: x_int8 = round(x_fp / scale) scale = max(|x_fp|) / 127 反量化:x_fp ≈ x_int8 × scale 非对称量化 引入零点偏移,处理分布不对称的情况: x_int8 = round((x_fp - zero_point) / scale) scale = (max(x) - min(x)) / 255 zero_point = min(x) 量化粒度 逐张量(per-tensor):整个张量共用一个scale,最简单但精度损失大 逐通道(per-channel):每个输出通道一个scale,精度好但额外参数多 逐组(per-group):将通道分组,组内共用scale,是精度和效率的折中 def per_group_quantize(x, group_size=128): """分组量化""" original_shape = x.shape # 重排为 [out_features // group_size, group_size, in_features] x_reshaped = x.view(-1, group_size, original_shape[-1]) # 每组计算独立的scale scales = x_reshaped.abs().max(dim=1, keepdim=True).values / 127 # 量化 x_int8 = (x_reshaped / scales).round().clamp(-128, 127).to(torch.int8) return x_int8, scales def per_group_dequantize(x_int8, scales, original_shape): """分组反量化""" x_fp = x_int8.float() * scales return x_reshaped.view(original_shape) INT8量化 适用场景 INT8是最成熟的量化方案,几乎所有推理框架都原生支持。适用于: ...

2026-07-02 · 3 min · 477 words · 硅基 AGI 探索者
多模态模型选型

多模态模型2026选型指南:不止于看图说话

引言 2026年的多模态模型已经远超"看图说话"的阶段。现代多模态模型能够理解图像中的细粒度细节、分析视频的时序信息、处理音频的情感特征,甚至跨模态推理。本文将为你提供系统化的多模态模型选型指南。 多模态能力分类 感知能力 图像理解:物体识别、场景理解、空间关系 视频理解:时序分析、事件检测、动作识别 音频理解:语音识别、情感分析、音乐理解 文档理解:OCR、表格识别、图表解析 推理能力 视觉问答:基于图像的多步推理 图文交叉推理:结合文本和图像进行推理 因果推理:理解视频中事件的因果关系 空间推理:3D空间理解 生成能力 图像描述:高质量图像描述生成 视频摘要:长视频内容摘要 跨模态翻译:图像到文本、文本到图像 主流多模态模型 全能型 Gemini 2.5 Ultra — 支持3模态(图/视频/音频),综合最强 GPT-5o — 实时多模态对话,延迟低 GPT-5 Vision — 图像理解最强 图像特化型 Claude 4 Vision — 文档和图表理解最佳 Qwen 3 VL 72B — 开源视觉最强 InternVL 3 78B — 中文视觉强 视频特化型 Gemini 2.5 Ultra — 长视频理解(2小时) VideoLLaMA 3 — 开源视频理解 Qwen 3 VL 72B — 开源视频理解最佳 音频特化型 Whisper 4 (OpenAI) — 语音识别最强 AudioLM 2 (Google) — 音频理解 Qwen 3 Audio — 中文语音理解 核心基准对比 视觉理解 (MMMU-Pro) 模型 得分 模态 GPT-5 Vision 72.1% 图像 Claude 4 Vision 69.8% 图像 Gemini 2.5 Ultra 67.5% 图像+视频 Qwen 3 VL 72B 62.3% 图像 InternVL 3 78B 60.1% 图像 视频理解 (VideoMME) 模型 得分 最大视频长度 Gemini 2.5 Ultra 76.8% 2小时 GPT-5 Vision 72.3% 10分钟 Qwen 3 VL 72B 68.5% 30分钟 VideoLLaMA 3 62.3% 10分钟 音频理解 模型 语音识别(WER) 情感分析 音频描述 Whisper 4 2.1% ✓ ✗ Gemini 2.5 Ultra 3.5% ✓ ✓ GPT-5o 2.8% ✓ ✓ 跨模态推理 跨模态推理要求模型结合多种模态进行推理: ...

2026-07-02 · 2 min · 311 words · 硅基 AGI 探索者
线性注意力研究

线性注意力研究2026

O(n²)到O(n)的吸引力 标准注意力的O(n²)复杂度是长序列处理的核心障碍。线性注意力旨在将复杂度降至O(n),使百万级token序列成为可能。但这个目标在保持注意力核心功能的同时实现极其困难——注意力之所以是O(n²),正是因为它需要建模所有Query-Key对之间的关系。 线性注意力的核函数框架 基本公式 标准注意力:Attention(Q,K,V) = softmax(QK^T)V 如果我们将softmax替换为一个核函数 φ(·),使得: Attention(Q,K,V) = φ(Q)φ(K)^T V = φ(Q)(φ(K)^T V) 关键变换在于结合律:先计算 φ(K)^T V(与Q无关),得到一个 d×d 的矩阵,然后与 φ(Q) 相乘。这使得复杂度从 O(n²d) 降为 O(nd²)。当 n » d 时,这是显著的速度提升。 Performer的随机特征 Performer使用随机特征方法来近似softmax核: def performer_attention(Q, K, V, n_features=256): """Performer的随机特征近似""" d = Q.shape[-1] # 生成随机投影矩阵 omega = torch.randn(d, n_features) / math.sqrt(d) # 非负映射函数 def phi(x): return torch.exp(x @ omega - 0.5 * (x ** 2).sum(-1, keepdim=True)) / math.sqrt(n_features) # 线性注意力 phi_Q = phi(Q) # [batch, n, m] phi_K = phi(K) # [batch, m, m] phi_V = V # [batch, m, d] # 先算 K^T V,再算 Q (K^T V) KV = torch.einsum('bmd,bme->bde', phi_K, phi_V) # [batch, d, d] output = torch.einsum('bnd,bde->bne', phi_Q, KV) # [batch, n, d] # 归一化 normalizer = torch.einsum('bnd,bmd->bn', phi_Q, phi_K).unsqueeze(-1) output = output / (normalizer + 1e-6) return output Performer的优势是无偏近似(随着特征数增大趋于精确),但需要较大的特征维度才能接近softmax注意力的性能。 ...

2026-07-02 · 2 min · 412 words · 硅基 AGI 探索者
Ring Attention分布式注意力

Ring Attention:分布式长上下文

超长上下文的分布式挑战 随着LLM上下文长度从32K扩展到1M甚至更长,单GPU的显存和计算能力已经远远不够。一个1M token的注意力矩阵在FP16下需要2TB显存——即使分布在8个GPU上,每张卡也需要256GB。 更关键的是,标准注意力计算需要在所有Query-Key对之间计算注意力分数,这在分布式环境下意味着大量的跨GPU通信。Ring Attention通过优雅的环形通信模式解决了这个问题。 核心思想:通信-计算重叠的环形流 Ring Attention的基本思想是:将长序列均匀切分到多个GPU上,每个GPU持有一段序列的Q、K、V。然后通过环形通信传递K/V块,同时与本地Q计算部分注意力。 环形拓扑 假设有N个GPU,编号为0到N-1。GPU i 持有序列的第 i 段的Q_i、K_i、V_i。计算过程如下: 第0步: GPU_i 用本地 Q_i 和 K_i 计算注意力,结果存为 partial_O_i 同时,GPU_i 将 K_i, V_i 发送给 GPU_{(i+1) % N} 第1步: GPU_i 接收 K_{(i-1) % N}, V_{(i-1) % N} 用 Q_i 和接收的 K 计算注意力,累加到 partial_O_i 同时发送 K_{(i-1) % N}, V_{(i-1) % N} 给 GPU_{(i+1) % N} ... (重复N-1步) 第N-1步: GPU_i 已与所有K/V块计算过注意力 partial_O_i 即为最终结果 关键在于:每一步中,通信和计算是并行进行的——GPU在接收下一块K/V的同时,用当前K/V进行注意力计算。 ...

2026-07-02 · 3 min · 454 words · 硅基 AGI 探索者
推理模型对比

推理模型对比:o1/Claude/Gemini谁更会思考

引言 2024年底,OpenAI发布了o1系列模型,引入了"思维链推理"的新范式。2026年,推理模型已经成为AI竞争的新焦点。Claude 4推出了Extended Thinking模式,Gemini 2.5 Ultra强化了推理能力,国产模型也在推理方向上持续发力。本文将深度对比主流推理模型的能力边界。 什么是推理模型 传统的LLM采用的是"直接生成"模式:输入→输出,中间过程对用户不可见。推理模型则采用了"内部思维链"模式: 用户在提问时,模型先进行内部推理(可能需要几秒到几分钟) 推理过程对用户可见(可选) 最终输出经过深思熟虑的答案 这种模式在数学、编程、科学推理等需要多步逻辑的任务上效果显著。 主流推理模型 OpenAI系列 o1-preview — 第一代推理模型 o1 — 正式版,推理能力更强 o1-mini — 轻量版,速度快 o3 (2026.06) — 新一代推理模型 Anthropic Claude 4 Opus Extended Thinking — 可扩展推理模式 Claude 4 Sonnet Extended Thinking — 轻量推理模式 Google Gemini 2.5 Ultra Thinking — 推理增强模式 Gemini 2.5 Flash Thinking — 轻量推理模式 国产模型 DeepSeek-R1 (深度求索) — 开源推理模型 GLM-5 Reasoner (智谱AI) — 推理增强版 Qwen 3 Reasoner (阿里) — 推理专用模型 核心基准对比 GPQA Diamond 研究生级别科学推理,最能体现模型深度推理能力: ...

2026-07-02 · 2 min · 327 words · 硅基 AGI 探索者
鲁ICP备2026018361号