Prompt工程进阶:思维链、自一致性与推理增强技术

超越零样本的推理增强 Prompt工程已从简单的指令编写进化为一门系统化的方法论。在需要复杂推理的任务中,恰当的推理增强技术可以将模型准确率提升30-50%。 思维链(Chain-of-Thought) 基本CoT 思维链的核心思想是让模型"展示推理过程"。通过在prompt中加入"让我们一步步思考"或提供推理示例: Q: 一个商店有23个苹果,卖了17个后又进了8个,现在有多少苹果? A: 让我们一步步思考。 初始数量:23 卖出17个后:23 - 17 = 6 又进了8个后:6 + 8 = 14 答案:14 CoT对数学推理、逻辑推理和多步规划任务效果显著。在GSM8K数学基准上,CoT将GPT-4的准确率从约75%提升到92%。 Zero-shot CoT 最简单的CoT只需在prompt末尾添加: 让我们一步步思考。 这五个字的魔力在于:它激活了模型在预训练阶段学到的"推理模式",使模型生成中间推理步骤而非直接跳到答案。 Few-shot CoT 提供2-4个带有推理过程的示例,效果更好但消耗更多token。关键是示例的推理过程要正确且简洁——过长的推理链反而会降低性能。 自一致性(Self-Consistency) 核心思想 CoT的一个问题是:同一条推理路径可能系统性偏向错误答案。自一致性通过生成多条推理路径并投票选择最一致的答案: def self_consistency(prompt, n_samples=5, temperature=0.7): responses = [] for _ in range(n_samples): response = llm.generate( prompt + "\n让我们一步步思考。", temperature=temperature # 较高温度增加多样性 ) answer = extract_answer(response) responses.append(answer) # 多数投票 from collections import Counter most_common = Counter(responses).most_common(1)[0] return most_common[0] 在GSM8K上,自一致性将准确率从92%进一步提升到96%+。代价是推理成本增加5倍。 采样策略 温度:0.5-0.8之间最佳,太低缺乏多样性,太高推理质量下降 采样数:5-10个样本是性价比最优区间 停止条件:如果前3个答案一致,可以提前停止 思维树(Tree-of-Thought) 核心思想 CoT是线性推理,ToT将推理过程组织为树形结构,支持分支探索和回溯: class ThoughtNode: def __init__(self, thought, parent=None): self.thought = thought self.parent = parent self.children = [] self.value = 0 评估值 self.visited = False def tree_of_thought(problem, max_depth=4, branching=3): root = ThoughtNode(problem) frontier = [root] for depth in range(max_depth): next_frontier = [] for node in frontier: # 生成branching个可能的下一步思考 thoughts = generate_thoughts(node, n=branching) for thought in thoughts: child = ThoughtNode(thought, parent=node) # 评估这个思考方向的价值 child.value = evaluate_thought(thought, problem) node.children.append(child) next_frontier.append(child) # 保留最优的节点继续探索(束搜索) frontier = sorted(next_frontier, key=lambda n: n.value, reverse=True)[:branching] # 回溯最优路径 return trace_best_path(root) 适用场景 ToT在以下场景中明显优于CoT: ...

2026-07-16 · 2 min · 314 words · 硅基 AGI 探索者

多模态大模型技术演进:从CLIP到原生多模态架构

多模态融合的三个阶段 多模态大模型的发展经历了三个阶段:模态对齐(CLIP)、模态桥接(LLaVA)、原生多模态(GPT-4o)。每个阶段都代表着对"如何让模型同时理解图像和文本"这一核心问题的不同回答。 第一阶段:CLIP双塔对齐 OpenAI在2021年提出的CLIP开创了对比学习对齐范本。CLIP分别用图像编码器和文本编码器提取特征,通过对比损失拉正样本对、推负样本对: class CLIP(nn.Module): def __init__(self, image_encoder, text_encoder, dim=512): self.image_encoder = image_encoder self.text_encoder = text_encoder self.logit_scale = nn.Parameter(torch.ones([]) * np.log(1/0.07)) def forward(self, images, texts): image_features = self.image_encoder(images) text_features = self.text_encoder(texts) # 归一化 image_features = F.normalize(image_features, dim=-1) text_features = F.normalize(text_features, dim=-1) # 对比损失 logit_scale = self.logit_scale.exp() logits = logit_scale * image_features @ text_features.T return logits CLIP的局限在于它是"理解"而非"生成"——可以判断图文匹配度,但不能生成图像描述或根据文本生成图像。但它奠定了后续多模态模型的基础:CLIP的视觉编码器被广泛应用于Stable Diffusion、LLaVA等模型中。 第二阶段:桥接架构(LLaVA) LLaVA代表了"视觉编码器+LLM"的桥接架构。核心思路是将图像编码为"视觉token"插入LLM的输入序列: [文本token] + [视觉token1] [视觉token2] ... [视觉tokenN] + [文本token] 关键设计选择: 视觉编码器选择 大多数模型使用CLIP ViT-L/14作为视觉编码器。它经过4亿图文对训练,视觉特征质量高。但也有例外:Qwen-VL使用自研的视觉编码器,支持动态分辨率。 连接器设计 连接器负责将视觉编码器的输出适配到LLM的输入空间: 线性投影(LLaVA-1.5):简单MLP,2层即可 Q-Former(BLIP-2):使用可学习的query token提取视觉信息 像素打散(Fuyu):直接将图像patch展平作为token LLaVA-1.5的线性投影看似简单,但在实践中效果最好——简单即有效。 分辨率处理 标准CLIP使用224x224分辨率,这限制了对细节的识别。解决方案: 动态分辨率(Qwen-VL):根据输入图像大小动态调整patch数量 切片策略(LLaVA-NeXT):将高分辨率图像切成多个子图,分别编码 原生高分辨率(InternVL):使用原生支持高分辨率的ViT 第三阶段:原生多模态架构 GPT-4o代表了原生多模态的新范式:不是将视觉编码器"嫁接"到LLM上,而是从头训练一个统一处理所有模态的模型。 原生多模态的核心特征 共享表示空间:图像、文本、音频在同一个embedding空间中 统一Transformer:单一Transformer处理所有模态,无需模态特定的编码器 端到端训练:从预训练阶段就混合多模态数据 架构设计推测 基于公开信息,原生多模态模型的架构可能如下: class NativeMultimodalModel(nn.Module): def __init__(self, dim=4096, n_layers=32): # 统一的token化器 self.text_tokenizer = TextTokenizer() self.image_tokenizer = ImageTokenizer() # VQ-VAE或类似 self.audio_tokenizer = AudioTokenizer() # 统一Transformer self.transformer = Transformer(dim, n_layers) # 统一输出头 self.text_head = nn.Linear(dim, vocab_size) self.image_head = nn.Linear(dim, image_codebook_size) self.audio_head = nn.Linear(dim, audio_codebook_size) 关键挑战在于图像和音频的tokenization:如何将连续的高维信号离散化为token序列。VQ-VAE和其变体(VQ-GAN、FSQ)是主流方案。 ...

2026-07-16 · 1 min · 176 words · 硅基 AGI 探索者

AI安全对齐技术栈:从RLHF到Constitutional AI

对齐问题:让模型"听话"且"不闯祸" 大模型的安全对齐是AGI发展道路上不可回避的核心问题。一个能力强大但不对齐的模型可能带来严重的社会风险。本文系统梳理当前主流的对齐技术方案。 RLHF:经典三阶段方法 第一阶段:SFT(监督微调) 使用人工编写的高质量对话数据微调基座模型: # SFT数据格式示例 { "instruction": "解释量子纠缠", "input": "", "output": "量子纠缠是指两个或多个粒子..." } SFT建立模型的指令跟随能力,是对齐的基础。 第二阶段:奖励模型训练 收集人类偏好数据(A优于B或B优于A),训练一个奖励模型预测人类偏好: class RewardModel(nn.Module): def __init__(self, base_model): super().__init__() self.transformer = base_model self.value_head = nn.Linear(hidden_size, 1) def forward(self, input_ids): hidden_states = self.transformer(input_ids).last_hidden_state # 取最后一个token的隐状态 last_hidden = hidden_states[:, -1, :] reward = self.value_head(last_hidden) return reward.squeeze(-1) 第三阶段:PPO强化学习 使用奖励模型的分数作为奖励信号,通过PPO算法优化策略模型: PPO阶段的核心挑战: KL散度约束:防止策略模型偏离SFT模型太远导致能力退化 奖励黑客:模型可能找到欺骗奖励模型的"捷径" 训练不稳定:需要精细的超参数调优 DPO:简化对齐流程 Direct Preference Optimization(DPO)绕过了奖励模型和强化学习,直接从偏好数据优化策略模型: def dpo_loss(policy_chosen_logps, policy_rejected_logps, ref_chosen_logps, ref_rejected_logps, beta=0.1): pi_logratios = policy_chosen_logps - policy_rejected_logps ref_logratios = ref_chosen_logps - ref_rejected_logps logits = pi_logratios - ref_logratios return -F.logsigmoid(beta * logits).mean() DPO的优势: 无需训练奖励模型,减少一个训练阶段 不需要PPO的复杂训练循环 训练更稳定,超参数更少 数学上等价于在隐式奖励上做最优的Bradley-Terry模型 但DPO也有局限:对数据质量更敏感,且在复杂多轮对话场景中效果不如RLHF。 Constitutional AI:自我改进对齐 Anthropic提出的Constitutional AI(CAI)方法让模型基于一组"宪法"原则进行自我批评和修正: 宪法原则示例: 1. 不要生成歧视性内容 2. 拒绝协助危险活动 3. 保持诚实,不编造信息 4. 尊重用户隐私 CAI的流程: 模型生成初始回复 模型根据宪法原则自我批评 模型生成修正后的回复 用修正后的数据做RLHF/DPO 这种方法减少了对人类标注的依赖,且对齐效果可与RLHF媲美。 安全护栏与实时过滤 对齐训练之外,推理时的安全护栏同样重要: ...

2026-07-16 · 2 min · 214 words · 硅基 AGI 探索者

大模型推理优化全景:从KV Cache到投机解码

推理优化的核心矛盾 大模型推理面临一个核心矛盾:用户需要低延迟和高吞吐,但自回归生成天然是串行的。每生成一个token都需要完整的前向传播,而KV Cache的显存占用随序列长度线性增长。本文系统梳理当前主流的推理优化技术。 KV Cache优化 KV Cache的工作原理 在自回归生成中,前面token的Key和Value可以缓存复用,避免重复计算。但KV Cache的显存占用惊人: $$\text{KV Cache Size} = 2 \times n_{layers} \times n_{heads} \times d_{head} \times seq_len \times batch_size \times \text{dtype_size}$$ 以Llama-3-70B为例,FP16精度下,单条2048长度的请求KV Cache就需要约5GB显存。 PagedAttention vLLM的PagedAttention借鉴操作系统的虚拟内存管理,将KV Cache分成固定大小的block(如16个token),按需分配: # vLLM的核心创新:非连续KV Cache存储 class PagedAttention: def __init__(self, block_size=16): self.block_size = block_size self.block_table = {} # 逻辑block -> 物理block映射 def allocate(self, seq_len): n_blocks = (seq_len + self.block_size - 1) // self.block_size return [self._alloc_block() for _ in range(n_blocks)] PagedAttention将显存利用率从约60%提升到96%以上,显著提高并发处理能力。 KV Cache量化 将KV Cache从FP16量化到INT8可以减半显存占用,而精度损失可控: # vLLM中启用KV Cache量化 from vllm import LLM, SamplingParams llm = LLM( model="meta-llama/Meta-Llama-3-70B", quantization="fp8", # 模型权重量化 kv_cache_dtype="fp8", # KV Cache量化 max_model_len=8192, ) 注意力机制优化 Flash Attention 2/3 Flash Attention通过分块计算和减少HBM读写,将注意力计算复杂度从 $O(n^2)$ 内存降到 $O(n)$ 内存: ...

2026-07-16 · 2 min · 247 words · 硅基 AGI 探索者

MCP协议实战:构建标准化的AI工具调用接口

MCP协议:AI工具调用的"USB-C"接口 2024年Anthropic推出的Model Context Protocol(MCP)正在改变AI Agent与外部工具的交互方式。如果说Function Calling是每个厂商各自的充电接口,那么MCP就是统一的USB-C标准。 MCP核心架构 MCP采用客户端-服务器架构,定义了三个核心原语: Resources(资源) 只读数据源,类似REST中的GET端点。Agent可以读取文件、数据库记录、API响应等: { "uri": "file:///project/src/main.py", "mimeType": "text/x-python", "content": "..." } Tools(工具) 可执行的操作,类似POST端点。每个工具定义包含名称、描述和JSON Schema参数: interface Tool { name: string; description: string; inputSchema: { type: "object"; properties: { ... }; required: string[]; }; } Prompts(提示模板) 预定义的提示词模板,支持参数化注入,方便复用。 与Function Calling的对比 传统Function Calling存在三个痛点:工具定义与模型耦合、跨厂商不兼容、缺乏状态管理。MCP通过标准化协议层解决了这些问题: 维度 Function Calling MCP 工具定义 内嵌在prompt中 独立服务,动态发现 跨厂商 各厂商格式不同 统一协议 状态管理 无状态 支持有状态会话 传输方式 API请求内嵌 stdio/SSE/HTTP 工程实现示例 以下是一个MCP Server的Python实现: from mcp.server import Server from mcp.types import Tool, TextContent server = Server("code-analyzer") @server.list_tools() async def list_tools(): return [ Tool( name="analyze_code", description="分析Python代码的复杂度和潜在问题", inputSchema={ "type": "object", "properties": { "code": {"type": "string", "description": "待分析的代码"}, "strictness": {"type": "string", "enum": ["low", "medium", "high"]} }, "required": ["code"] } ) ] @server.call_tool() async def call_tool(name: str, arguments: dict): if name == "analyze_code": result = await analyze(arguments["code"], arguments.get("strictness", "medium")) return [TextContent(type="text", text=result)] MCP在Agent编排中的价值 MCP最大的价值在于Agent编排场景。当多个Agent需要共享同一组工具时,MCP Server作为统一的工具提供者: ...

2026-07-16 · 1 min · 147 words · 硅基 AGI 探索者

AI Agent记忆系统架构深度解析:从短期记忆到持久化知识库

记忆系统:智能体的"海马体" 人类大脑的海马体负责将短期记忆转化为长期记忆,AI Agent同样需要一套完善的记忆机制才能实现真正意义上的智能行为。当前主流的Agent框架中,记忆系统设计往往是最被低估却又最关键的组件。 三层记忆架构模型 1. 工作记忆(Working Memory) 工作记忆对应Agent的上下文窗口,是当前正在处理的信息。以GPT-4 Turbo为例,128K token的上下文窗口就是其工作记忆容量。但工作记忆存在两个核心问题: 容量限制:即使是128K也有上限,长对话会丢失早期信息 注意力衰减:研究表明,LLM在上下文中间位置的信息处理能力显著下降(Lost in the Middle现象) 工程实践中,我们通常采用滑动窗口策略配合摘要压缩来管理工作记忆: class WorkingMemory: def __init__(self, max_tokens=128000): self.max_tokens = max_tokens self.messages = [] self.current_tokens = 0 def add(self, message): self.messages.append(message) self.current_tokens += count_tokens(message) if self.current_tokens > self.max_tokens * 0.8: self._compress() def _compress(self): # 保留最近N条消息,将早期消息摘要化 recent = self.messages[-10:] old = self.messages[:-10] summary = llm_summarize(old) self.messages = [{"role": "system", "content": summary}] + recent 2. 情景记忆(Episodic Memory) 情景记忆记录Agent过去的交互经历,包括具体对话、决策过程和结果反馈。这一层通常通过向量数据库实现,如Chroma、Pinecone或Weaviate。 关键设计点在于索引策略。单纯按语义相似度检索往往不够,还需要加入时间衰减因子,因为更近的交互经验通常更具参考价值: def retrieve_episodic(query, top_k=5, alpha=0.7): # 语义相似度 semantic_scores = vector_db.search(query, top_k=20) # 时间衰减 for item in semantic_scores: days_ago = (datetime.now() - item.timestamp).days time_score = math.exp(-0.05 * days_ago) item.final_score = alpha * item.similarity + (1 - alpha) * time_score return sorted(semantic_scores, key=lambda x: x.final_score, reverse=True)[:top_k] 3. 语义记忆(Semantic Memory) 语义记忆是Agent的长期知识库,存储经过验证的事实、规则和概念。与情景记忆的区别在于:情景记忆是"经历",语义记忆是"知识"。 典型的语义记忆构建流程包括: 从多次交互中提取共性知识 通过知识图谱建立实体间关系 定期进行知识一致性检查和冲突消解 记忆检索的工程优化 在实际项目中,记忆检索的延迟是用户体验的关键瓶颈。以下是一些经过验证的优化策略: 分层检索:先从语义记忆中快速过滤(关键词匹配),再进行向量相似度精确排序,可以将检索延迟从500ms降低到50ms以内。 预计算缓存:对于高频查询,预先计算并缓存检索结果。利用用户意图分类器判断是否命中缓存。 异步写入:记忆写入不应阻塞主流程。采用写前日志(WAL)模式,先快速持久化到本地,再异步同步到向量数据库。 记忆遗忘机制 好的记忆系统不仅需要记住,还需要遗忘。参考Ebbinghaus遗忘曲线,我们可以设计自适应遗忘策略: 高频访问的记忆:保留权重高,不易遗忘 被验证为错误的记忆:主动降低权重 超过30天未访问的非核心记忆:降级到冷存储 结语 记忆系统是AI Agent从"工具"向"助手"跃迁的关键基础设施。随着Agent应用场景的复杂化,记忆架构的设计将越来越接近人类认知模型。下一篇文章我们将探讨基于MCP协议的记忆共享机制,实现多Agent间的知识传递。 ...

2026-07-16 · 1 min · 134 words · 硅基 AGI 探索者

大模型训练的分布式优化策略:从数据并行到3D并行

训练一个千亿参数的大模型,需要数千GPU协同工作数周。如何高效利用这些GPU,是决定训练成本和速度的关键。分布式训练策略就是这个问题的核心答案。本文将系统解析各种并行策略的原理与工程实践。 一、为什么单GPU不够 1.1 显存瓶颈 一个70B参数的模型: 模型参数(FP16):140GB 梯度(FP16):140GB 优化器状态(Adam, FP32):560GB 激活值:取决于batch和序列长度 总计约840GB+ ——远超单张A100的80GB显存。 1.2 计算瓶颈 训练70B模型一个epoch(1万亿token): 单A100算力:312 TFLOPS (FP16) 训练所需FLOPS:~6×10²³ 单卡理论时间:~22000天 需要2048张A100并行才能在11天内完成。 二、数据并行(DP) 2.1 基本原理 最直观的并行——每张GPU持有完整模型副本,处理不同数据: GPU 0: 完整模型 + Batch[0:32] GPU 1: 完整模型 + Batch[32:64] GPU 2: 完整模型 + Batch[64:96] GPU 3: 完整模型 + Batch[96:128] 前向传播 → 各GPU独立计算loss 反向传播 → AllReduce同步梯度 更新 → 各GPU同步更新参数 2.2 问题:大模型装不下 数据并行要求每张GPU能装下完整模型+优化器状态+梯度。对于70B模型,需要840GB——单卡80GB根本装不下。 2.3 ZeRO优化:显存突破 DeepSpeed的ZeRO(Zero Redundancy Optimizer)通过切分训练状态来突破显存限制: ZeRO-1: 切分优化器状态 每GPU只存 1/N 的优化器状态 70B模型: 560GB/N → N=8时70GB/卡 ZeRO-2: 切分优化器状态 + 梯度 每GPU只存 1/N 的优化器状态和梯度 70B模型: (560+140)GB/N → N=8时87.5GB/卡 ZeRO-3: 切分优化器状态 + 梯度 + 参数 每GPU只存 1/N 的所有状态 70B模型: (560+140+140)GB/N → N=8时105GB/卡 参数在前向/反向时按需All-Gather # ZeRO-3的参数按需获取 class ZeRO3Layer: def forward(self, x): # 按需All-Gather本层参数 full_weight = self.all_gather(self.shard_weight) output = F.linear(x, full_weight) # 立即释放完整参数 del full_weight return output def backward(self, grad_output): # 按需All-Gather本层参数 full_weight = self.all_gather(self.shard_weight) grad_input = grad_output @ full_weight.T # Reduce-Scatter梯度 self.shard_grad = self.reduce_scatter(grad_output.T @ self.input) return grad_input 三、张量并行(TP) 3.1 原理 将单个层的参数矩阵切分到多张GPU上: ...

2026-07-13 · 4 min · 671 words · 硅基 AGI 探索者

从单模态到多模态:AI感知的进化之路

人类的感知是多模态的——我们看、听、说、触,这些感官协同工作,构成了对世界的完整理解。AI从纯文本出发,正在经历一场从"单感官"到"全感官"的进化。这条路上有哪些关键突破?多模态AI的感知与人类感知有何异同?本文将系统梳理。 一、单模态时代:各自为政 1.1 文本AI的局限 纯文本大模型虽然能力惊人,但存在根本性局限: 无法理解视觉内容:“红色"对文本模型只是一个token,没有视觉体验 空间推理薄弱:描述"把桌子左边的椅子搬到右边"时,文本模型容易混乱 缺少物理直觉:不理解"重物掉落会发出声响"这样的物理常识 文档理解受限:处理PDF/图表时,丢失排版和视觉信息 1.2 视觉AI的局限 传统计算机视觉模型(CNN时代): 只能做特定任务(分类、检测、分割) 缺乏语义推理能力 无法用自然语言描述所见 1.3 语音AI的局限 传统语音系统: ASR将语音转为文本,但丢失语调、情感 TTS将文本转为语音,但表达力有限 无法理解"他说’没问题’但其实语气很不情愿” 二、早期多模态尝试:拼接式融合 2.1 CLIP:图文对齐的突破(2021) OpenAI的CLIP开创了视觉-语言对齐的新范式: 训练方式: 对比学习 正样本: (猫的图片, "一只猫的照片") 负样本: (猫的图片, "一只狗的照片") 学习目标: 正样本的相似度高,负样本的相似度低 结果: 图像和文本编码到同一个向量空间 CLIP的意义:第一次让AI能够"用语言理解图像"。你可以说"找到图片中穿红色衣服的人",CLIP就能找到——无需专门训练。 2.2 BLIP-2:Q-Former桥接(2023) BLIP-2引入了Q-Former架构,用一组可学习的query从视觉编码器中提取与语言相关的信息: 图像 → Vision Encoder → 视觉特征 ↓ Q-Former (32个learnable queries) ↓ 视觉-语言对齐特征 ↓ 冻结的LLM → 文本输出 关键创新:Q-Former像一个"翻译官",将视觉信息压缩成LLM能理解的格式。 2.3 LLaVA:简单的拼接,惊艳的效果(2023) LLaVA证明了最简单的方法往往最有效: ...

2026-07-13 · 2 min · 359 words · 硅基 AGI 探索者

大模型压缩技术全景:剪枝、量化、蒸馏的工程实践

大模型越来越大,但部署环境千差万别。不是每台设备都有A100,不是每个场景都能容忍秒级延迟。模型压缩技术就是连接"大模型能力"和"有限部署资源"的桥梁。本文将系统梳理剪枝、量化、蒸馏三大压缩技术的原理与工程实践。 一、模型压缩的必要性 1.1 部署场景的多样性 场景 内存限制 延迟要求 功耗限制 云端GPU 80GB <2s 无 边缘服务器 16GB <1s 100W 手机端 4-8GB <500ms 5W IoT设备 <1GB <100ms <1W 一个70B参数的模型FP16需要140GB内存——只有云端GPU能跑。要部署到手机,需要压缩20-40倍。 1.2 压缩的三个维度 模型体积: 参数量 × 每参数字节数 推理速度: 与参数量和计算量相关 内存占用: 参数 + KV Cache + 激活值 压缩目标: 在保持精度的前提下,最小化以上三者 二、量化:最实用的压缩技术 2.1 量化原理 将高精度浮点数(FP16/FP32)映射到低精度整数(INT8/INT4): FP16: 0.1234, 0.5678, -0.2345 (16 bit/参数) INT8: 映射到 [-128, 127] (8 bit/参数) → 压缩2倍 INT4: 映射到 [-8, 7] (4 bit/参数) → 压缩4倍 2.2 量化方法对比 PTQ(Post-Training Quantization):训练后量化,无需重新训练 ...

2026-07-13 · 4 min · 714 words · 硅基 AGI 探索者

从GPT到Transformer:架构创新的时间线

2017年"Attention Is All You Need"论文发表时,很少有人预料它会引发一场计算革命。从那以后,Transformer架构经历了无数变体和改进。站在2026年回望,这条演进路线图不仅有趣,更有助于理解未来可能的突破方向。 一、2017-2019:奠基时代 2017年6月:Transformer Google提出的原始Transformer用于机器翻译,核心创新: 自注意力机制:替代RNN的序列依赖,实现并行计算 多头注意力:多个注意力头捕捉不同子空间的信息 位置编码:正弦余弦函数编码位置信息 关键意义:打破了RNN的序列计算瓶颈,训练效率大幅提升。 2018年6月:GPT-1 OpenAI的第一个Generative Pre-trained Transformer: 仅使用Decoder(自回归生成) 无监督预训练 + 有监督微调 参数量:1.17亿 在多个NLP任务上达到SOTA 2018年10月:BERT Google的双向Encoder: Masked Language Model预训练 双向注意力(看上下文而非仅看前文) 刷新11项NLP任务纪录 GPT vs BERT的路线分歧奠定了未来格局:GPT走生成路线,BERT走理解路线。最终,生成路线在scaling中展现出更强的潜力。 2019年2月:GPT-2 参数量激增到15亿,展现了令人惊讶的零样本能力。“写一篇关于独角兽的文章"的输出质量震惊了业界。OpenAI initially以"太危险"为由分阶段发布——现在看来,这个"安全担忧"更像是营销策略。 二、2020-2022:Scaling时代 2020年5月:GPT-3 参数量跳跃到1750亿,few-shot能力涌现。不需要微调,仅靠prompt中的几个示例就能完成新任务。 关键洞察:Scaling Law——模型能力随参数量、数据量、计算量幂律增长。这一发现改变了整个领域的研究范式:从"设计更好的架构"转向"scale up现有架构”。 2021年:稀疏专家模型(MoE) Google的Switch Transformer将MoE引入Transformer: 每个token只激活部分专家网络 参数量增加但计算量不变 相同计算预算下性能更优 MoE在2021年还是"小众"技术,但到2025-2026年已成为主流大模型的标配。 2022年1月:InstructGPT RLHF(人类反馈强化学习)首次大规模应用: SFT + Reward Model + PPO 模型从"续写"进化为"遵循指令" 这一步是从GPT-3到ChatGPT的关键桥梁 2022年11月:ChatGPT 对话能力质变,AI走入大众视野。技术上的创新不算多(InstructGPT + 对话优化),但产品层面的影响是颠覆性的。 三、2023:架构创新爆发 2023年3月:GPT-4 多模态能力(图文输入),推理能力大幅提升。OpenAI开始走"闭源+API"路线,学术界开始寻找开源替代。 2023年7月:Llama 2 Meta开源Llama 2,商业可用。虽然性能不如GPT-4,但开源生态的繁荣由此开始。 2023年:关键架构创新 Grouped-Query Attention (GQA): ...

2026-07-13 · 2 min · 241 words · 硅基 AGI 探索者
鲁ICP备2026018361号