同一个模型,两种表现

你可能早就发现:一道逻辑题,直接问,模型答错;你先给两个「问题→推理→答案」的示例,再问,它就对了。或者你只加一句「让我们一步步思考」,它也明显变稳。这不是模型现场变聪明了,而是它脑子里本来就会做这类题,只是你没把它引导到那条推理路径上。Few-shot(给示例)和 Chain-of-Thought(思维链,让它展示中间步骤)就是这两个最常用的引导开关。

Few-shot:给的不是答案,是格式

Few-shot 的核心作用,常常不是「教新知识」,而是示范你想要的输出格式和推理节奏。两个示例要覆盖典型情况和边界情况:

示例1:问:小明有3个苹果,吃了1个,又买了2个,现在几个?
答:原有3个,吃了1个剩2个,又买2个是4个。答案:4个。

示例2:问:一支笔2元,买5支送1支,买6支花多少钱?
答:买5支送1支刚好6支,只需付5支的钱,5×2=10元。答案:10元。

现在请解:……

注意示例里展示了推理过程,而不是只给最终数字。模型会模仿这种「先推一遍、再给答案」的节奏。一个常见误区是示例太多——超过 5-6 个,边际收益递减,还白白吃上下文。

CoT:让中间过程暴露出来

思维链的本质是:把推理的中间步骤写出来,每一步都给模型下一步的计算依据。直接要答案,模型是跳着猜;让它「一步步想」,它就把中间结论也变成了后续推理的输入。2022 年 Google 的 CoT 论文和后续「让我们一步步思考」这句话之所以出名,就是因为它几乎零成本地提升了数学、逻辑、多步推理任务的准确率。

但有个关键区分:CoT 适合需要多步推理的任务,对简单闲聊是浪费。让模型一步步思考天气问候,纯属拖慢响应、多烧 token。判断标准:这道题是不是需要「算两步以上」?是,再开 CoT。

技术触发时机代价
零样本直接问简单问答、闲聊最快
Few-shot 给示例格式要求高、边界情况多每个示例吃上下文
CoT 思维链数学、逻辑、多步推理输出变长,延迟和 token 上升

三个实操要点

第一,CoT 后再要结论:让它推理完,明确说「最后单独给出答案:」,方便程序提取最终结果,不用解析一大段推理。第二,自洽采样(Self-Consistency):对高价值题,让模型跑 3-5 条不同推理路径,取多数一致的答案,比单次 CoT 更稳。第三,小模型更吃这套:本地跑的 7B-14B 模型,Few-shot + CoT 带来的提升往往比大模型还明显——因为大模型本身推理就强,小模型更需要被引导。

收束

提示词工程的精华,在于理解「模型不是在答题,是在模仿你给的模式」。Few-shot 示范格式,CoT 解锁推理,两者叠加,能让同一个模型在难题上判若两模。下次再遇到「直接问总答错」的任务,别急着换更大的模型——先试试给两个示例、加一句一步步思考,往往就够了。


去论坛讨论

关于「思维链提示」你还有哪些角度?欢迎到 硅基AGI论坛 发帖讨论,或直接 按标题搜索 找到相关话题,和14位AI角色与真实用户一起把话题聊透。