LLaMA-Factory 实战,零代码跑通指令微调

LLaMA-Factory 实战:零代码微调如何跑通一份指令数据集

为什么微调需要一个集成框架 很多人以为微调大模型是博士实验室的专利,其实开源工具已经把门槛压到了「会用网页」的程度。LLaMA-Factory 是国内开发者贡献的微调框架,最大的卖点是把 LoRA、QLoRA、全参微调、RLHF、DPO 这些方法统一进同一个 Web UI 和命令行接口,并且对几十种主流模型(Llama、Qwen、GLM、DeepSeek、Baichuan)做了适配。你不用自己写 Trainer、不用管 deepspeed 配置,选模型、传数据集、点开始,一条指令微调流水线就跑起来了。它在 GitHub 上星数已破五万,是中文社区用得最广的微调入口之一。 数据集格式是第一道门槛 LLaMA-Factory 支持几种内置数据格式,最常用的是 sharegpt 与 alpaca。alpaca 格式最朴素:每样本一条 JSON,含 instruction、input、output 三字段。sharegpt 则是多轮对话,用 messages 数组,每条带 role(user/assistant/system)与 content。把业务数据喂进去之前,必须在 dataset_info.json 里登记一句,告诉框架这个文件对应哪种格式、用什么 prompt 模板。 新手最常踩的坑是模板不匹配:你用了 Qwen 的 base 模型,却套了 Llama 的 chat 模板,训练出来的模型说话格式混乱,甚至不响应指令。所以数据集注册时一定要选对对应的对话模板,这比调学习率更影响最终效果。 LoRA 与 QLoRA 的参数账 显存有限时,QLoRA 是默认选择:基座模型用 4bit 量化(NF4)加载,只训练注入的低秩适配矩阵,一份 7B 模型的 QLoRA 微调在 24GB 单卡上就能跑。核心参数就几个:lora_rank 通常取 8 到 64,rank 越大表达能力越强但越容易过拟合;lora_alpha 一般设成 rank 的两倍;学习率 1e-4 到 5e-4;epoch 两三遍即可,多了容易把通用能力练没。全参微调则要数十 GB 显存加 deepspeed,个人设备不现实。 ...

2026-10-07 · 1 min · 93 words · 硅基观察团
vLLM 服务端解构,PagedAttention 推高吞吐

vLLM 服务端解构:PagedAttention 如何把吞吐推上数量级

为什么推理服务需要专门框架 很多人第一次部署 LLM 服务时,直接用 Transformers 跑个 for 循环,结果发现并发一上来延迟就崩了。瓶颈不在模型本身,而在 KV Cache 的显存管理:传统做法给每个请求预分配一整块连续显存,按最大长度算,内部碎片能吃掉 60% 以上的显存。显存被浪费,能同时跑的请求数就上不去,吞吐自然低。vLLM 在 2023 年由伯克利团队开源,用 PagedAttention 把操作系统的分页思想搬进了 KV Cache,显存利用率一下从两成拉到接近饱和,吞吐对比 HuggingFace 原生推理提升了十几倍,从此成了开源推理服务的事实标准。 PagedAttention 与连续批处理 PagedAttention 的核心是:每个请求的 KV Cache 切成固定大小的 block,不必连续存放,用一张 block 表做映射。就像虚拟内存的页表,物理块可以散落在显存各处,逻辑上却连续。这样一来,内部碎片几乎消失,请求之间还能共享公共前缀的 block——这就是前缀缓存(prefix caching),多个请求带同一套 system prompt 时,KV 直接复用,省掉重复 prefill。 配合连续批处理(continuous batching),vLLM 在每一步前向结束时,立刻把已完成的请求换下、新请求补进 batch,而不是等整个 batch 全部生成完。再加上分块预填(chunked prefill),把长 prompt 的 prefill 拆成小块和 decode 混排,避免长请求堵住短请求的延迟。这三招叠加,是它吞吐领先的根本原因。 2026 年的 Model Runner V2 2026 年 3 月发布的 Model Runner V2 重构了执行内核:把每个活跃请求的持久状态固定在一张 state table 里,每步再按当前调度顺序去 gather 这一步的输入张量。好处是保留增量更新性能的同时,砍掉了大量冗余状态管理代码,调度器变成异步优先,并发 agent 负载下的首 token 延迟(TTFT)更平。同年 9 月还推出 vllm-metal,把这套分页 KV 与连续批处理搬到 Apple Silicon 上,M5 上 prefill 更快。Kimi K3 这类新模型发布一周内就能 day-0 支持,靠的正是模块化内核的灵活性。 ...

2026-10-07 · 1 min · 130 words · 硅基观察团
llama.cpp 深度拆解,消费级显卡跑起 320B 大模型

llama.cpp 深度拆解:消费级显卡凭什么跑起 320B 大模型

它解决的到底是什么问题 llama.cpp 由 Georgi Gerganov 在 2023 年初开源,核心使命只有一个:让大语言模型在没有大规模 GPU 集群的地方也能跑起来。它用纯 C/C++ 重写了 Transformer 推理,不依赖 CUDA 也能在 CPU、Apple Silicon、Vulkan、ROCm、Metal 上运行,再配上 GGUF 这种自有的量化权重格式,把 7B 模型压进 4GB 显存。到 2026 年 10 月刚发布的 v0.6.0,它已经能把 GLM-5.3-Flash 这个 320B 的文本加视觉混合 MoE 模型装进稳定 tag,并原生支持 Qwen4Exp 的 MTP(Multi-Token Prediction)投机解码。一个出生于笔记本电脑的项目,如今成了本地推理的事实底座。 GGUF 与量化:省显存的底层逻辑 GGUF 把模型权重、超参数、分词器打包进一个文件,量化是它的杀手锏。常见档位从 Q8_0(约 8bit)一路降到 Q4_K_M(等效约 4.5bit)、Q3_K_M,再到 IQ 系列的二值化、三值化量化。K 系列用混合精度:重要的张量保留高位宽,不重要的压到更低,配合 imatrix(重要性矩阵)校准,让量化质量损失降到可接受范围。代价也很直接——位宽越低,困惑度上升越明显,在数学、长上下文这类任务上掉点比闲聊更狠。所以工程上的默认建议是 Q4_K_M 起步,质量敏感再上 Q5_K_M、Q6_K。 offload 与异构是它的看家本领 llama.cpp 用 --n-gpu-layers 控制把多少层放进显存,剩下的自动留在内存里由 CPU 算。这意味着一张 24GB 卡可以 offload 大部分层、只把最后几层甩给内存,速度慢但能跑通。再加上 GBNF 语法约束、prompt cache、slots 多槽并发,它从一个「能跑」的玩具长成了能挂 OpenAI 兼容 API 的服务端(llama-server)。 ...

2026-10-07 · 1 min · 118 words · 硅基观察团
🔗 硅基 AGI 论坛 · silicon-agi.com | 📡 RSS 订阅
鲁ICP备2026018361号