硅基速览
- 9月10日,DeepSeek正式发布V4.1 Flash,552B参数MoE架构,预填充阶段每token仅激活8B,MIT协议开源。
- 在多数Agentic编程基准上,V4.1 Flash超越了DeepSeek自家的V4 Pro旗舰模型,长文本缓存硬盘占用暴降88%。
- API定价:低谷时段$0.15/百万输入token、$0.60/百万输出token,9月14日起V4 Pro流量自动路由到V4.1 Flash。
正文
一个"小而强"的新架构
2026年9月10日,据36氪和智东西报道,DeepSeek正式发布DeepSeek V4.1 Flash。这是DeepSeek全新模型架构系列中尺寸最小的成员,但性能上却超越了包括V4 Pro在内的一众旗舰模型。
核心参数:
- 总参数:552B(5520亿)
- 预填充激活参数:每token仅8B(80亿)
- 上下文窗口:100万token
- 开源协议:MIT(允许商业使用和修改,无限制)
- API定价:低谷时段$0.15/百万输入token、$0.60/百万输出token
这个架构设计的精妙之处在于:总参数552B保证了模型的知识容量和推理深度,但预填充阶段每token只激活8B,意味着处理长文本时的计算成本极低。这种"大总参+小激活"的MoE设计,让DeepSeek在"长文本理解"和"低成本推理"之间找到了一个非常好的平衡点。
为什么Flash能反超Pro
传统的MoE模型升级路径是"下一代旗舰 > 上一代旗舰"。但DeepSeek V4.1 Flash作为"尺寸最小"的新成员,却在多数Agentic编程基准上反超了自家旗舰V4 Pro。这背后是架构层面的改进,而非简单的堆参数。
根据LLMCheck在9月7日的开源模型状态报告,V4.1 Flash的关键改进包括:
MoE路由算法优化。 新的路由机制让激活的专家更精准地匹配任务类型,减少了"路由到错误专家"的浪费。在编程任务上,V4.1 Flash能更准确地路由到代码专家模块,从而在SWE-bench等基准上取得高分。
长文本缓存压缩。 这是最实用的改进。据36氪报道,V4.1 Flash的长文本缓存(KV Cache)硬盘占用比上一代暴降88%。这意味着同样的服务器硬件,能服务4倍以上的长文本用户。对于运行DeepSeek API的企业来说,这直接转化为推理成本的下降。
视觉能力首次加入。 V4.1 Flash的前身——V4-Flash-Vision-Exp在8月21-30日进行了为期十天的API-only测试,随后在8月31日开放了完整权重。V4.1 Flash继承了视觉输入能力,成为DeepSeek V4系列中第一个支持图像输入的模型。
对开源生态的冲击
V4.1 Flash采用MIT协议开源,这在2026年的前沿模型中非常罕见。大多数前沿模型要么完全闭源(GPT、Claude),要么使用有商业限制的开源协议(Llama的社区许可)。MIT协议意味着任何公司都可以自由使用、修改、商用,无需支付版权费。
这个策略对开源生态的影响立竿见影:
本地部署门槛降低。 552B总参数、8B激活的MoE设计,让V4.1 Flash可以在Mac Studio(256GB内存,2-bit量化)上运行。据LLMCheck报告,753B/40B激活级别的模型已经可以在Mac Studio上跑2-bit量化任务,V4.1 Flash的激活参数更小,本地部署体验更好。
云推理成本下降。 MIT开源让云厂商(AWS、Azure、阿里云、火山引擎)可以自由部署V4.1 Flash作为托管服务。多家云厂商已经宣布在9月14日V4.1 Flash GA后,将V4 Pro的API流量自动路由到V4.1 Flash,因为后者在多数任务上表现相当甚至更好,但成本更低。
开发者工具集成加速。 Hugging Face、vLLM、SGLang等推理框架在发布后48小时内就完成了对V4.1 Flash的支持。GitHub上已经出现了大量基于V4.1 Flash的Agent项目——从代码审查到自动化测试,开发者在用最低的成本构建最强的Agent应用。
Kimi K3:另一个开源巨兽
与DeepSeek同期,月之暗面发布的Kimi K3也在开源社区引起轰动。根据TensorFeed在9月14日的开源模型排行榜,Kimi K3是目前已发布的最大开源权重模型:总参数2.8T(2.8万亿),每token激活104B。
Kimi K3和DeepSeek V4.1 Flash代表了开源模型的两条路线:
- DeepSeek路线:中等总参(552B)+极小激活(8B),追求推理效率和成本
- Kimi路线:超大总参(2.8T)+较大激活(104B),追求绝对性能上限
两条路线各有优劣:DeepSeek V4.1 Flash适合需要高频调用、成本敏感的Agent场景;Kimi K3适合追求极致性能、有充足算力预算的企业研究场景。
硅基AGI社区在论坛silicon-agi.com上正在激烈讨论这两条路线的优劣,不少独立开发者在实测两种模型在Agent任务上的表现差异。
硅基点评
DeepSeek V4.1 Flash的发布,是2026年开源模型领域最重要的事件之一。它证明了一件事:前沿模型的能力不再被闭源公司垄断,开源社区已经能在多数实战任务上达到或接近闭源旗舰的水平,而且成本只有后者的十分之一甚至更低。
对中小团队和独立开发者来说,这是最大的利好。以前你需要每月花几千美元调用GPT-5或Claude API才能做的Agent应用,现在用V4.1 Flash的开源权重自部署,成本可以降到原来的5%以下。这个成本差距,会催生大量以前在经济上不可行的AI应用——比如7x24小时运行的客服Agent、处理百万级文档的法律检索系统、实时监控代码库的安全审计工具。
但也要清醒:开源模型的能力追上闭源旗舰,不等于闭源模型会停下。OpenAI和Anthropic的下一代模型已经在训练中,2027年闭源与开源之间的能力差距可能再次拉大。V4.1 Flash的"性价比窗口期"可能只有12-18个月,现在上车的团队需要在这个窗口内建立自己的护城河。
本文由硅基AGI社区原创,欢迎访问博客 guijiagi.com 获取更多AI实战教程,或到论坛 silicon-agi.com 参与讨论。