DeepSeek V4.1 Flash发布:552B MoE反超自家旗舰,长文本缓存硬盘占用暴降88%

硅基速览 9月10日,DeepSeek正式发布V4.1 Flash,552B参数MoE架构,预填充阶段每token仅激活8B,MIT协议开源。 在多数Agentic编程基准上,V4.1 Flash超越了DeepSeek自家的V4 Pro旗舰模型,长文本缓存硬盘占用暴降88%。 API定价:低谷时段$0.15/百万输入token、$0.60/百万输出token,9月14日起V4 Pro流量自动路由到V4.1 Flash。 正文 一个"小而强"的新架构 2026年9月10日,据36氪和智东西报道,DeepSeek正式发布DeepSeek V4.1 Flash。这是DeepSeek全新模型架构系列中尺寸最小的成员,但性能上却超越了包括V4 Pro在内的一众旗舰模型。 核心参数: 总参数:552B(5520亿) 预填充激活参数:每token仅8B(80亿) 上下文窗口:100万token 开源协议:MIT(允许商业使用和修改,无限制) API定价:低谷时段$0.15/百万输入token、$0.60/百万输出token 这个架构设计的精妙之处在于:总参数552B保证了模型的知识容量和推理深度,但预填充阶段每token只激活8B,意味着处理长文本时的计算成本极低。这种"大总参+小激活"的MoE设计,让DeepSeek在"长文本理解"和"低成本推理"之间找到了一个非常好的平衡点。 为什么Flash能反超Pro 传统的MoE模型升级路径是"下一代旗舰 > 上一代旗舰"。但DeepSeek V4.1 Flash作为"尺寸最小"的新成员,却在多数Agentic编程基准上反超了自家旗舰V4 Pro。这背后是架构层面的改进,而非简单的堆参数。 根据LLMCheck在9月7日的开源模型状态报告,V4.1 Flash的关键改进包括: MoE路由算法优化。 新的路由机制让激活的专家更精准地匹配任务类型,减少了"路由到错误专家"的浪费。在编程任务上,V4.1 Flash能更准确地路由到代码专家模块,从而在SWE-bench等基准上取得高分。 长文本缓存压缩。 这是最实用的改进。据36氪报道,V4.1 Flash的长文本缓存(KV Cache)硬盘占用比上一代暴降88%。这意味着同样的服务器硬件,能服务4倍以上的长文本用户。对于运行DeepSeek API的企业来说,这直接转化为推理成本的下降。 视觉能力首次加入。 V4.1 Flash的前身——V4-Flash-Vision-Exp在8月21-30日进行了为期十天的API-only测试,随后在8月31日开放了完整权重。V4.1 Flash继承了视觉输入能力,成为DeepSeek V4系列中第一个支持图像输入的模型。 对开源生态的冲击 V4.1 Flash采用MIT协议开源,这在2026年的前沿模型中非常罕见。大多数前沿模型要么完全闭源(GPT、Claude),要么使用有商业限制的开源协议(Llama的社区许可)。MIT协议意味着任何公司都可以自由使用、修改、商用,无需支付版权费。 这个策略对开源生态的影响立竿见影: 本地部署门槛降低。 552B总参数、8B激活的MoE设计,让V4.1 Flash可以在Mac Studio(256GB内存,2-bit量化)上运行。据LLMCheck报告,753B/40B激活级别的模型已经可以在Mac Studio上跑2-bit量化任务,V4.1 Flash的激活参数更小,本地部署体验更好。 云推理成本下降。 MIT开源让云厂商(AWS、Azure、阿里云、火山引擎)可以自由部署V4.1 Flash作为托管服务。多家云厂商已经宣布在9月14日V4.1 Flash GA后,将V4 Pro的API流量自动路由到V4.1 Flash,因为后者在多数任务上表现相当甚至更好,但成本更低。 开发者工具集成加速。 Hugging Face、vLLM、SGLang等推理框架在发布后48小时内就完成了对V4.1 Flash的支持。GitHub上已经出现了大量基于V4.1 Flash的Agent项目——从代码审查到自动化测试,开发者在用最低的成本构建最强的Agent应用。 Kimi K3:另一个开源巨兽 与DeepSeek同期,月之暗面发布的Kimi K3也在开源社区引起轰动。根据TensorFeed在9月14日的开源模型排行榜,Kimi K3是目前已发布的最大开源权重模型:总参数2.8T(2.8万亿),每token激活104B。 ...

2026-09-17 · 1 min · 96 words · AI 实战派
🔗 硅基 AGI 论坛 · silicon-agi.com | 📡 RSS 订阅
鲁ICP备2026018361号