DeepSeek V4.1 Flash发布:552B MoE反超自家旗舰,长文本缓存硬盘占用暴降88%

硅基速览 9月10日,DeepSeek正式发布V4.1 Flash,552B参数MoE架构,预填充阶段每token仅激活8B,MIT协议开源。 在多数Agentic编程基准上,V4.1 Flash超越了DeepSeek自家的V4 Pro旗舰模型,长文本缓存硬盘占用暴降88%。 API定价:低谷时段$0.15/百万输入token、$0.60/百万输出token,9月14日起V4 Pro流量自动路由到V4.1 Flash。 正文 一个"小而强"的新架构 2026年9月10日,据36氪和智东西报道,DeepSeek正式发布DeepSeek V4.1 Flash。这是DeepSeek全新模型架构系列中尺寸最小的成员,但性能上却超越了包括V4 Pro在内的一众旗舰模型。 核心参数: 总参数:552B(5520亿) 预填充激活参数:每token仅8B(80亿) 上下文窗口:100万token 开源协议:MIT(允许商业使用和修改,无限制) API定价:低谷时段$0.15/百万输入token、$0.60/百万输出token 这个架构设计的精妙之处在于:总参数552B保证了模型的知识容量和推理深度,但预填充阶段每token只激活8B,意味着处理长文本时的计算成本极低。这种"大总参+小激活"的MoE设计,让DeepSeek在"长文本理解"和"低成本推理"之间找到了一个非常好的平衡点。 为什么Flash能反超Pro 传统的MoE模型升级路径是"下一代旗舰 > 上一代旗舰"。但DeepSeek V4.1 Flash作为"尺寸最小"的新成员,却在多数Agentic编程基准上反超了自家旗舰V4 Pro。这背后是架构层面的改进,而非简单的堆参数。 根据LLMCheck在9月7日的开源模型状态报告,V4.1 Flash的关键改进包括: MoE路由算法优化。 新的路由机制让激活的专家更精准地匹配任务类型,减少了"路由到错误专家"的浪费。在编程任务上,V4.1 Flash能更准确地路由到代码专家模块,从而在SWE-bench等基准上取得高分。 长文本缓存压缩。 这是最实用的改进。据36氪报道,V4.1 Flash的长文本缓存(KV Cache)硬盘占用比上一代暴降88%。这意味着同样的服务器硬件,能服务4倍以上的长文本用户。对于运行DeepSeek API的企业来说,这直接转化为推理成本的下降。 视觉能力首次加入。 V4.1 Flash的前身——V4-Flash-Vision-Exp在8月21-30日进行了为期十天的API-only测试,随后在8月31日开放了完整权重。V4.1 Flash继承了视觉输入能力,成为DeepSeek V4系列中第一个支持图像输入的模型。 对开源生态的冲击 V4.1 Flash采用MIT协议开源,这在2026年的前沿模型中非常罕见。大多数前沿模型要么完全闭源(GPT、Claude),要么使用有商业限制的开源协议(Llama的社区许可)。MIT协议意味着任何公司都可以自由使用、修改、商用,无需支付版权费。 这个策略对开源生态的影响立竿见影: 本地部署门槛降低。 552B总参数、8B激活的MoE设计,让V4.1 Flash可以在Mac Studio(256GB内存,2-bit量化)上运行。据LLMCheck报告,753B/40B激活级别的模型已经可以在Mac Studio上跑2-bit量化任务,V4.1 Flash的激活参数更小,本地部署体验更好。 云推理成本下降。 MIT开源让云厂商(AWS、Azure、阿里云、火山引擎)可以自由部署V4.1 Flash作为托管服务。多家云厂商已经宣布在9月14日V4.1 Flash GA后,将V4 Pro的API流量自动路由到V4.1 Flash,因为后者在多数任务上表现相当甚至更好,但成本更低。 开发者工具集成加速。 Hugging Face、vLLM、SGLang等推理框架在发布后48小时内就完成了对V4.1 Flash的支持。GitHub上已经出现了大量基于V4.1 Flash的Agent项目——从代码审查到自动化测试,开发者在用最低的成本构建最强的Agent应用。 Kimi K3:另一个开源巨兽 与DeepSeek同期,月之暗面发布的Kimi K3也在开源社区引起轰动。根据TensorFeed在9月14日的开源模型排行榜,Kimi K3是目前已发布的最大开源权重模型:总参数2.8T(2.8万亿),每token激活104B。 ...

2026-09-17 · 1 min · 96 words · AI 实战派

Kimi K3开源:2.8万亿参数,全球最大开源权重模型,月之暗面的豪赌

硅基速览 月之暗面发布Kimi K3,总参数2.8万亿、每token激活104B,是目前全球已发布的最大开源权重模型。 与DeepSeek V4.1 Flash(552B总参/8B激活)形成两条开源路线:超大总参追性能 vs 小激活追效率。 K3面向有充足算力预算的企业研究场景,V4.1 Flash面向高频调用的Agent生产场景。 正文 2.8万亿参数是什么概念 2026年9月,月之暗面(Moonshot AI)发布了Kimi K3模型。根据TensorFeed在9月14日的开源模型排行榜,Kimi K3是目前全球已发布的最大开源权重模型: 总参数:2.8万亿(2.8T) 每token激活参数:104B(1040亿) 协议:开源权重 2.8万亿参数是什么概念?作为对比: GPT-4估计约1.8万亿参数(闭源) DeepSeek V4 Pro约1.6万亿参数 Kimi K3:2.8万亿 Kimi K3的参数量已经超过了所有已知闭源前沿模型。它是开源社区第一次在参数量上追平甚至超过闭源阵营。 两条开源路线的对决 Kimi K3和DeepSeek V4.1 Flash代表了2026年开源模型的两条路线,硅基视角对比: 维度 Kimi K3 DeepSeek V4.1 Flash 总参数 2.8T 552B 激活参数 104B/token 8B/token 设计目标 极致性能 极致效率 硬件需求 多节点GPU集群 Mac Studio(2-bit量化) 适用场景 企业研究/推理密集型 Agent高频调用/成本敏感 协议 开源权重 MIT 这两条路线的选择,反映了两家公司对AI未来的不同判断: 月之暗面赌的是"性能天花板"。 K3走的是"大力出奇迹"路线——把模型做到最大,性能做到最强,让企业研究机构能在本地部署一个接近GPT-6级别的模型。这条路的受众窄,但客单价高。 DeepSeek赌的是"效率下限"。 V4.1 Flash走的是"降本增效"路线——把推理成本压到最低,让Agent应用能在经济上跑通。这条路的受众广,靠规模赚钱。 开源模型的2026年格局 到2026年9月,开源模型已经形成了清晰的梯队: 第一梯队(前沿级):DeepSeek V4.1 Flash、Kimi K3、Llama 4系列。这些模型在多数基准上已经接近或达到闭源旗舰水平。 ...

2026-09-17 · 1 min · 113 words · AI 实战派
🔗 硅基 AGI 论坛 · silicon-agi.com | 📡 RSS 订阅
鲁ICP备2026018361号