Qwen3.8 Max首次开源 + 字节SeedRealtime:2026年8月国产AI双线突破

两个突破,一条主线 2026年8月第二周,国产AI同时在两个方向取得突破:阿里首次开源Max级旗舰模型权重,字节跳动推出原生实时多模态模型。看似不同赛道,背后是同一条主线——国产AI正在从"追赶"走向"定义"。 一、Qwen3.8 Max:2.4万亿参数首次开源 8月10日当周,阿里巴巴正式开源Qwen3.8-Max旗舰模型权重(Qwen3.8-2.4T-A95B)。 这是千问Max级别旗舰模型首次对外开源。 核心参数 指标 数值 总参数 2.4万亿(2.4T) 架构 稀疏MoE 单次激活 ~950亿参数(95B) Artificial Analysis智能指数 58 编程指数 71.8 开源意味着什么 此前Max级模型只有API调用,这次开放权重意味着: 企业可以本地部署:数据不出内网,合规无忧 研究者可以微调:在旗舰模型上做领域适配 生态效应:吸引更多开发者围绕Qwen构建工具链 配套发布 Qwen3.8-27B开放权重预计8月15日上线ModelScope。中小参数版本适合资源有限的团队,与Max版本形成梯度。 对开源生态的影响 国产开源模型已经形成清晰梯队: Qwen3.8 Max (2.4T) — 旗舰,企业级部署 Qwen3.8 27B — 中型,中小团队微调首选 DeepSeek V4 Flash — 轻量,大规模推理 开源不是慈善——是生态卡位。谁的模型被最多人用,谁就定义下一轮技术标准。 二、字节SeedRealtime:AI开始真正"看、听、说" 8月11日,字节跳动推出SeedRealtime模型。 核心能力 原生支持音视频全双工交互——可以同时处理视觉、听觉等输入,并进行实时输出。 过去的多模态AI更像流水线: 视频 → 视觉模型 → 文本理解 → 语言模型 → 语音生成 → 输出 SeedRealtime是原生端到端: 音视频输入 → 实时输出(延迟毫秒级) 这意味着什么 实时对话:你可以直接对着摄像头说话,AI同时看你的表情、听你的声音、实时回复 直播场景:AI可以成为真正的直播主持,与观众实时互动 教育场景:AI家教可以看学生做题过程,实时指导 客服场景:视频客服不再是"录制+播放",而是真正的实时对话 与竞品对比 指标 SeedRealtime GPT-5 Realtime Gemini Live 音视频同时输入 ✅ 原生 ✅ 部分 延迟 毫秒级 ~300ms ~500ms 中文支持 原生 良好 一般 开放程度 API调用 API调用 API调用 字节在中文实时多模态赛道上有明显优势——中文语音识别和生成是字节的看家本领。 ...

2026-08-18 · 1 min · 121 words · AI 实战派

DeepSeek V4 Pro正式版深夜发布:Agent能力暴涨390%,逼近Claude Fable 5

深夜无预告发布,DeepSeek又一次"静默引爆" 2026年8月13日凌晨,DeepSeek官网API文档悄然更新——V4 Pro预览版正式切换为 DeepSeek-V4-Pro-0813。没有发布会,没有预告,甚至没有一篇官方公众号推文。你打开定价页才发现模型版本号已经变了。 这种风格很DeepSeek。但这次更新本身并不低调——Agent能力实现了质的飞跃。 核心参数 指标 V4 Pro预览版 V4 Pro 0813正式版 变化 总参数 1.6T MoE 1.6T MoE 不变 激活参数 ~49B ~49B 不变 上下文长度 100万Token 100万Token 不变 最大输出 — 38.4万Token 大幅提升 Terminal Bench 2.1 72.1 87.9 +15.8 DeepSWE软件工程 12.8 62.7 +390% NL2Repo — 61.5 新增 DSBench-Hard — 67.2 新增 架构和参数量完全没变——1.6T MoE、激活约49B。所有提升来自针对性后训练。 Agent能力:从二流到第一梯队 Terminal Bench 2.1是衡量AI智能体在真实终端环境中完成复杂任务能力的基准。V4 Pro正式版拿下87.9分,距离全球第一的Anthropic Fable 5仅差0.1分。 更惊人的是DeepSWE——从12.8分直接飙到62.7分,接近原来的5倍。这意味着V4 Pro在软件工程场景下的实战能力已经从"勉强可用"跃升到"接近顶尖"。 定价:仍然是最具性价比的旗舰 输入:0.87美元/百万Token(约¥3/百万Token) 输出:1.74美元/百万Token(约¥6/百万Token) 对比Claude Fable 5的输入15美元/百万Token,DeepSeek V4 Pro的价格只有其十七分之一。官方已预告"近期将大幅涨价",趁现在用是最划算的窗口期。 新增功能 Responses API 新增Anthropic兼容的Responses API,支持Tool Calls,可直接导入Codex使用。这意味着你可以用DeepSeek替换Claude作为Codex的后端模型。 ...

2026-08-18 · 1 min · 137 words · AI 实战派

Kling 2.0深度评测:国产AI视频生成的突破

Kling 2.0:国产AI视频的新标杆 快手在2026年初发布的Kling 2.0标志着国产AI视频生成技术的重大突破。作为Sora之外最有竞争力的视频生成模型,Kling 2.0在多项指标上已经接近甚至在某些场景中超越了Sora 2.0。 本文基于200+次生成测试,从七个维度进行系统评测。 评测方法论 为保证评测的客观性,我们采用统一的测试集和评分标准: 评测维度 权重 测试样本数 评分方式 画面质量 20% 30 5分制人工评分 运动合理性 20% 30 自动检测+人工验证 提示词遵循 15% 30 元素检出率 中文理解 15% 20 中文特定场景 时序一致性 10% 20 帧间一致性计算 生成速度 10% 50 平均耗时 功能丰富度 10% N/A 功能清单对比 核心能力评测 1. 画面质量 Kling 2.0采用了升级的DiT(Diffusion Transformer)架构,在分辨率和细节上相比1.5版本有显著提升。 测试场景:人物面部特写、自然风光、城市建筑、产品展示 结果: 指标 Kling 2.0 Sora 2.0 Kling 1.5 最大分辨率 1080p 1080p 720p 面部细节 4.3/5 4.5/5 3.2/5 光影真实度 4.4/5 4.6/5 3.5/5 纹理质量 4.2/5 4.4/5 3.0/5 色彩表现 4.5/5 4.3/5 3.6/5 Kling 2.0在色彩表现上略有优势,特别是在暖色调和东方美学风格的场景中,色彩渲染更加自然。 ...

2026-07-29 · 2 min · 338 words · 硅基 AGI 探索者
DeepSeek V4

DeepSeek V4发布:训练成本仅GPT-6的1/10

DeepSeek V4:成本效率的极致追求 2026年5月,中国AI创业公司DeepSeek发布V4大模型。最令人震撼的不是性能指标——虽然在大多数基准上接近GPT-6——而是训练成本:仅需约800万美元,是GPT-6训练成本的约1/10。 这是DeepSeek连续第二次在大模型成本效率上实现突破。V3在2024年底以约600万美元的训练成本达到当时GPT-4级别的性能;V4进一步将成本效率提升到新的高度。 性能表现 基准测试对比 基准测试 DeepSeek V4 GPT-6 Claude 5 差距 MMLU 91.2% 93.4% 91.8% -2.2% GSM8K 96.1% 97.3% 94.6% -1.2% MATH 80.3% 82.1% 76.8% -1.8% HumanEval 89.7% 91.2% 85.7% -1.5% BBH 89.1% 90.8% 87.6% -1.7% C-Eval (中文) 90.8% 87.5% 85.3% +3.3% MMMU (多模态) 74.8% 72.1% 68.4% +2.7% DeepSeek V4在英文基准上略逊于GPT-6约1-2个百分点,但在中文基准上反超。考虑到训练成本仅为GPT-6的1/10,这个性能水平堪称卓越。 推理效率 DeepSeek V4采用了MoE架构,总参数680B,激活参数仅52B: 指标 DeepSeek V4 GPT-6 优势 推理FLOPS 52B等效 约220B 4.2x效率 显存占用 104GB (FP16) 约440GB 4.2x节省 单卡吞吐量 2,400 tok/s (H100) 约800 tok/s 3x提升 成本/token $0.0008 $0.003 3.75x便宜 这种极致的成本效率,使得DeepSeek V4 API的定价可以做到GPT-6 API的1/5。 ...

2026-07-02 · 2 min · 292 words · 硅基 AGI 探索者
字节Seed 3.0

字节Seed 3.0模型发布:中文能力登顶

Seed 3.0:字节跳动的AI野心 2026年6月,字节跳动在火山引擎FORCE大会上正式发布Seed 3.0大模型。在中文NLP基准测试C-Eval、CMMLU和AlignBench上,Seed 3.0全面超越了GPT-6、Claude 5和Gemini 3 Ultra,成为中文能力最强的大模型。 这是中国AI公司首次在中文综合能力上全面登顶。对于一直在大模型领域默默投入的字节跳动来说,Seed 3.0是一个里程碑式的成果。 模型规格 架构设计 Seed 3.0的技术报告显示,它采用了MoE架构: 规格 Seed 3.0 Seed 2.0 总参数 520B 180B 激活参数 65B 40B 专家数 64 16 激活专家 6 4 层数 80 64 隐藏维度 14336 8192 注意力头 112 (GQA 14 KV) 80 (GQA 10 KV) 上下文长度 1M 256K 词表大小 150K(中文优化) 100K Seed 3.0的词表从100K扩展到150K,新增的50K主要覆盖中文字词、成语、专业术语和emoji。更大的中文词表意味着中文token的压缩比更高——同样的中文文本,Seed 3.0的token数比GPT-6少约30%,这直接降低了推理成本。 训练数据 字节在技术报告中披露了训练数据的构成: 中文网页:35T tokens(高质量过滤后) 英文网页:45T tokens 代码:15T tokens 学术文献:12T tokens(中文3T + 英文9T) 多模态数据:20T tokens 合成数据:18T tokens 其他语言:5T tokens 总计:约150T tokens 中文数据占比超过30%,这是Seed 3.0中文能力领先的数据基础。作为对比,GPT-6的中文数据占比估计不到10%。 ...

2026-07-02 · 2 min · 286 words · 硅基 AGI 探索者
kling3 review

可灵 3.0 评测:国产 AI 视频生成的领跑者

2026 年,快手可灵已经迭代至 3.0 版本。作为国内最早商业化的 AI 视频生成产品之一,可灵在中文场景理解方面的深耕让它在本土市场占据了独特地位。本文将全面评测可灵 3.0,探讨它为何能成为国产 AI 视频生成的领跑者。 一、产品定位与核心能力 可灵 3.0 的产品定位非常清晰:面向中文创作者和企业的 AI 视频生成工具。相比国际竞品,它在三个维度上构建了差异化壁垒: 中文语义理解:对中国文化元素、成语典故、中式审美的深度理解 本土场景优化:电商、教育、短视频等国内主流应用场景的专项训练 性价比优势:以人民币计价,价格对国内用户更友好 核心参数对比 参数 可灵 3.0 Sora 2 Runway Gen-4 最大分辨率 1080p 1080p 4K 最大时长 30s 60s 30s 帧率 24/30fps 24/30/60fps 24fps 中文理解 ⭐⭐⭐⭐⭐ ⭐⭐⭐ ⭐⭐ 参考图生成 ✅ ✅ ✅ 首尾帧控制 ✅ ✅ ✅ 镜头运动控制 ✅ ✅ ✅ API 开放 ✅ ✅ ✅ 原生音频 ✅ ✅ ❌ 二、中文语义理解——可灵的核心壁垒 这是可灵 3.0 区别于国际竞品的核心能力。我们设计了三组专项测试来验证这一能力。 测试一:中国文化元素理解 Prompt 可灵 3.0 表现 Sora 2 表现 “水墨画风格的山水,浓淡干湿,虚实相生” 精准还原水墨质感,山峦层次分明 生成油画/水彩质感,缺乏水墨韵味 “穿汉服的女子在故宫红墙前拍照” 服装形制正确,发髻、配饰符合朝代 服装过于华丽,不符合汉服形制 “春节团聚,北方年夜饭场景” 饺子、春联、灯笼等元素齐全 元素正确但比例失调 “武侠电影风格的打斗,竹林” 剑客姿态飘逸,轻功飘逸 动作生硬,服装偏日式 测试结论:可灵 3.0 在中国文化元素理解上领先竞品约 40%。 ...

2026-06-28 · 2 min · 410 words · 硅基 AGI 探索者
鲁ICP备2026018361号