klingai 100m users

可灵 AI 两周年:1 亿用户 + 5 亿美元 ARR

从快手内部工具到全球 AI 视频龙头 2024 年 6 月,快手在内部黑客马拉松上发布了可灵 AI 的第一个版本——一个基于自研 Diffusion Transformer 架构的视频生成模型。两年后,可灵 AI 已经成为全球用户规模最大的 AI 视频生成平台。 2026 年 6 月,可灵 AI 两周年活动上,快手公布了最新的业务数据。这些数字让整个行业重新审视中国 AI 产品的商业化能力。 核心数据:一份亮眼的成绩单 用户与营收 指标 数据 对比 全球注册用户 1 亿 两年内达成(ChatGPT 达到 1 亿用了 2 个月,但那是文本) 月活用户 (MAU) 3800 万 行业第一 付费用户 850 万 付费率 22.4% 企业客户 5 万+ 含 500+ 世界 500 强 Q1 2026 营收 6.5 亿元人民币 同比增长 280% ARR (年经常性收入) 5 亿美元 约合 36 亿元人民币 与全球竞品对比 平台 MAU ARR 付费率 核心市场 可灵 AI 3800 万 $5 亿 22.4% 全球 Runway 280 万 $1.2 亿 15% 北美/欧洲 Pika Labs 190 万 $0.6 亿 12% 北美 Sora (OpenAI) 未公开 含在 ChatGPT 中 N/A 全球 海螺 AI (MiniMax) 520 万 $0.8 亿 18% 中国/东南亚 可灵 AI 在用户规模和营收上均领先于专门做视频生成的竞品。Sora 虽然技术领先,但作为 ChatGPT 的附属功能,其独立商业价值难以评估。 ...

2026-06-25 · 3 min · 525 words · AI 实战派
world models research

世界模型研究前沿:AI 能理解物理世界吗?

什么是世界模型 世界模型(World Model)是指 AI 系统内部对物理世界规律的内化表示。它不仅仅是"生成视频",而是理解物体永久性、因果链、物理约束、时间一致性——这些人类婴儿期就开始建立的能力。 Yann LeCun 的 JEPA 论文给出了一个框架性定义: 世界模型能够预测:给定当前状态 $s_t$ 和动作 $a_t$,下一时刻的状态 $s_{t+1}$ 是什么。这个预测不仅包括视觉外观,还包括物理属性、因果关系和不确定性。 LLM 本质上是语言世界模型——它预测下一个 token。但物理世界比语言世界复杂得多:连续状态、不可逆时间、无限维度。 核心方法对比 方法 提出者 核心思想 优势 局限 DreamerV3 Danijar Hafner 在潜空间学习世界模型 + Actor-Critic 样本效率高 仅游戏/简单控制 JEPA Yann LeCun 联合嵌入预测架构,预测抽象表示 避免像素级生成的困难 难以评估 Sora OpenAI DiT 扩散模型生成视频 视觉质量高 不保证物理正确 Genie DeepMind 交互式世界模型,可控生成 可控性强 分辨率低 Cosmos NVIDIA 世界基础模型,物理数据训练 多模态 计算需求大 Sora:视频生成 ≠ 世界模拟 Sora 是 2024 年最轰动的 AI 发布之一。OpenAI 称之为"世界模拟器",但这个说法在学术界引发了激烈争论。 Sora 能做什么 # Sora 架构概览(基于公开信息) """ Sora = DiT (Diffusion Transformer) + 视频压缩网络 1. 视频压缩:3D VAE 将视频压缩到时空 latent space - 输入:256x256x16 帧 → latent: 32x32x4 - 压缩比 ~64x 2. DiT 扩散: - 在 latent space 做条件扩散 - 条件:文本 prompt + 参考帧 - Transformer blocks: 28层, hidden=1024 3. 解码:latent → 视频帧 """ Sora 的物理理解测试 Tim Brooks 等人在技术报告中展示了 Sora 能模拟的物理现象: ...

2026-06-24 · 4 min · 779 words · AI 实战派
鲁ICP备2026018361号