从快手内部工具到全球 AI 视频龙头

2024 年 6 月,快手在内部黑客马拉松上发布了可灵 AI 的第一个版本——一个基于自研 Diffusion Transformer 架构的视频生成模型。两年后,可灵 AI 已经成为全球用户规模最大的 AI 视频生成平台。

2026 年 6 月,可灵 AI 两周年活动上,快手公布了最新的业务数据。这些数字让整个行业重新审视中国 AI 产品的商业化能力。

核心数据:一份亮眼的成绩单

用户与营收

指标 数据 对比
全球注册用户 1 亿 两年内达成(ChatGPT 达到 1 亿用了 2 个月,但那是文本)
月活用户 (MAU) 3800 万 行业第一
付费用户 850 万 付费率 22.4%
企业客户 5 万+ 含 500+ 世界 500 强
Q1 2026 营收 6.5 亿元人民币 同比增长 280%
ARR (年经常性收入) 5 亿美元 约合 36 亿元人民币

与全球竞品对比

平台 MAU ARR 付费率 核心市场
可灵 AI 3800 万 $5 亿 22.4% 全球
Runway 280 万 $1.2 亿 15% 北美/欧洲
Pika Labs 190 万 $0.6 亿 12% 北美
Sora (OpenAI) 未公开 含在 ChatGPT 中 N/A 全球
海螺 AI (MiniMax) 520 万 $0.8 亿 18% 中国/东南亚

可灵 AI 在用户规模和营收上均领先于专门做视频生成的竞品。Sora 虽然技术领先,但作为 ChatGPT 的附属功能,其独立商业价值难以评估。

增长曲线

时间节点 用户量 月营收 关键事件
2024.6 10 万 - 1.0 发布
2024.9 500 万 ¥3000 万 1.5 发布,文生视频
2024.12 2000 万 ¥8000 万 海外版上线
2025.3 4000 万 ¥1.5 亿 2.0 发布,图生视频
2025.6 6000 万 ¥2.8 亿 视频续写功能
2025.9 7500 万 ¥4.2 亿 2.5 发布,4K 输出
2025.12 8500 万 ¥5.5 亿 企业版发布
2026.3 9300 万 ¥6.2 亿 3.0 发布
2026.6 1 亿 ¥6.5 亿 3.0 Omni 发布

3.0 Omni 版本:视频生成的质变

技术架构升级

可灵 3.0 Omni 是两周年活动的核心发布。相比 2.5 版本,3.0 Omni 在架构上进行了根本性重构:

维度 2.5 版本 3.0 Omni
架构 DiT (Diffusion Transformer) DiT + Flow Matching 混合
最大分辨率 1080p 4K (3840×2160)
最长时长 10 秒 30 秒
生成速度 (10秒/1080p) 180 秒 45 秒
语义理解 T5 文本编码 多模态 LLM 理解
音频同步 ✅ 原生音频生成
多镜头叙事 ✅ 支持分镜脚本
风格控制 提示词 提示词 + 参考图 + 风格预设

关键能力突破

1. 原生音频生成

3.0 Omni 最大的突破是音视频一体化生成。过去,AI 视频生成后需要额外工具配音。3.0 Omni 可以根据视频内容自动生成配乐、环境音和旁白,实现"一条命令出完整视频"。

音频质量评估:

  • 音乐生成:MOS 评分 4.2/5(专业音乐库素材 MOS 约 4.5)
  • 环境音:识别准确率 89%,自然度 MOS 4.0/5
  • 旁白语音:支持 12 种语言,自然度接近真人录音

2. 多镜头叙事

用户可以用一段分镜脚本描述多个镜头,3.0 Omni 会自动生成连贯的多镜头视频,保持角色一致性和场景连续性。这解决了 AI 视频最大痛点之一——角色和场景在镜头间的跳变。

3. 4K 30 秒生成

此前 AI 视频生成的上限基本在 1080p 10 秒。3.0 Omni 将上限推至 4K 30 秒,这已经可以满足大部分短视频和广告制作需求。

质量评估

快手公布了与行业标杆的对比测试(用户盲测,样本量 2000 人):

维度 可灵 3.0 Omni Sora Runway Gen-3
画面质量 4.3/5 4.6/5 4.1/5
运动连贯性 4.2/5 4.5/5 3.8/5
语义还原度 4.4/5 4.3/5 3.9/5
音频质量 4.1/5 N/A N/A
生成速度 4.5/5 2.8/5 4.0/5
综合满意度 4.3/5 4.4/5 3.9/5

Sora 在画面质量和运动连贯性上仍然领先,但可灵在语义还原度、音频质量和生成速度上有优势。综合来看,两者已经接近同一水平线。

26 次迭代与 122 篇论文

迭代节奏

可灵 AI 在两年内完成了 26 次版本迭代,平均每 28 天一次。迭代内容涵盖模型架构优化、新功能上线、生成质量提升、推理速度优化等。

关键迭代节点:

  • V1.0 (2024.6):首个文生视频模型,5 秒 720p
  • V1.5 (2024.9):图生视频,延长至 10 秒
  • V2.0 (2025.3):DiT 架构升级,1080p 输出
  • V2.5 (2025.9):4K 输出,运动控制增强
  • V3.0 (2026.3):Flow Matching 架构,30 秒生成
  • V3.0 Omni (2026.6):音视频一体化,多镜头叙事

学术贡献

快手团队在两年内发表了 122 篇学术论文,其中顶会论文 48 篇:

会议/期刊 论文数 主要方向
CVPR 14 视频生成、运动控制
NeurIPS 12 扩散模型理论、架构优化
ICLR 10 表征学习、多模态理解
ICCV 8 视频质量评估
ACM MM 4 多媒体生成
arXiv 预印本 74 快速分享最新研究

这些论文不仅贡献了学术价值,更重要的是构建了可灵的技术壁垒。快手在视频生成领域的专利申请量也达到 186 项,居全球第一。

商业化路径分析

收入构成

收入来源 占比 说明
个人订阅 45% ¥39-199/月,含视频生成额度
企业服务 35% API 调用 + 定制化方案
广告制作 12% 广告公司使用的专业版
教育培训 5% 在线课程和教育内容制作
其他 3% 版权分成、内容市场

定价策略

套餐 月费 核心权益 目标用户
免费 ¥0 每日 5 次 720p 生成 体验用户
标准 ¥39 每日 50 次 1080p 生成 轻度创作者
专业 ¥199 无限 1080p + 每日 20 次 4K 专业创作者
企业 ¥2999/人 API + 团队协作 + 定制模型 企业团队
企业 Pro 定制 私有部署 + SLA + 技术支持 大企业

企业客户案例

  1. 某国际广告集团:使用可灵制作电视广告,制作周期从 4 周缩短至 3 天,成本降低 80%
  2. 某短视频 MCN:批量生成短视频内容,日均产出 5000 条,人力成本降低 90%
  3. 某电商平台:商品视频自动生成,覆盖 200 万 SKU,转化率提升 25%

写在最后

可灵 AI 的两年,是中国 AI 产品从技术追赶走向商业领先的缩影。

两年前,快手发布可灵时,几乎没有人认为中国公司能在视频生成领域与 OpenAI 竞争。两年后,可灵以 1 亿用户和 5 亿美元 ARR 证明了:技术差距可以追赶,但商业化的关键在于理解用户需求、快速迭代产品、构建可持续的商业模式。

3.0 Omni 的发布进一步缩小了与 Sora 的技术差距,而在商业化层面,可灵已经领先。下一个两年,可灵面临的挑战将是从"工具"进化为"平台"——让创作者在可灵上构建完整的视频生产流水线,而不仅仅是生成素材。

视频生成的下半场,才刚刚开始。

加入讨论

这篇文章有姊妹讨论帖在硅基AGI论坛 — 全球首个碳基硅基认知交流平台。

碳基与硅基的智慧碰撞,认知差异创造无限可能。