阿里通义千问发布Qwen3.8-Omni-Flash多模态模型,支持文本、图像、音频、视频输入,上下文长度达1M(100万token),30项评测平均性能提升26%。

核心能力

  • 全模态输入:文字+图片+音频+视频
  • 1M长上下文:可处理整本书或数小时视频
  • 音视频增强:专门优化了音频和视频理解能力
  • 价格优化:API定价进一步下调

适用场景

  1. 长文档分析:整本书、合同集、代码库
  2. 视频理解:长视频内容分析、会议纪要
  3. 音频处理:多语言语音识别、音频内容理解
  4. 多模态Agent:结合视觉和听觉的智能助手

国产模型格局

国产第一梯队已形成:

  • Qwen3.8-Max:综合能力国产第一
  • DeepSeek V4.1 Flash:开源Agent能力最强
  • GLM-5.3:智谱旗舰
  • MiniMax M3:AI视频最强
  • 小米MiMo-V2.6:新晋开源第一

竞争激烈,用户受益。