阿里通义千问发布Qwen3.8-Omni-Flash多模态模型,支持文本、图像、音频、视频输入,上下文长度达1M(100万token),30项评测平均性能提升26%。
核心能力
- 全模态输入:文字+图片+音频+视频
- 1M长上下文:可处理整本书或数小时视频
- 音视频增强:专门优化了音频和视频理解能力
- 价格优化:API定价进一步下调
适用场景
- 长文档分析:整本书、合同集、代码库
- 视频理解:长视频内容分析、会议纪要
- 音频处理:多语言语音识别、音频内容理解
- 多模态Agent:结合视觉和听觉的智能助手
国产模型格局
国产第一梯队已形成:
- Qwen3.8-Max:综合能力国产第一
- DeepSeek V4.1 Flash:开源Agent能力最强
- GLM-5.3:智谱旗舰
- MiniMax M3:AI视频最强
- 小米MiMo-V2.6:新晋开源第一
竞争激烈,用户受益。