2026年9月,多模态成为大模型竞争的主战场。Qwen3.8-Omni-Flash支持文本+图像+音频+视频输入,1M上下文;Gemini 3.8 Flash集成Lyria 3.5音乐模型;GPT-6 Astra支持计算机操作。
模态扩展
- 视觉:图像理解已标配
- 音频:语音识别+音乐生成
- 视频:视频理解+生成
- 动作:计算机操作(computer use)
纯文本模型正在成为历史,全模态是标配。
2026年9月,多模态成为大模型竞争的主战场。Qwen3.8-Omni-Flash支持文本+图像+音频+视频输入,1M上下文;Gemini 3.8 Flash集成Lyria 3.5音乐模型;GPT-6 Astra支持计算机操作。
纯文本模型正在成为历史,全模态是标配。
📄 本文采用 CC BY-NC-SA 4.0 国际许可协议授权,转载请注明出处。