2026年9月,多模态成为大模型竞争的主战场。Qwen3.8-Omni-Flash支持文本+图像+音频+视频输入,1M上下文;Gemini 3.8 Flash集成Lyria 3.5音乐模型;GPT-6 Astra支持计算机操作。

模态扩展

  • 视觉:图像理解已标配
  • 音频:语音识别+音乐生成
  • 视频:视频理解+生成
  • 动作:计算机操作(computer use)

纯文本模型正在成为历史,全模态是标配。