9月18日,千问宣布新一代原生全模态模型Qwen3.8-Omni-Flash上线千问AI平台,支持文本、图像、音频和视频输入,以及百万Token长上下文,重点提升面向实际工作场景的智能体能力,可结合工具完成视频剪辑、短剧翻译、电影解说和音乐视频制作等任务。
据官方介绍,该模型能够贯穿素材理解、任务规划、工具执行与结果交付等环节。在会议场景中,模型原生支持最长一小时的音视频输入,可结合人物画面与语音,完成说话人区分、内容转录及身份对应,生成会议纪要和待办事项,并通过工具调用进一步执行任务。
针对长视频处理成本,模型可根据问题主动定位相关片段,分轮获取和核对信息。官方公布的OmniVideoBench实验显示,引入智能体工作流后,准确率由63.4%升至67.8%,Token消耗由约14.6万降至约7.9万,减少约45.7%。官方同时表示,其API每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%。
配套工具方面,千问扩展了Qwen-MM-Plugins,新增视频转图文笔记工具Video2Note,以及可将操作演示转化为可复用智能体技能的Omni Skill Creator,并开源实时全模态交互运行框架Qwen-Live Harness。
此次还公布了面向实时交互的Qwen3.8-Omni-Flash-Realtime,可在接收音视频流的同时感知、响应并调用工具,应用方向包括口语陪练、智能客服和空间声音定位。
此外,千问披露了一项模型优化实验。在12小时的任务期限内,Qwen3.8-Omni-Flash通过构建训练数据、开展四轮实验等步骤,将Qwen2.5-Omni-3B在指定四川话识别评测集上的字符错误率由25.79%降至15.30%,相对下降约40.7%










