Google发布Gemini 3.8 Live,实时语音可「边聊边干活」

IP归属:广东

文章AI导读

一键萃取文章精髓,核心观点即刻呈现

9月16日,Google正式发布新一代实时语音模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,进一步强化AI在实时对话、多步骤推理以及任务执行方面的能力。

据Google介绍,Gemini 3.8 Live主要面向大规模语音交互场景,提升了模型的对话流畅度、视觉理解能力以及实时响应能力。而定位更高的Gemini 3.8 Live Extended Thinking,则首次将「深度推理能力」融入实时语音交互,让AI能够在保持自然交流的同时完成复杂任务。

在Google展示的案例中,Gemini可以在与用户持续交流的过程中,后台调用工具完成餐厅预约、信息查询、文档处理等多步骤任务,而无需中断对话。

同时,Gemini 3.8 Live支持实时视觉理解能力。用户可以通过摄像头向AI展示物品、环境或文件,模型能够结合视觉信息提供更具上下文的回答。此外,该模型支持97种语言在对话中的自动切换,进一步增强跨语言交流能力。

在性能方面,Google表示,Gemini 3.8 Live Extended Thinking在Artificial Analysis语音到语音质量指数中排名第一,得分达到82.6,在τ-Voice智能体任务完成测试中达到68.6%。

除了面向普通用户,Google也正在推动Gemini Live进入企业市场。此次更新将逐步接入Gemini API、Google AI Studio、Gemini Enterprise以及Google Workspace等产品,帮助企业构建基于语音交互的AI智能体。

陀螺科技现已开放专栏入驻,详情请见入驻指南: https://www.tuoluo.cn/article/detail-27547.html

前方智能专栏: https://www.tuoluo.cn/columns/author1911845/

本文网址: https://www.tuoluo.cn/article/detail-10131108.html

免责声明:
1、本文版权归原作者所有,仅代表作者本人观点,不代表陀螺科技观点或立场。
2、如发现文章、图片等侵权行为,侵权责任将由作者本人承担。

相关文章