谷歌宣布推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,称其为迄今最先进的实时对话模型。前者面向规模部署与成本优化,后者面向高复杂度任务,强化多步推理能力。
Gemini 3.8 Live Extended Thinking 在多项基准测试中领先,拿下 Artificial Analysis 语音对语音质量指数总排名第一(82.6%),在τ-Voice 智能体任务完成率达 68.6%,Big Bench Audio 得分 97.7%。Gemini 3.8 Live 在 Speech Agent Arena 排名第二,具备出色成本效益。
Gemini 3.8 Live 可近实时处理视觉输入,自动检测并切换 97 种语言,后台执行工具与 API 调用。Extended Thinking 可实现推理与发言同步进行。所有 AI 生成音频均嵌入 SynthID 隐形水印。
两款模型已开始推送,开发者可通过 Gemini API 和 Google AI Studio 使用,企业用户可在 Gemini Enterprise 体验。
文中提及的 AI 工具