9月15日,谷歌发布两款新的实时语音对话模型:Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking。据谷歌介绍,前者面向规模与成本效率,结合对话智能、流畅对话与视觉理解能力;后者面向高复杂度任务,强化多步推理。谷歌在官方博客中称,两款模型可处理复杂推理、实时视觉上下文与后台任务执行,且不打断用户对话。">
9月15日,谷歌发布两款新的实时语音对话模型:Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking。据谷歌介绍,前者面向规模与成本效率,结合对话智能、流畅对话与视觉理解能力;后者面向高复杂度任务,强化多步推理。谷歌在官方博客中称,两款模型可处理复杂推理、实时视觉上下文与后台任务执行,且不打断用户对话。
性能方面,据谷歌公布的测试数据,Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 的语音到语音质量指数(Speech to Speech Quality Index)中以82.6分位列第一;在智能体任务完成评测 τ-Voice 上得分68.6%,在 Sierra 的 τ-Voice-banking 上得分35.1%,在 Big Bench Audio 上得分97.7%。Gemini 3.8 Live 在 Speech Agent Arena 中排名第二。谷歌称,在 ServiceNow 的语音智能体基准 EVA-Bench 上,两款模型推动了对准确性与对话质量平衡的帕累托前沿(该测试运行于 Gemini Enterprise Agent Platform 的 Live API)。
能力上,Gemini 3.8 Live 可近实时处理视觉输入,并在对话中自动检测和切换97种支持语言;模型可在后台执行工具与 API 调用而不中断对话。针对需要更深推理的任务,Extended Thinking 支持"边推理边说话",通过"Let me check that…"等早期语言提示自然回应,并以实时进度播报引导多步后台任务。(袁宁)
下单付款后十分钟内,您可以在商城众网的个人中心查看订单信息