AI 前沿·阅读约 1 分钟·
Gemini 3.8 Live 发布:边推理边说话,中途能切换 97 种语言

Gemini 3.8 Live 发布:边推理边说话,中途能切换 97 种语言

Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两个语音模型:其中 3.8 Live 支持近实时视觉理解和后台工具调用,Extended Thinking 在 Artificial Analysis 的语音质量指数(Speech to Speech Quality Index)上拿到 82.6 分排名第一,3.8 Live 则支持通话中自动切换 97 种语言。

原文来源:Google Blog — Google 一次放出两个语音对话模型,把实时推理、视觉理解和后台工具调用塞进同一通对话里。

Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。两个模型都瞄准"近实时推理",目标是让语音智能体的说话节奏更像真人,而不是等你说完、转成文字、再思考半天才吐出一句话。

两个模型分工不同。Gemini 3.8 Live 面向规模和成本,主打流畅对话加视觉理解;3.8 Live Extended Thinking 面向复杂任务,做多步推理。价格上,Google 说它相对其他前沿模型仍有竞争力。对开发者来说,它们是搭生产级语音智能体的组件;对普通用户来说,它们就是 Gemini App、Google Workspace 和搜索里那个能"用嘴干活"的助手。

成绩单

先看跑分,Google 给了几个具体数字:

  • Artificial Analysis 的 Speech to Speech Quality Index:Extended Thinking 拿到 82.6 分,排名第一
  • 智能体任务完成:τ-Voice 68.6%,Sierra 的 τ-Voice-banking 35.1%
  • 推理能力:Big Bench Audio 97.7%
  • 在 Speech Agent Arena 上,Gemini 3.8 Live 排第二

在 ServiceNow 的 EVA-Bench(专门评测语音智能体的基准)上,两个模型在复杂工作流里同时兼顾了准确率和对话质量,Google 称这让它们"推进了帕累托前沿"。

—— 广告 ——

三个实际能力变化

视觉输入。3.8 Live 能以近乎实时的速度处理画面输入。Google 演示里的一个场景是员工入职培训:模型一边看你桌上的设备,一边回答你的问题。还有一个演示是让它下棋——靠视觉理解棋盘、靠推理判断局面,然后自然地跟你聊。

97 种语言中途切换。模型会在对话过程中自动识别语言并切换,不是开新会话才换语言,而是同一通电话里从英语切到日语再切回来。

后台执行工具调用。这是最实用的一条。模型可以在继续跟你说话的同时执行工具和 API 调用——先应一声"我看看",把任务丢到后台跑,跑完了再回来告诉你结果,中间对话不断。

Extended Thinking 的"边想边说"

复杂任务交给 3.8 Live Extended Thinking。它的特点是推理和说话同时进行:先给一个口头的确认信号("让我查一下……"),然后一边执行多步任务一边做实时进度播报。

Google 给的演示包括:把草图加上实时语音反馈,直接变成能跑的 React 组件;协调多步预订和异步函数调用,全程不打断对话;以及用语音现场生成完整商业计划和营销方案。

这个交互设计解决的是语音智能体的老问题——模型在后台思考的那几秒,用户只能听到沉默,不知道它是不是卡死了。用语言填充这段空白,体验上更接近人和人打电话。

开发者怎么接

Gemini Live API 已经有一批平台在做集成:Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents。这些平台在幕后承担复杂的实时媒体流基础设施,开发者只用关心交互本身。Salesforce、Genspark、Lumeris 也在合作名单里,官方说法是看中了延迟、流畅度和工具调用能力。

接入路径按角色分:

  • 开发者:Gemini API 和 Google AI Studio
  • 企业:Gemini Enterprise 私有预览
  • 普通用户:Search Live、Gemini App。Workspace 里的 Extended Thinking 有订阅门槛:Docs 面向 Google AI Pro 和 Ultra 订阅者,Gmail、Keep 面向所有 Google AI 订阅用户

一个值得留意的细节

所有 AI 生成的音频都带 SynthID 水印。这个水印人耳听不出来,但可以被检测出来,用来标记"这段声音是 AI 生成的"。语音模型越像真人,伪造音频的门槛就越低,这类可检测标记的价值也越高——虽然它挡不住有心的攻击者,但至少给了平台一个判断依据。

Google 同时放出了模型卡,里面有更细的安全和评测说明。

为什么语音智能体这两年一直卡着

(编者按:从这一节到结尾的点评都是编者的分析,Google 原文没有这部分内容。)

把语音做成"能用的助手",难点从来不在语音识别或者语音合成这两端。这两件事早就够用了。真正难的是中间那一段:模型要在用户还在说话的时候就开始理解,要在几百毫秒内给出一个能被接受的回应,还要在后台做那些可能耗时几十秒的事情。

前两代方案的做法是流水线:先把语音转成文字,交给一个文本模型想,再把结果转回语音。这条链路每一环都引入延迟,而且丢失了语气、停顿、打断这些说话时最重要的信号。用户说了一半停下来想词,系统以为你说完了,抢着回答——这是所有语音助手最招人烦的地方。

Gemini 3.8 Live 这类模型的做法是把这几步合成一个模型。视觉、语音、推理、工具调用在同一个模型里完成,因此可以做到三件事:听到一半就判断你还没说完、边说边想而不是想完再说、在后台跑任务的同时保持对话。这三件事看起来是体验优化,实际决定了语音助手能不能从"问答机"变成"能干活的东西"。

一个容易忽略的成本维度

Google 强调 3.8 Live 是"为规模和成本效率而建",Extended Thinking 是"为高复杂度任务而建"。这个分工其实在暗示一件开发者迟早要面对的事:语音智能体的成本结构和文本智能体不一样。

文本场景里,一次对话就是几十到几千 token,成本可预测。语音场景里,模型要持续处理音频流——哪怕用户没说话,音频流也在传;视觉场景更夸张,是持续的画面输入。也就是说,"按对话次数计费"的思路在这里会失效,真正决定账单的是"接入了多久"和"处理了多少画面"。

所以接语音智能体之前,先想清楚三件事:用户单次会话的平均时长是多少、视觉输入是不是真的必要、后台任务能不能异步化到不占用实时链路。这三个问题的答案,比选哪个模型更能决定你的单位经济模型。


语音交互这条线,过去两年一直卡在"延迟高、不会打断、不会边做边说"上。3.8 Live 这批模型把这三件事都往前推了一步,跑分也摆在了台面上。真正的考验在落地:语音智能体最容易翻车的地方不是模型本身,而是工具调用的可靠性——它会说"我查一下",那查失败的时候,它是老老实实告诉你,还是编一个结果糊过去。这个问题的答案要等生产环境的反馈。

分享到
微博Twitter

© 2026 四月

原文链接:https://www.aprilzz.com/ai/gemini-3-8-live-voice-models