IT之家9月16日消息,当地时间9月15日,谷歌宣布推出Gemini3.8Live和Gemini3.8Live Extended Thinking。谷歌称这是其迄今最先进的实时对话模型,在智能和并行推理方面有重大升级,让AI对话更直观智能。
两款新品分别为面向规模部署与成本优化的Gemini3.8Live,以及面向高复杂度任务、强化多步推理能力的Gemini3.8Live Extended Thinking。
Gemini3.8Live兼顾对话智能、流畅交流和视觉理解,面向规模化与成本效率。Gemini3.8Live Extended Thinking面向高复杂度任务,具备更强的智能和多步推理能力。
Gemini3.8Live Extended Thinking在多项基准测试中取得领先成绩,拿下Artificial Analysis语音对语音质量指数总排名第一(82.6%),在τ-Voice智能体任务完成率达68.6%,在Sierra的τ-Voice-banking基准测试达35.1%;推理能力方面,在Big Bench Audio得分97.7%,同时仍保持有竞争力的定价。
Gemini3.8Live则获得用户高认可度,在Speech Agent Arena排名第二,且具备出色成本效益,适合大规模部署。两款模型在ServiceNow(NOW) EVA-Bench语音智能体基准测试中,成功平衡准确性与对话质量,推高了复杂工作流的帕累托前沿。
Gemini3.8Live可近实时处理视觉输入,在对话中自动检测并切换97种支持的语言,还能在后台执行工具与API调用,同时保持对话流畅不中断。
针对需要深度推理的任务,Gemini3.8Live Extended Thinking可实现推理与发言同步进行,在不中断对话流畅度的前提下提升复杂工作流智能水平,通过“让我确认一下…”这类早期语言提示自然回应提示,还可实时讲解多步后台任务处理进度。
开发者可通过Gemini Live API,在声网(API)、Fishjam、LiveKit、Pipecat、Vercel、Vision Agents等平台轻松构建部署高性能语音驱动界面;谷歌还与Salesforce、Genspark、Lumeris等企业开展合作,共同推进生态建设。
谷歌所有AI生成音频都添加了SynthID隐形水印,直接嵌入音频输出,可检测AI生成内容,帮助防止虚假信息传播。
目前Gemini3.8Live已开始推送:开发者可在Gemini API和Google AI Studio使用;企业用户可在Gemini Enterprise(EFSC)抢先体验,即将登陆Gemini Enterprise(EFSC) for Customer Experience;全用户可在Search Live体验。
Gemini3.8Live Extended Thinking也已开启推送:开发者可在Gemini API和Google AI Studio使用;企业用户可在Gemini Enterprise(EFSC)抢先体验,即将登陆Gemini Enterprise(EFSC) for Customer Experience以及Google Workspace企业客户;普通用户可在Gemini Live体验,Google AI Pro和Ultra订阅者可在Google Workspace的Docs使用,所有Google AI订阅者可在Gmail和KEEP(HK3650)体验。
