谷歌发布两款Gemini实时语音模型
来源:Simon Willison · · 官方来源摘要 · 2 分钟阅读 · 流海编辑部
Simon Willison制作浏览器体验工具,支持切换模型、预设声音及打断语音回复。
实时语音Simon Willison
据 Simon Willison 介绍,谷歌发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两款语音到语音模型。他制作了浏览器体验工具,支持语音对话及打断回复。
对出海团队的影响
面向语音助手、口语陪练等产品的出海团队,多了一个可测试的实时语音方案。该工具支持选择模型和预设声音、输入可选系统提示词;实现未使用第三方库,通过 WebSocket 连接接口,并用 Web Audio API 采集和播放音频,可作为浏览器端原型参考。但材料未提供价格、语言覆盖或延迟评测,尚不足以判断其上线成本与目标市场适配度。
接下来怎么做
建议先用目标市场语言测试对话自然度、打断后的衔接及系统提示词遵循情况,并对两款模型使用相同任务做比较。
可参考公开实现搭建小规模原型,重点检查麦克风权限、回声和网络波动对体验的影响。
正式接入前,建议查阅官方文档,核实定价、地区可用性、数据处理政策及密钥保护方案,不宜直接将演示实现用于生产环境。
继续了解AI 产品出海
AI 工具 · Agent · 全球分发
查看「AI 产品出海」全部文章 →