谷歌推出 Gemini 3.8 语音合成模型
来源:Simon Willison · · 官方来源摘要 · 2 分钟阅读 · 流海编辑部
两款新模型提供超2000种音色,支持30秒样本定制声音及多角色对话,已有自带密钥的试玩工具。
语音合成Simon Willison
据 Simon Willison 介绍,谷歌推出 Gemini 3.8 Flash TTS 和 Flash-Lite TTS 两款语音合成模型;他也发布了需自带 API 密钥的试玩工具。
对出海团队的影响
新模型提供超过2000种音色,可用30秒本人或有权使用的录音定制声音,并支持为多角色对话分别设置音色与表达风格。这为出海应用的角色语音、对话式内容和营销配音提供了新的测试选项。Willison 的一次 Flash TTS 演示约用20秒生成78秒音频,费用为2.74美分;这只是单次示例,不能直接视为生产环境的成本或速度承诺,材料也未给出各语言的质量表现。
接下来怎么做
建议先用目标市场语言的真实脚本,对比两款模型的发音、角色一致性、生成耗时与实际费用,再判断是否适合接入。
如需定制声音,建议先确认录音授权及使用范围,避免将可上传样本等同于拥有商业使用权。
试用 Playground 时可使用独立测试密钥并控制配额;该工具消耗用户自己的 Gemini API 账户额度,不宜直接以生产账户开展无上限测试。
继续了解AI 产品出海
AI 工具 · Agent · 全球分发
查看「AI 产品出海」全部文章 →