向外看,向前游。和出海者一起,发现流量的方向。
自动快讯

谷歌推出 Gemini 3.8 语音合成模型

来源:Simon Willison · · 官方来源摘要 · 2 分钟阅读 · 流海编辑部

两款新模型提供超2000种音色,支持30秒样本定制声音及多角色对话,已有自带密钥的试玩工具。

语音合成Simon Willison
Simon Willison

据 Simon Willison 介绍,谷歌推出 Gemini 3.8 Flash TTS 和 Flash-Lite TTS 两款语音合成模型;他也发布了需自带 API 密钥的试玩工具。

对出海团队的影响

新模型提供超过2000种音色,可用30秒本人或有权使用的录音定制声音,并支持为多角色对话分别设置音色与表达风格。这为出海应用的角色语音、对话式内容和营销配音提供了新的测试选项。Willison 的一次 Flash TTS 演示约用20秒生成78秒音频,费用为2.74美分;这只是单次示例,不能直接视为生产环境的成本或速度承诺,材料也未给出各语言的质量表现。

接下来怎么做

建议先用目标市场语言的真实脚本,对比两款模型的发音、角色一致性、生成耗时与实际费用,再判断是否适合接入。

如需定制声音,建议先确认录音授权及使用范围,避免将可上传样本等同于拥有商业使用权。

试用 Playground 时可使用独立测试密钥并控制配额;该工具消耗用户自己的 Gemini API 账户额度,不宜直接以生产账户开展无上限测试。

原始来源

https://simonwillison.net/2026/Sep/23/gemini-tts-playground/ ↗

官方事实与编辑解读分段展示,具体条款请以官方最新说明为准。

继续了解AI 产品出海

AI 工具 · Agent · 全球分发

查看「AI 产品出海」全部文章 →