新 闻科教                                             

谷歌推出两款Gemini语音模型
华尔街日报2026-09-23  

声明: 本消息或因风格和篇幅原因进行过编辑,但未经核实,也不代表我们的立场、观点或建议。如有侵权,联系秒删。[ 使用条款 ]
赞助信息

谷歌周三推出两款新的文本转语音(TTS)模型Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS,进一步拓展Gemini在AI语音生成领域的应用。

点击图片看原样大小图片





其中,Flash TTS更侧重声音表现力和复杂创意场景,而Flash-Lite TTS则针对大规模、低成本的语音生成进行优化,应用场景包括内容配音、音频制作以及实时语音代理。

谷歌开发者文档显示,Gemini 3.8 Flash TTS支持130种语言,Flash-Lite TTS支持101种语言。并可根据文字指令调整声音、语速、情绪和对话方式。

Flash TTS主打声音定制,声音设计综合指标中排名第一

据谷歌介绍,Gemini 3.8 Flash TTS主要面向有声书、播客、游戏角色和互动媒体等创意应用,用户可以通过自然语言提示词从零设计声音,包括角色设定、口音和声音特征等。

该模型还支持根据约30秒的音频样本复制声音。谷歌表示,进行声音复制时,需要获得声音所有者的同意,并通过相应的同意验证机制。生成的音频则会嵌入不可感知的SynthID水印,以帮助识别AI生成的语音内容。

Gemini 3.8 Flash TTS在Hume AI的Voice Design Benchmark中取得71.4分,在声音设计综合指标中排名第一;两款模型在Hume AI Overall Quality Index中分别位列第一和第二。

点击图片看原样大小图片





目前,谷歌提供超过2000种可直接使用的声音,并覆盖墨西哥西班牙语、魁北克法语和苏格兰英语等地区性语言变体。

您的观点至关重要

点击朱笔,直抒胸臆

By Google

    © 2026    八阕之地™ by Towards Digital Group关于我们反馈意见业务合作八阕书局隐私政策使用条款  
谷歌推出两款Gemini语音模型