Gemini 增加更真实的语音克隆和戏剧性演讲能力
谷歌正在扩展其 Gemini 人工智能模型的功能,推出新的文本转语音技术,旨在生成更具表现力和自然音色的声音。最新系统可以重现更广泛的声音特征,使生成的语音能够反映语调、口音、节奏和情感的变化。
此次更新是谷歌更广泛开发 Gemini 系列的一部分,因为该公司继续超越基本的文本生成,朝着能够处理语音、图像、视频和其他形式内容的多模态 AI 系统迈进。
新产品包括 Gemini Flash TTS 和 Flash-Lite TTS,赋予用户和开发者更大的控制权,以决定生成语音的传递方式。模型不仅仅是将书面文本转换为口语,而是可以遵循详细的说明,描述特定台词的声音特征,包括节奏、强度、停顿、低语、笑声和其他声音提示的变化。
谷歌表示,其技术可以根据自然语言描述生成原创声音,并支持超过 100 种语言和方言。该公司还提供大量现成的语音库供生产使用,同时在用户获得必要授权的情况下,可以使用短语音样本创建一致的合成声音。
该技术特别适用于对话和角色表演的场景。单个脚本可以转变为涉及不同声音的对话,系统在较长录音中保持角色之间的一致性。这种能力可能对播客、有声读物、配音、旁白视频和基于语音的应用程序非常有用。
这些改进还反映了人工智能生成语音市场日益激烈的竞争,企业试图使合成语音听起来越来越自然和富有表现力。谷歌自己的测试在多个语音质量评估中显示出强劲的结果,尽管竞争服务在与声音真实感和多样性相关的特定类别中也表现良好。
新技术不仅限于开发者。谷歌已经开始将其语音模型集成到诸如 NotebookLM 等产品中,同时 Flash-Lite TTS 也正在引入 Google Vids。开发者可以通过谷歌的 AI 开发工具和 API 访问这些模型,将技术开放给更广泛的应用。
语音克隆还引发了关于同意、冒充和合成语音潜在滥用的重要问题。因此,谷歌引入了需要授权才能复制个人声音的保障措施,并使用 SynthID 和 C2PA 凭证等技术帮助识别 AI 生成的内容。
某些语音克隆功能的可用性也受到地区限制,反映了围绕合成媒体的不同监管和法律环境。
随着这些发展,Gemini 的语音技术正朝着更具表现力的方向发展,使 AI 生成的声音不仅能够传达单词,还能传达交付和情感的元素。这一转变表明生成式 AI 正越来越多地融入创意制作,同时围绕同意、透明度和负责任使用的问题仍然是语音克隆技术发展的核心。
-
20:00
-
19:47
-
19:32
-
19:15
-
19:00
-
18:42
-
18:21
-
18:05
-
17:45
-
17:24
-
17:10
-
16:47
-
16:32
-
16:16
-
15:50
-
15:32
-
15:15
-
15:00
-
14:41
-
14:21
-
14:05
-
13:45
-
13:30
-
13:13
-
12:47
-
12:30
-
12:12
-
11:47
-
11:32
-
11:15
-
10:50
-
10:32
-
10:15
-
10:00
-
09:42
-
09:09
-
08:47
-
08:32
-
08:15