谷歌推出Gemini 3.5 Transcribe,加速实时语音转录
谷歌在语音人工智能领域迈出了新的一步,推出了Gemini 3.5 Transcribe,这是一种新模型,旨在以更快的速度和更高的准确性将语音转换为文本。该技术面向开发者和企业,旨在满足日益增长的即时转录需求,涵盖对话、会议和音频录音。
新模型的一个显著特点是其在复杂环境中处理语音的能力。背景噪音、专业术语、说话者的犹豫或修正都可以被考虑在内,以提高生成文本的质量。
根据提供的数据,Gemini 3.5 Transcribe在连续转录中的错误率为4%,在处理离线音频时为2.6%。获取最终转录所需的时间也比之前的Chirp 3模型减少了70%。
实时转录或录音后转录
谷歌提供了两种使用模式,以满足不同的需求。第一种模式通过提供延迟低于一秒的实时流媒体接口,实现几乎即时的转录。
第二种模式适用于已经录制的音频内容,如商务会议或通话记录。该版本还可以识别并分配不同参与者的发言。
该模型能够自动检测和转录超过85种语言。它还可以识别同一录音中的最多三位对话者,并将他们的发言与时间戳关联。
宣布的功能还包括去除填充词、自动格式化文本以及集成自定义词汇,以提高对特定行业术语的识别。
谷歌扩展其语音人工智能的应用
在FLEURS基准测试中,Gemini 3.5 Transcribe在流媒体模式下的错误率为5.50%,在处理离线内容时为5.04%。
谷歌计划逐步将该技术集成到其多个产品和服务中。该模型特别与macOS上的Gemini应用程序、通过Gboard在Android上的某些功能以及Google AI Studio相关联。
此次发布也是其更广泛战略的一部分,旨在增强生成性人工智能在专业和大众工具中的集成。开发者可以通过Google AI Studio公开预览该模型,而企业则可以通过Gemini Enterprise Agent平台进行集成。
最终,Chrome浏览器也将受益于基于该技术的新听写功能。通过Gemini 3.5 Transcribe,谷歌希望将语音打造为日常数字工具使用中的一个越来越核心的接口。
-
09:51
-
09:06
-
08:56
-
08:50
-
08:43
-
08:37
-
08:30
-
08:14
-
08:02
-
07:51
-
07:36
-
07:30
-
17:07
-
17:01
-
16:55
-
16:23
-
16:02
-
15:47
-
15:46
-
15:16
-
15:01
-
14:57
-
14:52
-
14:49
-
14:37
-
14:19
-
14:00
-
13:53
-
13:44
-
13:35
-
13:32
-
13:29
-
13:22
-
13:15
-
11:35
-
11:30
-
11:15
-
11:10
-
11:09
-
11:08
-
11:03
-
10:59
-
10:46
-
10:32
-
10:32
-
10:22
-
10:14
-
10:05