谷歌推出新一代语音转文字模型“双子座3.5转录版”,进一步推动语音识别技术从传统的“逐字转写”向“理解式转录”发展。新模型不仅提升识别准确率,还能够理解说话者意图、识别自我纠正,并自动整理口语内容,使语音直接转化为更加清晰、规范的文字。
从逐字转录转向理解说话者意图
谷歌将“双子座3.5转录版”称为其迄今“最准确”的语音转文字模型。与传统语音识别工具主要负责记录用户说出的每一个词不同,新模型更加注重上下文和真实表达意图。
例如,当用户说“星期二——不,是星期三”时,模型能够判断说话者是在进行自我纠正,并将最终内容整理为“星期三”,而不是机械地保留两个日期。
这一能力意味着语音转录开始具备一定程度的文本编辑功能,可以在保留原始含义的同时,对自然口语进行整理。
自动删除语气词并规范文本
新模型还能够自动识别并删除“嗯”“呃”等没有实际信息价值的口语填充词,同时整理标点符号和文本格式。
对于会议记录、采访整理、语音备忘录以及内容创作等场景,这种处理方式可以减少用户在完成语音转录后再次修改文字的工作量。
在语言覆盖方面,该模型支持超过85种语言,并具备自动语言识别能力,可以应对多语言语音环境。
谷歌还提供自定义词汇功能。用户可以添加专业术语、特殊拼写以及由字母和数字组成的特定信息,从而提高模型对订单编号、邮政编码等内容的识别准确率。
对于预先录制的音频,新模型还支持区分不同说话者,并提供逐词时间标记,为会议整理、采访记录和字幕制作等应用提供便利。
开发者接口同步开放预览
在开发者应用方面,“双子座3.5转录版”已经通过谷歌的开发者接口进入预览阶段,主要支持实时语音流和录制音频文件两种处理方式。
根据谷歌公布的信息,录制文件最长可以处理一小时的音频内容,而实时转录则主要针对需要快速响应的低延迟应用。
开发者可以使用低延迟转录、自定义词汇和智能格式整理等功能,将语音识别能力整合到自己的应用和服务中。
这意味着相关技术未来可以进一步应用于会议软件、智能客服、内容创作、办公协作以及其他人工智能应用。
输入法和人工智能应用率先采用
在消费级产品方面,新一代语音转录技术已经应用于安卓系统的谷歌键盘语音输入功能,同时进入苹果电脑版本的“双子座”人工智能应用。
谷歌还计划将这一能力引入其浏览器。届时,用户可以直接通过语音向网页中的文本输入框填写内容,用于回复消息、撰写文章以及向人工智能系统发送指令。
由于输入法和浏览器属于互联网用户日常使用频率较高的工具,语音识别能力进入这些产品后,有望进一步扩大语音输入的应用范围。
谷歌加快布局人工智能语音入口
此次推出的语音转录模型也是谷歌扩大人工智能语音业务布局的一部分。除语音转文字外,谷歌还在推进实时语音对话、语音翻译以及其他自然语言交互能力。
从行业发展趋势来看,语音转文字正在从一种基础后台技术逐渐转变为人工智能服务的重要交互入口。
随着模型同时具备识别、理解、整理和执行能力,用户与人工智能系统之间的交流方式可能进一步发生变化。过去主要依赖键盘完成的部分操作,未来可能更多通过自然语音完成。
对于谷歌而言,如果这种语音能力进一步进入浏览器、输入法、在线文档和电子邮件等高频产品,将有助于扩大其人工智能技术在办公、沟通和内容创作场景中的覆盖范围。
随着语音模型与浏览器、输入法及生产力工具持续融合,行业竞争重点也正在从单纯追求更高的识别准确率,转向更加准确地理解用户真实意图。语音输入有望成为未来用户连接人工智能系统的重要方式之一。

Jun Chen 是 descargitas.com 的撰稿作者,主要关注新闻、政治、商业、科技、体育、娱乐及生活方式等领域的最新动态。他注重信息的准确性与清晰表达,致力于为读者提供及时、实用且易于理解的内容。通过持续关注时事热点和社会发展,他分享与读者密切相关的新闻报道和故事,帮助读者更全面地了解当下的重要议题与趋势。