关闭广告

想象一下,你正在和陌生人交谈,但你听到的不是手机里传来的机械音,而是直接通过耳机听到的流畅翻译。而且,翻译还保留了原说话者的语调和音色。 谷歌翻译 谷歌刚刚推出了一项将彻底打破语言障碍的技术。谷歌的机器翻译今年迎来二十周年纪念,该公司自豪地宣称,其产品现在每月翻译超过万亿个单词。 audio 模型 Gemini 3.5 实时翻译旨在将整个翻译领域提升到一个全新的水平。告别传统的文本翻译,告别那种需要说出句子、等待处理、然后播放结果的繁琐操作。谷歌正朝着无缝同声传译的方向发展,就像专业人士提供的服务一样。

这款全新模型能够以近乎实时的方式翻译70多种语言的口语。与以往的解决方案不同,它不会等待说话者说完,而是持续翻译,仅比说话者慢几秒钟,同时保持其语调、语速和音高。最终的译文听起来就像原说话者一样自然流畅。其核心创新在于连续语音生成。该模型能够智能地权衡是等待更多上下文信息(从而提高翻译质量)还是立即翻译并跟上说话者的节奏。最终呈现出流畅自然的语音,没有任何不自然的停顿。此外,无需手动设置语言。该模型能够自动检测70多种语言,轻松应对多语言对话或嘈杂环境。

在全新的“聆听模式”下,您只需将手机贴近耳朵,就像打电话一样。然后,您就可以直接从手机听筒中隐蔽地听到翻译,这彻底改变了在异国他乡进行个人沟通的方式。再也不用把手放在陌生人面前,让屏幕对着他们的脸了。这项新功能将逐步引入视频通话中。 谷歌见面语音翻译功能将首先作为部分 Google Workspace 企业客户的内部测试项目推出,Google 承诺将于今年晚些时候进行更广泛的部署。开发者可以通过以下方式获取该模型: Gemini 实时API。例如,亚洲出行平台Grab是首批测试该API的公司之一,该平台用于司机和乘客之间的沟通——仅其应用程序每月就进行超过10万次语音通话。该平台的管理层主要称赞其自动语言识别功能和极低的延迟。

能够用你的声音说出外语的技术当然是一把双刃剑。为了防止深度伪造和虚假信息的传播,该模型生成的所有音频都带有一个名为 SynthID 的不可听见的数字水印。这使得未来能够可靠地识别人工智能内容。通过这一举措,谷歌显著增强了其竞争优势。 Apple 最近押注实时翻译 AirPodech 和三星正在大力推广他们的 AI 翻译器,直接集成到他们的手机中。 Galaxy然而,谷歌的这款新产品完美支持捷克语和斯洛伐克语,根据我们的初步测试,翻译质量一流。单一用途硬件翻译器的制造商将面临越来越大的竞争压力。

如何立即激活该功能?

  • 在应用商店更新谷歌翻译应用(Google Play / App Store).
  • 打开应用程序后,点击“对话”图标。
  • 选择新项目“收听”,然后单击“开始”。
  • 将手机贴在耳边开始收听。chat 周围环境。

根据我们初步的编辑测试,这项功能运行非常稳定可靠,并且能够惊人地还原原声。您对这项科幻新奇功能有何看法?欢迎在讨论区与我们分享。

今日阅读最多的

.