想象一下,你正在和陌生人交谈,但你听到的不是手机里传来的机械音,而是直接通过耳机听到的流畅翻译。而且,翻译还保留了原说话者的语调和音色。 谷歌翻译 谷歌刚刚推出了一项将彻底打破语言障碍的技术。谷歌的机器翻译今年迎来二十周年纪念,该公司自豪地宣称,其产品现在每月翻译超过万亿个单词。 audio 模型 Gemini 3.5 实时翻译旨在将整个翻译领域提升到一个全新的水平。告别传统的文本翻译,告别那种需要说出句子、等待处理、然后播放结果的繁琐操作。谷歌正朝着无缝同声传译的方向发展,就像专业人士提供的服务一样。
这款全新模型能够以近乎实时的方式翻译70多种语言的口语。与以往的解决方案不同,它不会等待说话者说完,而是持续翻译,仅比说话者慢几秒钟,同时保持其语调、语速和音高。最终的译文听起来就像原说话者一样自然流畅。其核心创新在于连续语音生成。该模型能够智能地权衡是等待更多上下文信息(从而提高翻译质量)还是立即翻译并跟上说话者的节奏。最终呈现出流畅自然的语音,没有任何不自然的停顿。此外,无需手动设置语言。该模型能够自动检测70多种语言,轻松应对多语言对话或嘈杂环境。
在全新的“聆听模式”下,您只需将手机贴近耳朵,就像打电话一样。然后,您就可以直接从手机听筒中隐蔽地听到翻译,这彻底改变了在异国他乡进行个人沟通的方式。再也不用把手放在陌生人面前,让屏幕对着他们的脸了。这项新功能将逐步引入视频通话中。 谷歌见面语音翻译功能将首先作为部分 Google Workspace 企业客户的内部测试项目推出,Google 承诺将于今年晚些时候进行更广泛的部署。开发者可以通过以下方式获取该模型: Gemini 实时API。例如,亚洲出行平台Grab是首批测试该API的公司之一,该平台用于司机和乘客之间的沟通——仅其应用程序每月就进行超过10万次语音通话。该平台的管理层主要称赞其自动语言识别功能和极低的延迟。
能够用你的声音说出外语的技术当然是一把双刃剑。为了防止深度伪造和虚假信息的传播,该模型生成的所有音频都带有一个名为 SynthID 的不可听见的数字水印。这使得未来能够可靠地识别人工智能内容。通过这一举措,谷歌显著增强了其竞争优势。 Apple 最近押注实时翻译 AirPodech 和三星正在大力推广他们的 AI 翻译器,直接集成到他们的手机中。 Galaxy然而,谷歌的这款新产品完美支持捷克语和斯洛伐克语,根据我们的初步测试,翻译质量一流。单一用途硬件翻译器的制造商将面临越来越大的竞争压力。
如何立即激活该功能?
- 在应用商店更新谷歌翻译应用(Google Play / App Store).
- 打开应用程序后,点击“对话”图标。
- 选择新项目“收听”,然后单击“开始”。
- 将手机贴在耳边开始收听。chat 周围环境。
根据我们初步的编辑测试,这项功能运行非常稳定可靠,并且能够惊人地还原原声。您对这项科幻新奇功能有何看法?欢迎在讨论区与我们分享。
在这个世界上 Siri 不会说捷克语。真遗憾。
我同意,这太荒谬了。
还有那个只会笑的Pixel
我试着看了一部原声的韩国电影。感觉就像回到了录像带时代,听到的都是快速配音。
你是怎么让它生效的?我看到了那个优惠,但是点不了(像文章里的图片那样是灰色的)。谢谢你的建议😉👍🏻
可能是因为你没插耳机。另外,请确保应用已更新到最新版本,旧款 iPad 上没有这个应用,更新后就有了。
无论你是否理解了内容,这才是最重要的,免费且即时,而且你理解了。完美并非免费。
就是这样……它翻译了台词,勉强和字幕匹配,但声音不一样,感觉就差强人意了。不如让大家自己试试,然后评判。这项技术会随着时间推移而发展。例如,Netflix 和其他公司可能会提供一些 API 接口/开发翻译 AI。
我不知道我哪里做错了,菜单明明就在那里,但我却点不出来🤷♂️ 它像文章里的图片那样是灰色的,所以我不知道它到底能不能用?!
我正在测试,玩《孤岛惊魂6》的时候经常出错。有时候完全不翻译,有时候一分钟才翻译完,有时候又会突然中断,然后一个词重复30遍,简直莫名其妙。不过我知道游戏里有音乐和音效,我得把所有声音都关掉才行。chat 如果只有人声,那就太无聊了。但在 YouTube 上,一个人的声音清晰,不会被音乐淹没,效果就相当不错。
对我来说不太管用,但我只是试了一会儿。
但如果它能接收手机的声音就好了。我当时在等一个来自奥地利的电话,但我德语很差。幸好有个捷克人打来电话,帮我们这些外国人翻译了。说明书上说要先把手机声音调大再用翻译器,但这个方法不管用,手机好像设置成忽略手机本身的声音(这是个技术问题,会产生啸叫或回声)。