Zamknij reklame

Wyobraź sobie rozmowę z obcą osobą, ale zamiast mechanicznego głosu z telefonu komórkowego słyszysz płynne tłumaczenie bezpośrednio w słuchawce. Co więcej, z intonacją i barwą głosu osoby mówiącej. tłumacz Google Właśnie wprowadził technologię, która definitywnie przełamie bariery językowe. Tłumaczenie maszynowe w Google obchodzi w tym roku dwudziestą rocznicę istnienia, a firma chwali się, że jej produkty tłumaczą obecnie ponad bilion słów miesięcznie. Nowość audio model Gemini 3.5 Live Translate ma na celu przeniesienie całej dyscypliny na wyższy poziom. Zapomnij o tradycyjnym tłumaczeniu tekstu i niezręcznej koncepcji konieczności wypowiedzenia zdania, oczekiwania na jego przetworzenie i odtworzenia wyniku. Google zmierza w kierunku płynnego tłumaczenia symultanicznego, takiego, jakie znamy z tłumaczeń profesjonalistów.

Nowy model potrafi tłumaczyć mowę niemal w czasie rzeczywistym, w ponad 70 językach. W przeciwieństwie do starszych rozwiązań, nie czeka, aż mówca skończy mówić. Tłumaczy w sposób ciągły, pozostając za mówcą zaledwie przez kilka sekund, zachowując jego intonację, tempo i ton głosu. Uzyskane tłumaczenie brzmi po prostu jak głos mówcy. Kluczową innowacją jest ciągłe generowanie mowy. Model stale i inteligentnie dobiera czas, aby poczekać na dodatkowy kontekst (i tym samym poprawić jakość tłumaczenia), czy tłumaczyć natychmiast i nadążać za mówcą. Rezultatem jest płynna mowa bez nienaturalnych przerw. Co więcej, nie ma potrzeby ręcznego ustawiania języka. Model samodzielnie rozpoznaje ponad 70 języków i z łatwością radzi sobie z rozmowami wielojęzycznymi lub w hałaśliwym otoczeniu.

W nowym „trybie słuchania” wystarczy przyłożyć telefon do ucha, tak jakbyś rozmawiał z kimś przez telefon. Możesz wtedy dyskretnie usłyszeć tłumaczenie bezpośrednio ze słuchawki telefonu, co całkowicie zmienia dynamikę komunikacji w obcym otoczeniu. Koniec z trzymaniem ręki z wyświetlaczem przed twarzą nieznajomego. Nowa funkcja będzie stopniowo wprowadzana w rozmowach wideo w Google Meet. Funkcja tłumaczenia mowy pojawi się tam najpierw w ramach prywatnych testów dla wybranych klientów biznesowych Google Workspace, a Google obiecuje szersze wdrożenie jeszcze w tym roku. Model ten jest dostępny dla programistów za pośrednictwem Gemini API na żywo. Jedną z pierwszych, które je testowały, jest na przykład azjatycka platforma transportowa Grab, służąca do komunikacji między kierowcami a pasażerami – za pośrednictwem samej aplikacji miesięcznie wykonywanych jest ponad 10 milionów połączeń głosowych. Zarząd platformy chwali przede wszystkim automatyczne wykrywanie języka i wyjątkowo niskie opóźnienia.

Technologia, która potrafi mówić w obcym języku własnym głosem, to oczywiście miecz obosieczny. Aby zapobiec rozprzestrzenianiu się deepfake'ów i dezinformacji, wszystkie dźwięki generowane przez ten model są opatrzone niesłyszalnym cyfrowym znakiem wodnym o nazwie SynthID. Umożliwia to niezawodne rozpoznawanie treści przez sztuczną inteligencję w przyszłości. Dzięki temu krokowi Google znacząco wzmacnia swoją przewagę konkurencyjną. Apple ostatnio obstawiałem tłumaczenie na żywo w AirPodech i Samsung masowo wdrażają swój interpreter sztucznej inteligencji bezpośrednio w swoich telefonach GalaxyJednak nowy produkt Google’a działa doskonale z językiem czeskim i słowackim, a jakość tłumaczenia jest na najwyższym poziomie, według naszych pierwszych testów. Producenci sprzętowych translatorów jednofunkcyjnych będą mieli coraz większe trudności.

Jak natychmiast aktywować tę funkcję?

  • Zaktualizuj aplikację Tłumacz Google w sklepie z aplikacjami (Google Play / App Store).
  • Po otwarciu aplikacji dotknij ikony „Rozmowy”.
  • Wybierz nową pozycję „Słuchanie” i kliknij „Rozpocznij”.
  • Przyłóż telefon do ucha i zacznij słuchać.chat okolica.

Według naszych pierwszych testów redakcyjnych, funkcja działa bardzo niezawodnie i zaskakująco wiernie naśladuje głosy oryginalnych lektorów. Co sądzisz o tej nowości science fiction? Podziel się swoją opinią w dyskusji.

Najczęściej czytane dzisiaj

.