← Wszystkie pojęcia VoIP

Przetwarzanie mediów i analityka

Synteza mowy

Inne nazwy: text-to-speech, TTS

Co to jest Synteza mowy?

Synteza mowy to automatyczne tworzenie wypowiedzi głosowej z tekstu, często określane skrótem TTS, czyli text-to-speech. System nie musi odtwarzać wcześniej nagranego całego zdania. Może wypowiedzieć zmienną treść, na przykład termin wizyty lub numer zamówienia.

Do czego służy Synteza mowy?

Służy do budowania komunikatów IVR, odpowiedzi voicebota i powiadomień głosowych. Ułatwia aktualizowanie treści bez ponownej sesji z lektorem. Nie oznacza to, że każda wypowiedź brzmi naturalnie: nazwiska, skróty i nietypowe liczby często wymagają przygotowania sposobu wymowy.

Jak może mi pomóc Synteza mowy?

Firma może szybciej zmienić godziny pracy, poinformować o opóźnieniu lub odczytać klientowi indywidualny status sprawy. Przy wielu często zmieniających się komunikatach oszczędza to pracę redakcyjną. Stałe, ważne zapowiedzi nadal warto porównać jakościowo z nagraniem profesjonalnego lektora.

Jakie problemy rozwiązuje Synteza mowy?

TTS rozwiązuje problem odczytywania dynamicznych danych i utrzymywania wielu wersji komunikatów. Nie naprawi niejasnego tekstu ani zbyt długiego menu. Zdanie dobrze wyglądające na ekranie może być trudne do zrozumienia przez telefon, dlatego należy testować je ze słuchu.

Technologia

Współczesne systemy wykorzystują modele generujące dźwięk na podstawie tekstu i parametrów głosu. Znaczniki SSML mogą sterować pauzami, wymową lub sposobem odczytywania danych, zależnie od usługi. Ważne są także opóźnienie generowania i zgodność formatu audio z centralą.

Gdzie można wykorzystać Synteza mowy?

Syntezę mowy stosuje się w infoliniach, dostępności cyfrowej i automatycznych potwierdzeniach. Przy wyborze głosu należy sprawdzić język polski na rzeczywistych nazwach i kwotach. Klonowanie głosu konkretnej osoby to osobna funkcja wymagająca odpowiednich uprawnień, a nie nieodłączna cecha TTS.

Koszyk