Słownik AI

Co to jest text-to-speech? Jak AI zamienia tekst w naturalny głos

Text-to-speech to zamiana tekstu na mowę. Nowoczesne modele TTS brzmią na tyle naturalnie, że w rozmowie telefonicznej trudno je odróżnić od człowieka, także po polsku.

Inne nazwy: TTS, synteza mowy, głos AI

Od robota do naturalnego głosu

Kto dzwonił kiedyś na infolinię, pamięta ten głos: każde słowo osobno, dziwna intonacja, liczby czytane jak przez automat. Stare syntezatory sklejały nagrane fragmenty albo generowały dźwięk z reguł. Dzisiejsze modele neuronowe uczą się mowy z tysięcy godzin nagrań i odtwarzają to, czego reguły nie łapały: pauzy, akcent zdaniowy, lekkie przyspieszenie przy oczywistych rzeczach.

Co decyduje o jakości po polsku

Najwięcej problemów sprawia wszystko, co w tekście wygląda inaczej, niż się to czyta: liczby, daty, godziny, kwoty, skróty. Zapis „12.10 o 15:30, 1 250 zł, ul. Grodzka 5/7” trzeba przeczytać jako „dwunastego października o piętnastej trzydzieści” i dalej w tym duchu. Dobre systemy normalizują tekst przed syntezą, słabe czytają „jeden dwa kropka jeden zero”.

W rozmowie liczy się też czas reakcji. Głos może być piękny, ale jeśli odpowiedź przychodzi po trzech sekundach, rozmówca myśli, że połączenie się zerwało. Szerzej piszę o tym w tekście o jakości głosu agenta AI, a jak to brzmi w praktyce, sprawdzisz w demach Asystentów Głosowych.

Klonowanie głosu

Z kilku minut nagrania da się dziś stworzyć syntetyczną kopię konkretnego głosu. Firmy używają tego, żeby asystent mówił głosem znanym klientom. Warunek podstawowy to zgoda osoby, której głos jest klonowany, najlepiej na piśmie i z jasno opisanym zakresem. Rozmówcy powinni też wiedzieć, że rozmawiają z AI, czego wymaga AI Act.

Kontakt

Masz proces, który zjada czas zespołu?

Napisz dwa zdania o tym, co boli. Odpiszę i powiem wprost, czy warto to automatyzować.

albo zadzwoń +48 735 170 951 · +48 516 461 444

Zwykle odpisuję tego samego dnia.

Znajdziesz mnie też tutaj

GitHubLinkedInX