Słownik AI

Co to jest speech-to-text? Rozpoznawanie mowy i transkrypcja AI

Speech-to-text to zamiana mowy na tekst przez AI. Służy do transkrypcji spotkań i rozmów, a w agentach głosowych jest pierwszym krokiem: agent musi najpierw usłyszeć, co powiedziałeś.

Inne nazwy: STT, ASR, transkrypcja mowy, rozpoznawanie mowy

Jak działa

Nagranie albo strumień dźwięku trafia do modelu, który zamienia go na tekst. Nowoczesne modele uczono na setkach tysięcy godzin nagrań w wielu językach. Przełomem był model Whisper od OpenAI z 2022 roku, udostępniony jako open source. Od tamtej pory dobre rozpoznawanie polskiej mowy przestało być drogie i trudno dostępne.

Często do transkrypcji dochodzi rozpoznawanie mówców, czyli oznaczenie, kto co powiedział. Przy spotkaniach to połowa wartości.

Zastosowania

Notatki i protokoły ze spotkań, które opisuję w tekście o transkrypcji spotkań z AI. Analiza rozmów na infolinii: o co ludzie dzwonią najczęściej, gdzie rozmowy się przeciągają. Dyktowanie notatek w terenie. No i agenci głosowi, gdzie rozpoznawanie mowy musi działać w ułamku sekundy, bo po drugiej stronie czeka człowiek.

Trudne przypadki

Najczęściej mylone są nazwiska, nazwy produktów, kody i ciągi cyfr: numery telefonów, PESEL, numery zamówień. Do tego gwara, dwie osoby mówiące naraz i słaba jakość połączenia telefonicznego. W agentach głosowych radzę sobie z tym na dwa sposoby: słownik nazw własnych podany modelowi i powtarzanie ważnych danych rozmówcy do potwierdzenia („zapisuję numer 604 123 456, zgadza się?”).

Nagranie głosu to dane osobowe. Rozmówca musi wiedzieć, że rozmowa jest nagrywana i przetwarzana, a nagrania nie powinny leżeć dłużej, niż to potrzebne.

Kontakt

Masz proces, który zjada czas zespołu?

Napisz dwa zdania o tym, co boli. Odpiszę i powiem wprost, czy warto to automatyzować.

albo zadzwoń +48 735 170 951 · +48 516 461 444

Zwykle odpisuję tego samego dnia.

Znajdziesz mnie też tutaj

GitHubLinkedInX