Słownik AI
Co to jest speech-to-text? Rozpoznawanie mowy i transkrypcja AI
Speech-to-text to zamiana mowy na tekst przez AI. Służy do transkrypcji spotkań i rozmów, a w agentach głosowych jest pierwszym krokiem: agent musi najpierw usłyszeć, co powiedziałeś.
Inne nazwy: STT, ASR, transkrypcja mowy, rozpoznawanie mowy
Jak działa
Nagranie albo strumień dźwięku trafia do modelu, który zamienia go na tekst. Nowoczesne modele uczono na setkach tysięcy godzin nagrań w wielu językach. Przełomem był model Whisper od OpenAI z 2022 roku, udostępniony jako open source. Od tamtej pory dobre rozpoznawanie polskiej mowy przestało być drogie i trudno dostępne.
Często do transkrypcji dochodzi rozpoznawanie mówców, czyli oznaczenie, kto co powiedział. Przy spotkaniach to połowa wartości.
Zastosowania
Notatki i protokoły ze spotkań, które opisuję w tekście o transkrypcji spotkań z AI. Analiza rozmów na infolinii: o co ludzie dzwonią najczęściej, gdzie rozmowy się przeciągają. Dyktowanie notatek w terenie. No i agenci głosowi, gdzie rozpoznawanie mowy musi działać w ułamku sekundy, bo po drugiej stronie czeka człowiek.
Trudne przypadki
Najczęściej mylone są nazwiska, nazwy produktów, kody i ciągi cyfr: numery telefonów, PESEL, numery zamówień. Do tego gwara, dwie osoby mówiące naraz i słaba jakość połączenia telefonicznego. W agentach głosowych radzę sobie z tym na dwa sposoby: słownik nazw własnych podany modelowi i powtarzanie ważnych danych rozmówcy do potwierdzenia („zapisuję numer 604 123 456, zgadza się?”).
Nagranie głosu to dane osobowe. Rozmówca musi wiedzieć, że rozmowa jest nagrywana i przetwarzana, a nagrania nie powinny leżeć dłużej, niż to potrzebne.
Kontakt
Masz proces, który zjada czas zespołu?
Napisz dwa zdania o tym, co boli. Odpiszę i powiem wprost, czy warto to automatyzować.
albo zadzwoń +48 735 170 951 · +48 516 461 444
Zwykle odpisuję tego samego dnia.