Słownik AI
Co to jest embedding? Jak AI zapisuje znaczenie tekstu w liczbach
Embedding to zapis znaczenia tekstu jako listy liczb, czyli wektora. Teksty o podobnym sensie mają podobne wektory, więc AI może szukać po znaczeniu, a nie po słowach.
Inne nazwy: osadzenie wektorowe, wektor semantyczny, embeddingi
Jak to działa
Specjalny model, zwany modelem do embeddingów, zamienia fragment tekstu na wektor złożony z kilkuset albo kilku tysięcy liczb. Same liczby nic człowiekowi nie mówią. Ważne jest to, że teksty o podobnym znaczeniu lądują blisko siebie, a teksty o różnym daleko.
„Korekta faktury” i „faktura korygująca” dostaną prawie takie same wektory, choć składają się z innych słów. „Faktura” i „sprzątanie biura” będą daleko od siebie. Odległość między wektorami liczy się matematycznie, najczęściej tak zwanym podobieństwem kosinusowym, i to w ułamku sekundy nawet dla milionów tekstów.
Do czego się przydaje
Najważniejsze zastosowanie to wyszukiwanie po znaczeniu w systemach RAG. Klient pyta własnymi słowami, a system znajduje fragment regulaminu, który odpowiada na to pytanie, nawet jeśli nie ma w nim ani jednego słowa z pytania.
Embeddingi przydają się też do grupowania. Wrzucasz tysiąc zgłoszeń od klientów i dostajesz je pogrupowane w tematy, bez ręcznego tagowania. Tak samo da się wyłapywać duplikaty albo podobne reklamacje z różnych kanałów.
Na co uważać
Model do embeddingów musi dobrze znać polski. Te trenowane głównie na angielskim gorzej łapią polską odmianę i idiomy, więc przed wyborem testuję kilka na prawdziwych pytaniach klienta. Druga sprawa: zmiana modelu oznacza przeliczenie całego indeksu od nowa, bo wektory z dwóch różnych modeli nie są porównywalne.
Wektory utworzone z danych osobowych traktuję jak same dane osobowe. Odtworzenie z nich tekstu nie jest proste, ale przy RODO ostrożność na starcie jest tańsza niż późniejsze tłumaczenie się.
Najczęstsze pytania
Czy embeddingi rozumieją polski?
Zależy od modelu. Wielojęzyczne modele do embeddingów radzą sobie z polskim dobrze, te trenowane głównie po angielsku wyraźnie gorzej. Zanim wybiorę model do projektu, testuję kilka na prawdziwych pytaniach i dokumentach klienta, bo ogólne rankingi nie zawsze przekładają się na konkretną branżę.
Czy embedding to to samo co model językowy?
Nie. Model do embeddingów zamienia tekst na liczby opisujące jego znaczenie, ale sam niczego nie pisze. Model językowy generuje tekst. W systemie RAG pracują razem: pierwszy wyszukuje pasujące fragmenty, drugi układa z nich odpowiedź.
Kontakt
Masz proces, który zjada czas zespołu?
Napisz dwa zdania o tym, co boli. Odpiszę i powiem wprost, czy warto to automatyzować.
albo zadzwoń +48 735 170 951 · +48 516 461 444
Zwykle odpisuję tego samego dnia.