Nauka AI
Jak działa ChatGPT? Proste wyjaśnienie tego, co dzieje się po kliknięciu „wyślij”
Model przewiduje następne słowo, i to wystarcza zaskakująco daleko
ChatGPT to interfejs do dużego modelu językowego. Sam model robi jedną rzecz: patrzy na tekst, który już jest, i przewiduje, jaki fragment powinien pojawić się dalej. Potem dopisuje ten fragment i powtarza cały proces. Słowo po słowie powstaje odpowiedź.
Brzmi to banalnie, ale żeby dobrze przewidzieć kolejne słowo w zdaniu „Faktura korygująca służy do”, model musi mieć jakieś wyobrażenie o księgowości. Żeby dokończyć kod programu, musi rozumieć, co ten kod robi. Trening na gigantycznej ilości tekstu sprawił, że model przy okazji nauczył się gramatyki, faktów, stylu i sporej części logiki.
Dobrze to sobie uświadomić, bo tłumaczy wiele zachowań. Model nie „wie”, że coś jest prawdą. Wie, że taka odpowiedź pasuje do wzorców, które widział. Najczęściej to się pokrywa z prawdą. Czasem nie.
Dobrą analogią jest bardzo oczytana osoba, która przeczytała pół internetu, ale nie może niczego sprawdzić. Odpowiada z pamięci, płynnie i pewnie. Przeważnie trafnie, bo czytała dużo. Czasem jednak miesza fakty albo dopowiada szczegóły, których nie pamięta.
Tokeny, czyli jak model widzi twój tekst
Model nie czyta liter ani całych słów. Dzieli tekst na tokeny, czyli kawałki słów. Krótkie angielskie słowo to zwykle jeden token. Polskie słowa, z odmianą i długimi końcówkami, często rozpadają się na dwa, trzy tokeny. Dlatego ten sam tekst po polsku bywa „droższy” w przeliczeniu na tokeny niż po angielsku.
To ma znaczenie praktyczne. Limity w darmowych planach, ceny w API i długość rozmowy liczy się właśnie w tokenach. Jeśli budujesz coś na API, koszt zależy od liczby tokenów wysłanych i odebranych.
Tokeny wyjaśniają też kilka dziwnych błędów. Model potrafi się pomylić, licząc litery w słowie albo odwracając wyraz od końca, bo nigdy nie widział pojedynczych liter. Widział kawałki. Dla człowieka to proste zadanie, dla modelu nienaturalne.
Pamiętaj też, że odpowiedź jest liczona w tokenach. Jeśli prosisz o długi raport, zużywasz więcej limitu niż przy krótkiej odpowiedzi. W darmowych planach to najczęstszy powód komunikatu o wyczerpaniu limitu wiadomości.
Skąd model wie tyle rzeczy: trening w dwóch etapach
Pierwszy etap to trening na ogromnym zbiorze tekstów: strony internetowe, książki, kod, artykuły. Model uczy się przewidywać kolejne tokeny, miliardy razy poprawiając swoje wewnętrzne ustawienia. Technicznie opiera się to na architekturze transformer, która dobrze radzi sobie z wychwytywaniem zależności między odległymi fragmentami tekstu.
Po pierwszym etapie model umie pisać, ale nie umie rozmawiać. Na pytanie może odpowiedzieć kolejnym pytaniem albo dopisać ciąg dalszy jak w forum internetowym. Dlatego jest drugi etap: dostrajanie na przykładach dobrych rozmów i ocenach ludzi. Stąd bierze się uprzejmy ton, struktura odpowiedzi i odmowa przy niebezpiecznych prośbach.
Wiedza modelu ma datę graniczną, czyli moment, do którego zebrano dane treningowe. O wydarzeniach po tej dacie model sam z siebie nie wie. Wiele asystentów potrafi dziś przeszukać internet, ale to osobna funkcja doklejona do modelu, a nie jego pamięć.
Z tego podziału na dwa etapy wynika ciekawa rzecz. Model ma w sobie dużo więcej wiedzy, niż widać w zwykłej rozmowie. Odpowiednio zadane pytanie, z kontekstem i przykładami, wydobywa z niego znacznie lepsze odpowiedzi niż krótkie hasło.
Okno kontekstowe: ile model pamięta w jednej rozmowie
Model nie ma pamięci w ludzkim sensie. Przy każdej odpowiedzi dostaje całą dotychczasową rozmowę jako tekst wejściowy. Maksymalna ilość tekstu, którą może naraz przetworzyć, to okno kontekstowe. Dzisiejsze okna są duże i mieszczą całe raporty czy umowy.
Kiedy rozmowa robi się bardzo długa, najstarsze fragmenty mogą zostać obcięte albo model zaczyna zwracać na nie mniej uwagi. Widać to, gdy po godzinie pracy AI „zapomina” ustalenia z początku. Prosta rada: przy nowym temacie zaczynaj nową rozmowę i na początku wklej najważniejsze informacje.
Niektóre aplikacje mają funkcję pamięci między rozmowami. Działa to tak, że aplikacja zapisuje wybrane fakty o tobie i dokleja je do kolejnych rozmów. Sam model nadal niczego się od ciebie nie uczy na stałe.
Dla firm to ważna informacja. Jeśli chcesz, żeby asystent znał twój cennik czy procedury, nie wystarczy mu raz o nich powiedzieć. Trzeba za każdym razem dostarczyć je w kontekście, ręcznie albo automatycznie. W agentach, które buduję, robi to za użytkownika system wyszukujący odpowiednie dokumenty.
Dlaczego ChatGPT czasem zmyśla
Skoro model przewiduje najbardziej pasujący tekst, to na pytanie o nieistniejący wyrok sądu też wygeneruje coś, co wygląda jak wyrok. Z sygnaturą, datą i uzasadnieniem. To są halucynacje i nie da się ich całkowicie wyłączyć, można je tylko ograniczać.
Pomaga podawanie źródeł w samym poleceniu. Jeśli wkleisz regulamin i każesz odpowiadać tylko na jego podstawie, model trzyma się tekstu znacznie lepiej. Na tej zasadzie działa RAG, czyli technika, której używam w agentach dla firm: najpierw wyszukujemy właściwe dokumenty, potem model odpowiada na ich podstawie.
Praktyczne metody sprawdzania odpowiedzi opisałem w tekście o halucynacjach AI. Krótko: fakty, liczby i przepisy zawsze weryfikujesz u źródła.
Drugim sposobem jest dostęp do wyszukiwarki. Kiedy asystent przeszukuje sieć i podaje linki, łatwiej sprawdzić, skąd wziął informację. Nie eliminuje to błędów całkowicie, bo model może źle zrozumieć stronę, ale daje ci punkt zaczepienia do weryfikacji.
Co z tego wynika dla ciebie
Skoro model reaguje na tekst, który mu dasz, to jakość odpowiedzi w dużej mierze zależy od ciebie. Więcej kontekstu oznacza lepsze przewidywanie. Dlatego dobrze napisany prompt robi tak dużą różnicę, a ogólnikowe pytanie daje ogólnikową odpowiedź.
Odpowiedzi nie są też za każdym razem identyczne. Model losuje spośród prawdopodobnych kontynuacji, a stopień tej losowości reguluje parametr temperatura. Jeśli pierwsza wersja ci nie pasuje, wygeneruj kolejną. To normalne i nic nie kosztuje.
Kiedy już rozumiesz mechanizm, łatwiej ocenić, gdzie AI się sprawdzi. Tekst, streszczenia, szkice, tłumaczenia: tak. Precyzyjne obliczenia i aktualne fakty bez źródła: ostrożnie. Więcej takich granic opisuję w tekście czego AI nie potrafi.
Nie ma w tym magii ani świadomości. Jest bardzo wyrafinowane przewidywanie tekstu, wsparte narzędziami. Ta wiedza chroni przed dwoma skrajnościami: przed lękiem, że AI „wie wszystko”, i przed lekceważeniem, że to „tylko autouzupełnianie”. Prawda jest ciekawsza od obu.
Co dzieje się między twoim pytaniem a odpowiedzią
Kiedy klikasz „wyślij”, aplikacja nie przekazuje modelowi samego twojego pytania. Dokleja do niego ukryte instrukcje od dostawcy, czyli tak zwany system prompt, opis dostępnych narzędzi, twoje ustawienia personalizacji i całą wcześniejszą rozmowę. Dopiero ten pakiet trafia do modelu.
Model zamienia tekst na tokeny, przetwarza je i zaczyna generować odpowiedź token po tokenie. Dlatego widzisz, jak tekst „pisze się” na ekranie. To nie efekt specjalny, tylko rzeczywisty sposób pracy modelu. Ten proces nazywa się inferencją.
Jeśli model uzna, że potrzebuje narzędzia, na przykład wyszukiwarki albo kalkulatora, zamiast odpowiedzi generuje polecenie dla aplikacji. Aplikacja wykonuje wyszukiwanie, wynik wraca do modelu, a model pisze odpowiedź na jego podstawie. Z twojej perspektywy to jedna płynna rozmowa.
Na tej samej zasadzie działają agenci AI, które buduję. Model dostaje dostęp do kalendarza, systemu zamówień czy bazy klientów i sam decyduje, kiedy z nich skorzystać. Mechanizm jest identyczny jak w czacie, różni się tylko zestaw narzędzi.
Najczęstsze pytania
Czy ChatGPT przeszukuje internet przy każdej odpowiedzi?
Nie. Podstawą jest wiedza zapisana w modelu podczas treningu. Wyszukiwanie w sieci to dodatkowa funkcja, która włącza się tylko w niektórych trybach lub gdy aplikacja uzna to za potrzebne.
Czy ChatGPT uczy się z moich rozmów?
Model nie zmienia się w trakcie rozmowy. Dostawca może jednak używać rozmów do trenowania kolejnych wersji, zależnie od ustawień konta i planu. W ustawieniach prywatności zwykle da się to wyłączyć, a plany firmowe domyślnie tego nie robią.
Czym jest token?
To fragment tekstu, na które model dzieli wejście i wyjście. Polskie słowo to często dwa lub trzy tokeny. Szerzej w haśle token.
Dlaczego na to samo pytanie dostaję różne odpowiedzi?
Model wybiera kolejne słowa z pewną losowością. Dzięki temu teksty brzmią naturalnie, ale też każda próba może wyjść trochę inaczej.
Zobacz też
Chcesz, żeby model językowy odpowiadał na podstawie twoich dokumentów, a nie z pamięci? Zbuduję agenta AI, który korzysta z wiedzy twojej firmy.
Kontakt
Masz proces, który zjada czas zespołu?
Napisz dwa zdania o tym, co boli. Odpiszę i powiem wprost, czy warto to automatyzować.
albo zadzwoń +48 735 170 951 · +48 516 461 444
Zwykle odpisuję tego samego dnia.