Kwantyzacja jest powodem, dla którego modele wymagające sprzętu serwerowego działają na zwykłej karcie graficznej.
Na czym polega
Wartości opisujące model zapisywane są z mniejszą dokładnością. Rozmiar spada kilkukrotnie, a jakość odpowiedzi — nieznacznie.
To zabieg czysto techniczny. Model nie jest uczony od nowa ani okrojony z wiedzy, zmienia się tylko sposób zapisu jego wartości. Efekt praktyczny jest jednak duży, bo o tym, co da się uruchomić, decyduje pamięć karty graficznej, a nie liczba parametrów sama w sobie.
Poziomy
Osiem bitów daje wynik praktycznie nieodróżnialny od pełnej precyzji. Cztery bity to typowy kompromis. Poniżej czterech jakość zaczyna wyraźnie spadać.
Wybór poziomu jest więc decyzją o tym, ile pamięci firma chce odzyskać i za jaką cenę. Nie ma tu jednej właściwej odpowiedzi — zależy ona od zadania, a nie od modelu.
Co traci najpierw
Zadania wymagające precyzji: rachunki, ścisłe trzymanie się formatu, długie rozumowania. Rozmowa i streszczanie znoszą kwantyzację znacznie lepiej.
Warto zapamiętać ten podział, bo od niego zależy, gdzie w ogóle wolno oszczędzać. Jeśli model ma wyciągać z dokumentów dane do dalszego przetwarzania i zwracać je w ustalonej strukturze, każdy błąd formatu zatrzymuje cały proces. Jeśli ma pomagać w redagowaniu pisma, drobne różnice w sformułowaniach nikomu nie przeszkadzają. Szerzej opisuje ten wątek tekst o tym, jak instalacja lokalna wpływa na jakość odpowiedzi.
Praktyczna zasada
Większy model po kwantyzacji jest zwykle lepszy niż mniejszy w pełnej precyzji przy tym samym zużyciu pamięci. To najważniejsza konsekwencja przy doborze sprzętu.
Zasada ta zmienia kolejność zakupów. Zamiast pytać, jaki model zmieści się bez kompromisów, warto zapytać, jaki największy model zmieści się po kwantyzacji — i dopiero ten wynik porównać z zadaniem.
Wpływ na szybkość
Mniejszy zapis to również mniej danych do przeczytania przy każdej odpowiedzi, więc praca zwykle przyspiesza. Nie jest to jednak reguła bez wyjątków: zysk zależy od sprzętu i od sposobu uruchomienia. Jeśli szybkość ma znaczenie, trzeba ją zmierzyć na miejscu, tak samo jak liczbę zapytań, które serwer obsłuży.
Sprawdzenie na własnym zadaniu
Ten sam zestaw przykładów na dwóch poziomach kwantyzacji. Bywa, że różnica jest niedostrzegalna — i wtedy oszczędność pamięci jest darmowa.
Porównanie ma sens tylko wtedy, gdy jest powtarzalne. Ten sam zestaw dokumentów, ta sama treść polecenia, ta sama forma oczekiwanego wyniku. Inaczej ocenia się wrażenie, a nie różnicę.
Gotowe wersje
Modele skwantyzowane są zwykle publikowane razem z pierwowzorem. Samodzielne przygotowanie rzadko bywa potrzebne.
Przy pobieraniu gotowej wersji warto jednak sprawdzić, kto ją przygotował i czy odpowiada pierwowzorowi. To ten sam rodzaj ostrożności, co przy każdym pliku pobieranym z zewnątrz.