# Cena za token to wierzchołek góry lodowej
Cennik mówi o cenie za 1000 tokenów wejścia i wyjścia. Problem w tym, że "jedno pytanie użytkownika" to nie jest jedno pytanie wysłane do modelu. To system prompt z instrukcjami i tonem marki, lista dostępnych narzędzi, wyniki z bazy wiedzy i cała dotychczasowa historia rozmowy. Krótkie "a ile to kosztuje?" od użytkownika może oznaczać 6000 tokenów wysłanych do modelu.
# Pamięć konwersacji to mnożnik, nie dodatek
Chatbot bez pamięci jest bezużyteczny — użytkownik oczekuje, że pamiętasz, co napisał trzy wiadomości wcześniej. Ale każda kolejna tura dokleja całą historię do nowego zapytania. Tura pierwsza: 1000 tokenów. Tura dziesiąta: 9000 tokenów, bo niesiesz dziewięć poprzednich. W jednej dłuższej rozmowie płacisz za te same wiadomości wielokrotnie. To dlatego koszt rośnie kwadratowo z długością konwersacji, a nie liniowo.
# RAG i narzędzia dodają ukryty narzut
Chatbot odpowiadający na pytania o Twoje produkty potrzebuje kontekstu z bazy wiedzy. Typowy retrieval wstrzykuje 3-5 fragmentów dokumentów do każdego zapytania — to kolejne 1500-3000 tokenów wejścia, których nie ma w naiwnej kalkulacji. Każde wywołanie narzędzia (sprawdzenie statusu zamówienia, kalendarz, CRM) to dodatkowa pętla: zapytanie, odpowiedź narzędzia z powrotem do modelu, finalna odpowiedź. Trzy wywołania narzędzi to trzy pełne przebiegi przez context window.
# Prompt caching potrafi ściąć rachunek o połowę
Dobra wiadomość: spora część tego kontekstu się nie zmienia. System prompt, definicje narzędzi, stała baza wiedzy — to identyczny prefiks w każdym zapytaniu. Dostawcy modeli pozwalają go cache'ować, a tokeny z cache'a kosztują ułamek normalnej ceny. Przy chatbocie z długim system promptem to realnie 50-70% oszczędności na tokenach wejścia. Warunek: trzeba świadomie ułożyć prompt tak, żeby część stała była na początku, a zmienna na końcu.
# Realny rachunek
Na koniec praktyka. Chatbot obsługujący 3000 rozmów dziennie, średnio 8 tur na rozmowę, z RAG i prompt cachingiem to rząd kilkuset do ~tysiąca dolarów miesięcznie — zależnie od modelu i tego, czy ktoś zadbał o cache i limity długości historii. Bez tych optymalizacji ten sam ruch potrafi kosztować wielokrotnie więcej. Koszt chatbota to nie pozycja w cenniku, tylko decyzja architektoniczna.