DeepSeek V4 Flash zjadł 8 bilionów tokenów w jeden dzień. Co to mówi o AI?
Źródło: Link
Źródło: Link
Osiem bilionów tokenów w jeden dzień. To nie pomyłka - to rzeczywiste zużycie DeepSeek V4 Flash na jednym narzędziu do kodowania, OpenCode. Pięć bilionów z darmowych limitów, trzy biliony z płatnych planów. Dla porównania: cała platforma OpenRouter obsługuje średnio 6,6 biliona tokenów dziennie. Jeden model, jedno narzędzie, więcej ruchu niż agregator dziesiątek API.
To nie jest historia o tym, jak dobry jest DeepSeek. To historia o tym, jak zmienił się sposób, w jaki ludzie używają AI.

Kiedyś zadawałeś pytanie, dostawałeś odpowiedź, koniec. Teraz agenci AI czytają pliki, modyfikują kod, uruchamiają programy. Gdy coś nie działa - próbują ponownie. Jeden użytkownik zbudował prostą grę 3D z Claude Opus 5. Wynik? Jeden plik HTML i 690 milionów zużytych tokenów. Koszt: prawie 3000 złotych.
To nie jest błąd. To nowa rzeczywistość, w której AI nie odpowiada na pytania - wykonuje zadania. I robi to w pętli, aż się uda.
Problem? Przy starych cennikach taka praca staje się nieopłacalna. Dlatego DeepSeek zmienia ekonomię AI - nie przez lepszą inteligencję, a przez radykalnie niższą cenę za token.
Milion tokenów wyjściowych kosztuje 2 złote w DeepSeek V4 Flash. W Claude Opus 4.8? 25 dolarów, czyli około 170 złotych. Różnica: 85 razy.
W benchmarku Artificial Analysis Intelligence Index v4.1 DeepSeek V4 Flash Max uzyskał 50 punktów, Claude Opus Max 56. Opus wygrał o 6 punktów. Ukończenie całego testu kosztowało 72,02 dolara w DeepSeek i 3752,55 dolara w Claude. Opus był lepszy o 12%, ale droższy o 5200%.
Gdy model kosztuje dziesiątki razy więcej, a przewaga wynosi kilka procent, matematyka przestaje się spinać. Zwłaszcza gdy płacisz nie za jedno pytanie, a za tysiące iteracji agenta w tle.

Dla porównania: Claude Opus kosztuje 25 USD za milion tokenów wyjściowych, Fable 5 - 50 USD. Chińskie modele? Qwen 3.8 Max to 36 juanów, Kimi K3 - 100 juanów, GLM 5.2 - 28 juanów. DeepSeek wycenił się poniżej wszystkich, włączając lokalną konkurencję.
Pierwsi na celowniku nie są mali gracze. Małe modele wciąż mają sens w routingu, flagowce wciąż rozwiązują najtrudniejsze problemy. Niewygodnie robi się modelom średniej półki - tym, które są silniejsze niż DeepSeek V4 Flash, ale dziesiątki razy droższe i nie na tyle mocne, by rozwiązać to, czego DeepSeek nie potrafi.
To właśnie jest linia śmierci DeepSeek. Nie musi być najlepszy. Wystarczy, że jest wystarczająco dobry do większości zadań, a różnica w cenie rzędu dwóch rzędów wielkości wypycha droższe modele z domyślnych wywołań.
Gdy agent AI wykonuje zadanie, nie liczy się już "jak mądra jest pojedyncza odpowiedź". Liczy się "ile kosztuje ukończenie całego zadania". I tu ekonomia przesądza o wyborze.
Bezpośredni koszt inferencji na token zależy od aktywowanych parametrów, precyzji obliczeń, mechanizmu uwagi, pamięci KV cache, długości wyjścia, wykorzystania sprzętu i współbieżności. DeepSeek V4 Flash ma 284 miliardy parametrów, ale aktywuje tylko około 13 miliardów na token. Hybrydowa uwaga, niska precyzja wag, optymalizacja cache - przy kontekście miliona tokenów obliczenia inferencji to około 10% tego, co wymaga V3.2, a KV cache około 7%.
Seria V4 przeprojektowała mechanizm uwagi na CSA (kompresja, potem fokus) i HCA (pełne przeglądanie). DeepSeekMoE kieruje każdy token do małego podzbioru ekspertów. Koszty serwisowe i ceny komercyjne idą w ślad za architekturą.

Linia frontu w AI przestała być wyznaczana przez samą wydajność. Teraz to wydajność i cena razem, z kosztem ukończonego zadania jako metryką decydującą. Model może być o 10% słabszy, ale jeśli kosztuje 50 razy mniej, wygrywa w 80% przypadków użycia.
Podobnie jak mniejsze modele biją większe przez lepszą architekturę, DeepSeek pokazuje, że w erze agentów liczy się koszt całej pętli, nie pojedynczej odpowiedzi.
Jeśli budujesz coś na API AI, Twoja kalkulacja właśnie się zmieniła. Wcześniej pytanie brzmiało: "który model jest najmądrzejszy?". Teraz brzmi: "który model ukończy zadanie najtaniej, przy akceptowalnej jakości?".
Dla prostych zadań - routing do małych modeli. Dla najtrudniejszych - flagowce. Dla wszystkiego pomiędzy? DeepSeek V4 Flash właśnie stał się domyślnym wyborem. Nie chodzi o to, że jest najlepszy. Dlatego, że jest wystarczająco dobry i 85 razy tańszy.
Agenci AI zmieniają sposób, w jaki myślimy o wartości modeli. Gdy jedno zadanie generuje setki milionów tokenów, różnica między 2 złotymi a 170 złotymi za milion przestaje być detalem. Staje się głównym kryterium wyboru.
Ekonomia AI to nie tylko ceny API. To zrozumienie, kiedy płacić za moc, a kiedy za objętość. Na darmowym webinarze pokazuję, jak wybierać modele pod konkretne zadania - bez przepalania budżetu na overkill. Zapisz się na darmowy webinar →
Częściowo. OpenCode oferował 5 bilionów tokenów w darmowych limitach i 3 biliony w płatnych planach. Sam model ma cennik 2 złote za milion tokenów wyjściowych, co czyni go najtańszym na rynku, ale nie całkowicie darmowym.
Agenci nie kończą pracy na jednej odpowiedzi. Czytają pliki, modyfikują kod, uruchamiają programy, a gdy coś nie działa - próbują ponownie. Jedno zadanie może generować setki milionów tokenów w pętli iteracji, co przy starych cennikach czyni je nieopłacalnymi.
Nie w zadaniach wymagających maksymalnej inteligencji. W większości rutynowych zadań agentowych - tak, różnica 85 razy w cenie przeważa nad różnicą 10-12% w jakości. Flagowce zachowają pozycję w najtrudniejszych problemach, ale stracą wolumen w zadaniach średniej klasy.
To próg cenowy, poniżej którego modele średniej półki tracą sens ekonomiczny. DeepSeek nie musi być najlepszy - wystarczy, że jest wystarczająco dobry i dziesiątki razy tańszy, by stać się domyślnym wyborem w większości zastosowań agentowych.
Przez architekturę MoE (Mixture of Experts), która aktywuje tylko 13 miliardów z 284 miliardów parametrów na token, hybrydową uwagę (CSA i HCA), niską precyzję wag i optymalizację KV cache. Przy kontekście miliona tokenów obliczenia to 10% tego, co wymaga V3.2, a pamięć cache około 7%.
Na podstawie: Pandaily
10 gotowych promptów do codziennej pracy + 5 narzędzi + plan na pierwszy tydzień. PDF, 4 strony konkretu.