Najtańszy model AI pokonał Claude Opus 4.8. Jak to możliwe?
Źródło: Link
Źródło: Link
DeepSeek-V4-Flash kosztuje 0,14 dolara za milion tokenów. Claude Opus 4.8 - 10 dolarów. To 57-krotna różnica. I właśnie najtańszy wiarygodny model na rynku pokonał flagowca Anthropic we wszystkich pięciu testach wydajnościowych. Sprawdźmy dane.
AOE Tech Labs, chiński zespół stojący za produktem Floatboat, opublikował 7 sierpnia kompletne wyniki testów na pięciu publicznych benchmarkach agentów AI. Użyli DeepSeek-V4-Flash jako modelu bazowego. Zmienili tylko jedno: system wykonawczy (Harness). Ten sam model, który przegrywał z Opus 4.8 na wszystkich pięciu testach w natywnym środowisku DeepSeek, wygrał wszystkie pięć w środowisku Floatboat.
AOE Tech Labs przeprowadził eksperyment z pojedynczą zmienną. Model bazowy: oficjalna wersja DeepSeek-V4-Flash-0731 (nie wersja preview). Grupa kontrolna działała na natywnym środowisku dostawcy w trybie minimalistycznym - inżynieria DeepSeek była w grze, co czyni porównanie bardziej wymagającym. Floatboat uruchomił testy w izolowanych fizycznych środowiskach sandbox z identycznymi parametrami wejściowymi.
Jedyna zmienna: sam Harness. System, który zarządza wykonaniem zadań - dostęp do plików, wywołania narzędzi, utrzymanie stanu, wieloetapowa autokorekta, rollback.
Pięć benchmarków to publiczne rankingi stworzone przez niezależne podmioty, w tym BrowseComp od OpenAI. Nie ma tu selekcji pytań pod wynik.
Uporządkowane od najkrótszych do najdłuższych zadań, wzrosty wydajności nie maleją: 1,9%, 9,6%, 12,6%, 19,9%, 23,6%.
Krótkie zadania to w zasadzie jednorazowe Q&A - tam dominuje jakość modelu. Długie zadania, czyli to, jak wygląda prawdziwa praca, są zdominowane przez system wykonawczy: dostęp do plików, wieloetapowe wywołania narzędzi, utrzymanie stanu między krokami, samokorekta, cofanie błędnych działań. Prawdziwa praca dzieje się na długim końcu spektrum.
AOE Tech Labs wprowadził wskaźnik Harness Leverage Ratio (HLR), żeby porównanie było weryfikowalne. Wzór: wzrost z samej zmiany Harness podzielony przez wzrost z upgrade'u do silniejszego modelu referencyjnego. HLR powyżej 1 oznacza, że sam Harness bije upgrade modelu.
Na benchmarku DeepSWE Floatboat zgłosił HLR 3,57. Utrzymanie identycznego modelu i zmiana tylko Harness dała 3,57 raza większy wzrost niż publiczny rozstęp wydajności reprezentowany przez upgrade do Opus 4.8. Dla wszystkich pięciu benchmarków HLR rósł monotonicznie z długością zadania - od 0,78 do 3,57.
Opus 4.8 kosztuje 5 dolarów za milion tokenów wejściowych i 25 dolarów za milion wyjściowych. Przy typowym dla agentów stosunku 3:1 (input:output) łączony koszt Floatboat wynosi 0,175 dolara za milion tokenów wobec 10 dolarów dla Opus 4.8. To 57-krotna różnica.
DeepSeek-V4-Flash to najtańszy wiarygodny model na rynku. Teraz, z odpowiednim systemem wykonawczym, może dorównać lub pokonać najdroższy model flagowy w zadaniach agentowych.
AOE Tech Labs założono pod koniec 2025 roku. Inwestorzy seed: HongShan i VLight Capital. Zespół wypuścił Floatboat Desktop w styczniu 2026, FloatIM w kwietniu, FloatSchedule w maju.
Teza firmy: system, który ciągle zamyka lukę między ewoluującym celem wykonania a dryfującym outputem modelu, to klucz do agentów używanych na co dzień. Chińskie firmy AI konsekwentnie pokazują, że optymalizacja systemów wykonawczych może być ważniejsza niż same modele.
Jeśli budujesz agenta AI, masz teraz wybór: zapłacić 57 razy więcej za flagship model, albo zainwestować w lepszy system wykonawczy i użyć najtańszego modelu na rynku. Dla długich zadań - tych, które przypominają prawdziwą pracę - różnica w wydajności może być większa niż różnica między modelami.
To kolejny dowód na to, że inżynieria systemów liczy się bardziej niż parametry modelu. Zwłaszcza gdy mówimy o agentach, które mają działać w rzeczywistych środowiskach - z dostępem do plików, wieloetapowymi zadaniami, błędami do naprawienia.
Floatboat udostępnił pełne dane z testów. Metodologia jest publiczna. Jeśli budujesz produkty AI, sprawdź, czy Twój system wykonawczy nie zostawia na stole więcej wydajności niż dałby Ci upgrade modelu.
Harness to system wykonawczy, który zarządza tym, jak agent AI wykonuje zadania: dostęp do plików, wywołania narzędzi, utrzymanie stanu między krokami, wieloetapowa autokorekta, cofanie błędnych działań. To warstwa między modelem a rzeczywistym środowiskiem pracy.
Tak, DeepSeek-V4-Flash jest dostępny przez API DeepSeek również w Polsce. Model ma licencję MIT, więc można go używać komercyjnie. Cena: 0,14 dolara za milion tokenów wejściowych, 0,28 dolara za milion wyjściowych.
HLR to wskaźnik wprowadzony przez AOE Tech Labs. Pokazuje, ile razy większy wzrost wydajności daje zmiana samego Harness w porównaniu do upgrade'u modelu. HLR powyżej 1 oznacza, że lepszy system wykonawczy bije upgrade modelu.
Krótkie zadania to w zasadzie jedno pytanie i jedna odpowiedź - tam liczy się głównie jakość modelu. Długie zadania wymagają wieloetapowego działania, dostępu do narzędzi, utrzymania kontekstu, naprawiania błędów. Tam system wykonawczy ma więcej miejsca, żeby pokazać różnicę.
Na podstawie: Pandaily
10 gotowych promptów do codziennej pracy + 5 narzędzi + plan na pierwszy tydzień. PDF, 4 strony konkretu.