Modele AI
Modele AI · 5 min czytania · 12 sierpnia 2026

Najtańszy model AI pokonał Claude Opus 4.8. Jak to możliwe?

Najtańszy model AI pokonał Claude Opus 4.8. Jak to możliwe?

Źródło: Link

DeepSeek-V4-Flash kosztuje 0,14 dolara za milion tokenów. Claude Opus 4.8 - 10 dolarów. To 57-krotna różnica. I właśnie najtańszy wiarygodny model na rynku pokonał flagowca Anthropic we wszystkich pięciu testach wydajnościowych. Sprawdźmy dane.

AOE Tech Labs, chiński zespół stojący za produktem Floatboat, opublikował 7 sierpnia kompletne wyniki testów na pięciu publicznych benchmarkach agentów AI. Użyli DeepSeek-V4-Flash jako modelu bazowego. Zmienili tylko jedno: system wykonawczy (Harness). Ten sam model, który przegrywał z Opus 4.8 na wszystkich pięciu testach w natywnym środowisku DeepSeek, wygrał wszystkie pięć w środowisku Floatboat.

Ten sam model, dwa różne środowiska wykonawcze - różnica w wynikach

Jedna zmienna, zero skrótów

AOE Tech Labs przeprowadził eksperyment z pojedynczą zmienną. Model bazowy: oficjalna wersja DeepSeek-V4-Flash-0731 (nie wersja preview). Grupa kontrolna działała na natywnym środowisku dostawcy w trybie minimalistycznym - inżynieria DeepSeek była w grze, co czyni porównanie bardziej wymagającym. Floatboat uruchomił testy w izolowanych fizycznych środowiskach sandbox z identycznymi parametrami wejściowymi.

Jedyna zmienna: sam Harness. System, który zarządza wykonaniem zadań - dostęp do plików, wywołania narzędzi, utrzymanie stanu, wieloetapowa autokorekta, rollback.

Pięć benchmarków to publiczne rankingi stworzone przez niezależne podmioty, w tym BrowseComp od OpenAI. Nie ma tu selekcji pytań pod wynik.

Wzrost wydajności rośnie z długością zadania

Uporządkowane od najkrótszych do najdłuższych zadań, wzrosty wydajności nie maleją: 1,9%, 9,6%, 12,6%, 19,9%, 23,6%.

Krótkie zadania to w zasadzie jednorazowe Q&A - tam dominuje jakość modelu. Długie zadania, czyli to, jak wygląda prawdziwa praca, są zdominowane przez system wykonawczy: dostęp do plików, wieloetapowe wywołania narzędzi, utrzymanie stanu między krokami, samokorekta, cofanie błędnych działań. Prawdziwa praca dzieje się na długim końcu spektrum.

Im dłuższe zadanie, tym większa przewaga systemu wykonawczego nad samym modelem

Harness Leverage Ratio - nowa metryka

AOE Tech Labs wprowadził wskaźnik Harness Leverage Ratio (HLR), żeby porównanie było weryfikowalne. Wzór: wzrost z samej zmiany Harness podzielony przez wzrost z upgrade'u do silniejszego modelu referencyjnego. HLR powyżej 1 oznacza, że sam Harness bije upgrade modelu.

Na benchmarku DeepSWE Floatboat zgłosił HLR 3,57. Utrzymanie identycznego modelu i zmiana tylko Harness dała 3,57 raza większy wzrost niż publiczny rozstęp wydajności reprezentowany przez upgrade do Opus 4.8. Dla wszystkich pięciu benchmarków HLR rósł monotonicznie z długością zadania - od 0,78 do 3,57.

57-krotna różnica w cenie

Opus 4.8 kosztuje 5 dolarów za milion tokenów wejściowych i 25 dolarów za milion wyjściowych. Przy typowym dla agentów stosunku 3:1 (input:output) łączony koszt Floatboat wynosi 0,175 dolara za milion tokenów wobec 10 dolarów dla Opus 4.8. To 57-krotna różnica.

DeepSeek-V4-Flash to najtańszy wiarygodny model na rynku. Teraz, z odpowiednim systemem wykonawczym, może dorównać lub pokonać najdroższy model flagowy w zadaniach agentowych.

Różnica w cenie: 57-krotna. Różnica w wydajności: żadna (przy odpowiednim Harness)

Kim jest AOE Tech Labs?

AOE Tech Labs założono pod koniec 2025 roku. Inwestorzy seed: HongShan i VLight Capital. Zespół wypuścił Floatboat Desktop w styczniu 2026, FloatIM w kwietniu, FloatSchedule w maju.

Teza firmy: system, który ciągle zamyka lukę między ewoluującym celem wykonania a dryfującym outputem modelu, to klucz do agentów używanych na co dzień. Chińskie firmy AI konsekwentnie pokazują, że optymalizacja systemów wykonawczych może być ważniejsza niż same modele.

Co to zmienia w praktyce

Jeśli budujesz agenta AI, masz teraz wybór: zapłacić 57 razy więcej za flagship model, albo zainwestować w lepszy system wykonawczy i użyć najtańszego modelu na rynku. Dla długich zadań - tych, które przypominają prawdziwą pracę - różnica w wydajności może być większa niż różnica między modelami.

To kolejny dowód na to, że inżynieria systemów liczy się bardziej niż parametry modelu. Zwłaszcza gdy mówimy o agentach, które mają działać w rzeczywistych środowiskach - z dostępem do plików, wieloetapowymi zadaniami, błędami do naprawienia.

Floatboat udostępnił pełne dane z testów. Metodologia jest publiczna. Jeśli budujesz produkty AI, sprawdź, czy Twój system wykonawczy nie zostawia na stole więcej wydajności niż dałby Ci upgrade modelu.

Najczęstsze pytania

Czym jest Harness Jeśli chodzi o agentów AI?

Harness to system wykonawczy, który zarządza tym, jak agent AI wykonuje zadania: dostęp do plików, wywołania narzędzi, utrzymanie stanu między krokami, wieloetapowa autokorekta, cofanie błędnych działań. To warstwa między modelem a rzeczywistym środowiskiem pracy.

Czy DeepSeek-V4-Flash jest dostępny w Polsce?

Tak, DeepSeek-V4-Flash jest dostępny przez API DeepSeek również w Polsce. Model ma licencję MIT, więc można go używać komercyjnie. Cena: 0,14 dolara za milion tokenów wejściowych, 0,28 dolara za milion wyjściowych.

Co oznacza HLR (Harness Leverage Ratio)?

HLR to wskaźnik wprowadzony przez AOE Tech Labs. Pokazuje, ile razy większy wzrost wydajności daje zmiana samego Harness w porównaniu do upgrade'u modelu. HLR powyżej 1 oznacza, że lepszy system wykonawczy bije upgrade modelu.

Dlaczego długie zadania bardziej zyskują na lepszym Harness?

Krótkie zadania to w zasadzie jedno pytanie i jedna odpowiedź - tam liczy się głównie jakość modelu. Długie zadania wymagają wieloetapowego działania, dostępu do narzędzi, utrzymania kontekstu, naprawiania błędów. Tam system wykonawczy ma więcej miejsca, żeby pokazać różnicę.

Na podstawie: Pandaily

Informacje o artykule

Darmowy AI Starter Kit

10 gotowych promptów do codziennej pracy + 5 narzędzi + plan na pierwszy tydzień. PDF, 4 strony konkretu.

Udostępnij:
Nie przegap nowych artykułów - dodaj SukcesAI do swoich źródeł w wyszukiwarce Google.
Dodaj do preferowanych źródeł
Jan Gajos

Ekspert AI & Founder, AI Evolution

Pasjonat sztucznej inteligencji, który od 18 lat działa z sukcesem biznesowo i szkoleniowo. Wprowadzam AI do swoich firm oraz codziennego życia. Fascynują mnie nowe technologie, gry wideo i składanie klocków Lego - tam też widzę logikę i kreatywność, które AI potrafi wzmacniać. Wierzę, że dobrze użyta sztuczna inteligencja to nie ogłupiające ułatwienie, lecz prawdziwy przełom w sposobie, w jaki myślimy, tworzymy i pracujemy.