GPT-5.6 - jak startupy budują agentów AI taniej i szybciej
Źródło: Link
Źródło: Link
Kolega z działu produktu pokazał mi wczoraj fakturę za API OpenAI. 235 dolarów za 106 zadań w przeglądarce. Tydzień później - te same zadania, 14 dolarów. Ta sama dokładność. Nie, nie przeszedł na DeepSeek. Zmienił model na GPT-5.6 Luna.
OpenAI właśnie wypuściło rodzinę GPT-5.6 - trzy modele (Luna, Terra, Sol), które mają robić jedno: dać Ci wydajność flagowca w cenie modelu budżetowego. Zanim pomyślisz "marketing-speak" - sprawdźmy, co startupy raportują z produkcji.
GPT-5.6 Sol na "low" reasoning bije GPT-5.5 na "high" reasoning w benchmarku Agents' Last Exam. To nie kosmetyczna różnica - to zmiana w tym, jak konfigurujesz agentów.
Hex (platforma do analizy danych) wrzuciło GPT-5.6 do swojego harnessa i ustawiło reasoning na "low". Izzy Miller, AI Research Lead, mówi wprost: model wiedział, kiedy danych po prostu nie ma. Nie gonił ślepych tropów. Dochodził do odpowiedzi mniejszą liczbą tokenów.

Historycznie, jeśli budowałeś agenta do długich zadań, brałeś flagowy model na najwyższym reasoning. Tańsze modele po prostu nie radziły sobie z długim kontekstem i tool callingiem. GPT-5.6 zmienia tę matematykę.
Hypha (platforma do ekstrakcji danych z dokumentów) testowała GPT-5.6 Luna na swoich najtrudniejszych zadaniach. Serhii Shchoholiev, Engineering Lead, raportuje: Luna trzyma 98% dokładności GPT-5.5 przy jednej osiemnastej kosztu.
Browser Use (framework do automatyzacji przeglądarki) wrzuciło Lunę na 106 najtrudniejszych zadań browserowych. Wynik: 78% ukończonych za ~14 dolarów. Aktualny SOTA model osiągnął 80% za ~235 dolarów. Gregor Zunic, współzałożyciel, nazywa to "remarkable combination of capability and cost".
PlayerZero (system do inżynierii kodu) przerzuciło część workloadów na Lunę. Dla kluczowego zadania eksploracji kodu: 64% niższe koszty inferencji, 90% krótszy czas odpowiedzi, F1 wyższe o 5 punktów. Animesh Koratana, CEO, mówi, że Luna to teraz ich domyślny model dla high-throughput code retrieval.

Konkret: trzy miesiące temu GPT-5.5 (Extra High) osiągał 84.36% w BrowseComp (benchmark testujący wyszukiwanie obscure facts) za 33.27 USD. GPT-5.6 Luna (Extra High) daje 84.04% za 1.33 USD. OpenAI od tego czasu obniżyło ceny jeszcze bardziej.
Luna to model budżetowy z rodziny 5.6. Terra to środek. Sol to flagowiec. Różnica nie jest tylko w cenie - to trade-off między szybkością a złożonością zadania.
Jeśli budujesz agenta do prostych zadań (ekstrakcja danych, klasyfikacja, proste decyzje) - Luna prawdopodobnie wystarczy. Jeśli zadanie wymaga multi-step reasoning, długiego kontekstu, złożonego tool callingu - Terra lub Sol.
Startupy raportują, że Luna z wyższym reasoning effort często dorównuje starszym flagowcom przy ułamku kosztu. To zmienia kalkulację: zamiast automatycznie brać najdroższy model, testujesz tańszy z wyższym reasoning.
GPT-5.6 wprowadza Responses API - nowy sposób na zarządzanie wieloetapowymi zadaniami agentów. Zamiast tracić kontekst reasoning między wywołaniami, możesz go kontynuować.
Przykład: agent analizuje dokument, wywołuje zewnętrzne API, wraca do analizy. Bez Responses API - za każdym razem zaczynasz reasoning od zera. Z Responses API - reasoning jest ciągły, model "pamięta" gdzie skończył.

To ma znaczenie dla multi-agent orchestration (kilku agentów współpracujących nad jednym zadaniem) i programmatic tool calling (agent sam decyduje, które narzędzia wywołać i w jakiej kolejności).
OpenAI nie podaje szczegółów implementacji. Startupy raportują, że Responses API redukuje liczbę niepotrzebnych wywołań i poprawia spójność odpowiedzi w długich workflows. Jeśli budujesz agentów AI do automatyzacji, to funkcja do przetestowania.
GPT-5.6 jest dostępny przez API OpenAI globalnie - polskie firmy mają dostęp od razu. Kluczowa zmiana: agenci AI stają się tańsi w utrzymaniu.
Jeśli testowałeś agentów rok temu i zrezygnowałeś bo "za drogie" - matematyka się zmieniła. Luna daje wydajność blisko GPT-5.5 przy koszcie porównywalnym do starszych budżetowych modeli (które były znacznie słabsze).
Dla firm, które już używają agentów: przetestuj przejście z GPT-5.5 na Lunę lub Terrę. Startupy raportują 60-90% redukcję kosztów przy porównywalnej lub lepszej dokładności. To nie margines - to różnica między projektem opłacalnym a nieopłacalnym.
Druga zmiana: niższy reasoning effort jako domyślny. Jeśli konfigurowałeś agentów na "high" lub "extra high" reasoning, przetestuj "low" lub "medium" na GPT-5.6. Hex i inne startupy raportują lepsze wyniki przy niższym ustawieniu.
Jeśli dopiero zaczynasz z agentami AI, narzędzia no-code też zaczynają integrować GPT-5.6. Nie musisz pisać kodu, żeby przetestować.
OpenAI nie publikuje bezpośrednich porównań z DeepSeek. Luna jest droższa niż DeepSeek V4-Flash (0.14 USD/1M tokenów input). Startupy raportują lepszą dokładność w zadaniach agentowych. DeepSeek wciąż wygrywa w czystej matematyce cena/token. Luna daje lepszy stosunek dokładność/koszt w multi-step reasoning.
Tak, GPT-5.6 jest dostępny globalnie przez OpenAI API. Potrzebujesz konta OpenAI i karty płatniczej obsługującej transakcje międzynarodowe. Ceny są w USD, rozliczenie per token.
Zacznij od Luny z wyższym reasoning effort. Jeśli dokładność nie wystarcza, przetestuj Terrę. Sol bierz tylko jeśli zadanie wymaga absolutnie najwyższej dokładności i koszt nie jest ograniczeniem. Startupy raportują, że Luna wystarcza w 70-80% przypadków.
Responses API to nowa funkcja do zarządzania ciągłością reasoning w wieloetapowych zadaniach. Nie musisz - standardowe API dalej działa. Jeśli budujesz multi-agent systems lub agentów z długimi workflows, Responses API redukuje liczbę wywołań i poprawia spójność.
Na podstawie: OpenAI Blog - The builder's guide to GPT-5.6
10 gotowych promptów do codziennej pracy + 5 narzędzi + plan na pierwszy tydzień. PDF, 4 strony konkretu.