GPT-6 Astra: model OpenAI, który pracuje na Twoim komputerze
Przejdź do treści i przykładów
Źródło: Link
Źródło: Link
Audyty, wdrożenia, szkolenia sprzedażowe i AI. Dopasowane do zespołu i procesów.
"Ustawiliśmy Astrę w harness Devina w dniu premiery i od razu biła nasze wewnętrzne benchmarki" - mówi Silas Alberti z Cognition. Kiedy firma budująca własnego agenta programistycznego mówi coś takiego o cudzym modelu, warto się zatrzymać. OpenAI właśnie udostępniło GPT-6 Astra w ChatGPT Work, Codex i przez API, a pierwsze opinie klientów biznesowych już płyną.
Model trafił do trzech miejsc naraz: ChatGPT Work (wersja dla firm), Codex (środowisko do pracy z kodem) oraz do API, czyli tam, gdzie deweloperzy budują własne narzędzia na bazie modeli OpenAI. To nie jest kolejna aktualizacja czatu - to model zaprojektowany pod konkretne, praktyczne zadania: obsługę komputera, przeglądanie sieci, pracę zawodową, inżynierię oprogramowania, cyberbezpieczeństwo i naukę. OpenAI opisuje go jako model osiągający najlepsze wyniki w tych obszarach spośród dotychczasowych rozwiązań firmy.
Większość narzędzi AI wymaga przygotowania: musisz uporządkować dane, przebudować procesy, zbudować integracje, zanim cokolwiek zacznie działać. OpenAI twierdzi, że Astra to omija. Model potrafi pisać kod i pracować w tych samych aplikacjach, których używają ludzie - nawet jeśli te aplikacje nie mają żadnego API. Nie musisz najpierw "otworzyć" swojej firmy dla AI przez tygodnie prac inżynieryjnych. Model wchodzi w istniejące workflow od pierwszego dnia.
To praktyczna różnica dla firm, które nie mają zespołu programistów gotowego budować niestandardowe integracje (a większość firm w Polsce takiego zespołu nie ma). Podobny kierunek - upraszczanie wdrożeń AI w codziennej pracy - widać zresztą w tym, jak OpenAI porządkuje panel administracyjny ChatGPT dla firm korzystających z narzędzia na większą skalę.
OpenAI przywołuje konkretny przykład: Astra ukończyła zadania z Financial Modeling World Cup - konkursu modelowania finansowego w Excelu - około czterech razy szybciej niż zwycięzca wśród ludzkich uczestników (odniesienie do Mistrzostw Świata w Excelu z 2023 roku). Dla analityka finansowego to oznacza mniej czasu spędzonego na budowaniu modelu, a więcej na interpretacji wyników i podejmowaniu decyzji. To niewielka różnica, dopóki nie policzysz, ile godzin miesięcznie Twój zespół spędza na klikaniu w te same arkusze.
OpenAI zebrało opinie kilku partnerów biznesowych, i to one - a nie marketingowy opis - dają najlepszy obraz tego, co model faktycznie potrafi.
Databricks (Ivan Zhou, Staff Research Engineer) mówi, że Astra ustanowiła nowy poziom w ich testach OfficeQA Pro i Pro V2, uruchamianych przez ich własny harness Genie. Model ma też oferować lepszy koszt na zadanie niż wcześniejszy GPT-5.6 Sol, a w rozumowaniu na danych i dokumentach dla firm pokazuje wyraźny skok.
Box (Yashodha Bhavnani, VP of AI Products) chwali z kolei coś mniej oczywistego - osąd modelu. Astra rzadziej niż konkurencyjne rozwiązania twierdziła coś, czego dokumenty nie potwierdzały - według Box była o ponad 10% mniej skłonna do pewnych siebie, ale błędnych stwierdzeń. To ma większe znaczenie niż surowa szybkość: model, który mówi "nie wiem" zamiast zgadywać z pewnością siebie, jest po prostu bezpieczniejszy w użyciu.
Hebbia (George Sivulka, CEO) podaje konkretne liczby: Astra tworzyła najlepsze prezentacje w ich testach, trzymała się briefu o 17% wierniej niż najlepszy dotychczasowy model i o 19% częściej poprawnie wskazywała źródło swoich twierdzeń w odpowiednim dokumencie. Dla analityków pracujących z gęstym materiałem finansowym to różnica między prezentacją, którą trzeba jeszcze sprawdzić linijka po linijce, a taką, którą można od razu przekazać klientowi.
Figma (Loredana Crisan, Chief Design Officer) opisuje coś innego - model rozumie zamysł projektowy i potrafi pracować w Figmie, żeby go zrealizować, przy czym decyzje kreatywne wciąż zostają po stronie człowieka. Z kolei w pracy prawniczej (Omar Bari, VP Applied Research) Astra ma pokazywać skok w jakości pisania i lepszą koordynację wielu agentów działających równolegle, co przekłada się na precyzję w rozumieniu intencji klienta - a to w prawie bywa istotniejsze niż sama poprawność językowa.
Jeśli interesuje Cię, jak konkurencja radzi sobie z podobnymi wyzwaniami pamięci i kontekstu w pracy zespołowej, zerknij na to, jak Claude przestaje zapominać między chatem a Cowork. Pokazuje to, że wyścig o "pamięć i kontekst w pracy" toczy się teraz na wielu frontach jednocześnie, nie tylko u OpenAI.
Model wchodzi do firmowych procesów bez przygotowania? To dokładnie ten moment, w którym warto sprawdzić, jak wdrożyć takie narzędzia u siebie zanim zrobi to konkurencja. Zobacz wdrożenia AI dla firm →
Te opinie łączy jeden wzorzec: nie chodzi o pojedynczy spektakularny wynik, lecz o powtarzalną poprawę na kilku frontach - lepszą precyzję, ostrożniejszy osąd, mniejszy koszt na zadanie. To rodzaj postępu, który nie robi nagłówków sam w sobie, ale zmienia codzienną pracę analityków, prawników i projektantów. Szczegóły dotyczące dostępności i cen tego modelu opisaliśmy osobno w artykule o premierze i cenach GPT-6 Astra.
Za 6-12 miesięcy różnica między firmami, które zaczęły wdrażać takie modele od razu, a tymi, które czekały "aż będzie stabilniej", może być trudna do nadrobienia. Powód jest prosty: zespoły, które zaczną wcześniej, po prostu szybciej nauczą się z niego korzystać.
Model jest dostępny w ChatGPT Work, w środowisku Codex oraz przez API OpenAI. To trzy różne sposoby dostępu w zależności od tego, czy chcesz korzystać z niego jako gotowego narzędzia, czy budować na nim własne rozwiązania.
Nie w takim stopniu jak większość narzędzi AI. Model potrafi pracować w aplikacjach nawet bez dostępnego API, co oznacza mniej pracy przygotowawczej przed pierwszym użyciem.
Według cytowanych przez OpenAI opinii klientów, model pokazuje lepszy osąd (rzadziej twierdzi rzeczy niepotwierdzone w dokumentach), wyższą jakość pisania i lepszy koszt na zadanie w porównaniu z wcześniejszym GPT-5.6 Sol.
Nie - opisany test z Excelem pokazuje, że model wykonuje modelowanie szybciej niż człowiek, ale OpenAI podkreśla, że chodzi o uwolnienie czasu na interpretację wyników i decyzje, a nie zastąpienie tej pracy w całości.
Na podstawie: OpenAI Blog