SukcesAI

Prompty i wyniki ćwiczeń — 2 października 2026

To mały test konkretnych zadań na fikcyjnych danych. Wyniki zachowano w całości. Nie jest rankingiem modeli ani testem funkcji zalogowanych aplikacji.

Co wykonano

18 wywołań API: dziewięć zadań w Sonnet 5.5 oraz dodatkowe powtórzenia maila, obliczeń faktury i odczytu umowy w Sonnet 5.5 i GPT-6.1 Sol. Każde z tych trzech zadań ma po dwie odpowiedzi każdego modelu. Pozostałe zadania mają jedną odpowiedź Sonnet. GPT używał ustawienia reasoning high; Sonnet domyślnego myślenia. Różne ustawienia i mała liczba prób ograniczają porównanie.

Pełne prompty, odpowiedzi, wersje, czas i pola usage (JSON). Brak błędu wywołania nie jest automatycznie oceną jakości. Kwoty i osoby w zadaniach są fikcyjne; stawka VAT 23% w obliczeniu jest zadanym warunkiem ćwiczenia.

Wynik i kontrola

Oba modele zachowały dane w czterech mailach i poprawnie policzyły cztery zadania: 170 zł netto, 39,10 zł VAT i 209,10 zł brutto. Odpowiedzi o fikcyjnej umowie wskazywały paragrafy i pytania, nie rozstrzygały ważności prawnej. Część pytań była nadmiarowa. W korekcie angielskiego wynik „was waiting” uznano za poprawny mimo braku literalnego słowa „waited”, a numer paragrafu w osobnej kolumnie tabeli nie był błędem pomimo braku zapisu „§3”.

Walidator harnessu przyjął prawdziwy wynik z sumą 73 i odrzucił przygotowane kontrolnie 72. Błędne 72 nie pochodziło z modelu. Działanie kalkulatora sprawdzono w przeglądarce: 12.5 × 3 = 37.50; pusta cena i wartości ujemne wyświetlają „Błąd”. Przy szerokości 390 px nie było poziomego przewijania. SVG ma trzy słupki o wysokościach 30, 60 i 90, zgodnie z danymi 10, 20, 30.

Pliki i zrzuty

Kod HTML kalkulatora jako tekst · Kod SVG jako tekst

Kalkulator przy szerokości 390 pikseli; test błędnej wartości pokazuje komunikat BłądWykres trzech słupków A 10, B 20, C 30

Lokalny model

Ollama 0.35.1, qwen3:0.6b, Linux CPU, około 23,5 GiB RAM. Próba /api/generate odtworzyła różnicę między domyślnym NDJSON a pojedynczym JSON z stream:false. Wynik 73 był poprawny, ale model nie zwrócił wyłącznie liczby. Konfiguracja wyłączała chmurę; nie wykonano audytu wszystkich połączeń ani próby przy odłączonym internecie. Żądania i odpowiedzi.

Ceny i Claude Code

Odczyt kwot cennika dla PL nie obejmował zakupu. Próba CLI Claude Code zakończyła się limitem tygodniowym konta. Nie utworzono pliku i nie zaliczono zadania programowania.

Czasy pojedynczych wywołań

Czasy obejmują wywołanie i odebranie odpowiedzi w tej próbie. Nie są pomiarem SLA. JSON zawiera usage, lecz nie jest rachunkiem końcowym dostawcy.

ZadanieModel zwrócony przez APISekundy
academic-anthropic-1claude-sonnet-5-55.9
artifact-anthropic-1claude-sonnet-5-511.9
harness-anthropic-1claude-sonnet-5-51.3
invoice-anthropic-1claude-sonnet-5-51.8
invoice-anthropic-2claude-sonnet-5-51.7
invoice-openai-1gpt-6.1-sol2.7
invoice-openai-2gpt-6.1-sol2.4
language-anthropic-1claude-sonnet-5-56.6
legal-anthropic-1claude-sonnet-5-515.8
legal-anthropic-2claude-sonnet-5-514.0
legal-openai-1gpt-6.1-sol12.1
legal-openai-2gpt-6.1-sol14.2
mail-anthropic-1claude-sonnet-5-52.6
mail-anthropic-2claude-sonnet-5-52.6
mail-openai-1gpt-6.1-sol11.1
mail-openai-2gpt-6.1-sol8.7
polish-anthropic-1claude-sonnet-5-51.0
svg-anthropic-1claude-sonnet-5-53.4

Wyniki walidatora JSON: poprawna odpowiedź oraz kontrolne błędy sumy, typu i źródła.