To mały test konkretnych zadań na fikcyjnych danych. Wyniki zachowano w całości. Nie jest rankingiem modeli ani testem funkcji zalogowanych aplikacji.
18 wywołań API: dziewięć zadań w Sonnet 5.5 oraz dodatkowe powtórzenia maila, obliczeń faktury i odczytu umowy w Sonnet 5.5 i GPT-6.1 Sol. Każde z tych trzech zadań ma po dwie odpowiedzi każdego modelu. Pozostałe zadania mają jedną odpowiedź Sonnet. GPT używał ustawienia reasoning high; Sonnet domyślnego myślenia. Różne ustawienia i mała liczba prób ograniczają porównanie.
Pełne prompty, odpowiedzi, wersje, czas i pola usage (JSON). Brak błędu wywołania nie jest automatycznie oceną jakości. Kwoty i osoby w zadaniach są fikcyjne; stawka VAT 23% w obliczeniu jest zadanym warunkiem ćwiczenia.
Oba modele zachowały dane w czterech mailach i poprawnie policzyły cztery zadania: 170 zł netto, 39,10 zł VAT i 209,10 zł brutto. Odpowiedzi o fikcyjnej umowie wskazywały paragrafy i pytania, nie rozstrzygały ważności prawnej. Część pytań była nadmiarowa. W korekcie angielskiego wynik „was waiting” uznano za poprawny mimo braku literalnego słowa „waited”, a numer paragrafu w osobnej kolumnie tabeli nie był błędem pomimo braku zapisu „§3”.
Walidator harnessu przyjął prawdziwy wynik z sumą 73 i odrzucił przygotowane kontrolnie 72. Błędne 72 nie pochodziło z modelu. Działanie kalkulatora sprawdzono w przeglądarce: 12.5 × 3 = 37.50; pusta cena i wartości ujemne wyświetlają „Błąd”. Przy szerokości 390 px nie było poziomego przewijania. SVG ma trzy słupki o wysokościach 30, 60 i 90, zgodnie z danymi 10, 20, 30.
Kod HTML kalkulatora jako tekst · Kod SVG jako tekst


Ollama 0.35.1, qwen3:0.6b, Linux CPU, około 23,5 GiB RAM. Próba /api/generate odtworzyła różnicę między domyślnym NDJSON a pojedynczym JSON z stream:false. Wynik 73 był poprawny, ale model nie zwrócił wyłącznie liczby. Konfiguracja wyłączała chmurę; nie wykonano audytu wszystkich połączeń ani próby przy odłączonym internecie. Żądania i odpowiedzi.
Odczyt kwot cennika dla PL nie obejmował zakupu. Próba CLI Claude Code zakończyła się limitem tygodniowym konta. Nie utworzono pliku i nie zaliczono zadania programowania.
Czasy obejmują wywołanie i odebranie odpowiedzi w tej próbie. Nie są pomiarem SLA. JSON zawiera usage, lecz nie jest rachunkiem końcowym dostawcy.
| Zadanie | Model zwrócony przez API | Sekundy |
|---|---|---|
| academic-anthropic-1 | claude-sonnet-5-5 | 5.9 |
| artifact-anthropic-1 | claude-sonnet-5-5 | 11.9 |
| harness-anthropic-1 | claude-sonnet-5-5 | 1.3 |
| invoice-anthropic-1 | claude-sonnet-5-5 | 1.8 |
| invoice-anthropic-2 | claude-sonnet-5-5 | 1.7 |
| invoice-openai-1 | gpt-6.1-sol | 2.7 |
| invoice-openai-2 | gpt-6.1-sol | 2.4 |
| language-anthropic-1 | claude-sonnet-5-5 | 6.6 |
| legal-anthropic-1 | claude-sonnet-5-5 | 15.8 |
| legal-anthropic-2 | claude-sonnet-5-5 | 14.0 |
| legal-openai-1 | gpt-6.1-sol | 12.1 |
| legal-openai-2 | gpt-6.1-sol | 14.2 |
| mail-anthropic-1 | claude-sonnet-5-5 | 2.6 |
| mail-anthropic-2 | claude-sonnet-5-5 | 2.6 |
| mail-openai-1 | gpt-6.1-sol | 11.1 |
| mail-openai-2 | gpt-6.1-sol | 8.7 |
| polish-anthropic-1 | claude-sonnet-5-5 | 1.0 |
| svg-anthropic-1 | claude-sonnet-5-5 | 3.4 |
Wyniki walidatora JSON: poprawna odpowiedź oraz kontrolne błędy sumy, typu i źródła.