DeepSeek wypuszcza pierwszy model z wizją i otwiera kod
Przejdź do treści i przykładów
Źródło: Link
Źródło: Link
Ktoś na forum deweloperskim zapytał wczoraj: "czy jest jakiś otwarty model, który ogarnie screenshot z błędem i sam mi powie co jest nie tak?". Miesiąc temu odpowiedź brzmiałaby "nie za darmo, nie na Twoim sprzęcie". Dziś brzmi inaczej.
31 sierpnia DeepSeek opublikował na Hugging Face model DeepSeek-V4-Flash-Vision-Exp na licencji MIT. To pierwszy model z serii V4, który obok tekstu przyjmuje też obrazy. Do tej pory linia V4 czytała tylko słowa - teraz widzi też piksele, i to od razu na wolnej licencji, bez proszenia o dostęp.
DeepSeek nie ograniczył się do wrzucenia samych wag modelu. W paczce na Hugging Face znajdziesz tokenizer, referencyjną implementację kodowania promptów oraz minimalną implementację inferencji w PyTorch, która obejmuje enkoder wizji, moduł "aligner" (łączący obraz z tekstem), mechanizm uwagi DFlash, warstwę routingu mixture-of-experts, moduły Hyper-Connections i DSpark. To przypomina żargon inżynierski, ale sedno jest proste: to nie jest sam model wrzucony na serwer z instrukcją "radźcie sobie sami". To kompletny zestaw narzędzi do uruchomienia go samodzielnie.
Firma oznaczyła wagę jako eksperymentalną - stąd dopisek "Exp" w nazwie. Model był już dostępny przez API DeepSeek od 21 sierpnia, więc otwarcie kodu 31 sierpnia to formalizacja czegoś, co część deweloperów testowała od kilku tygodni.
Funkcja wizji obsługuje formaty JPEG, PNG, GIF i WebP. Model potrafi opisać zdjęcie, przeczytać tekst ze zrzutu ekranu i przeanalizować wykres. To trzy konkretne zastosowania, które od razu tłumaczą się na pracę biurową - analiza raportu w PDF-ie zrobionym ze zdjęcia, odczytanie błędu z zrzutu ekranu od klienta, streszczenie wykresu sprzedaży bez ręcznego przepisywania liczb.
Najciekawsza deklaracja DeepSeek dotyczy tego, co NIE ucierpiało. Na czysto tekstowych zadaniach - agentowych, wymagających rozumowania, opartych na wiedzy ogólnej - firma twierdzi, że model działa na poziomie wydanej wersji V4-Flash. Innymi słowy: dodanie wizji nie odbiło się na jakości tekstu. To ważne, bo w wielu multimodalnych modelach dodanie nowej modalności oznacza kompromis gdzie indziej.
Na benchmarkach agentowych wymagających rozumienia wizualnego model zyskuje znacząco względem wersji V4-Flash i - jak podaje DeepSeek - zbliża swoje możliwości agentowe do poziomu Claude Opus 4.8. To deklaracja samej firmy, więc traktuj ją jako punkt wyjścia do własnych testów, nie jako wyrok sądu ostatecznego.
Warto zestawić to z innym ruchem DeepSeek w kierunku wizji, o którym pisaliśmy przy okazji wcześniejszej prezentacji AI rozumiejącej ekran - to nie jest pierwszy krok firmy w tę stronę, ale pierwszy, który trafia do głównej linii V4 na licencji otwartej.
Sam plik z wagami modelu to jedno. Otwarcie referencyjnej implementacji inferencji to drugie, i akurat to drugie robi realną różnicę dla zespołów technicznych. Zamiast zgadywać, jak poprawnie połączyć enkoder wizji z resztą architektury, dostajesz gotowy szkielet. DeepSeek wyraźnie liczy na to, że model trafi do różnych frameworków agentowych i narzędzi zewnętrznych, rozszerzając strategię otwartych wag z tekstu na pracę z obrazem.
Dla zespołów IT i firm szukających tańszej alternatywy dla zamkniętych modeli to sygnał, że bariera wejścia w modele z wizją klasy frontierowej właśnie spadła. Nie trzeba płacić za API dużego dostawcy, żeby przetestować model rozpoznający zrzuty ekranu - można postawić go lokalnie lub na standardowej infrastrukturze chmurowej.
DeepSeek sam radzi, by nie zakładać gotowości produkcyjnej model na wszystkich rodzajach zadań z obrazem. Rozpoznawanie i rozumienie wykresów są mocne, ale firma zaleca testowanie modelu pod kątem konkretnych zastosowań, zanim wpuści się go do procesu produkcyjnego. To uczciwe podejście - łatwiej wybaczyć błędy modelowi oznaczonemu jako "Exp", niż takiemu reklamowanemu jako gotowy produkt.
Firma zapowiedziała dalszą pracę nad linią V4, traktując wersję z wizją jako poligon doświadczalny dla wyborów architektonicznych - aligner, DSpark, Hyper-Connections - przed szerszym multimodalnym wydaniem. Innymi słowy: to, co widzisz teraz, to wersja testowa większego planu, nie finalny produkt.
Ten wzorzec - coraz bardziej otwarte, multimodalne wydania z chińskich laboratoriów, korzystające z permisywnych licencji i agresywnych cen, by zdobyć miejsce w katalogach platform i menu modeli enterprise - widzieliśmy już wcześniej, choćby przy okazji zamieszania z Ox Alpha w rankingach. Konkurencja o miejsce w narzędziach programistów robi się coraz bardziej otwarta i coraz tańsza, co dla firm szukających alternatyw dla drogich API jest dobrą wiadomością.
Modele z wizją to nie magia, to narzędzie do ogarnięcia. Jeśli chcesz zrozumieć, jak w praktyce wykorzystać takie modele w codziennej pracy - od analizy dokumentów po automatyzację zadań - zapisz się na darmowy webinar, gdzie tłumaczymy to krok po kroku, bez żargonu. Zapisz się na darmowy webinar →
Wczesni użytkownicy - od grup badawczych po deweloperów aplikacji - już testują otwarty stos, sprawdzając czy zbliżone do Opus 4.8 umiejętności agentowe z wizją utrzymają się w ich własnych procesach, a nie tylko w laboratoryjnych warunkach. To najlepszy test każdej takiej deklaracji - nie marketing, tylko realna praca na realnych danych.
Nowa wersja dodaje obsługę obrazów - opisywanie zdjęć, czytanie tekstu ze zrzutów ekranu i analizę wykresów - czego wcześniejsza wersja V4-Flash nie potrafiła. Według DeepSeek na zadaniach czysto tekstowych jakość pozostaje na tym samym poziomie.
Model jest dostępny na Hugging Face na licencji MIT, co oznacza darmowy dostęp do wag i kodu inferencji. Możesz pobrać go i uruchomić na własnej infrastrukturze bez opłat licencyjnych.
Model przyjmuje pliki JPEG, PNG, GIF i WebP. To pokrywa większość codziennych zastosowań, od zrzutów ekranu po zdjęcia dokumentów i wykresy.
DeepSeek oznaczył go jako eksperymentalny ("Exp") i zaleca testowanie pod kątem konkretnych zadań przed wdrożeniem produkcyjnym. Rozpoznawanie obrazów i analiza wykresów są mocne, ale firma sama zastrzega, że nie należy zakładać gotowości produkcyjnej we wszystkich scenariuszach.
Otwarcie wag razem z kodem inferencji ułatwia integrację modelu z istniejącymi frameworkami agentowymi i narzędziami, co przyspiesza jego adopcję. To kontynuacja strategii DeepSeek, która wcześniej stosowała otwarte licencje wobec modeli tekstowych, teraz rozszerzonej na modele z wizją.
Na podstawie: Pandaily
10 gotowych promptów do codziennej pracy + 5 narzędzi + plan na pierwszy tydzień. PDF, 4 strony konkretu.