Qwen3.8-Omni-Flash: Alibaba łączy tekst, obraz, audio i wideo
Przejdź do treści i przykładów
Źródło: Link
Źródło: Link
26 procent. Tyle - według Alibaby - zyskał nowy model Qwen w średnim wyniku z 30 testów porównawczych względem poprzedniej generacji. Sama liczba niewiele mówi, dopóki nie zobaczysz, co ten model robi inaczej: przyjmuje tekst, obraz, audio i wideo w jednym przebiegu, bez przerzucania danych między osobnymi narzędziami. To ta część, która realnie zmienia sposób pracy z AI.
Zespół Qwen (należący do Alibaby) udostępnił model Qwen3.8-Omni-Flash na platformie Qwen AI. To model natywnie omni-modalny, czyli zaprojektowany od podstaw do obsługi wielu typów danych naraz, a nie doklejany "na siłę" do modelu tekstowego. Dostał też okno kontekstu na poziomie 1 miliona tokenów - dzięki temu może "pamiętać" i analizować naprawdę długie materiały w jednej sesji, bez dzielenia ich na fragmenty.

Większość dostępnych na rynku modeli "multimodalnych" działa tak, że osobny komponent czyta obraz, osobny transkrybuje audio, a wynik dopiero potem trafia do modelu językowego. Qwen3.8-Omni-Flash ma to zrobić inaczej - jako jeden, zintegrowany system, który od razu rozumie kontekst wszystkich czterech typów danych naraz. W praktyce nie musisz najpierw transkrybować nagrania, a potem wklejać transkrypt do czatu - model może pracować bezpośrednio na materiale audio czy wideo.
Alibaba deklaruje poprawę wyników w kilku konkretnych obszarach: agentach obsługujących audio i wideo, zadaniach programistycznych, pracy z długim kontekstem oraz interakcji multimodalnej w czasie rzeczywistym. To nie jest lista przypadkowa - pokazuje, w którą stronę firma celuje: automatyzację, która słyszy, widzi i czyta jednocześnie, a nie tylko czyta.
Okno kontekstu to w skrócie ilość informacji, którą model może "trzymać w głowie" podczas jednej rozmowy czy zadania. Milion tokenów to naprawdę dużo - wystarczy na analizę wielogodzinnego wideo, długiego nagrania spotkania albo obszernej dokumentacji bez utraty wątku sprzed kilkudziesięciu minut.
Model wsparto konkretnymi zastosowaniami: analizą długich materiałów wideo, podsumowaniami ze spotkań, researchem na bazie nagrań wideo oraz korzystaniem z narzędzi multimodalnych podczas jednego zadania. To odpowiedź na problem, z którym mierzą się osoby pracujące z contentem - godzina nagrania z konferencji albo webinaru, którą trzeba streścić, nie musi już być dzielona na dziesięć osobnych zapytań.
Podobne podejście do wideo widać już u konkurencji - Gemini uczy się oglądać wideo mądrzej, nie dłużej, co pokazuje, że długi kontekst wizualny staje się osią rywalizacji między dużymi laboratoriami AI, nie tylko dodatkiem.

Razem z modelem Alibaba wypuściła dwa dodatkowe elementy: Qwen-MM-Plugins oraz Qwen-Live Harness. Pierwszy ma odpowiadać za pracę wieloetapową i dłużej trwającą, drugi za interakcje w czasie rzeczywistym. To sygnał, że Alibaba nie traktuje samego modelu jako produktu finalnego, ale buduje wokół niego infrastrukturę - podobnie jak inni gracze budują własne "rusztowania" dla agentów AI, czego przykładem jest DeepSeek Harness 0.1.5 porządkujący pracę agentów.
W praktyce deweloperzy budujący własne aplikacje - na przykład asystentów obsługujących rozmowy głosowe na żywo albo systemy monitorujące wideo z kamer - dostają gotowe klocki, zamiast pisać całą integrację od zera.
Alibaba obniżyła cenę wejściową API do poziomu 0,8 juana za milion tokenów. To znacząca redukcja kosztów w porównaniu z modelami zamkniętymi z Zachodu, gdzie ceny za milion tokenów liczone są w dolarach, nie w groszach. Dla firm przetwarzających duże ilości danych - transkrypcje, materiały wideo, długie dokumenty - różnica w skali miesiąca może być odczuwalna finansowo, nie tylko technicznie.
To wpisuje się w szerszy trend chińskich firm - agresywne ceny API jako broń konkurencyjna, podobnie jak robi to DeepSeek-V4.1-Flash, gdzie architektura modelu ma znaczenie równie duże jak sam wynik w benchmarkach. Dla polskich firm i deweloperów to realna alternatywa cenowa, choć trzeba pamiętać o kwestiach związanych z przetwarzaniem danych poza Unią Europejską - to temat, który przy wdrożeniach korporacyjnych warto sprawdzić zawsze, niezależnie od tego, jak atrakcyjna jest cena.

Jeśli pracujesz z narzędziami do analizy nagrań, spotkań albo materiałów wideo, sprawdź, jak Qwen3.8-Omni-Flash wypada w porównaniu z innymi asystentami multimodalnymi - podobnie jak przy wyborze asystenta do kodu, liczy się nie tylko sama moc modelu, ale też to, jak wygodnie wpasowuje się w Twój codzienny workflow.
To model, który przetwarza tekst, obraz, audio i wideo w jednym, zintegrowanym procesie, a nie za pomocą osobnych narzędzi łączonych ze sobą po fakcie. Dzięki temu rozumie kontekst wszystkich typów danych naraz, co przyspiesza pracę z materiałami mieszanymi, jak nagrania z prezentacją na ekranie.
Okno kontekstu to ilość informacji, którą model może przetworzyć i "zapamiętać" w ramach jednej sesji. Milion tokenów wystarcza na analizę bardzo długich materiałów, na przykład wielogodzinnego nagrania wideo albo obszernej dokumentacji, bez dzielenia ich na mniejsze części.
Model jest udostępniony przez platformę Qwen AI z dostępem przez API, więc technicznie można z niego korzystać z Polski. Firmy planujące wdrożenie powinny jednak zweryfikować kwestie związane z lokalizacją przetwarzania danych, szczególnie jeśli obowiązują je unijne regulacje dotyczące ochrony danych.
Alibaba podaje cenę wejściową na poziomie 0,8 juana za milion tokenów jako najniższy próg cenowy. To znacząca redukcja względem wcześniejszych cen, choć ostateczny koszt zależy od konkretnego wariantu użycia i wolumenu danych.
Na podstawie: TechNode
10 gotowych promptów do codziennej pracy + 5 narzędzi + plan na pierwszy tydzień. PDF, 4 strony konkretu.