Modele AI · 5 min czytania · 22 września 2026

Light Origins otwiera kod robota, który uczy się z wideo ludzi

Przejdź do treści i przykładów
Light Origins otwiera kod robota, który uczy się z wideo ludzi

Źródło: Link

Powiązane tematy

Mówią, że nauczenie robota poruszania się wymaga drogich kombinezonów do motion capture i miesięcy pracy w laboratorium. Firma Light Origins pokazuje inne podejście: wystarczy zwykłe nagranie wideo z człowiekiem. 21 września opublikowała Light-O1-Preview, model liczący około 6 miliardów parametrów, który uczy się ruchu z filmów, a potem próbuje przenieść tę wiedzę na roboty. Kod trafił na Hugging Face i GitHub na licencji Apache 2.0 - dowolna firma może go pobrać, przerobić i wykorzystać komercyjnie.

To nie jest kolejny gadżet do nawigacji. Light Origins ma już w portfolio LightNav-0, wcześniejszy system nawigacyjny dla robotów. Light-O1-Preview to coś innego - model, który ma sterować całym ciałem robota: rękami, nogami, pozą. Firma nazywa go "publicznym wycinkiem" większego projektu Light-O1, czyli fundamentowego modelu embodied AI trenowanego właśnie na ludzkich akcjach z wideo.

Model uczy się ruchu z nagrań ludzi, a potem przenosi wzorzec na robota
Model uczy się ruchu z nagrań ludzi, a potem przenosi wzorzec na robota

Jak film ze zwykłej kamery zamienia się w instrukcję ruchu dla robota

Cały proces zaczyna się od segmentacji ludzi w materiale wideo. Model wyodrębnia sylwetkę, rekonstruuje ruch w trzech wymiarach, a następnie zamienia trajektorię ciała, pozę i stan dłoni na dyskretne tokeny akcji. Te tokeny miesza się z tekstem i obrazem, po czym całość trafia do treningu w klasycznym, autoregresywnym transformerze - tej samej rodzinie architektur, która stoi za większością dzisiejszych dużych modeli językowych.

Innymi słowy: model traktuje ruch człowieka trochę jak zdanie do przewidzenia. Zamiast kolejnego słowa przewiduje kolejną pozycję ciała. To podejście, które w świecie modeli językowych sprawdziło się już wielokrotnie, teraz zostało przeniesione na grunt robotyki.

Skala eksperymentów

  • Testy skalowania obejmowały od około 3,75 miliarda do 120 miliardów tokenów multimodalnych
  • Największy budżet treningowy odpowiadał w przybliżeniu 100 tysiącom godzin odzyskanego ludzkiego ruchu
  • Adaptacja modelu obejmowała dane egocentryczne (widok z perspektywy pierwszej osoby), zestawy teleoperacji Unitree G1 oraz własne dane firmy z korpusu LightBot
  • Firma raportuje spadek błędu przewidywania kolejnej akcji oraz błędu pozy całego ciała zgodnie z prawem potęgowym - im więcej danych, tym lepiej, i to w przewidywalny sposób

Co dokładnie robi ten model, a czego nie robi

Wersja dostępna na Hugging Face to checkpoint 6B osadzony w drzewie modelu Qwen3.5-4B-Base. Działa to tak: podajesz instrukcję tekstową, model generuje krótki ślad rozumowania, a na wyjściu dostajesz sekwencję ruchów całego ciała przy 20 klatkach na sekundę. Każda klatka to 138 wartości - ruch podstawy ciała, wysokość miednicy, obrót, 22 stawy i stan otwarcia dłoni.

Jest jednak haczyk, o którym trzeba pamiętać, zanim pomyślisz, że wystarczy pobrać model i podłączyć go do robota. Light-O1-Preview generuje trajektorie ruchu, ale samo wdrożenie na fizycznym sprzęcie wymaga oddzielnego modelu zachowania albo kontrolera niskiego poziomu. Przykładowa ścieżka dla Unitree G1, którą dokumentuje firma, dziś działa w symulacji z dodatkowym checkpointem polityki sterowania. To nie jest gotowy system operacyjny dla robota - to warstwa priorytetów ruchu, którą trzeba dopiero uzbroić w resztę infrastruktury.

Skalowanie danych treningowych i spadek błędu przewidywania ruchu
Skalowanie danych treningowych i spadek błędu przewidywania ruchu

Wyniki w symulacji

Firma podaje wynik 79,3% wskaźnika sukcesu (macro success rate) w symulacjach RoboCasa GR-1 dla scenariusza kuchennego, obejmującego 24 zadania. To liczba raportowana przez samą firmę, nie z niezależnego publicznego rankingu. W materiałach promocyjnych pojawiają się demonstracje na LightBot i Unitree G1 obejmujące klękanie, balansowanie, wycieranie i podnoszenie przedmiotów - wszystkie wykorzystujące ten sam ludzki prior ruchu.

Otwarty kod nie znaczy gotowy produkt

Dla zespołów zajmujących się robotyką Light-O1-Preview to konkretna, darmowa do pobrania warstwa priorów ruchu, a nie kompletny system sterowania robotem. Otwarta licencja pozwala każdemu laboratorium czy firmie samodzielnie sprawdzić, czy twierdzenia o pretrainingu na wideo ludzkim się bronią. Jakość przenoszenia ruchu między różnymi typami robotów (tzw. cross-embodiment loco-manipulation) wciąż zależy od danych adaptacyjnych i kontrolerów, które w dużej mierze pozostają zastrzeżone.

To zresztą trend, który widzimy coraz częściej w AI - podobnie jak w przypadku otwartych modeli językowych typu DeepSeek, firmy chętniej dzielą się rdzeniem technologii, zatrzymując dla siebie ostatnią, najbardziej kosztowną warstwę wdrożeniową. Otwarte wagi budują zaufanie i przyciągają społeczność deweloperską, ale prawdziwe wdrożenie na sprzęcie wciąż wymaga know-how, którego nikt nie oddaje za darmo.

Jeśli działasz w automatyce przemysłowej albo prowadzisz startup robotyczny, to sygnał, żeby obserwować ten segment rynku - koszt wejścia w budowę własnych modeli sterowania ruchem spada, bo nie musisz już zbierać danych motion capture od zera. Wystarczy dobrze oznaczone wideo, a resztą zajmuje się architektura transformerowa, którą znasz już z innych zastosowań dużych modeli.

Ciekawi Cię, jak firmy wdrażają AI w praktyce? Modele takie jak Light-O1-Preview pokazują, że granica między AI tekstowym a fizycznym światem coraz szybciej się zaciera. Jeśli zastanawiasz się, jak podobne mechanizmy automatyzacji przełożyć na własną firmę, zobacz konkretne przypadki wdrożeń. Zobacz wdrożenia AI dla firm →

Najczęstsze pytania

Czy Light-O1-Preview można pobrać za darmo?

Tak, model jest dostępny na Hugging Face i GitHub na licencji Apache 2.0, czyli można go pobrać, modyfikować i wykorzystywać komercyjnie bez opłat licencyjnych.

Czy ten model działa od razu na dowolnym robocie?

Nie. Model generuje trajektorie ruchu, ale ich wdrożenie na fizycznym sprzęcie wymaga dodatkowego modelu zachowania lub kontrolera niskiego poziomu. Przykład Unitree G1 dokumentowany przez firmę działa obecnie w symulacji.

Czym różni się Light-O1-Preview od LightNav-0?

LightNav-0 to wcześniejszy system Light Origins do nawigacji robota. Light-O1-Preview odpowiada za sterowanie całym ciałem - postawą, kończynami i dłońmi - a nie za poruszanie się po przestrzeni.

Skąd model bierze dane treningowe?

Firma odzyskuje ruch człowieka z nagrań wideo, rekonstruując go w trójwymiarze i zamieniając na tokeny akcji. Model dodatkowo adaptuje się na danych z teleoperacji Unitree G1 oraz własnym korpusie LightBot.

Czy wyniki testów są niezależnie zweryfikowane?

Nie do końca - wynik 79,3% skuteczności w symulacjach RoboCasa GR-1 pochodzi z testów przeprowadzonych przez samą firmę, a nie z publicznego, niezależnego rankingu.

Na podstawie: Pandaily

Informacje o artykule

Darmowy AI Starter Kit

10 gotowych promptów do codziennej pracy + 5 narzędzi + plan na pierwszy tydzień. PDF, 4 strony konkretu.

Udostępnij:
Nie przegap nowych artykułów - dodaj SukcesAI do swoich źródeł w wyszukiwarce Google.
Dodaj do preferowanych źródeł
Jan Gajos

Ekspert AI & Founder, AI Evolution

Pasjonat sztucznej inteligencji, który od 18 lat działa z sukcesem biznesowo i szkoleniowo. Wprowadzam AI do swoich firm oraz codziennego życia. Fascynują mnie nowe technologie, gry wideo i składanie klocków Lego - tam też widzę logikę i kreatywność, które AI potrafi wzmacniać. Wierzę, że dobrze użyta sztuczna inteligencja to nie ogłupiające ułatwienie, lecz prawdziwy przełom w sposobie, w jaki myślimy, tworzymy i pracujemy.