O czym jest ten film
- Nate Jones rozmawia z Ming Yu, kierującym pracami nad platformą Cosmos w Nvidii, o tym, czego robot musi się nauczyć, by działać w świecie fizycznym.
- Modele świata służą różnym celom: rozpoznają sytuację, przewidują jej rozwój, tworzą symulacje i pomagają wyznaczać działania.
- Symulacje pozwalają sprawdzać zachowanie autonomicznych samochodów i robotów w sytuacjach trudnych do odtworzenia podczas zwykłych testów.
- Robot potrzebuje szybkiego modelu działającego na urządzeniu, lecz przy bardziej złożonych zadaniach może korzystać z większego modelu w centrum danych.
- Jakość symulacji zależy od ilości danych, wielkości modelu oraz tego, jak szczegółowo system opisze scenę przed jej wygenerowaniem.
- Nagrania dostarczają wielu danych, ale nie pokazują wszystkiego: przedmioty mogą zasłaniać się nawzajem, a przyczyna ruchu bywa niewidoczna.
- Modele coraz lepiej odtwarzają zjawiska fizyczne, jednak rozmówca nie twierdzi, że odkryły lub rozumieją prawa fizyki.
- Model sterujący urządzeniem musi stale korygować działanie na podstawie nowych obserwacji — na przykład zmienić tor jazdy, gdy przed samochodem pojawi się inny pojazd.
- Rozwój robotów przyspieszy tam, gdzie wynik zadania można łatwo sprawdzić, także w symulacji. Poprawne złożenie prania łatwiej ocenić niż smak jajecznicy.
- Nvidia rozwija wyspecjalizowane rodziny modeli i udostępnia narzędzia programistom, zakładając, że różne zastosowania będą wymagały różnych rozwiązań.
10 najważniejszych takeaways — z kontekstem zastosowania
1.Najpierw ustal, po co robotowi model świata
Na czym polega: „Model świata” nie oznacza jednej funkcji. Może służyć do rozpoznawania otoczenia, przewidywania następstw działania, prowadzenia symulacji albo sterowania urządzeniem.
Jak stosować: Przy ocenie projektu robotycznego zapytaj, które z tych zadań model faktycznie wykonuje. Wymagania wobec systemu kontroli jakości w fabryce będą inne niż wobec modelu sterującego ramieniem robota.
Na co uważać: Samo określenie „model świata” nie dowodzi, że urządzenie potrafi samodzielnie działać w rzeczywistym otoczeniu.
2.Wykorzystuj symulacje do wybierania obiecujących rozwiązań
Na czym polega: Wirtualne środowisko pozwala wielokrotnie sprawdzić sposób sterowania pojazdem lub robotem, zanim zacznie się kosztowne testy na sprzęcie.
Jak stosować: Porównuj w symulacji kolejne wersje systemu sterowania. Do testów w terenie kieruj te, które najlepiej radzą sobie z przygotowanymi scenariuszami.
Na co uważać: Wynik w symulacji zależy od tego, jak wiernie odtworzono warunki. Test wirtualny nie zastępuje sprawdzenia urządzenia w rzeczywistości.
3.Oddziel decyzje wymagające natychmiastowej reakcji od tych, które mogą poczekać
Na czym polega: Mały model może działać na robocie i reagować na bieżąco. Większy model, uruchomiony na mocniejszym komputerze, może rozwiązywać trudniejsze zadania, które nie wymagają odpowiedzi w ułamku sekundy.
Jak stosować: Projektując system, określ dopuszczalny czas reakcji dla każdej czynności. Omijanie przeszkody wymaga innej architektury niż planowanie kolejnego etapu pracy.
Na co uważać: Największy model nie będzie najlepszym wyborem, jeśli opóźnienie lub koszt obliczeń uniemożliwią bezpieczne działanie urządzenia.
4.Sprawdzaj, co naprawdę zawierają dane wizualne
Na czym polega: Świat dostarcza ogromu nagrań, lecz obraz nie ujawnia wszystkich przyczyn zdarzeń. Nie widać choćby tego, co zasłonił inny przedmiot.
Jak stosować: Uzupełniaj nagrania danymi o ruchu, działaniu urządzeń i wynikach ich pracy. Tam, gdzie brakuje odpowiednich przykładów, rozważ dane wygenerowane przez symulator fizyki.
Na co uważać: Duża liczba filmów nie oznacza automatycznie, że model nauczył się przyczyn i skutków potrzebnych do bezpiecznego działania.
5.Oceniaj zachowanie modelu, nie przypisuj mu pochopnie znajomości fizyki
Na czym polega: Zwiększanie zbioru danych poprawia odtwarzanie zjawisk fizycznych. Ming Yu zaznacza jednak, że nie wiadomo, czy model rzeczywiście wyprowadza rządzące nimi prawa.
Jak stosować: Testuj konkretne przewidywania i działania: tor spadającego przedmiotu, skutki zderzenia czy ruch chwytaka. Wyniki porównuj z pomiarami i symulacją fizyczną.
Na co uważać: Wiarygodnie wyglądający film może ukrywać błędne zależności, które ujawnią się dopiero podczas pracy robota.
6.Traktuj opis sceny jako część pracy nad symulacją
Na czym polega: Według rozmówcy szczegółowe określenie ruchu i kolejnych zdarzeń pomaga uzyskać lepszy wynik generowania. System może sam rozbudowywać taki opis przed stworzeniem symulacji.
Jak stosować: Określaj istotne położenia, ruchy i zmiany w czasie. Przy zadaniach złożonych sprawdzaj wynik, poprawiaj opis i uruchamiaj model ponownie.
Na co uważać: Więcej szczegółów ma sens tylko wtedy, gdy opisują warunki ważne dla zadania. Precyzyjny opis nie naprawi błędnego modelu otoczenia.
7.Mierz skuteczność sterowania w zmiennych warunkach
Na czym polega: Model sterujący urządzeniem wybiera kolejne działania na podstawie obserwacji. Samochód nie dostaje raz na zawsze ustalonej trasy: musi ją korygować, gdy sytuacja się zmienia.
Jak stosować: W testach uwzględniaj zdarzenia pojawiające się w trakcie wykonywania zadania, na przykład pojazd zajeżdżający drogę albo człowieka wchodzącego na tor robota.
Na co uważać: Pokaz pojedynczej, udanej czynności nie mówi wiele o tym, czy system poradzi sobie z zakłóceniami.
8.Szukaj zadań z wynikiem, który można jasno sprawdzić
Na czym polega: Rozwój łatwiej przyspieszać, gdy system dostaje jednoznaczną informację, czy zadanie wykonał poprawnie. Można obejrzeć złożone pranie albo uruchomić test po podłączeniu przewodu. Ocena smaku potrawy jest trudniejsza.
Jak stosować: Przy wyborze pierwszych zastosowań robotów ustal prostą, wiarygodną metodę weryfikacji. Tam, gdzie to możliwe, przenieś część prób do symulacji.
Na co uważać: Łatwy do policzenia wynik może pomijać cechy ważne dla człowieka — na przykład to, czy jedzenie rzeczywiście smakuje.
9.Rozbijaj złożone zadania na czynności, które można kontrolować
Na czym polega: Rozmówca spodziewa się, że roboty będą korzystać z układów łączących modele i narzędzia, podobnie jak dzisiejsi agenci programowi. Jeden element może zaplanować ruch, drugi go wykonać, a kolejny ocenić rezultat.
Jak stosować: W projekcie opisz etapy działania, potrzebne narzędzia i sposób sprawdzenia każdego etapu. Przewidź możliwość poprawienia błędu i ponowienia czynności.
Na co uważać: Przeniesienie pomysłu znanego z oprogramowania do robotyki jest trudne: każda próba odbywa się w fizycznym świecie, trwa dłużej i może zmienić otoczenie.
10.Dobieraj wyspecjalizowane modele do kosztu i miejsca pracy
Na czym polega: Ming Yu przewiduje dalszą specjalizację modeli. Robot domowy nie potrzebuje wszystkich umiejętności dużego modelu językowego, a urządzenie pracujące w terenie nie może zawsze czekać na odpowiedź z centrum danych.
Jak stosować: Porównuj rozwiązania według potrzebnej umiejętności, czasu reakcji, zużycia zasobów i możliwości działania na urządzeniu.
Na co uważać: Uniwersalność bywa kosztowna. Model, który potrafi więcej na papierze, może być mniej przydatny w konkretnym urządzeniu.
Redakcyjne tłumaczenie
Dlaczego robot szybciej złoży pranie, niż usmaży idealną jajecznicę
Nate Jones: Czy dobrze rozumiem: prędzej zobaczę w domu robota, który wypierze i poprawnie złoży ubrania, niż takiego, który zrobi idealną jajecznicę?
Ming Yu: Tak sądzę.
Nate Jones: Właśnie o takich różnicach chcę dziś porozmawiać. Jestem w Nvidii, którą większość osób kojarzy przede wszystkim z układami graficznymi. Firma rozwija jednak również modele AI. Moim gościem jest Ming Yu, kierujący pracami nad rodziną modeli świata Cosmos.
Na początek przyda się proste wyjaśnienie. Gdy rozmawiamy z modelem językowym, otrzymujemy tekst. System działający w świecie fizycznym musi zrobić coś więcej: rozpoznać otoczenie, przewidzieć skutki ruchu i wyznaczyć działanie urządzenia. Może na przykład pomóc ramieniu robota chwycić butelkę. W prostszej postaci podobne rozwiązania spotykamy już w urządzeniach takich jak autonomiczne kosiarki, które na bieżąco wybierają dalszą drogę.
Ming, opowiedz najpierw o sobie i o swojej pracy.
Ming Yu: Kieruję laboratorium Cosmos i rozwojem tej platformy. Zaczynałem jako badacz generatywnej AI. Około dziesięciu lat temu, podczas rozmowy o pracę w Nvidii, powiedziałem naszemu głównemu naukowcowi, że choć obrazy tworzy się wtedy przede wszystkim metodami grafiki komputerowej, z czasem coraz większą rolę przejmie sztuczna inteligencja.
Nie była to wówczas oczywista teza. Obrazy generowane przez modele miały niską rozdzielczość, a przedstawieni na nich ludzie często wyglądali nienaturalnie. Pociągała mnie jednak możliwość uczenia systemu na danych zamiast ręcznego zapisywania niezliczonych zasad tworzenia trójwymiarowych scen. Przez kolejne lata obserwowaliśmy postęp w tej dziedzinie. Dziś ilość materiałów wizualnych tworzonych przez AI rośnie bardzo szybko.
Czym jest model świata
Nate Jones: Nvidia zatrudnia wielu programistów, choć zwykle słyszymy o jej układach. Jak modele świata mieszczą się w działalności firmy?
Ming Yu: Tworzymy rozwiązania dla programistów. Sam komputer czy układ graficzny nie wystarczy, by łatwo zbudować produkt. Potrzebne są także narzędzia do programowania, biblioteki i modele AI. Rozwijamy kolejne warstwy oprogramowania, żeby inni mogli szybciej pracować. Dzięki temu sami lepiej rozumiemy, jakich komputerów będzie wymagać przyszłe oprogramowanie.
Nate Jones: Większość z nas poznała AI przez ChatGPT. Myślimy więc o słowach, tokenach i modelach językowych. Czym różni się od nich model świata?
Ming Yu: Ludzie zdobywają pewne wyobrażenie o świecie, zanim nauczą się mówić. Język znakomicie zapisuje wiedzę i znaczenia. Nic dziwnego, że ważny przełom w AI nastąpił właśnie dzięki modelom uczonym na tekstach. Mogą z nami rozmawiać, pomagać pisać kod i go sprawdzać.
Modele świata buduje się z myślą o innych zadaniach. Chcemy na przykład ustalić, dlaczego coś się wydarzyło, przewidzieć, co stanie się za chwilę, albo znaleźć drogę przez otoczenie. Nie chodzi więc o jeden model wykonujący zawsze tę samą pracę. Budujemy różne modele, zależnie od celu.
W Cosmos koncentrujemy się na AI działającej w świecie fizycznym: samochodach autonomicznych, robotach i maszynach w fabrykach. Zastanawiamy się, jakich zdolności potrzebują twórcy takich urządzeń. Jedna z nich to rozpoznawanie sytuacji. System mógłby ocenić, czy pracownik obsługuje maszynę zgodnie z instrukcją bezpieczeństwa albo czy produkt na linii ma wadę widoczną na zdjęciu.
Druga zdolność to symulowanie zdarzeń. Gdy opracujesz sposób sterowania samochodem autonomicznym, musisz sprawdzić, czy działa bezpiecznie. Możesz wysłać flotę pojazdów na drogi, ale zajmie to dużo czasu, a pewnych rzadkich sytuacji możesz w ogóle nie napotkać. Model świata pozwala stworzyć środowisko, które samochód będzie odbierał podobnie do rzeczywistego, i sprawdzić w nim różne wersje sterowania. Podobnie można badać zachowanie robotów.
W rozwijanej rodzinie Cosmos 3 łączymy rozpoznawanie otoczenia, symulację i wyznaczanie działań. Te zadania są różne, lecz dotyczą tego samego świata, więc część wiedzy modelu może służyć im wszystkim.
Reakcja robota musi być dostatecznie szybka
Nate Jones: Wyobraźmy sobie robota poruszającego się po hali. Na jego drodze pojawia się wózek widłowy, przechodzi człowiek albo przewraca się paleta. Robot musi zareagować od razu. Jak uwzględniacie to przy projektowaniu modeli?
Ming Yu: Budujemy modele różnej wielkości. W Cosmos 3 są trzy rozmiary, w tym mały model przeznaczony do działania bezpośrednio na urządzeniu. Zależy nam, by model, który musi szybko reagować, mógł pracować tam, gdzie znajduje się robot.
Mniejszy model ma oczywiście bardziej ograniczone możliwości. Największy może działać w centrum danych albo na mocniejszym komputerze i zajmować się trudniejszymi zadaniami. Podczas omijania przeszkody nie można czekać, ale planowanie na wyższym poziomie dopuszcza dłuższą odpowiedź. Dlatego połączenie modeli pracujących na urządzeniu i poza nim wydaje mi się rozsądnym rozwiązaniem.
Skąd bierze się lepsza symulacja
Nate Jones: Przy modelach językowych dużo mówi się o tym, jak poprawiają się wraz ze wzrostem ilości danych, liczby parametrów czy czasu przeznaczonego na rozwiązanie problemu. Czy przy modelach świata zachodzi coś podobnego?
Ming Yu: Tak, i to na kilka sposobów. Więcej danych pomaga. Większy model także może dać lepszy wynik. Ciekawa jest jednak również praca wykonywana podczas przygotowywania odpowiedzi.
Przy generowaniu sceny wizualnej bardziej szczegółowy opis zwykle poprawia rezultat. Jeśli określisz, co robot robi w pierwszej sekundzie, o ile obraca dłoń, a co dzieje się chwilę później, model otrzyma dokładniejsze wskazówki. System może sam stopniowo rozbudowywać opis tego, co ma znaleźć się w symulacji, a dopiero potem wygenerować obraz.
Nate Jones: Czyli człowiek nie musi ręcznie opisywać każdego ruchu. Sam model może doprecyzować plan sceny — choćby ruch ramienia nalewającego kawę — i na tej podstawie ją stworzyć.
Ming Yu: Właśnie tak. Nie zawsze trzeba też poprzestać na jednej próbie. Można ponownie uruchomić model, ocenić wynik i skorygować szczegół, na przykład położenie palców robota. Poprawa może więc wynikać z większej ilości danych, większego modelu, bardziej szczegółowego przygotowania odpowiedzi oraz z kolejnych prób i korekt.
Nate Jones: Świat fizyczny wydaje się niewyczerpanym źródłem danych. Czy pod tym względem modele świata mają łatwiej niż modele językowe?
Ming Yu: Pod pewnym względem tak, ale obraz stawia własne trudności. Język jest zwięzły i niesie znaczenie wprost. W nagraniu wielu rzeczy nie widać. Jeden przedmiot zasłania drugi; nie zawsze wiadomo, jakie działanie spowodowało obserwowaną zmianę. Pracujemy też z bardziej surowym sygnałem, a wygenerowanie obrazu wymaga uwzględnienia znacznie większej liczby szczegółów.
Weź choćby strumień powietrza, który rozdmuchuje drobne przedmioty. Samo odtworzenie takiego zachowania jest trudne.
Czy model zna prawa fizyki?
Nate Jones: Czy gdy model rośnie i dostaje więcej danych, zaczyna w pewnym sensie rozumieć fizykę?
Ming Yu: Widzimy, że przy większej ilości danych lepiej symuluje zjawiska fizyczne. Korzystamy też z silników fizycznych, między innymi w środowiskach takich jak Omniverse czy Isaac, by tworzyć dodatkowe dane treningowe.
Ostrożnie używałbym jednak słowa „rozumie”. Sieci neuronowe wciąż są dla nas pod wieloma względami trudne do wyjaśnienia. Model próbuje odtworzyć zależności obecne w danych, a wiemy, że rzeczywiste zdarzenia podlegają prawom fizyki. Nie daje nam to jeszcze pewności, że sam model te prawa odkrył.
Nate Jones: Jeśli upuszczę butelkę, możemy opisać jej spadanie równaniami. Model oglądający wiele takich nagrań może nauczyć się, jak wygląda ruch spadającego przedmiotu. Dane z symulatora fizyki mogą pomóc mu w nauce, zwłaszcza przy zdarzeniach, których mamy mało na nagraniach.
Ming Yu: Tak. Możemy w ten sposób przygotować choćby przykłady zderzeń obiektów, których trudno zebrać dostatecznie dużo w rzeczywistości.
W Cosmos 3 część odpowiedzialna za rozumowanie pracuje z językiem, a część generująca tworzy na tej podstawie symulację wideo. Uwzględniamy również działania, bo zmiana obserwowana w świecie często wynika z czyjegoś ruchu. W robotyce pożądanym wynikiem modelu może być właśnie wskazanie kolejnego działania.
Gdyby część rozumująca, obserwując spadające przedmioty, samodzielnie doszła do precyzyjnej zasady opisującej ich ruch, mielibyśmy mocniejszy powód, by mówić o nauczeniu się fizyki. Nie sądzę, byśmy już byli na tym etapie. Taka budowa modelu może nam jednak z czasem pomóc lepiej zobaczyć, czego rzeczywiście się nauczył.
Nate Jones: Czyli dzisiejsze modele potrafią już przekonująco odtwarzać pewne zdarzenia, ale wciąż badacie, czy za tym zachowaniem stoi bardziej ogólne rozumienie reguł.
Ming Yu: Tak. Można to porównać do pytania, czy system, który widział wiele programów i ich wyników, potrafi sam odtworzyć zasady języka programowania. To interesujący kierunek badań, ale nie twierdzę, że już osiągnęliśmy taki wynik dla fizyki.
Od symulacji do sterowania
Nate Jones: Mimo tych ograniczeń modele świata mają już zastosowania. Które z nich są dla ciebie najciekawsze?
Ming Yu: Jednym jest sprawdzanie modeli sterujących. Masz kilka wersji systemu prowadzenia samochodu i chcesz ocenić, która rokuje najlepiej. Możesz rozegrać wiele scenariuszy w Cosmos, porównać skuteczność poszczególnych wersji i do prób z flotą pojazdów wybrać te bardziej obiecujące.
Cosmos może też sam służyć do wyznaczania działań. Pokazywaliśmy wyniki w zadaniach chwytania i odkładania przedmiotów. Model pracuje z tekstem, obrazem i działaniami, więc może odczytać polecenie, uwzględnić to, co widzi, a następnie wskazać ruch potrzebny do wykonania zadania.
Nate Jones: Wyjaśnijmy pojęcie modelu sterującego komuś, kto nie zajmuje się robotyką.
Ming Yu: Taki model wybiera polecenia dla urządzenia fizycznego na podstawie zadania i bieżących obserwacji. Samochód autonomiczny może na przykład zobaczyć zieloną strzałkę pozwalającą skręcić w lewo. Model wyznaczy wtedy punkty, przez które samochód powinien przejechać.
To nie jest jednorazowa decyzja. Podczas skrętu może pojawić się inny pojazd. System otrzymuje nowy obraz otoczenia i wyznacza nowy tor jazdy.
Nate Jones: A więc „działanie” oznacza tu konkretny ruch w przestrzeni i czasie, nie tekstowe polecenie w rodzaju „skręć w lewo”. Takie systemy nie są już wyłącznie pomysłem na przyszłość — działają w pojazdach.
Ming Yu: Im więcej AI trafi do urządzeń fizycznych, tym częściej będziemy spotykać modele sterujące.
Robot jako zespół modeli i narzędzi
Nate Jones: W oprogramowaniu coraz częściej spotykamy agentów, którzy łączą model z narzędziami i zasadami ich używania. Jak wyglądałby podobny układ w robotyce?
Ming Yu: Ogólna idea jest podobna: trzeba koordynować modele i narzędzia. Zmieniają się jednak same narzędzia. Agent działający w świecie fizycznym może korzystać z robota, kamery i narzędzi do jej kalibracji. Jeden model wyznacza ruch, a inny ocenia obraz, by sprawdzić, czy zadanie zostało wykonane.
Lubię w podejściu agentowym to, że trudny problem dzieli się na mniejsze części. Modele językowe rozwiązują zadanie krok po kroku, przewidując kolejne fragmenty odpowiedzi. Modele dyfuzyjne stopniowo usuwają szum, aż powstanie wynik. Agent może dodatkowo wykonywać różne czynności: raz wywołać model, innym razem użyć narzędzia, sprawdzić rezultat i zdecydować, co zrobić dalej.
Uważam, że taki sposób pracy będzie ważny również dla AI fizycznej. Zadanie robota można rozbić na etapy i dobrać do nich odpowiednie modele oraz narzędzia.
Nate Jones: W programach agent manipuluje danymi. Robot mógłby postępować podobnie, tylko jego działania zmieniają też rzeczywiste otoczenie. Jak może to wyglądać w nadchodzącym czasie?
Ming Yu: Sądzę, że rozwój pójdzie w stronę agentów fizycznych. Taki agent będzie mógł sterować robotem, a w razie potrzeby korzystać też z narzędzi cyfrowych. Granica między tymi zastosowaniami może się stopniowo zacierać.
Jednocześnie nadal potrzebujemy specjalizacji. Wraz ze wzrostem możliwości modeli coraz ważniejszy będzie koszt ich działania. Robot, który nigdy nie musi rozwiązywać zadań z olimpijskiej matematyki, niekoniecznie powinien stale wykorzystywać zasoby potrzebne do takiej umiejętności.
Znaczenie ma też miejsce pracy modelu. W centrum danych można obsługiwać razem żądania wielu użytkowników. Robot w terenie nie zawsze może czekać. Różne zastosowania będą więc wymagały różnych architektur i różnej mocy obliczeniowej. Wspólna pozostaje zasada dzielenia trudnego zadania na prostsze kroki.
Czy robot będzie mógł nauczyć się nowej „umiejętności”?
Nate Jones: Agenci programowi mogą dostawać instrukcje pozwalające im wykonywać wyspecjalizowane zadania. Czy robot będzie mógł w podobny sposób nauczyć się składania prania, a potem przygotowywania jajecznicy?
Ming Yu: To dobre porównanie. Robot potrzebowałby jednak umiejętności wykonywanej fizycznie. W oprogramowaniu możesz wypróbować narzędzie, przejrzeć zapis jego działania i poprawić instrukcję. Robot musi naprawdę poruszyć przedmiotem. Potem może ocenić, co się stało, i zmienić sposób działania przy kolejnej próbie.
Nie mamy jeszcze odpowiednika prostej instrukcji, którą wystarczy dać robotowi, by niezawodnie opanował nową czynność. Pojawiają się pierwsze prace w tym kierunku. Główna różnica polega na testowaniu: program można uruchamiać i sprawdzać bardzo szybko na komputerze, podczas gdy próby z robotem w świecie fizycznym są dużo trudniejsze.
Właśnie dlatego budujemy modele świata. Jeśli dobrze odtworzymy otoczenie i jego reakcję na działania robota, będzie można ćwiczyć w symulacji. Zamiast przygotowywać tysiąc rzeczywistych kuchni, szybko stworzymy tysiąc różnych kuchni w modelu.
Nate Jones: Dom jest pod tym względem wyjątkowo wymagający. Kuchnie różnią się układem, podobnie jak sypialnie, w których robot miałby składać i odkładać ubrania. Jak sprawić, by umiejętność zdobyta w jednym miejscu przydawała się w innych?
Ming Yu: Kluczowa jest możliwość sprawdzenia wyniku. W programowaniu lub matematyce często łatwo ustalić, czy odpowiedź jest poprawna. W AI fizycznej trudne jest zarówno zebranie danych, jak i uzyskanie wiarygodnej oceny działania.
Załóżmy, że robot gotuje. Możemy zasymulować wiele elementów pracy w kuchni, ale ostatecznej oceny smaku musi dokonać człowiek. To bardzo trudne do zautomatyzowania. Są jednak czynności, których wynik sprawdzimy łatwiej. Po złożeniu prania można ocenić obraz i zobaczyć, czy ubrania wyglądają zgodnie z poleceniem. Po podłączeniu przewodu w centrum danych można uruchomić test i sprawdzić, czy połączenie działa.
Tam, gdzie wynik da się sprawdzić w symulacji, postęp może być szybszy. Możemy wykonać więcej prób i uzyskać informację, które działania się powiodły.
Nate Jones: Stąd odpowiedź z początku rozmowy: prawidłowe złożenie prania może być łatwiejszym celem niż idealna jajecznica, bo wynik pierwszego zadania prościej ocenić.
Ming Yu: Tak uważam.
Dlaczego Nvidia rozwija różne rodziny modeli
Nate Jones: Nvidia ma coraz więcej rodzin modeli. Jaki jest wspólny cel tych prac?
Ming Yu: AI będzie się dalej rozwijać, a różne zastosowania będą wymagały specjalizacji. Dlatego pracujemy nad modelami do języka i kodowania, modelami świata, rozwiązaniami związanymi z robotyką, jazdą autonomiczną czy opieką zdrowotną.
Ważna jest dla nas również otwartość. Dostęp do gotowego API bywa bardzo użyteczny, ale sam interfejs nie pokazuje, jak rozwiązanie działa. Jako doktorant uczyłem się na kodzie udostępnianym przez innych. Dzięki otwartym narzędziom badacze i programiści mogą poznawać istniejące metody, wnosić własne pomysły i budować lepsze modele. Chcemy dostarczać im do tego narzędzia.
Co mogłoby zaskoczyć w ciągu roku
Nate Jones: Na koniec: jaki postęp w ciągu najbliższych dwunastu miesięcy naprawdę by cię zaskoczył?
Ming Yu: Jeszcze niedawno wskazałbym tworzenie trójwymiarowych światów przez bardzo niewielką liczbę osób. Uważałem to za trudne zadanie, a widzimy już interesujące wyniki. Przykładem omawianym przez nas jest użycie Blendera: system tworzy scenę 3D, generuje jej obraz i sprawdza, czy odpowiada opisowi. Powstaje cykl tworzenia, weryfikacji i poprawiania.
Kolejnym zaskoczeniem byłoby dla mnie znalezienie równie skutecznego sposobu sprawdzania wyników działań w świecie fizycznym. Być może istnieją zadania, których poprawność już dziś dałoby się wiarygodnie oceniać, lecz jeszcze nie znaleźliśmy właściwej metody. Gdy ktoś ją pokaże, rozwój określonych umiejętności robotów może wyraźnie przyspieszyć.
Nate Jones: W badaniach nad AI bywa tak, że mały zespół znajduje sposób na rozwiązanie konkretnego problemu, publikuje wyniki i inni mogą na nich budować.
Ming Yu: Swobodny przepływ wiedzy i możliwość korzystania z niej przez kolejne osoby są bardzo ważne. Wielu badaczy głęboko w to wierzy.
Nate Jones: Dziękuję za rozmowę.
Ming Yu: Dziękuję.