Fyzikálna AI od Nvidie: Cosmos 3 učí sa z videa a akcie

Nvidia Cosmos 3 kombinuje video, text a akciu na učenie sa a generovanie nových videí a akcií robotov. Systém využíva „svetový model“ pre predikciu a optimalizáciu, čím znižuje potrebu nákladného testovania v reálnom svete. Všetky zdroje sú open-source.

Fyzikálna AI od Nvidie: Cosmos 3 učí sa z videa a akcie
Photo by julien Tromeur/Unsplash

Nová éra umelej inteligencie prichádza s fyzikálnymi modelmi, ktoré sa učia priamo z interakcie so svetom. V najnovšej epizóde Machine Learning Street Talku Ming-Yu Liu z Nvidie predstavil Cosmos 3 – systém, ktorý dokáže chápať video, text a akciu, a dokonca generovať nové videá a robotické akcie. Táto technológia otvára dvere k rozsiahlemu testovaniu robotických systémov v simuláciách a znižuje potrebu nákladného a potenciálne nebezpečného testovania v reálnom svete. Poďme sa pozrieť na to, ako Cosmos 3 funguje a aké má potenciálne využitie.

Architektúra Cosmos 3: Spojenie Jazyka a Vizuálu

Srdcom systému je kombinácia jazykového modelu (buď trénovaného odznova alebo využívajúceho existujúci open-source model) a vizuálneho enkodéra pre spracovanie videa a obrázkov. Táto kombinácia vytvára tzv. vision-language model, ktorý dokáže odpovedať na otázky o videách, ako napríklad „Koľko áut je vo videu?“ alebo určiť, či robot úspešne dokončil akciu. Následne sa inicializuje dvojcestný generátor pre video, audio a akcie. Kľúčovým prvkom je aj tzv. temporal position embedding, ktorý normalizuje rôzne frekvencie signálov (snímky videa, hertz zvuku, načasovania akcií) do spoločnej škály.

Mastodon