17.
jul
Zagovor magistrskega dela EMAI: Hernandez Cancino estrada, Jose Edgar
ob 10:00

Naslov magistrskega dela: Vizualno-jezikovno-akcijski model za robotsko manipulacijo s tekstilnimi objekti

 

Povzetek:

Vizualno-jezikovno-akcijski (VLA) modeli so enoviti modeli za vodenje robotov, ki bogate zaznavne predstavitve prevzemajo iz predhodno naučenih vizualno-jezikovnih temeljnih modelov. Vendar še vedno ni jasno, ali se te predstavitve pri generiranju akcij v celoti izkoristijo. V tem delu raziskujemo, ali je mogoče iz notranjih večmodalnih značilk modela X-VLA obnoviti zaznavne informacije, pomembne za izvedbo naloge, ter jih ponovno uporabiti za izboljšanje vodenja robota, zlasti pri prostorskem sklepanju, ki je potrebno za natančno prijemanje tekstilnih objektov.

V tem delu predstavimo lahek dekodirnik vizualnega sklepanja, naučen za rekonstrukcijo ekspertno določenih zaznavnih ciljev iz notranjih predstavitev osnovnega modela X-VLA. Obnovljene informacije vključimo na dva načina: implicitno kot pomožni učni signal, ki osnovni model spodbuja k ohranjanju strukture, pomembne za izvedbo naloge, ter eksplicitno v obliki usmerjevalnih žetonov, ki jih ponovno uvedemo v proces generiranja akcij.

Predlagane metode ovrednotimo na nalogah pobiranja kock, pobiranja in odlaganja blaga ter prepogibanja blaga. Izvirni model X-VLA primerjamo z različicami, ki bodisi regularizirajo njegove latentne predstavitve, da bi ohranile informacije, pomembne za izvedbo naloge, bodisi omogočijo, da so te informacije med generiranjem akcij eksplicitno dostopne. Rezultati kažejo, da lahko eksplicitno podajanje informacij, pomembnih za izvedbo naloge, izboljša delovanje modela v dvoumnih ali zahtevnih primerih. Pri ovrednotenih nalogah implicitno usmerjanje z regularizacijo latentnega prostora daje mešane rezultate, medtem ko eksplicitno usmerjanje prinaša izboljšave pri nekaterih nalogah manipulacije s tekstilom. Te ugotovitve kažejo, da osnovni modeli VLA vsebujejo zaznavno strukturo, pomembno za izvedbo naloge, ki jo je mogoče obnoviti, vendar je njena uporabnost odvisna od načina vključevanja teh informacij v proces generiranja akcij in od značilnosti manipulacijske naloge.

 

Mentor: prof. dr. Danijel Skočaj

 

Komisija za zagovor:

doc. dr. Jure Žabkar (predsednik),

izr. prof. dr. Matevž Pesek (član), 

doc. dr. Alan Lukežič (član).

 

Prostor zagovora/Termin zagovora: izvedba predstavitve bo potekala hibridno (v Sejni Sobi 3 na Fakulteti za računalništvo in informatik ter v online okolju).

 

Povezava do video kanala, po katerem se bo prenašal zagovor in ga bo možno spremljati, bo dodana najkasneje na dan zagovora (predvidoma 30 minut pred terminom izvedbe zagovora) na spletni strani: 

https://ucilnica.fri.uni-lj.si/mod/zoom/view.php?id=63775