VLN视觉语言大模型导航-OmniVLA

2336
0
2026-04-26 18:06:33
34
14
88
25
OmniVLA 是一个用于机器人导航的视觉-语言-动作模型。它能够结合相机观测和自然语言指令,直接输出未来轨迹点,再通过底层控制器转换为底盘运动指令。 OmniVLA简单复现,使用OmniVLA的语言输入指令模式,进行指定物体的导航。 移动载体:全向轮底盘 (taobao直接买的现成支持串口、stm32主控底盘) 移动主控:ORIN-NX (主要当跳板机用,用来给4090云服务器相机推流、和转发底盘推理指令给底盘stm32) 摄像头: 普通的USB板卡摄像头,1MP分辨率 (为了炫技,还用了ORIN的NVJPEG来进行图像硬件编解码,CPU接近占用5%) 训练平台:腾讯云租的4090服务器,进行远程推理 通信:服务器和ORIN走的socket通信,ORIN和stm32走的ROS2通信 实验1:输入语言指令 “move forward to yellow toy” 实验2:输入语言指令 “move forward to red seat” 参考文献: 复现过程,大部分参考以下两位UP主,非常感谢两位UP主的解答 https://www.bilibili.com/video/BV1yJQsBTEK4/?spm_id_from=333.337.search-card.all.click&vd_source=ed6bf57ee5a8e930b7a857e261dac86d https://www.bilibili.com/video/BV1HnDrBmEyC/?spm_id_from=333.337.search-card.all.click&vd_source=ed6bf57ee5a8e930b7a857e261dac86d https://omnivla-nav.github.io/
https://github.com/kahowang
接下来播放
自动连播
客服
顶部
赛事库 课堂 2021拜年纪