【CVPR'24】MP5:当多模态大语言模型遇上具身智能

5016
1
2024-09-06 11:15:06
162
44
279
63
本期讲者是香港中文大学(深圳)博士生秦逸然,他将为大家解读CVPR'24 文章MP5: A Multi-modal Open-ended Embodied System in Minecraft via Active Perception,这篇文章介绍了MP5多模态开放式体验系统,该系统通过主动感知机制在Minecraft游戏中实现了具身化操作。文章详细讲解了MP5的工作原理和实验结果,并对其在不同任务中的性能进行了评估和分析。此外,文章还讨论了MP5的局限性和未来工作方向。
ReadPaper是沈向洋老师创办的IDEA研究院研发的论文阅读产品,欢迎登陆readpaper.com,快乐读论文。
论文一刻
(40/41)
25.9万播放
简介
Transformer对时序预测真的有效吗? | AAAI'23 Oral
11:03
增量学习新范式:基于分类器的隔离与公平聚合【AAAI Oral】
08:16
换成极坐标系就有提升!BEV下的纯视觉三维目标检测算法【AAAI'23 Oral】
06:27
【论文一刻】ICCV'23 Oral:可控人物图像生成方法-HUMAN SD
06:14
【论文一刻】双重注意力:语音驱动的高清自然的多人视频生成【ICCV 23】
07:39
【论文一刻】ICCV'23 从蒸馏到自蒸馏:通用归一化损失与定制软标签
06:41
【论文一刻 】ICCV'23 从2D图像到3D空间:全新的特征拉升方法 - 3D Deformable Attention
07:40
【论文一刻】ICCV'23 500倍速,Encoder在3D GAN inversion中再发光芒
05:07
【论文一刻】ICCV'23 基于稳定匹配的 Detection Transformer
06:55
【论文一刻 】开放词表分割方法OpenSeeD
06:59
【论文一刻】LAMM:语言辅助的多模态指令调优数据集、框架和基准【NeurIPS23】【数据集】
07:14
【论文一刻】DiffUTE-通用文字编辑的扩散模型 NeurIPS'23
07:12
【论文一刻】基于可控得分蒸馏的3D数字人生成及动画化【NeurIPS23】
05:51
【NeurlPS'23】PrimDiffusion: 基于体积基元扩散的三维人体生成模型【论文一刻】
08:41
【NeurIPS'23】自我激励:解密Offline-RL训练发散机制及其对策
09:24
【NeurIPS'23】Genimage与GenDet:AI生成图像检测的Benchmark与方法
05:16
【NeurIPS'23】LMC:通过大模型合作与互相评估来进行无需训练的开放集识别
06:03
【NeurIPS'23】LLM自我长度预测以实现推理加速
05:42
【NeurIPS'23】深度蚁群算法(DeepACO)
06:31
【NeurIPS'23】通过平坦的局部感知来提升对抗攻击的可迁移性
06:51
【NeurIPS'23】迈向全景图质量评估的新框架
10:04
【NeurIPS'23】首个人体动捕大模型面世!SMPLer-X:横扫七大榜单
08:40
【NeurIPS'23】利用贝叶斯方法考量人类偏好的多样性,实现语言模型对齐
06:56
【NeurIPS'23】基于扩散模型、以数据为中心的无标签图迁移学习
07:51
【NeurIPS'23】3D蒸馏新范式:视觉主干为中心的多模态网络助力涨点
07:41
【NeurIPS'23】从Linear Mode Connectivity出发到神经网络表征空间的线性映射
09:12
【NeurIPS'23】spotlight:用于真实图像去模糊的层次结合扩散模型
07:21
【NeurIPS'23】SGFormer:面向大图的简化Transformer
09:38
【NeurIPS'23】SheetCopilot:大语言模型赋能软件生产力
07:00
【NeurIPS'23】基于内容的无限制对抗攻击
09:07
【NeurIPS'23】ERDA:充分利用无标注信息的弱监督点云分割
09:59
【NeurIPS'23】FGWMixup:联合建模拓扑与特征的图数据mixup方法
10:54
【CVPR'24 】针对零样本视频编辑的时空期望最大化反演
08:23
【CVPR'24】3D人-物交互理解 (LEMON)
05:44
【CVPR'24】DiffSHEG: 基于扩散模型的实时语音驱动表情和手势联合生成
11:53
【CVPR'24】特征适配:在计算病理学中达到病理大模型性能水平
06:01
【CVPR'24】扩散模型中时间区间端点奇异性的解决
17:11
【CVPR'24】面向预训练模型的连续遗忘
05:51
【CVPR'24】驶向未来:首个多视图预测和规划的自动驾驶世界模型
08:06
【CVPR'24】MP5:当多模态大语言模型遇上具身智能
13:30
【CVPR'24】TransNeXt: Vision Transformers的稳健中央凹视觉感知
19:48
客服
顶部
赛事库 课堂 2021拜年纪