CVPR 2025|多模态大模型专题

1.2万
0
2025-06-01 12:00:00
257
103
864
110
1.陈铠 香港科技大学博士生 EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions 2.王奉祥 国防科技大学博士生 XLRS-Bench: Could Your Multimodal LLMs Understand Extremely Large Ultra-High-Resolution Remote Sensing Imagery? 3.洪文逸 清华大学博士生 MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models 4.张天舒 清华大学本科生 ICT: Image-Object Cross-Level Trusted Intervention for Mitigating Object Hallucination in Large Vision-Language Models 5.行习铭 北京航空航天大学博士生 Empowering LLMs to Understand and Generate Complex Vector Graphics 6.陈天宇 北京航空航天大学博士生 Galaxy Walker: Geometry-aware VLMs For Galaxy-scale Understanding 7.闵安娜 清华大学本科生 Supervising Sound Localization using In-the-wild Ego-motion 8.张泽锋 中科院信息工程研究所博士生 Debiasing Multimodal Large Language Models via Noise-Aware Preference Optimization 9.杜恒辉 中国人民大学硕士生 Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation 10.梁思源 新加坡国立大学博士后研究员 Revisiting Backdoor Attacks against Large Vision-Language Models from Domain Shift
发扬科学思辨精神,链接全球AI 爱好者
CVPR 2025
(4/27)
7.5万播放
简介
沈春华教授:通过模仿人工标注轨迹探索多模态大模型的像素理解能力|CVPR 2025预讲会特邀报告
43:08
CVPR 2025|计算机基础任务专题
43:27
基础模型与效率优化
01:52:56
CVPR 2025|多模态大模型专题
02:35:12
CVPR 2025|具身智能与机器人专场
01:15:23
CVPR'25 Oral|卷积网络又双叒叕行了?OverLoCK:一种仿生的卷积神经网络视觉基础模型
16:32
CVPR'25 Oral|无需共享数据,如何用几何知识对齐全局分布?
07:52
CVPR 2025|香港大学 MM lab 专场
01:10:36
CVPR 2025|生成式模型与扩散模型专场
01:36:12
CVPR 2025|香港大学赵恒爽老师课题组专场
01:38:31
CVPR 2025|DAMO开发者矩阵专场
02:02:24
CVPR'25 Highlight|基于建筑程序的三维结构化简模重建
11:46
CVPR'25|ECBench:统一静态、动态与幻觉场景的机器人认知评测体系
16:22
赵恒爽教授:空间智能视觉基础模型
45:43
罗平教授:Multimodal Discrete Diffusion for Understanding, Generation and Thinking
45:17
CVPR'25 Oral | VideoEspresso: 基于核心帧和关键物体时空推理的大规模链式思维数据集和评测基准
17:18
CVPR'25 | ECBench:统一静态、动态与幻觉场景的机器人认知评测体系
14:46
CVPR'25 | EMOVA: 听说读写全能的开源端到端全模态大模型
17:24
CVPR'25 | 最高 91% 的视觉标记裁剪率!优化视觉语言模型推理的创新方法
09:29
CVPR'25 | 突破多模态虚假新闻检测瓶颈:基于“上下文-语义一致性”的创新方法
13:09
CVPR'25 Highlight | 把Contrastive Loss的Batch Size冲到100M!
12:27
CVPR 2025 Highlight | ASUKA:提升图像修复稳定性,减轻幻觉生成和维持色彩一致性
08:04
CVPR'25 Highlight | 在分布偏移下对目标检测器和多模态大模型进行基准测试
09:53
CVPR'25 Highlight | ConsisID:北大罗切斯特大学研究团队提出人脸一致性视频生成模型
13:40
CVPR'25 Highlight | UniReal: 通过学习真实世界的动态变化统一图像生成与编辑
19:40
CVPR'25 Highlight | Galaxy Walker天文学大模型:让VLM理解真实的宇宙几何
18:54
CVPR'25 Highlight | 基于真实场景自我运动的监督式声音定位
09:19
客服
顶部
赛事库 课堂 2021拜年纪