CAM: Question Answering on Entity-Centric Videos with Continuous Extraction and Adaptive Querying
本文针对长视频问答中高层次语义捕捉及细粒度细节检索问题,提出CAM方法,通过连续提取和自适应查询提升多模态大模型的性能。
0 citationsRead paper
本文针对长视频问答中高层次语义捕捉及细粒度细节检索问题,提出CAM方法,通过连续提取和自适应查询提升多模态大模型的性能。
为解决视觉运动策略在物体位置和视角同时变化时失效的问题,提出MemCorr-DP方法,通过将参考轨迹与当前场景的3D关系显式化来指导扩散策略。
本文针对长视频问答中高层次语义捕捉及细粒度细节检索问题,提出CAM方法,通过连续提取和自适应查询提升多模态大模型的性能。
为解决视觉运动策略在物体位置和视角同时变化时失效的问题,提出MemCorr-DP方法,通过将参考轨迹与当前场景的3D关系显式化来指导扩散策略。