VLX-VR: An Agentic-Aware Video Reasoning Model
该研究提出VLX-VR模型,通过强化学习训练以解决视频理解中证据获取和利用的问题,实现对多模态数据的高效推理。
0 citationsRead paper
该研究提出VLX-VR模型,通过强化学习训练以解决视频理解中证据获取和利用的问题,实现对多模态数据的高效推理。
本文针对多轮工具调用中的校准问题,提出了一种基于动作类别的诊断框架,通过分解失败模式为动作类别校准错误和执行失败来提高评估准确性。
该研究提出VLX-VR模型,通过强化学习训练以解决视频理解中证据获取和利用的问题,实现对多模态数据的高效推理。
本文针对多轮工具调用中的校准问题,提出了一种基于动作类别的诊断框架,通过分解失败模式为动作类别校准错误和执行失败来提高评估准确性。