Label-free steering: Compressing test-time reinforcement learning into bias-only subspaces
研究通过仅优化约10万个偏置参数并使用多数投票伪标签作为奖励,实现了在不依赖标记数据的情况下提高模型推理能力,解决了测试时强化学习需要大量参数优化的问题。
0 citationsRead paper
研究通过仅优化约10万个偏置参数并使用多数投票伪标签作为奖励,实现了在不依赖标记数据的情况下提高模型推理能力,解决了测试时强化学习需要大量参数优化的问题。
为解决机器人在SLAM图优化过程中语义记忆一致性问题,P-POSEMEM通过存储不可变事件及保留被边缘化的关键帧条件来保持对象命名一致。
研究通过无显式推理监督的专家模型训练方法,利用学生蒸馏作为探针观察隐含轨迹分布,揭示了调整选择直接影响传递给下游模型的隐式监督。
本文针对小样本移动感知研究中准确预测难及模型解释性不足的问题,提出了一种由大语言模型指导的概念集成变换器(CIT)方法。
本文研究了图中所有最小识别码共有的顶点问题,通过构造特定图族和理论分析给出了proper-min-forced顶点数量的上界,并证明了相关决策问题是co-NP难的。
研究通过仅优化约10万个偏置参数并使用多数投票伪标签作为奖励,实现了在不依赖标记数据的情况下提高模型推理能力,解决了测试时强化学习需要大量参数优化的问题。
为解决机器人在SLAM图优化过程中语义记忆一致性问题,P-POSEMEM通过存储不可变事件及保留被边缘化的关键帧条件来保持对象命名一致。
研究通过无显式推理监督的专家模型训练方法,利用学生蒸馏作为探针观察隐含轨迹分布,揭示了调整选择直接影响传递给下游模型的隐式监督。
本文针对小样本移动感知研究中准确预测难及模型解释性不足的问题,提出了一种由大语言模型指导的概念集成变换器(CIT)方法。
本文研究了图中所有最小识别码共有的顶点问题,通过构造特定图族和理论分析给出了proper-min-forced顶点数量的上界,并证明了相关决策问题是co-NP难的。