AgenticRag-R1: Agentic Reinforcement Learning with Stack Memory for Multi-Step Reasoning, Retrieval and Memorizing

📅 2026-08-30
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
本文针对多步推理中自适应检索和上下文连续修正难题,提出AgenticRag-R1框架,通过堆栈记忆与细粒度动作空间结合强化学习方法解决。
📝 Abstract
Retrieval-Augmented Generation (RAG) improves the factuality of large language models (LLMs), yet existing RAG systems often struggle with complex, multi-step reasoning that requires adaptive retrieval and continuous revision of intermediate contexts. Recent reinforcement learning (RL)-based agentic RAG methods partially alleviate this issue, but typically rely on coarse-grained action spaces and trajectory-level rewards, resulting in weak reward assignment and a bias toward short-horizon, stereotyped reasoning template. To address, we propose AgenticRag-R1, a RL framework that deeply integrates reasoning, retrieval, and memory via a memory stack and fine-grained action space, supported by hierarchical action-aware rewards and an information-aware trajectory rejection strategy to enable effective long-horizon learning. Experiments across a diverse set of multi-hop, open-domain, and agentic reasoning benchmarks, spanning multiple backbone model sizes, demonstrate that AgenticRag-R1 consistently outperforms strong baselines. Moreover, AgenticRag-R1 learns more robust, interpretable, and memory-aware reasoning behaviors, highlighting the effect of fine-grained action modeling and information-aware optimization for long-horizon reasoning. Our code is anonymous available at https://github.com/jiangxinke/Harness-RL/tree/AgenticRAG-R1-Whitebox.
Problem

Research questions and friction points this paper is trying to address.

Retrieval-Augmented Generation
Reinforcement Learning
Multi-Step Reasoning
Adaptive Retrieval
Memory Stack
Innovation

Methods, ideas, or system contributions that make the work stand out.

Stack Memory
Fine-grained Action Space
Hierarchical Action-aware Rewards
Information-aware Trajectory Rejection Strategy
X
Xinke Jiang
National Engineering Research Center of Software Engineering, Peking University, Beijing, China; School of Computer Science, Peking University, Beijing, China; Key Laboratory of High Confidence Software Technologies, Ministry of Education, Beijing, China
Y
Yue Fang
National Engineering Research Center of Software Engineering, Peking University, Beijing, China; School of Computer Science, Peking University, Beijing, China; Key Laboratory of High Confidence Software Technologies, Ministry of Education, Beijing, China
Z
Zhibang Yang
National Engineering Research Center of Software Engineering, Peking University, Beijing, China; School of Computer Science, Peking University, Beijing, China; Key Laboratory of High Confidence Software Technologies, Ministry of Education, Beijing, China
J
Jiaran Gao
National Engineering Research Center of Software Engineering, Peking University, Beijing, China; School of Computer Science, Peking University, Beijing, China; Key Laboratory of High Confidence Software Technologies, Ministry of Education, Beijing, China
Zhixin Zhang
Zhixin Zhang
Ph.D of Robotics, University of Manchester
SLAMVINSLIOSensor FusionRobotics
Tao Feng
Tao Feng
National Engineering Research Center of Software Engineering, Peking University, Beijing, China
R
Rihong Qiu
National Engineering Research Center of Software Engineering, Peking University, Beijing, China; School of Computer Science, Peking University, Beijing, China; Key Laboratory of High Confidence Software Technologies, Ministry of Education, Beijing, China
Wentao Zhang
Wentao Zhang
Institute of Physics, Chinese Academy of Sciences
photoemissionsuperconductivitycupratehtsctime-resolved
H
Hongxin Ding
National Engineering Research Center of Software Engineering, Peking University, Beijing, China; School of Computer Science, Peking University, Beijing, China
Ruizhe Zhang
Ruizhe Zhang
Purdue University
Quantum computingOptimizationMachine learningComplexity theory
Yongxin Xu
Yongxin Xu
Peking University
Large Language ModelsKnowledge GraphsElectronic Medical Record Analysis
Yuheng Huang
Yuheng Huang
Cedars-Sinai Medical Center
CMR
Xu Chu
Xu Chu
Peking University
Machine learningData mining
Junfeng Zhao
Junfeng Zhao
Assistant Professor at Arizona State University, Director of BELIV Lab
Connected & Automated VehicleMotion Planning & ControlsElectric VehiclesAI/ML
Y
Yasha Wang
National Engineering Research Center of Software Engineering, Peking University, Beijing, China; Peking University Information Technology Institute (Tianjin Binhai), Tianjin, China