Advantage-level Aggregation Reinforcement Learning for X-point Target Magnetic Configuration Control in an EXL-50U Experiment-Calibrated Simulation Environment

📅 2026-08-21
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
为解决紧凑型高功率托卡马克中偏滤器热负荷管理问题,采用优势聚合强化学习方法控制X点目标磁构形,在EXL-50U实验校准的模拟环境中实现高效反馈控制。
📝 Abstract
Managing divertor heat loads is a central challenge for compact, high-power tokamaks. To increase local flux expansion and decouple the dissipation volume from the core, EHL-2 adopts the X-point target (XPT) divertor. This requires the secondary X-point to remain on the divertor leg; displacement degrades the topology and exhaust geometry. Current experiments, including EXL-50U discharges, rely on precomputed feedforward waveforms with PID loops on global quantities. Lacking dedicated closed-loop feedback for the secondary null, XPT operation is repeatable but not routine. We formulate XPT feedback as a multi-objective reinforcement learning (RL) control problem in a free-boundary environment calibrated to EXL-50U discharge #13906. To address strong coupling among plasma current, shape, and null constraints - where reward scalarisation collapses objective-specific temporal credit - we develop Advantage Aggregation (AdvA). AdvA preserves objective-wise temporal credit before worst-objective-aware nonlinear scalarisation and introduces a residual correction to policy updates. AdvA-PPO is evaluated against Reward-PPO and a feedforward-plus-PID baseline under nominal operation, measurement uncertainties, and unseen initial equilibria. On a 500 ms rollout, AdvA-PPO raises the mean worst-channel score from 0.23 to 0.81 over Reward-PPO, reducing X-point flux RMSE by ~20x. Under combined measurement uncertainties, it is the only learned controller completing the horizon while retaining a usable XPT shape. Multi-initialization fine-tuning enables a single AdvA-PPO policy to complete full-horizon operation across divertor and limiter initial equilibria. These results provide a simulation-based foundation for future real-time XPT validation on EXL-50U.
Problem

Research questions and friction points this paper is trying to address.

divertor heat loads
X-point target
closed-loop feedback
plasma current
shape control
Innovation

Methods, ideas, or system contributions that make the work stand out.

Advantage Aggregation
Multi-objective Reinforcement Learning
X-point Target Control
EXL-50U
Temporal Credit
🔎 Similar Papers
No similar papers found.
Siqi Ding
Siqi Ding
Beijing ENN Fusion Energy Science and Technology Co., Ltd., Beijing 101111, China; Beijing Key Laboratory of High Magnetic Field Spherical Torus Fusion Energy, Beijing 101111, China; Hebei Key Laboratory of Compact Fusion, Langfang 065000, China
X
Xuanhe Wang
Beijing ENN Fusion Energy Science and Technology Co., Ltd., Beijing 101111, China; Beijing Key Laboratory of High Magnetic Field Spherical Torus Fusion Energy, Beijing 101111, China; Hebei Key Laboratory of Compact Fusion, Langfang 065000, China
Pei Guo
Pei Guo
Soochow University
LLMsNatural Language Generation
G
Guoyang Shi
Beijing ENN Fusion Energy Science and Technology Co., Ltd., Beijing 101111, China; Beijing Key Laboratory of High Magnetic Field Spherical Torus Fusion Energy, Beijing 101111, China; Hebei Key Laboratory of Compact Fusion, Langfang 065000, China
C
Changquan Yu
School of Nuclear Science and Engineering, East China University of Technology, Nanchang 330013, Jiangxi, China
Yiting Wang
Yiting Wang
Graduate Student, University of Maryland
AI for EDAHardware Security
X
Xianming Song
Beijing ENN Fusion Energy Science and Technology Co., Ltd., Beijing 101111, China; Beijing Key Laboratory of High Magnetic Field Spherical Torus Fusion Energy, Beijing 101111, China; Hebei Key Laboratory of Compact Fusion, Langfang 065000, China
Xiang Gu
Xiang Gu
Xi'an Jiaotong University
transfer learningoptimal transportgenerative models
Z
Zhengyuan Chen
Beijing ENN Fusion Energy Science and Technology Co., Ltd., Beijing 101111, China; Beijing Key Laboratory of High Magnetic Field Spherical Torus Fusion Energy, Beijing 101111, China; Hebei Key Laboratory of Compact Fusion, Langfang 065000, China
Lei Xing
Lei Xing
stanford university
Y
Yapeng Zhang
Beijing ENN Fusion Energy Science and Technology Co., Ltd., Beijing 101111, China; Beijing Key Laboratory of High Magnetic Field Spherical Torus Fusion Energy, Beijing 101111, China; Hebei Key Laboratory of Compact Fusion, Langfang 065000, China
J
Jianguo Chen
Beijing ENN Fusion Energy Science and Technology Co., Ltd., Beijing 101111, China; Beijing Key Laboratory of High Magnetic Field Spherical Torus Fusion Energy, Beijing 101111, China; Hebei Key Laboratory of Compact Fusion, Langfang 065000, China
Tianyuan Liu
Tianyuan Liu
Donghua University
Welding AutomationComputer VisionDeep Learningand Intelligent Manufacturing Systems