Intrinsic Value-Aligned Policy Optimization for Offline-to-Online Reinforcement Learning
{{output}}
Offline-to-online reinforcement learning (O2O RL) enables agents to leverage offline pretrained policies and efficiently adapt to target environments through limited online interactions. However, during the transition from offline training to online finetuning... ...