Abstract:Recent advances in learning decision-making policies can largely be attributed to training expressive policy models, largely via imitation learning. While imitation learning discards non-expert data, reinforcement learning (RL) can still learn from suboptimal data. However, instantiating RL training of a new policy class often presents a different challenge: most deep RL machinery is co-developed with assumptions on the policy class and backbone, resulting in poor performance when the policy class changes. For instance, SAC utilizes a low-variance reparameterization policy gradient for Gaussian policies, but this is unstable for diffusion policies and intractable for autoregressive categorical policies. To address this issue, we develop an offline RL and online fine-tuning approach called policy-agnostic RL (PA-RL) that can effectively train multiple policy classes, with varying architectures and sizes. We build off the basic idea that a universal supervised learning loss can replace the policy improvement step in RL, as long as it is applied on "optimized" actions. To obtain these optimized actions, we first sample multiple actions from a base policy, and run global optimization (i.e., re-ranking multiple action samples using the Q-function) and local optimization (i.e., running gradient steps on an action sample) to maximize the critic on these candidates. PA-RL enables fine-tuning diffusion and transformer policies with either autoregressive tokens or continuous action outputs, at different sizes, entirely via actor-critic RL. Moreover, PA-RL improves the performance and sample-efficiency by up to 2 times compared to existing offline RL and online fine-tuning methods. We show the first result that successfully fine-tunes OpenVLA, a 7B generalist robot policy, autonomously with Cal-QL, an online RL fine-tuning algorithm, improving from 40% to 70% in the real world in 40 minutes.

Off-policy Evaluation for Tabular Reinforcement Learning with Synthetic Trajectories

Offline Policy Evaluation for Reinforcement Learning with Adaptively Collected Data

Reliable Off-policy Evaluation for Reinforcement Learning

Robust On-Policy Sampling for Data-Efficient Policy Evaluation in Reinforcement Learning

Policy-regularized Offline Multi-objective Reinforcement Learning

Reward-agnostic Fine-tuning: Provable Statistical Benefits of Hybrid Reinforcement Learning

Efficient Reinforcement Learning Through Trajectory Generation

Harnessing Mixed Offline Reinforcement Learning Datasets via Trajectory Weighting

Offline Reinforcement Learning: Role of State Aggregation and Trajectory Data

Matrix Estimation for Offline Reinforcement Learning with Low-Rank Structure

Efficient Online Reinforcement Learning with Offline Data

Using Offline Data to Speed-up Reinforcement Learning in Procedurally Generated Environments

Off-Policy RL Algorithms Can be Sample-Efficient for Continuous Control via Sample Multiple Reuse

Interpretable performance analysis towards offline reinforcement learning: A dataset perspective

Efficient Policy Evaluation with Offline Data Informed Behavior Policy Design

Robust Offline Reinforcement Learning from Low-Quality Data

Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone

Offline Reinforcement Learning via High-Fidelity Generative Behavior Modeling

Expert-Supervised Reinforcement Learning for Offline Policy Learning and Evaluation

Safe Offline Reinforcement Learning with Real-Time Budget Constraints

Efficient Evaluation of Natural Stochastic Policies in Offline Reinforcement Learning