Score: 1

Optimal Perturbation Budget Allocation for Data Poisoning in Offline Reinforcement Learning

Published: December 9, 2025 | arXiv ID: 2512.08485v1

By: Junnan Qiu, Jie Li

Potential Business Impact:

Tricks AI into making bad choices from old data.

Business Areas:

A/B Testing Data and Analytics

Offline Reinforcement Learning (RL) enables policy optimization from static datasets but is inherently vulnerable to data poisoning attacks. Existing attack strategies typically rely on locally uniform perturbations, which treat all samples indiscriminately. This approach is inefficient, as it wastes the perturbation budget on low-impact samples, and lacks stealthiness due to significant statistical deviations. In this paper, we propose a novel Global Budget Allocation attack strategy. Leveraging the theoretical insight that a sample's influence on value function convergence is proportional to its Temporal Difference (TD) error, we formulate the attack as a global resource allocation problem. We derive a closed-form solution where perturbation magnitudes are assigned proportional to the TD-error sensitivity under a global L2 constraint. Empirical results on D4RL benchmarks demonstrate that our method significantly outperforms baseline strategies, achieving up to 80% performance degradation with minimal perturbations that evade detection by state-of-the-art statistical and spectral defenses.

Exposing Vulnerabilities in RL: A Novel Stealthy Backdoor Attack through Reward Poisoning

Cryptography and Security

Makes AI agents learn bad habits secretly.

27 Nov 2025 0

86%

On Robustness of Linear Classifiers to Targeted Data Poisoning

Machine Learning (CS)

Finds fake data that tricks computer learning.

16 Nov 2025 2

86%

Provably Near-Optimal Distributionally Robust Reinforcement Learning in Online Settings

Machine Learning (CS)

Teaches robots to work safely in new places.

5 Aug 2025 0

View PDF Login to Bookmark

Country of Origin

🇨🇳 China

Page Count

6 pages

Optimal Perturbation Budget Allocation for Data Poisoning in Offline Reinforcement Learning

Tricks AI into making bad choices from old data.

Technical Abstract

Exposing Vulnerabilities in RL: A Novel Stealthy Backdoor Attack through Reward Poisoning

On Robustness of Linear Classifiers to Targeted Data Poisoning

Provably Near-Optimal Distributionally Robust Reinforcement Learning in Online Settings