Activation Gradient based Poisoned Sample Detection Against Backdoor Attacks
International Conference on Learning Representations, 2025
Abstract
This paper introduces Activation Gradient based Poisoned sample Detection (AGPD), which uses the circular distribution of activation gradients to identify target classes and separate poisoned samples from clean ones. Experiments across diverse backdoor settings demonstrate its generality and effectiveness.
Citation
Yuan, Danni, Shaokui Wei, Mingda Zhang, Li Liu, and Baoyuan Wu. "Activation Gradient based Poisoned Sample Detection Against Backdoor Attacks." ICLR, 2025.
