Probe-Based Data Attribution: Discovering and Mitigating Undesirable Behaviors in LLM Post-Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Xiao, Frank, Aranguri, Santiago |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Inference-Time Toxicity Mitigation in Protein Language Models
di: Burda, Manuel Fernández, et al.
Pubblicazione: (2026)
di: Burda, Manuel Fernández, et al.
Pubblicazione: (2026)
Mixed Dynamics In Linear Networks: Unifying the Lazy and Active Regimes
di: Tu, Zhenfeng, et al.
Pubblicazione: (2024)
di: Tu, Zhenfeng, et al.
Pubblicazione: (2024)
Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing
di: Li, Zhe, et al.
Pubblicazione: (2025)
di: Li, Zhe, et al.
Pubblicazione: (2025)
Who's the Evil Twin? Differential Auditing for Undesired Behavior
di: Balappanawar, Ishwar, et al.
Pubblicazione: (2025)
di: Balappanawar, Ishwar, et al.
Pubblicazione: (2025)
Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training
di: Hu, Pingbang, et al.
Pubblicazione: (2026)
di: Hu, Pingbang, et al.
Pubblicazione: (2026)
Phase-aware Training Schedule Simplifies Learning in Flow-Based Generative Models
di: Aranguri, Santiago, et al.
Pubblicazione: (2024)
di: Aranguri, Santiago, et al.
Pubblicazione: (2024)
AIM: Attributing, Interpreting, Mitigating Data Unfairness
di: Liu, Zhining, et al.
Pubblicazione: (2024)
di: Liu, Zhining, et al.
Pubblicazione: (2024)
Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning
di: Tan, Zelin, et al.
Pubblicazione: (2025)
di: Tan, Zelin, et al.
Pubblicazione: (2025)
Discovering Behavioral Predispositions in Data to Improve Human Activity Recognition
di: Popko, Maximilian, et al.
Pubblicazione: (2022)
di: Popko, Maximilian, et al.
Pubblicazione: (2022)
UNIQ: Offline Inverse Q-learning for Avoiding Undesirable Demonstrations
di: Hoang, Huy, et al.
Pubblicazione: (2024)
di: Hoang, Huy, et al.
Pubblicazione: (2024)
Efficient Ensembles Improve Training Data Attribution
di: Deng, Junwei, et al.
Pubblicazione: (2024)
di: Deng, Junwei, et al.
Pubblicazione: (2024)
Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM Units
di: Chen, Jianhui, et al.
Pubblicazione: (2026)
di: Chen, Jianhui, et al.
Pubblicazione: (2026)
Automatic Configuration of LLM Post-Training Pipelines
di: Chwa, Channe, et al.
Pubblicazione: (2026)
di: Chwa, Channe, et al.
Pubblicazione: (2026)
Learning from the Undesirable: Robust Adaptation of Language Models without Forgetting
di: Nam, Yunhun, et al.
Pubblicazione: (2025)
di: Nam, Yunhun, et al.
Pubblicazione: (2025)
PostTrainBench: Can LLM Agents Automate LLM Post-Training?
di: Rank, Ben, et al.
Pubblicazione: (2026)
di: Rank, Ben, et al.
Pubblicazione: (2026)
Zipping the Thought: When and How Compressed Reasoning Data Works in LLM Post-Training
di: Matsutani, Kohsei, et al.
Pubblicazione: (2026)
di: Matsutani, Kohsei, et al.
Pubblicazione: (2026)
Mitigating LLM Hallucination via Behaviorally Calibrated Reinforcement Learning
di: Wu, Jiayun, et al.
Pubblicazione: (2025)
di: Wu, Jiayun, et al.
Pubblicazione: (2025)
Quanda: An Interpretability Toolkit for Training Data Attribution Evaluation and Beyond
di: Bareeva, Dilyara, et al.
Pubblicazione: (2024)
di: Bareeva, Dilyara, et al.
Pubblicazione: (2024)
Learning What to Do and What Not To Do: Offline Imitation from Expert and Undesirable Demonstrations
di: Hoang, Huy, et al.
Pubblicazione: (2025)
di: Hoang, Huy, et al.
Pubblicazione: (2025)
RigorLLM: Resilient Guardrails for Large Language Models against Undesired Content
di: Yuan, Zhuowen, et al.
Pubblicazione: (2024)
di: Yuan, Zhuowen, et al.
Pubblicazione: (2024)
The Impact of Off-Policy Training Data on Probe Generalisation
di: Kirch, Nathalie, et al.
Pubblicazione: (2025)
di: Kirch, Nathalie, et al.
Pubblicazione: (2025)
Diffusion Attribution Score: Evaluating Training Data Influence in Diffusion Models
di: Lin, Jinxu, et al.
Pubblicazione: (2024)
di: Lin, Jinxu, et al.
Pubblicazione: (2024)
Distributional Training Data Attribution: What do Influence Functions Sample?
di: Mlodozeniec, Bruno, et al.
Pubblicazione: (2025)
di: Mlodozeniec, Bruno, et al.
Pubblicazione: (2025)
OptRot: Mitigating Weight Outliers via Data-Free Rotations for Post-Training Quantization
di: Gadhikar, Advait, et al.
Pubblicazione: (2025)
di: Gadhikar, Advait, et al.
Pubblicazione: (2025)
Correlation-Aware Feature Attribution Based Explainable AI
di: Sengupta, Poushali, et al.
Pubblicazione: (2025)
di: Sengupta, Poushali, et al.
Pubblicazione: (2025)
DAQ: Delta-Aware Quantization for Post-Training LLM Weight Compression
di: Yu, Xiaoming, et al.
Pubblicazione: (2026)
di: Yu, Xiaoming, et al.
Pubblicazione: (2026)
PT$^2$-LLM: Post-Training Ternarization for Large Language Models
di: Yan, Xianglong, et al.
Pubblicazione: (2025)
di: Yan, Xianglong, et al.
Pubblicazione: (2025)
Concept Influence: Leveraging Interpretability to Improve Performance and Efficiency in Training Data Attribution
di: Kowal, Matthew, et al.
Pubblicazione: (2026)
di: Kowal, Matthew, et al.
Pubblicazione: (2026)
Reducing the Probability of Undesirable Outputs in Language Models Using Probabilistic Inference
di: Zhao, Stephen, et al.
Pubblicazione: (2025)
di: Zhao, Stephen, et al.
Pubblicazione: (2025)
AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training
di: Han, Zhenyu, et al.
Pubblicazione: (2025)
di: Han, Zhenyu, et al.
Pubblicazione: (2025)
DVPO: Distributional Value Modeling-based Policy Optimization for LLM Post-Training
di: Zhu, Dingwei, et al.
Pubblicazione: (2025)
di: Zhu, Dingwei, et al.
Pubblicazione: (2025)
GUDA: Counterfactual Group-wise Training Data Attribution for Diffusion Models via Unlearning
di: Murata, Naoki, et al.
Pubblicazione: (2026)
di: Murata, Naoki, et al.
Pubblicazione: (2026)
Measuring and Mitigating Bias for Tabular Datasets with Multiple Protected Attributes
di: Duong, Manh Khoi, et al.
Pubblicazione: (2024)
di: Duong, Manh Khoi, et al.
Pubblicazione: (2024)
Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training
di: Lai, Song, et al.
Pubblicazione: (2025)
di: Lai, Song, et al.
Pubblicazione: (2025)
Explanova: Automatically Discover Data Insights in N \times M Table via XAI Combined LLM Workflow
di: Huang, Yiming
Pubblicazione: (2026)
di: Huang, Yiming
Pubblicazione: (2026)
TaylorPODA: A Taylor Expansion-Based Method to Improve Post-Hoc Attributions for Opaque Models
di: Tang, Yuchi, et al.
Pubblicazione: (2025)
di: Tang, Yuchi, et al.
Pubblicazione: (2025)
Adaptive Repetition for Mitigating Position Bias in LLM-Based Ranking
di: Vardasbi, Ali, et al.
Pubblicazione: (2025)
di: Vardasbi, Ali, et al.
Pubblicazione: (2025)
Post-Training with Policy Gradients: Optimality and the Base Model Barrier
di: Mousavi-Hosseini, Alireza, et al.
Pubblicazione: (2026)
di: Mousavi-Hosseini, Alireza, et al.
Pubblicazione: (2026)
Astro: Activation-guided Structured Regularization for Outlier-Robust LLM Post-Training Quantization
di: Chen, Xi, et al.
Pubblicazione: (2026)
di: Chen, Xi, et al.
Pubblicazione: (2026)
Front-Loading Reasoning: The Synergy between Pretraining and Post-Training Data
di: Akter, Syeda Nahida, et al.
Pubblicazione: (2025)
di: Akter, Syeda Nahida, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Inference-Time Toxicity Mitigation in Protein Language Models
di: Burda, Manuel Fernández, et al.
Pubblicazione: (2026) -
Mixed Dynamics In Linear Networks: Unifying the Lazy and Active Regimes
di: Tu, Zhenfeng, et al.
Pubblicazione: (2024) -
Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing
di: Li, Zhe, et al.
Pubblicazione: (2025) -
Who's the Evil Twin? Differential Auditing for Undesired Behavior
di: Balappanawar, Ishwar, et al.
Pubblicazione: (2025) -
Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training
di: Hu, Pingbang, et al.
Pubblicazione: (2026)