Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Feng, Weitao, Wang, Lixu, Lv, Peizhuo, Wei, Tianyi, Zhang, Jie, Gao, Chongyang, Zhan, Sinong, Dong, Wei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMs
von: Meng, Haoming, et al.
Veröffentlicht: (2026)
von: Meng, Haoming, et al.
Veröffentlicht: (2026)
Efficient Differentially Private Fine-Tuning of LLMs via Reinforcement Learning
von: Khadangi, Afshin, et al.
Veröffentlicht: (2025)
von: Khadangi, Afshin, et al.
Veröffentlicht: (2025)
Parameter-Efficient Fine-Tuning for Foundation Models
von: Zhang, Dan, et al.
Veröffentlicht: (2025)
von: Zhang, Dan, et al.
Veröffentlicht: (2025)
DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards
von: Zhang, Kaiyi, et al.
Veröffentlicht: (2026)
von: Zhang, Kaiyi, et al.
Veröffentlicht: (2026)
Supervised Fine-Tuning as Inverse Reinforcement Learning
von: Sun, Hao
Veröffentlicht: (2024)
von: Sun, Hao
Veröffentlicht: (2024)
Eliciting Harmful Capabilities by Fine-Tuning On Safeguarded Outputs
von: Kaunismaa, Jackson, et al.
Veröffentlicht: (2026)
von: Kaunismaa, Jackson, et al.
Veröffentlicht: (2026)
Teaching LLMs How to Learn with Contextual Fine-Tuning
von: Choi, Younwoo, et al.
Veröffentlicht: (2025)
von: Choi, Younwoo, et al.
Veröffentlicht: (2025)
Memory-Efficient Fine-Tuning of Transformers via Token Selection
von: Simoulin, Antoine, et al.
Veröffentlicht: (2025)
von: Simoulin, Antoine, et al.
Veröffentlicht: (2025)
Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training
von: Lai, Song, et al.
Veröffentlicht: (2025)
von: Lai, Song, et al.
Veröffentlicht: (2025)
Threshold Filtering Packing for Supervised Fine-Tuning: Training Related Samples within Packs
von: Dong, Jiancheng, et al.
Veröffentlicht: (2024)
von: Dong, Jiancheng, et al.
Veröffentlicht: (2024)
QEFT: Quantization for Efficient Fine-Tuning of LLMs
von: Lee, Changhun, et al.
Veröffentlicht: (2024)
von: Lee, Changhun, et al.
Veröffentlicht: (2024)
CoMoE: Contrastive Representation for Mixture-of-Experts in Parameter-Efficient Fine-tuning
von: Feng, Jinyuan, et al.
Veröffentlicht: (2025)
von: Feng, Jinyuan, et al.
Veröffentlicht: (2025)
UFT: Unifying Supervised and Reinforcement Fine-Tuning
von: Liu, Mingyang, et al.
Veröffentlicht: (2025)
von: Liu, Mingyang, et al.
Veröffentlicht: (2025)
Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control
von: Zhang, Jiazheng, et al.
Veröffentlicht: (2026)
von: Zhang, Jiazheng, et al.
Veröffentlicht: (2026)
Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning
von: Liu, Hanbing, et al.
Veröffentlicht: (2025)
von: Liu, Hanbing, et al.
Veröffentlicht: (2025)
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
Supervised Fine-Tuning Needs to Unlock the Potential of Token Priority
von: Shen, Zhanming, et al.
Veröffentlicht: (2026)
von: Shen, Zhanming, et al.
Veröffentlicht: (2026)
MoRA: High-Rank Updating for Parameter-Efficient Fine-Tuning
von: Jiang, Ting, et al.
Veröffentlicht: (2024)
von: Jiang, Ting, et al.
Veröffentlicht: (2024)
EBFT: Effective and Block-Wise Fine-Tuning for Sparse LLMs
von: Guo, Song, et al.
Veröffentlicht: (2024)
von: Guo, Song, et al.
Veröffentlicht: (2024)
Prompting and Fine-Tuning of Small LLMs for Length-Controllable Telephone Call Summarization
von: Thulke, David, et al.
Veröffentlicht: (2024)
von: Thulke, David, et al.
Veröffentlicht: (2024)
Silence the Judge: Reinforcement Learning with Self-Verifier via Latent Geometric Clustering
von: Zhang, Nonghai, et al.
Veröffentlicht: (2026)
von: Zhang, Nonghai, et al.
Veröffentlicht: (2026)
PocketLLM: Enabling On-Device Fine-Tuning for Personalized LLMs
von: Peng, Dan, et al.
Veröffentlicht: (2024)
von: Peng, Dan, et al.
Veröffentlicht: (2024)
Ignore the KL Penalty! Boosting Exploration on Critical Tokens to Enhance RL Fine-Tuning
von: Vassoyan, Jean, et al.
Veröffentlicht: (2025)
von: Vassoyan, Jean, et al.
Veröffentlicht: (2025)
Iterative Self-Tuning LLMs for Enhanced Jailbreaking Capabilities
von: Sun, Chung-En, et al.
Veröffentlicht: (2024)
von: Sun, Chung-En, et al.
Veröffentlicht: (2024)
Reinforcement Learning without Human Feedback for Last Mile Fine-Tuning of Large Language Models
von: Solway, Alec
Veröffentlicht: (2024)
von: Solway, Alec
Veröffentlicht: (2024)
Investigating and Alleviating Harm Amplification in LLM Interactions
von: Guo, Ruohao, et al.
Veröffentlicht: (2026)
von: Guo, Ruohao, et al.
Veröffentlicht: (2026)
Simplify-This: A Comparative Analysis of Prompt-Based and Fine-Tuned LLMs
von: Cohen, Eilam, et al.
Veröffentlicht: (2026)
von: Cohen, Eilam, et al.
Veröffentlicht: (2026)
SAFT: Structure-Aware Fine-Tuning of LLMs for AMR-to-Text Generation
von: Kamel, Rafiq, et al.
Veröffentlicht: (2025)
von: Kamel, Rafiq, et al.
Veröffentlicht: (2025)
Fine-Tuning or Retrieval? Comparing Knowledge Injection in LLMs
von: Ovadia, Oded, et al.
Veröffentlicht: (2023)
von: Ovadia, Oded, et al.
Veröffentlicht: (2023)
Enhancing the Code Reasoning Capabilities of LLMs via Consistency-based Reinforcement Learning
von: Qin, Zhanyue, et al.
Veröffentlicht: (2026)
von: Qin, Zhanyue, et al.
Veröffentlicht: (2026)
Triplets Better Than Pairs: Towards Stable and Effective Self-Play Fine-Tuning for LLMs
von: Wang, Yibo, et al.
Veröffentlicht: (2026)
von: Wang, Yibo, et al.
Veröffentlicht: (2026)
Can LLMs Speak For Diverse People? Tuning LLMs via Debate to Generate Controllable Controversial Statements
von: Li, Ming, et al.
Veröffentlicht: (2024)
von: Li, Ming, et al.
Veröffentlicht: (2024)
Reinforcement Learning Enhanced LLMs: A Survey
von: Wang, Shuhe, et al.
Veröffentlicht: (2024)
von: Wang, Shuhe, et al.
Veröffentlicht: (2024)
DPO Meets PPO: Reinforced Token Optimization for RLHF
von: Zhong, Han, et al.
Veröffentlicht: (2024)
von: Zhong, Han, et al.
Veröffentlicht: (2024)
Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization
von: Adams, Carter, et al.
Veröffentlicht: (2026)
von: Adams, Carter, et al.
Veröffentlicht: (2026)
Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling
von: Huang, Zeyu, et al.
Veröffentlicht: (2025)
von: Huang, Zeyu, et al.
Veröffentlicht: (2025)
Filtering Beats Fine Tuning: A Bayesian Kalman View of In Context Learning in LLMs
von: Kiruluta, Andrew
Veröffentlicht: (2026)
von: Kiruluta, Andrew
Veröffentlicht: (2026)
Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration
von: Deng, Wenhao, et al.
Veröffentlicht: (2025)
von: Deng, Wenhao, et al.
Veröffentlicht: (2025)
EMORL: Ensemble Multi-Objective Reinforcement Learning for Efficient and Flexible LLM Fine-Tuning
von: Kong, Lingxiao, et al.
Veröffentlicht: (2025)
von: Kong, Lingxiao, et al.
Veröffentlicht: (2025)
Meta-Tuning LLMs to Leverage Lexical Knowledge for Generalizable Language Style Understanding
von: Guo, Ruohao, et al.
Veröffentlicht: (2023)
von: Guo, Ruohao, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMs
von: Meng, Haoming, et al.
Veröffentlicht: (2026) -
Efficient Differentially Private Fine-Tuning of LLMs via Reinforcement Learning
von: Khadangi, Afshin, et al.
Veröffentlicht: (2025) -
Parameter-Efficient Fine-Tuning for Foundation Models
von: Zhang, Dan, et al.
Veröffentlicht: (2025) -
DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards
von: Zhang, Kaiyi, et al.
Veröffentlicht: (2026) -
Supervised Fine-Tuning as Inverse Reinforcement Learning
von: Sun, Hao
Veröffentlicht: (2024)