Ignore the KL Penalty! Boosting Exploration on Critical Tokens to Enhance RL Fine-Tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Vassoyan, Jean, Beau, Nathanaël, Plaud, Roman |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Revisiting Hierarchical Text Classification: Inference and Metrics
di: Plaud, Roman, et al.
Pubblicazione: (2024)
di: Plaud, Roman, et al.
Pubblicazione: (2024)
Reflect-RL: Two-Player Online RL Fine-Tuning for LMs
di: Zhou, Runlong, et al.
Pubblicazione: (2024)
di: Zhou, Runlong, et al.
Pubblicazione: (2024)
Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2025)
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2025)
Memory-Efficient Fine-Tuning of Transformers via Token Selection
di: Simoulin, Antoine, et al.
Pubblicazione: (2025)
di: Simoulin, Antoine, et al.
Pubblicazione: (2025)
Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMs
di: Meng, Haoming, et al.
Pubblicazione: (2026)
di: Meng, Haoming, et al.
Pubblicazione: (2026)
Offline Exploration-Aware Fine-Tuning for Long-Chain Mathematical Reasoning
di: Mu, Yongyu, et al.
Pubblicazione: (2026)
di: Mu, Yongyu, et al.
Pubblicazione: (2026)
Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models
di: Li, Pengyi, et al.
Pubblicazione: (2025)
di: Li, Pengyi, et al.
Pubblicazione: (2025)
Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning
di: Feng, Weitao, et al.
Pubblicazione: (2025)
di: Feng, Weitao, et al.
Pubblicazione: (2025)
Boosting Large Language Models with Mask Fine-Tuning
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
Generative Model for Small Molecules with Latent Space RL Fine-Tuning to Protein Targets
di: Sob, Ulrich A. Mbou, et al.
Pubblicazione: (2024)
di: Sob, Ulrich A. Mbou, et al.
Pubblicazione: (2024)
Supervised Fine-Tuning Needs to Unlock the Potential of Token Priority
di: Shen, Zhanming, et al.
Pubblicazione: (2026)
di: Shen, Zhanming, et al.
Pubblicazione: (2026)
MMICT: Boosting Multi-Modal Fine-Tuning with In-Context Examples
di: Chen, Tao, et al.
Pubblicazione: (2023)
di: Chen, Tao, et al.
Pubblicazione: (2023)
Agents Explore but Agents Ignore: LLMs Lack Environmental Curiosity
di: Engländer, Leon, et al.
Pubblicazione: (2026)
di: Engländer, Leon, et al.
Pubblicazione: (2026)
BroRL: Scaling Reinforcement Learning via Broadened Exploration
di: Hu, Jian, et al.
Pubblicazione: (2025)
di: Hu, Jian, et al.
Pubblicazione: (2025)
Improving RL Exploration for LLM Reasoning through Retrospective Replay
di: Dou, Shihan, et al.
Pubblicazione: (2025)
di: Dou, Shihan, et al.
Pubblicazione: (2025)
Exploration Hacking: Can LLMs Learn to Resist RL Training?
di: Jang, Eyon, et al.
Pubblicazione: (2026)
di: Jang, Eyon, et al.
Pubblicazione: (2026)
Enhancing BERT Fine-Tuning for Sentiment Analysis in Lower-Resourced Languages
di: Kubík, Jozef, et al.
Pubblicazione: (2025)
di: Kubík, Jozef, et al.
Pubblicazione: (2025)
Synthetic Data Generation in Low-Resource Settings via Fine-Tuning of Large Language Models
di: Kaddour, Jean, et al.
Pubblicazione: (2023)
di: Kaddour, Jean, et al.
Pubblicazione: (2023)
Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability
di: Lin, Zicheng, et al.
Pubblicazione: (2024)
di: Lin, Zicheng, et al.
Pubblicazione: (2024)
Fine-Tuning Enhances Existing Mechanisms: A Case Study on Entity Tracking
di: Prakash, Nikhil, et al.
Pubblicazione: (2024)
di: Prakash, Nikhil, et al.
Pubblicazione: (2024)
Task-Specific Directions: Definition, Exploration, and Utilization in Parameter Efficient Fine-Tuning
di: Si, Chongjie, et al.
Pubblicazione: (2024)
di: Si, Chongjie, et al.
Pubblicazione: (2024)
Anchored Supervised Fine-Tuning
di: Zhu, He, et al.
Pubblicazione: (2025)
di: Zhu, He, et al.
Pubblicazione: (2025)
Don't Ignore the Tail: Decoupling top-K Probabilities for Efficient Language Model Distillation
di: Dasgupta, Sayantan, et al.
Pubblicazione: (2026)
di: Dasgupta, Sayantan, et al.
Pubblicazione: (2026)
Attention as a Compass: Efficient Exploration for Process-Supervised RL in Reasoning Models
di: Liu, Runze, et al.
Pubblicazione: (2025)
di: Liu, Runze, et al.
Pubblicazione: (2025)
Pre-training LLM without Learning Rate Decay Enhances Supervised Fine-Tuning
di: Yano, Kazuki, et al.
Pubblicazione: (2026)
di: Yano, Kazuki, et al.
Pubblicazione: (2026)
Token-Driven GammaTune: Adaptive Calibration for Enhanced Speculative Decoding
di: Gautam, Aayush, et al.
Pubblicazione: (2025)
di: Gautam, Aayush, et al.
Pubblicazione: (2025)
Learn Hard Problems During RL with Reference Guided Fine-tuning
di: Wu, Yangzhen, et al.
Pubblicazione: (2026)
di: Wu, Yangzhen, et al.
Pubblicazione: (2026)
Is Next Token Prediction Sufficient for GPT? Exploration on Code Logic Comprehension
di: Qi, Mengnan, et al.
Pubblicazione: (2024)
di: Qi, Mengnan, et al.
Pubblicazione: (2024)
Prompt Tuning for Natural Language to SQL with Embedding Fine-Tuning and RAG
di: Jang, Jisoo, et al.
Pubblicazione: (2025)
di: Jang, Jisoo, et al.
Pubblicazione: (2025)
Low-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable Reward
di: Huang, Guanhua, et al.
Pubblicazione: (2025)
di: Huang, Guanhua, et al.
Pubblicazione: (2025)
Few Tokens, Big Leverage: Preserving Safety Alignment by Constraining Safety Tokens during Fine-tuning
di: Wang, Guoli, et al.
Pubblicazione: (2026)
di: Wang, Guoli, et al.
Pubblicazione: (2026)
Fine Tuning Methods for Low-resource Languages
di: Bakkenes, Tim, et al.
Pubblicazione: (2025)
di: Bakkenes, Tim, et al.
Pubblicazione: (2025)
UFT: Unifying Supervised and Reinforcement Fine-Tuning
di: Liu, Mingyang, et al.
Pubblicazione: (2025)
di: Liu, Mingyang, et al.
Pubblicazione: (2025)
QEFT: Quantization for Efficient Fine-Tuning of LLMs
di: Lee, Changhun, et al.
Pubblicazione: (2024)
di: Lee, Changhun, et al.
Pubblicazione: (2024)
Energy and Carbon Considerations of Fine-Tuning BERT
di: Wang, Xiaorong, et al.
Pubblicazione: (2023)
di: Wang, Xiaorong, et al.
Pubblicazione: (2023)
ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning
di: Lin, Zihan, et al.
Pubblicazione: (2026)
di: Lin, Zihan, et al.
Pubblicazione: (2026)
Enhancing Event Reasoning in Large Language Models through Instruction Fine-Tuning with Semantic Causal Graphs
di: Bethany, Mazal, et al.
Pubblicazione: (2024)
di: Bethany, Mazal, et al.
Pubblicazione: (2024)
Reject Only Critical Tokens: Pivot-Aware Speculative Decoding
di: Ziashahabi, Amir, et al.
Pubblicazione: (2025)
di: Ziashahabi, Amir, et al.
Pubblicazione: (2025)
One-Pass to Reason: Token Duplication and Block-Sparse Mask for Efficient Fine-Tuning on Multi-Turn Reasoning
di: Goru, Ritesh, et al.
Pubblicazione: (2025)
di: Goru, Ritesh, et al.
Pubblicazione: (2025)
Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation
di: Zhao, Anhao, et al.
Pubblicazione: (2026)
di: Zhao, Anhao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Revisiting Hierarchical Text Classification: Inference and Metrics
di: Plaud, Roman, et al.
Pubblicazione: (2024) -
Reflect-RL: Two-Player Online RL Fine-Tuning for LMs
di: Zhou, Runlong, et al.
Pubblicazione: (2024) -
Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2025) -
Memory-Efficient Fine-Tuning of Transformers via Token Selection
di: Simoulin, Antoine, et al.
Pubblicazione: (2025) -
Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMs
di: Meng, Haoming, et al.
Pubblicazione: (2026)