Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Howard, Razin, Noam, Narasimhan, Karthik, Chen, Danqi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization
di: Razin, Noam, et al.
Pubblicazione: (2024)
di: Razin, Noam, et al.
Pubblicazione: (2024)
RULE: Reinforcement UnLEarning Achieves Forget-Retain Pareto Optimality
di: Zhang, Chenlong, et al.
Pubblicazione: (2025)
di: Zhang, Chenlong, et al.
Pubblicazione: (2025)
How to Train Long-Context Language Models (Effectively)
di: Gao, Tianyu, et al.
Pubblicazione: (2024)
di: Gao, Tianyu, et al.
Pubblicazione: (2024)
Why is Your Language Model a Poor Implicit Reward Model?
di: Razin, Noam, et al.
Pubblicazione: (2025)
di: Razin, Noam, et al.
Pubblicazione: (2025)
Understanding Deep Learning via Notions of Rank
di: Razin, Noam
Pubblicazione: (2024)
di: Razin, Noam
Pubblicazione: (2024)
QuRating: Selecting High-Quality Data for Training Language Models
di: Wettig, Alexander, et al.
Pubblicazione: (2024)
di: Wettig, Alexander, et al.
Pubblicazione: (2024)
Sharpness-Aware Pretraining Mitigates Catastrophic Forgetting
di: Watts, Ishaan, et al.
Pubblicazione: (2026)
di: Watts, Ishaan, et al.
Pubblicazione: (2026)
The Heuristic Core: Understanding Subnetwork Generalization in Pretrained Language Models
di: Bhaskar, Adithya, et al.
Pubblicazione: (2024)
di: Bhaskar, Adithya, et al.
Pubblicazione: (2024)
SimPO: Simple Preference Optimization with a Reference-Free Reward
di: Meng, Yu, et al.
Pubblicazione: (2024)
di: Meng, Yu, et al.
Pubblicazione: (2024)
What Makes a Reward Model a Good Teacher? An Optimization Perspective
di: Razin, Noam, et al.
Pubblicazione: (2025)
di: Razin, Noam, et al.
Pubblicazione: (2025)
Forgetting to Forget: Attention Sink as A Gateway for Backdooring LLM Unlearning
di: Shang, Bingqi, et al.
Pubblicazione: (2025)
di: Shang, Bingqi, et al.
Pubblicazione: (2025)
Extracting Rule-based Descriptions of Attention Features in Transformers
di: Friedman, Dan, et al.
Pubblicazione: (2025)
di: Friedman, Dan, et al.
Pubblicazione: (2025)
Lory: Fully Differentiable Mixture-of-Experts for Autoregressive Language Model Pre-training
di: Zhong, Zexuan, et al.
Pubblicazione: (2024)
di: Zhong, Zexuan, et al.
Pubblicazione: (2024)
Mitigating Catastrophic Forgetting in Mathematical Reasoning Finetuning through Mixed Training
di: Reynolds, John Graham
Pubblicazione: (2025)
di: Reynolds, John Graham
Pubblicazione: (2025)
LESS: Selecting Influential Data for Targeted Instruction Tuning
di: Xia, Mengzhou, et al.
Pubblicazione: (2024)
di: Xia, Mengzhou, et al.
Pubblicazione: (2024)
Representing Rule-based Chatbots with Transformers
di: Friedman, Dan, et al.
Pubblicazione: (2024)
di: Friedman, Dan, et al.
Pubblicazione: (2024)
LoRA Soups: Merging LoRAs for Practical Skill Composition Tasks
di: Prabhakar, Akshara, et al.
Pubblicazione: (2024)
di: Prabhakar, Akshara, et al.
Pubblicazione: (2024)
Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning
di: Shi, Chengshuai, et al.
Pubblicazione: (2026)
di: Shi, Chengshuai, et al.
Pubblicazione: (2026)
Do LLMs Really Forget? Evaluating Unlearning with Knowledge Correlation and Confidence Awareness
di: Wei, Rongzhe, et al.
Pubblicazione: (2025)
di: Wei, Rongzhe, et al.
Pubblicazione: (2025)
Interpretability Illusions in the Generalization of Simplified Models
di: Friedman, Dan, et al.
Pubblicazione: (2023)
di: Friedman, Dan, et al.
Pubblicazione: (2023)
Language-Guided World Models: A Model-Based Approach to AI Control
di: Zhang, Alex, et al.
Pubblicazione: (2024)
di: Zhang, Alex, et al.
Pubblicazione: (2024)
Vanishing Gradients in Reinforcement Finetuning of Language Models
di: Razin, Noam, et al.
Pubblicazione: (2023)
di: Razin, Noam, et al.
Pubblicazione: (2023)
The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning
di: Zhu, Xinyu, et al.
Pubblicazione: (2025)
di: Zhu, Xinyu, et al.
Pubblicazione: (2025)
Cognitive Architectures for Language Agents
di: Sumers, Theodore R., et al.
Pubblicazione: (2023)
di: Sumers, Theodore R., et al.
Pubblicazione: (2023)
Contextual Experience Replay for Self-Improvement of Language Agents
di: Liu, Yitao, et al.
Pubblicazione: (2025)
di: Liu, Yitao, et al.
Pubblicazione: (2025)
Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection
di: Bethune, Louis, et al.
Pubblicazione: (2025)
di: Bethune, Louis, et al.
Pubblicazione: (2025)
Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning
di: Xia, Mengzhou, et al.
Pubblicazione: (2023)
di: Xia, Mengzhou, et al.
Pubblicazione: (2023)
Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training
di: Lai, Song, et al.
Pubblicazione: (2025)
di: Lai, Song, et al.
Pubblicazione: (2025)
Entropy-Adaptive Fine-Tuning: Resolving Confident Conflicts to Mitigate Forgetting
di: Diao, Muxi, et al.
Pubblicazione: (2026)
di: Diao, Muxi, et al.
Pubblicazione: (2026)
Evaluating Large Language Models at Evaluating Instruction Following
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2023)
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2023)
Elephants Never Forget: Testing Language Models for Memorization of Tabular Data
di: Bordt, Sebastian, et al.
Pubblicazione: (2024)
di: Bordt, Sebastian, et al.
Pubblicazione: (2024)
Improving Language Understanding from Screenshots
di: Gao, Tianyu, et al.
Pubblicazione: (2024)
di: Gao, Tianyu, et al.
Pubblicazione: (2024)
CURLoRA: Stable LLM Continual Fine-Tuning and Catastrophic Forgetting Mitigation
di: Fawi, Muhammad
Pubblicazione: (2024)
di: Fawi, Muhammad
Pubblicazione: (2024)
Recover-to-Forget: Gradient Reconstruction from LoRA for Efficient LLM Unlearning
di: Liu, Yezi, et al.
Pubblicazione: (2025)
di: Liu, Yezi, et al.
Pubblicazione: (2025)
Faster Transformer Decoding: N-gram Masked Self-Attention
di: Chelba, Ciprian, et al.
Pubblicazione: (2020)
di: Chelba, Ciprian, et al.
Pubblicazione: (2020)
Can Small Language Models Learn, Unlearn, and Retain Noise Patterns?
di: Scaria, Nicy, et al.
Pubblicazione: (2024)
di: Scaria, Nicy, et al.
Pubblicazione: (2024)
Detecting Pretraining Data from Large Language Models
di: Shi, Weijia, et al.
Pubblicazione: (2023)
di: Shi, Weijia, et al.
Pubblicazione: (2023)
Lecture Notes on Linear Neural Networks: A Tale of Optimization and Generalization in Deep Learning
di: Cohen, Nadav, et al.
Pubblicazione: (2024)
di: Cohen, Nadav, et al.
Pubblicazione: (2024)
PrivUn: Unveiling Latent Ripple Effects and Shallow Forgetting in Privacy Unlearning
di: Chen, Xiaoyi, et al.
Pubblicazione: (2026)
di: Chen, Xiaoyi, et al.
Pubblicazione: (2026)
QualEval: Qualitative Evaluation for Model Improvement
di: Murahari, Vishvak, et al.
Pubblicazione: (2023)
di: Murahari, Vishvak, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization
di: Razin, Noam, et al.
Pubblicazione: (2024) -
RULE: Reinforcement UnLEarning Achieves Forget-Retain Pareto Optimality
di: Zhang, Chenlong, et al.
Pubblicazione: (2025) -
How to Train Long-Context Language Models (Effectively)
di: Gao, Tianyu, et al.
Pubblicazione: (2024) -
Why is Your Language Model a Poor Implicit Reward Model?
di: Razin, Noam, et al.
Pubblicazione: (2025) -
Understanding Deep Learning via Notions of Rank
di: Razin, Noam
Pubblicazione: (2024)