Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Howard, Razin, Noam, Narasimhan, Karthik, Chen, Danqi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization
por: Razin, Noam, et al.
Publicado: (2024)
por: Razin, Noam, et al.
Publicado: (2024)
RULE: Reinforcement UnLEarning Achieves Forget-Retain Pareto Optimality
por: Zhang, Chenlong, et al.
Publicado: (2025)
por: Zhang, Chenlong, et al.
Publicado: (2025)
How to Train Long-Context Language Models (Effectively)
por: Gao, Tianyu, et al.
Publicado: (2024)
por: Gao, Tianyu, et al.
Publicado: (2024)
Why is Your Language Model a Poor Implicit Reward Model?
por: Razin, Noam, et al.
Publicado: (2025)
por: Razin, Noam, et al.
Publicado: (2025)
Understanding Deep Learning via Notions of Rank
por: Razin, Noam
Publicado: (2024)
por: Razin, Noam
Publicado: (2024)
QuRating: Selecting High-Quality Data for Training Language Models
por: Wettig, Alexander, et al.
Publicado: (2024)
por: Wettig, Alexander, et al.
Publicado: (2024)
Sharpness-Aware Pretraining Mitigates Catastrophic Forgetting
por: Watts, Ishaan, et al.
Publicado: (2026)
por: Watts, Ishaan, et al.
Publicado: (2026)
The Heuristic Core: Understanding Subnetwork Generalization in Pretrained Language Models
por: Bhaskar, Adithya, et al.
Publicado: (2024)
por: Bhaskar, Adithya, et al.
Publicado: (2024)
SimPO: Simple Preference Optimization with a Reference-Free Reward
por: Meng, Yu, et al.
Publicado: (2024)
por: Meng, Yu, et al.
Publicado: (2024)
What Makes a Reward Model a Good Teacher? An Optimization Perspective
por: Razin, Noam, et al.
Publicado: (2025)
por: Razin, Noam, et al.
Publicado: (2025)
Forgetting to Forget: Attention Sink as A Gateway for Backdooring LLM Unlearning
por: Shang, Bingqi, et al.
Publicado: (2025)
por: Shang, Bingqi, et al.
Publicado: (2025)
Extracting Rule-based Descriptions of Attention Features in Transformers
por: Friedman, Dan, et al.
Publicado: (2025)
por: Friedman, Dan, et al.
Publicado: (2025)
Lory: Fully Differentiable Mixture-of-Experts for Autoregressive Language Model Pre-training
por: Zhong, Zexuan, et al.
Publicado: (2024)
por: Zhong, Zexuan, et al.
Publicado: (2024)
Mitigating Catastrophic Forgetting in Mathematical Reasoning Finetuning through Mixed Training
por: Reynolds, John Graham
Publicado: (2025)
por: Reynolds, John Graham
Publicado: (2025)
LESS: Selecting Influential Data for Targeted Instruction Tuning
por: Xia, Mengzhou, et al.
Publicado: (2024)
por: Xia, Mengzhou, et al.
Publicado: (2024)
Representing Rule-based Chatbots with Transformers
por: Friedman, Dan, et al.
Publicado: (2024)
por: Friedman, Dan, et al.
Publicado: (2024)
LoRA Soups: Merging LoRAs for Practical Skill Composition Tasks
por: Prabhakar, Akshara, et al.
Publicado: (2024)
por: Prabhakar, Akshara, et al.
Publicado: (2024)
Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning
por: Shi, Chengshuai, et al.
Publicado: (2026)
por: Shi, Chengshuai, et al.
Publicado: (2026)
Do LLMs Really Forget? Evaluating Unlearning with Knowledge Correlation and Confidence Awareness
por: Wei, Rongzhe, et al.
Publicado: (2025)
por: Wei, Rongzhe, et al.
Publicado: (2025)
Interpretability Illusions in the Generalization of Simplified Models
por: Friedman, Dan, et al.
Publicado: (2023)
por: Friedman, Dan, et al.
Publicado: (2023)
Language-Guided World Models: A Model-Based Approach to AI Control
por: Zhang, Alex, et al.
Publicado: (2024)
por: Zhang, Alex, et al.
Publicado: (2024)
Vanishing Gradients in Reinforcement Finetuning of Language Models
por: Razin, Noam, et al.
Publicado: (2023)
por: Razin, Noam, et al.
Publicado: (2023)
The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning
por: Zhu, Xinyu, et al.
Publicado: (2025)
por: Zhu, Xinyu, et al.
Publicado: (2025)
Cognitive Architectures for Language Agents
por: Sumers, Theodore R., et al.
Publicado: (2023)
por: Sumers, Theodore R., et al.
Publicado: (2023)
Contextual Experience Replay for Self-Improvement of Language Agents
por: Liu, Yitao, et al.
Publicado: (2025)
por: Liu, Yitao, et al.
Publicado: (2025)
Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection
por: Bethune, Louis, et al.
Publicado: (2025)
por: Bethune, Louis, et al.
Publicado: (2025)
Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning
por: Xia, Mengzhou, et al.
Publicado: (2023)
por: Xia, Mengzhou, et al.
Publicado: (2023)
Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training
por: Lai, Song, et al.
Publicado: (2025)
por: Lai, Song, et al.
Publicado: (2025)
Entropy-Adaptive Fine-Tuning: Resolving Confident Conflicts to Mitigate Forgetting
por: Diao, Muxi, et al.
Publicado: (2026)
por: Diao, Muxi, et al.
Publicado: (2026)
Evaluating Large Language Models at Evaluating Instruction Following
por: Zeng, Zhiyuan, et al.
Publicado: (2023)
por: Zeng, Zhiyuan, et al.
Publicado: (2023)
Elephants Never Forget: Testing Language Models for Memorization of Tabular Data
por: Bordt, Sebastian, et al.
Publicado: (2024)
por: Bordt, Sebastian, et al.
Publicado: (2024)
Improving Language Understanding from Screenshots
por: Gao, Tianyu, et al.
Publicado: (2024)
por: Gao, Tianyu, et al.
Publicado: (2024)
CURLoRA: Stable LLM Continual Fine-Tuning and Catastrophic Forgetting Mitigation
por: Fawi, Muhammad
Publicado: (2024)
por: Fawi, Muhammad
Publicado: (2024)
Recover-to-Forget: Gradient Reconstruction from LoRA for Efficient LLM Unlearning
por: Liu, Yezi, et al.
Publicado: (2025)
por: Liu, Yezi, et al.
Publicado: (2025)
Faster Transformer Decoding: N-gram Masked Self-Attention
por: Chelba, Ciprian, et al.
Publicado: (2020)
por: Chelba, Ciprian, et al.
Publicado: (2020)
Can Small Language Models Learn, Unlearn, and Retain Noise Patterns?
por: Scaria, Nicy, et al.
Publicado: (2024)
por: Scaria, Nicy, et al.
Publicado: (2024)
Detecting Pretraining Data from Large Language Models
por: Shi, Weijia, et al.
Publicado: (2023)
por: Shi, Weijia, et al.
Publicado: (2023)
Lecture Notes on Linear Neural Networks: A Tale of Optimization and Generalization in Deep Learning
por: Cohen, Nadav, et al.
Publicado: (2024)
por: Cohen, Nadav, et al.
Publicado: (2024)
PrivUn: Unveiling Latent Ripple Effects and Shallow Forgetting in Privacy Unlearning
por: Chen, Xiaoyi, et al.
Publicado: (2026)
por: Chen, Xiaoyi, et al.
Publicado: (2026)
QualEval: Qualitative Evaluation for Model Improvement
por: Murahari, Vishvak, et al.
Publicado: (2023)
por: Murahari, Vishvak, et al.
Publicado: (2023)
Ejemplares similares
-
Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization
por: Razin, Noam, et al.
Publicado: (2024) -
RULE: Reinforcement UnLEarning Achieves Forget-Retain Pareto Optimality
por: Zhang, Chenlong, et al.
Publicado: (2025) -
How to Train Long-Context Language Models (Effectively)
por: Gao, Tianyu, et al.
Publicado: (2024) -
Why is Your Language Model a Poor Implicit Reward Model?
por: Razin, Noam, et al.
Publicado: (2025) -
Understanding Deep Learning via Notions of Rank
por: Razin, Noam
Publicado: (2024)