Learning and Forgetting Unsafe Examples in Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhao, Jiachen, Deng, Zhun, Madras, David, Zou, James, Ren, Mengye |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Demystifying Language Model Forgetting with Low-rank Example Associations
por: Jin, Xisen, et al.
Publicado: (2024)
por: Jin, Xisen, et al.
Publicado: (2024)
What Will My Model Forget? Forecasting Forgotten Examples in Language Model Refinement
por: Jin, Xisen, et al.
Publicado: (2024)
por: Jin, Xisen, et al.
Publicado: (2024)
Offline Learning and Forgetting for Reasoning with Large Language Models
por: Ni, Tianwei, et al.
Publicado: (2025)
por: Ni, Tianwei, et al.
Publicado: (2025)
tnGPS: Discovering Unknown Tensor Network Structure Search Algorithms via Large Language Models (LLMs)
por: Zeng, Junhua, et al.
Publicado: (2024)
por: Zeng, Junhua, et al.
Publicado: (2024)
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
por: Wang, Yiping, et al.
Publicado: (2025)
por: Wang, Yiping, et al.
Publicado: (2025)
Erasing Without Remembering: Implicit Knowledge Forgetting in Large Language Models
por: Wang, Huazheng, et al.
Publicado: (2025)
por: Wang, Huazheng, et al.
Publicado: (2025)
Evaluating Defences against Unsafe Feedback in RLHF
por: Rosati, Domenic, et al.
Publicado: (2024)
por: Rosati, Domenic, et al.
Publicado: (2024)
Are LLMs Prescient? A Continuous Evaluation using Daily News as the Oracle
por: Dai, Hui, et al.
Publicado: (2024)
por: Dai, Hui, et al.
Publicado: (2024)
Elephants Never Forget: Memorization and Learning of Tabular Data in Large Language Models
por: Bordt, Sebastian, et al.
Publicado: (2024)
por: Bordt, Sebastian, et al.
Publicado: (2024)
Unveiling and Addressing Pseudo Forgetting in Large Language Models
por: Sun, Huashan, et al.
Publicado: (2024)
por: Sun, Huashan, et al.
Publicado: (2024)
Reawakening knowledge: Anticipatory recovery from catastrophic interference via structured training
por: Yang, Yanlai, et al.
Publicado: (2024)
por: Yang, Yanlai, et al.
Publicado: (2024)
Prompt Risk Control: A Rigorous Framework for Responsible Deployment of Large Language Models
por: Zollo, Thomas P., et al.
Publicado: (2023)
por: Zollo, Thomas P., et al.
Publicado: (2023)
Analyzing and Mitigating Object Hallucination in Large Vision-Language Models
por: Zhou, Yiyang, et al.
Publicado: (2023)
por: Zhou, Yiyang, et al.
Publicado: (2023)
Moderating Illicit Online Image Promotion for Unsafe User-Generated Content Games Using Large Vision-Language Models
por: Guo, Keyan, et al.
Publicado: (2024)
por: Guo, Keyan, et al.
Publicado: (2024)
Understanding Catastrophic Forgetting in Language Models via Implicit Inference
por: Kotha, Suhas, et al.
Publicado: (2023)
por: Kotha, Suhas, et al.
Publicado: (2023)
Aligning LLMs with Human Uncertainty: A Beta-Bernoulli Calibrator for LLM Forecasting
por: Dai, Hui, et al.
Publicado: (2026)
por: Dai, Hui, et al.
Publicado: (2026)
Context Tuning for In-Context Optimization
por: Lu, Jack, et al.
Publicado: (2025)
por: Lu, Jack, et al.
Publicado: (2025)
Seeking the Unfamiliar but Memorable: Conceptual Creativity as Meta-Learning
por: Ren, Mengye
Publicado: (2026)
por: Ren, Mengye
Publicado: (2026)
Talking Nonsense: Probing Large Language Models' Understanding of Adversarial Gibberish Inputs
por: Cherepanova, Valeriia, et al.
Publicado: (2024)
por: Cherepanova, Valeriia, et al.
Publicado: (2024)
Graceful Forgetting in Generative Language Models
por: Jiang, Chunyang, et al.
Publicado: (2025)
por: Jiang, Chunyang, et al.
Publicado: (2025)
Elephants Never Forget: Testing Language Models for Memorization of Tabular Data
por: Bordt, Sebastian, et al.
Publicado: (2024)
por: Bordt, Sebastian, et al.
Publicado: (2024)
Multistage Collaborative Knowledge Distillation from a Large Language Model for Semi-Supervised Sequence Generation
por: Zhao, Jiachen, et al.
Publicado: (2023)
por: Zhao, Jiachen, et al.
Publicado: (2023)
Scaling Laws for Forgetting When Fine-Tuning Large Language Models
por: Kalajdzievski, Damjan
Publicado: (2024)
por: Kalajdzievski, Damjan
Publicado: (2024)
BAPO: Base-Anchored Preference Optimization for Overcoming Forgetting in Large Language Models Personalization
por: Lee, Gihun, et al.
Publicado: (2024)
por: Lee, Gihun, et al.
Publicado: (2024)
FIT to Forget: Robust Continual Unlearning for Large Language Models
por: Xu, Xiaoyu, et al.
Publicado: (2026)
por: Xu, Xiaoyu, et al.
Publicado: (2026)
FOREVER: Forgetting Curve-Inspired Memory Replay for Language Model Continual Learning
por: Feng, Yujie, et al.
Publicado: (2026)
por: Feng, Yujie, et al.
Publicado: (2026)
Analyzing and Reducing Catastrophic Forgetting in Parameter Efficient Tuning
por: Ren, Weijieying, et al.
Publicado: (2024)
por: Ren, Weijieying, et al.
Publicado: (2024)
Did You Forget What I Asked? Prospective Memory Failures in Large Language Models
por: Mittal, Avni
Publicado: (2026)
por: Mittal, Avni
Publicado: (2026)
LLMGuard: Guarding Against Unsafe LLM Behavior
por: Goyal, Shubh, et al.
Publicado: (2024)
por: Goyal, Shubh, et al.
Publicado: (2024)
Can Models Learn Skill Composition from Examples?
por: Zhao, Haoyu, et al.
Publicado: (2024)
por: Zhao, Haoyu, et al.
Publicado: (2024)
Uncertainty Quantification for In-Context Learning of Large Language Models
por: Ling, Chen, et al.
Publicado: (2024)
por: Ling, Chen, et al.
Publicado: (2024)
Mapping Post-Training Forgetting in Language Models at Scale
por: Harmon, Jackson, et al.
Publicado: (2025)
por: Harmon, Jackson, et al.
Publicado: (2025)
Pareto Optimal Learning for Estimating Large Language Model Errors
por: Zhao, Theodore, et al.
Publicado: (2023)
por: Zhao, Theodore, et al.
Publicado: (2023)
Distilling Large Language Models for Text-Attributed Graph Learning
por: Pan, Bo, et al.
Publicado: (2024)
por: Pan, Bo, et al.
Publicado: (2024)
Improving Language Plasticity via Pretraining with Active Forgetting
por: Chen, Yihong, et al.
Publicado: (2023)
por: Chen, Yihong, et al.
Publicado: (2023)
Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMs
por: Si, Wai Man, et al.
Publicado: (2026)
por: Si, Wai Man, et al.
Publicado: (2026)
To Forget or Not? Towards Practical Knowledge Unlearning for Large Language Models
por: Tian, Bozhong, et al.
Publicado: (2024)
por: Tian, Bozhong, et al.
Publicado: (2024)
On the Thinking-Language Modeling Gap in Large Language Models
por: Liu, Chenxi, et al.
Publicado: (2025)
por: Liu, Chenxi, et al.
Publicado: (2025)
A Comprehensive Survey of Electronic Health Record Modeling: From Deep Learning Approaches to Large Language Models
por: Ren, Weijieying, et al.
Publicado: (2025)
por: Ren, Weijieying, et al.
Publicado: (2025)
Forgetting to Forget: Attention Sink as A Gateway for Backdooring LLM Unlearning
por: Shang, Bingqi, et al.
Publicado: (2025)
por: Shang, Bingqi, et al.
Publicado: (2025)
Ejemplares similares
-
Demystifying Language Model Forgetting with Low-rank Example Associations
por: Jin, Xisen, et al.
Publicado: (2024) -
What Will My Model Forget? Forecasting Forgotten Examples in Language Model Refinement
por: Jin, Xisen, et al.
Publicado: (2024) -
Offline Learning and Forgetting for Reasoning with Large Language Models
por: Ni, Tianwei, et al.
Publicado: (2025) -
tnGPS: Discovering Unknown Tensor Network Structure Search Algorithms via Large Language Models (LLMs)
por: Zeng, Junhua, et al.
Publicado: (2024) -
Reinforcement Learning for Reasoning in Large Language Models with One Training Example
por: Wang, Yiping, et al.
Publicado: (2025)