CATNIP: LLM Unlearning via Calibrated and Tokenized Negative Preference Alignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Zhengbang, Zhong, Yisheng, Hong, Junyuan, Zhu, Zhuangdi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Hierarchical Federated Unlearning for Large Language Models
por: Zhong, Yisheng, et al.
Publicado: (2025)
por: Zhong, Yisheng, et al.
Publicado: (2025)
DUET: Distilled LLM Unlearning from an Efficiently Contextualized Teacher
por: Zhong, Yisheng, et al.
Publicado: (2026)
por: Zhong, Yisheng, et al.
Publicado: (2026)
ChatWise: A Strategy-Guided Chatbot for Enhancing Cognitive Support in Older Adults
por: Yang, Zhengbang, et al.
Publicado: (2025)
por: Yang, Zhengbang, et al.
Publicado: (2025)
Distribution Corrected Offline Data Distillation for Large Language Models
por: Zhang, Yumeng, et al.
Publicado: (2026)
por: Zhang, Yumeng, et al.
Publicado: (2026)
Harmonizing Multi-Objective LLM Unlearning via Unified Domain Representation and Bidirectional Logit Distillation
por: Zhong, Yisheng, et al.
Publicado: (2026)
por: Zhong, Yisheng, et al.
Publicado: (2026)
Sports Intelligence: Assessing the Sports Understanding Capabilities of Language Models through Question Answering from Text to Video
por: Yang, Zhengbang, et al.
Publicado: (2024)
por: Yang, Zhengbang, et al.
Publicado: (2024)
Simplicity Prevails: Rethinking Negative Preference Optimization for LLM Unlearning
por: Fan, Chongyu, et al.
Publicado: (2024)
por: Fan, Chongyu, et al.
Publicado: (2024)
Align-then-Unlearn: Embedding Alignment for LLM Unlearning
por: Spohn, Philipp, et al.
Publicado: (2025)
por: Spohn, Philipp, et al.
Publicado: (2025)
Language and Multimodal Models in Sports: A Survey of Datasets and Applications
por: Xia, Haotian, et al.
Publicado: (2024)
por: Xia, Haotian, et al.
Publicado: (2024)
DRAGON: Guard LLM Unlearning in Context via Negative Detection and Reasoning
por: Wang, Yaxuan, et al.
Publicado: (2025)
por: Wang, Yaxuan, et al.
Publicado: (2025)
LUNE: Efficient LLM Unlearning via LoRA Fine-Tuning with Negative Examples
por: Liu, Yezi, et al.
Publicado: (2025)
por: Liu, Yezi, et al.
Publicado: (2025)
Panacea: Pareto Alignment via Preference Adaptation for LLMs
por: Zhong, Yifan, et al.
Publicado: (2024)
por: Zhong, Yifan, et al.
Publicado: (2024)
Negative Preference Optimization: From Catastrophic Collapse to Effective Unlearning
por: Zhang, Ruiqi, et al.
Publicado: (2024)
por: Zhang, Ruiqi, et al.
Publicado: (2024)
Bridging the Gap Between Preference Alignment and Machine Unlearning
por: Feng, Xiaohua, et al.
Publicado: (2025)
por: Feng, Xiaohua, et al.
Publicado: (2025)
Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment
por: Xiao, Teng, et al.
Publicado: (2024)
por: Xiao, Teng, et al.
Publicado: (2024)
Less is More: Improving LLM Alignment via Preference Data Selection
por: Deng, Xun, et al.
Publicado: (2025)
por: Deng, Xun, et al.
Publicado: (2025)
As Simple as Fine-tuning: LLM Alignment via Bidirectional Negative Feedback Loss
por: Mao, Xin, et al.
Publicado: (2024)
por: Mao, Xin, et al.
Publicado: (2024)
SEAL: Steerable Reasoning Calibration of Large Language Models for Free
por: Chen, Runjin, et al.
Publicado: (2025)
por: Chen, Runjin, et al.
Publicado: (2025)
CTPD: Cross Tokenizer Preference Distillation
por: Nguyen, Truong, et al.
Publicado: (2026)
por: Nguyen, Truong, et al.
Publicado: (2026)
SparsePO: Controlling Preference Alignment of LLMs via Sparse Token Masks
por: Christopoulou, Fenia, et al.
Publicado: (2024)
por: Christopoulou, Fenia, et al.
Publicado: (2024)
Safety Alignment via Constrained Knowledge Unlearning
por: Shi, Zesheng, et al.
Publicado: (2025)
por: Shi, Zesheng, et al.
Publicado: (2025)
OpenUnlearning: Accelerating LLM Unlearning via Unified Benchmarking of Methods and Metrics
por: Dorna, Vineeth, et al.
Publicado: (2025)
por: Dorna, Vineeth, et al.
Publicado: (2025)
Unlearning What Matters: Token-Level Attribution for Precise Language Model Unlearning
por: Wu, Jiawei, et al.
Publicado: (2026)
por: Wu, Jiawei, et al.
Publicado: (2026)
PMMT: Preference Alignment in Multilingual Machine Translation via LLM Distillation
por: Sun, Shuqiao, et al.
Publicado: (2024)
por: Sun, Shuqiao, et al.
Publicado: (2024)
PMoL: Parameter Efficient MoE for Preference Mixing of LLM Alignment
por: Liu, Dongxu, et al.
Publicado: (2024)
por: Liu, Dongxu, et al.
Publicado: (2024)
GUARD: Generation-time LLM Unlearning via Adaptive Restriction and Detection
por: Deng, Zhijie, et al.
Publicado: (2025)
por: Deng, Zhijie, et al.
Publicado: (2025)
CLUE: Conflict-guided Localization for LLM Unlearning Framework
por: Chen, Hang, et al.
Publicado: (2025)
por: Chen, Hang, et al.
Publicado: (2025)
On-the-fly Preference Alignment via Principle-Guided Decoding
por: Zhu, Mingye, et al.
Publicado: (2025)
por: Zhu, Mingye, et al.
Publicado: (2025)
Group Preference Alignment: Customized LLM Response Generation from In-Situ Conversations
por: Mondal, Ishani, et al.
Publicado: (2025)
por: Mondal, Ishani, et al.
Publicado: (2025)
Negating Negatives: Alignment with Human Negative Samples via Distributional Dispreference Optimization
por: Duan, Shitong, et al.
Publicado: (2024)
por: Duan, Shitong, et al.
Publicado: (2024)
Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM Game
por: Cheng, Pengyu, et al.
Publicado: (2023)
por: Cheng, Pengyu, et al.
Publicado: (2023)
TTPA: Token-level Tool-use Preference Alignment Training Framework with Fine-grained Evaluation
por: Huang, Chengrui, et al.
Publicado: (2025)
por: Huang, Chengrui, et al.
Publicado: (2025)
Improving LLM Unlearning Robustness via Random Perturbations
por: Huu-Tien, Dang, et al.
Publicado: (2025)
por: Huu-Tien, Dang, et al.
Publicado: (2025)
Representation-Guided Parameter-Efficient LLM Unlearning
por: Xiao, Zeguan, et al.
Publicado: (2026)
por: Xiao, Zeguan, et al.
Publicado: (2026)
TokAlign++: Advancing Vocabulary Adaptation via Better Token Alignment
por: Li, Chong, et al.
Publicado: (2026)
por: Li, Chong, et al.
Publicado: (2026)
StoicLLM: Preference Optimization for Philosophical Alignment in Small Language Models
por: Khan, Ishmam, et al.
Publicado: (2026)
por: Khan, Ishmam, et al.
Publicado: (2026)
Improving Conversational Abilities of Quantized Large Language Models via Direct Preference Alignment
por: Lee, Janghwan, et al.
Publicado: (2024)
por: Lee, Janghwan, et al.
Publicado: (2024)
Not Every Token Needs Forgetting: Selective Unlearning to Limit Change in Utility in Large Language Model Unlearning
por: Wan, Yixin, et al.
Publicado: (2025)
por: Wan, Yixin, et al.
Publicado: (2025)
SPECTRA: Revealing the Full Spectrum of User Preferences via Distributional LLM Inference
por: Zhang, Luyang, et al.
Publicado: (2025)
por: Zhang, Luyang, et al.
Publicado: (2025)
Energy-Based Preference Model Offers Better Offline Alignment than the Bradley-Terry Preference Model
por: Hong, Yuzhong, et al.
Publicado: (2024)
por: Hong, Yuzhong, et al.
Publicado: (2024)
Ejemplares similares
-
Hierarchical Federated Unlearning for Large Language Models
por: Zhong, Yisheng, et al.
Publicado: (2025) -
DUET: Distilled LLM Unlearning from an Efficiently Contextualized Teacher
por: Zhong, Yisheng, et al.
Publicado: (2026) -
ChatWise: A Strategy-Guided Chatbot for Enhancing Cognitive Support in Older Adults
por: Yang, Zhengbang, et al.
Publicado: (2025) -
Distribution Corrected Offline Data Distillation for Large Language Models
por: Zhang, Yumeng, et al.
Publicado: (2026) -
Harmonizing Multi-Objective LLM Unlearning via Unified Domain Representation and Bidirectional Logit Distillation
por: Zhong, Yisheng, et al.
Publicado: (2026)