DUSK: Do Not Unlearn Shared Knowledge
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jeung, Wonje, Yoon, Sangyeon, Hong, Hyesoo, Kim, Soeun, Han, Seungju, Yu, Youngjae, No, Albert |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
R-TOFU: Unlearning in Large Reasoning Models
par: Yoon, Sangyeon, et autres
Publié: (2025)
par: Yoon, Sangyeon, et autres
Publié: (2025)
SEPS: A Separability Measure for Robust Unlearning in LLMs
par: Jeung, Wonje, et autres
Publié: (2025)
par: Jeung, Wonje, et autres
Publié: (2025)
Rethinking Benign Relearning: Syntax as the Hidden Driver of Unlearning Failures
par: Yoon, Sangyeon, et autres
Publié: (2026)
par: Yoon, Sangyeon, et autres
Publié: (2026)
A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models
par: Jeung, Wonje, et autres
Publié: (2025)
par: Jeung, Wonje, et autres
Publié: (2025)
BenchPreS: A Benchmark for Context-Aware Personalized Preference Selectivity of Persistent-Memory LLMs
par: Yoon, Sangyeon, et autres
Publié: (2026)
par: Yoon, Sangyeon, et autres
Publié: (2026)
SAFEPATH: Preventing Harmful Reasoning in Chain-of-Thought via Early Alignment
par: Jeung, Wonje, et autres
Publié: (2025)
par: Jeung, Wonje, et autres
Publié: (2025)
VLMs Trace Without Tracking: Diagnosing Failures in Visual Path Following
par: Hong, Hyesoo, et autres
Publié: (2026)
par: Hong, Hyesoo, et autres
Publié: (2026)
Adversarial Sample-Based Approach for Tighter Privacy Auditing in Final Model-Only Scenarios
par: Yoon, Sangyeon, et autres
Publié: (2024)
par: Yoon, Sangyeon, et autres
Publié: (2024)
Representation Bending for Large Language Model Safety
par: Yousefpour, Ashkan, et autres
Publié: (2025)
par: Yousefpour, Ashkan, et autres
Publié: (2025)
Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs
par: Yoon, Sangyeon, et autres
Publié: (2026)
par: Yoon, Sangyeon, et autres
Publié: (2026)
Knowledge Beyond Language: Bridging the Gap in Multilingual Machine Unlearning Evaluation
par: Hwang, Kyomin, et autres
Publié: (2026)
par: Hwang, Kyomin, et autres
Publié: (2026)
Large Language Models Still Exhibit Bias in Long Text
par: Jeung, Wonje, et autres
Publié: (2024)
par: Jeung, Wonje, et autres
Publié: (2024)
Where Rollouts Begin: Low-Load, High-Leverage First-Token Diversification for RLVR
par: Kim, Soeun, et autres
Publié: (2026)
par: Kim, Soeun, et autres
Publié: (2026)
SMILE: Multimodal Dataset for Understanding Laughter in Video with Language Models
par: Hyun, Lee, et autres
Publié: (2023)
par: Hyun, Lee, et autres
Publié: (2023)
An Information Theoretic Evaluation Metric For Strong Unlearning
par: Jeon, Dongjae, et autres
Publié: (2024)
par: Jeon, Dongjae, et autres
Publié: (2024)
Selective Vision is the Challenge for Visual Reasoning: A Benchmark for Visual Argument Understanding
par: Chung, Jiwan, et autres
Publié: (2024)
par: Chung, Jiwan, et autres
Publié: (2024)
Is GPT-4 Alone Sufficient for Automated Essay Scoring?: A Comparative Judgment Approach Based on Rater Cognition
par: Kim, Seungju, et autres
Publié: (2024)
par: Kim, Seungju, et autres
Publié: (2024)
Do LLMs Have Distinct and Consistent Personality? TRAIT: Personality Testset designed for LLMs with Psychometrics
par: Lee, Seungbeen, et autres
Publié: (2024)
par: Lee, Seungbeen, et autres
Publié: (2024)
Do MLLMs Capture How Interfaces Guide User Behavior? A Benchmark for Multimodal UI/UX Design Understanding
par: Jeon, Jaehyun, et autres
Publié: (2025)
par: Jeon, Jaehyun, et autres
Publié: (2025)
Do Language Models Associate Sound with Meaning? A Multimodal Study of Sound Symbolism
par: Jeong, Jinhong, et autres
Publié: (2025)
par: Jeong, Jinhong, et autres
Publié: (2025)
DSG-KD: Knowledge Distillation from Domain-Specific to General Language Models
par: Cho, Sangyeon, et autres
Publié: (2024)
par: Cho, Sangyeon, et autres
Publié: (2024)
Intrinsic Test of Unlearning Using Parametric Knowledge Traces
par: Hong, Yihuai, et autres
Publié: (2024)
par: Hong, Yihuai, et autres
Publié: (2024)
Multi-Level Knowledge Distillation and Dynamic Self-Supervised Learning for Continual Learning
par: Kim, Taeheon, et autres
Publié: (2025)
par: Kim, Taeheon, et autres
Publié: (2025)
Assigning Distinct Roles to Quantized and Low-Rank Matrices Toward Optimal Weight Decomposition
par: Cho, Yoonjun, et autres
Publié: (2025)
par: Cho, Yoonjun, et autres
Publié: (2025)
Verifying the Verifiers: Unveiling Pitfalls and Potentials in Fact Verifiers
par: Seo, Wooseok, et autres
Publié: (2025)
par: Seo, Wooseok, et autres
Publié: (2025)
Do LLMs Really Forget? Evaluating Unlearning with Knowledge Correlation and Confidence Awareness
par: Wei, Rongzhe, et autres
Publié: (2025)
par: Wei, Rongzhe, et autres
Publié: (2025)
Rainbow Padding: Mitigating Early Termination in Instruction-Tuned Diffusion LLMs
par: Kim, Bumjun, et autres
Publié: (2025)
par: Kim, Bumjun, et autres
Publié: (2025)
Pearl: A Review-driven Persona-Knowledge Grounded Conversational Recommendation Dataset
par: Kim, Minjin, et autres
Publié: (2024)
par: Kim, Minjin, et autres
Publié: (2024)
RESTOR: Knowledge Recovery in Machine Unlearning
par: Rezaei, Keivan, et autres
Publié: (2024)
par: Rezaei, Keivan, et autres
Publié: (2024)
ConCSE: Unified Contrastive Learning and Augmentation for Code-Switched Embeddings
par: Jeon, Jangyeong, et autres
Publié: (2024)
par: Jeon, Jangyeong, et autres
Publié: (2024)
The Semantic Hub Hypothesis: Language Models Share Semantic Representations Across Languages and Modalities
par: Wu, Zhaofeng, et autres
Publié: (2024)
par: Wu, Zhaofeng, et autres
Publié: (2024)
Does Localization Inform Unlearning? A Rigorous Examination of Local Parameter Attribution for Knowledge Unlearning in Language Models
par: Lee, Hwiyeong, et autres
Publié: (2025)
par: Lee, Hwiyeong, et autres
Publié: (2025)
Right at My Level: A Unified Multilingual Framework for Proficiency-Aware Text Simplification
par: Jeong, Jinhong, et autres
Publié: (2026)
par: Jeong, Jinhong, et autres
Publié: (2026)
Safety-Aligned Weights Are Not Enough: Refusal-Teacher-Guided Finetuning Enhances Safety and Downstream Performance under Harmful Finetuning Attacks
par: Ham, Seokil, et autres
Publié: (2025)
par: Ham, Seokil, et autres
Publié: (2025)
KnowledgeSmith: Uncovering Knowledge Updating in LLMs with Model Editing and Unlearning
par: Luo, Yinyi, et autres
Publié: (2025)
par: Luo, Yinyi, et autres
Publié: (2025)
Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic Localization
par: Guo, Phillip, et autres
Publié: (2024)
par: Guo, Phillip, et autres
Publié: (2024)
IFCap: Image-like Retrieval and Frequency-based Entity Filtering for Zero-shot Captioning
par: Lee, Soeun, et autres
Publié: (2024)
par: Lee, Soeun, et autres
Publié: (2024)
ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning
par: Kim, Taewhan, et autres
Publié: (2024)
par: Kim, Taewhan, et autres
Publié: (2024)
Mind the Motions: Benchmarking Theory-of-Mind in Everyday Body Language
par: Lee, Seungbeen, et autres
Publié: (2025)
par: Lee, Seungbeen, et autres
Publié: (2025)
Are Any-to-Any Models More Consistent Across Modality Transfers Than Specialists?
par: Chung, Jiwan, et autres
Publié: (2025)
par: Chung, Jiwan, et autres
Publié: (2025)
Documents similaires
-
R-TOFU: Unlearning in Large Reasoning Models
par: Yoon, Sangyeon, et autres
Publié: (2025) -
SEPS: A Separability Measure for Robust Unlearning in LLMs
par: Jeung, Wonje, et autres
Publié: (2025) -
Rethinking Benign Relearning: Syntax as the Hidden Driver of Unlearning Failures
par: Yoon, Sangyeon, et autres
Publié: (2026) -
A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models
par: Jeung, Wonje, et autres
Publié: (2025) -
BenchPreS: A Benchmark for Context-Aware Personalized Preference Selectivity of Persistent-Memory LLMs
par: Yoon, Sangyeon, et autres
Publié: (2026)