A Probabilistic Perspective on Unlearning and Alignment for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Scholten, Yan, Günnemann, Stephan, Schwinn, Leo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Model Collapse Is Not a Bug but a Feature in Machine Unlearning for LLMs
di: Scholten, Yan, et al.
Pubblicazione: (2025)
di: Scholten, Yan, et al.
Pubblicazione: (2025)
Extracting Unlearned Information from LLMs with Activation Steering
di: Seyitoğlu, Atakan, et al.
Pubblicazione: (2024)
di: Seyitoğlu, Atakan, et al.
Pubblicazione: (2024)
Sampling-aware Adversarial Attacks Against Large Language Models
di: Beyer, Tim, et al.
Pubblicazione: (2025)
di: Beyer, Tim, et al.
Pubblicazione: (2025)
Flow Matching with Gaussian Process Priors for Probabilistic Time Series Forecasting
di: Kollovieh, Marcel, et al.
Pubblicazione: (2024)
di: Kollovieh, Marcel, et al.
Pubblicazione: (2024)
Assessing Robustness via Score-Based Adversarial Image Generation
di: Kollovieh, Marcel, et al.
Pubblicazione: (2023)
di: Kollovieh, Marcel, et al.
Pubblicazione: (2023)
Soft Prompt Threats: Attacking Safety Alignment and Unlearning in Open-Source LLMs through the Embedding Space
di: Schwinn, Leo, et al.
Pubblicazione: (2024)
di: Schwinn, Leo, et al.
Pubblicazione: (2024)
Adversarial Alignment for LLMs Requires Simpler, Reproducible, and More Measurable Objectives
di: Schwinn, Leo, et al.
Pubblicazione: (2025)
di: Schwinn, Leo, et al.
Pubblicazione: (2025)
Hierarchical Randomized Smoothing
di: Scholten, Yan, et al.
Pubblicazione: (2023)
di: Scholten, Yan, et al.
Pubblicazione: (2023)
Closing the Distribution Gap in Adversarial Training for LLMs
di: Hu, Chengzhi, et al.
Pubblicazione: (2026)
di: Hu, Chengzhi, et al.
Pubblicazione: (2026)
Provably Reliable Conformal Prediction Sets in the Presence of Data Poisoning
di: Scholten, Yan, et al.
Pubblicazione: (2024)
di: Scholten, Yan, et al.
Pubblicazione: (2024)
Efficient Time Series Processing for Transformers and State-Space Models through Token Merging
di: Götz, Leon, et al.
Pubblicazione: (2024)
di: Götz, Leon, et al.
Pubblicazione: (2024)
Probabilistic Token Alignment for Large Language Model Fusion
di: Zeng, Runjia, et al.
Pubblicazione: (2025)
di: Zeng, Runjia, et al.
Pubblicazione: (2025)
Joint Relational Database Generation via Graph-Conditional Diffusion Models
di: Ketata, Mohamed Amine, et al.
Pubblicazione: (2025)
di: Ketata, Mohamed Amine, et al.
Pubblicazione: (2025)
Byte Pair Encoding for Efficient Time Series Forecasting
di: Götz, Leon, et al.
Pubblicazione: (2025)
di: Götz, Leon, et al.
Pubblicazione: (2025)
Fast Proxies for LLM Robustness Evaluation
di: Beyer, Tim, et al.
Pubblicazione: (2025)
di: Beyer, Tim, et al.
Pubblicazione: (2025)
The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence
di: Wollschläger, Tom, et al.
Pubblicazione: (2025)
di: Wollschläger, Tom, et al.
Pubblicazione: (2025)
Intriguing Properties of Input-dependent Randomized Smoothing
di: Súkeník, Peter, et al.
Pubblicazione: (2021)
di: Súkeník, Peter, et al.
Pubblicazione: (2021)
Large Language Model Unlearning
di: Yao, Yuanshun, et al.
Pubblicazione: (2023)
di: Yao, Yuanshun, et al.
Pubblicazione: (2023)
Offset Unlearning for Large Language Models
di: Huang, James Y., et al.
Pubblicazione: (2024)
di: Huang, James Y., et al.
Pubblicazione: (2024)
SUA: Stealthy Multimodal Large Language Model Unlearning Attack
di: Zhang, Xianren, et al.
Pubblicazione: (2025)
di: Zhang, Xianren, et al.
Pubblicazione: (2025)
Joint Out-of-Distribution Filtering and Data Discovery Active Learning
di: Schmidt, Sebastian, et al.
Pubblicazione: (2025)
di: Schmidt, Sebastian, et al.
Pubblicazione: (2025)
Spatio-Spectral Graph Neural Networks
di: Geisler, Simon, et al.
Pubblicazione: (2024)
di: Geisler, Simon, et al.
Pubblicazione: (2024)
Long-Range Graph Wavelet Networks
di: Guerranti, Filippo, et al.
Pubblicazione: (2025)
di: Guerranti, Filippo, et al.
Pubblicazione: (2025)
ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models
di: Lin, Yujie, et al.
Pubblicazione: (2026)
di: Lin, Yujie, et al.
Pubblicazione: (2026)
Oblivionis: A Lightweight Learning and Unlearning Framework for Federated Large Language Models
di: Zhang, Fuyao, et al.
Pubblicazione: (2025)
di: Zhang, Fuyao, et al.
Pubblicazione: (2025)
Boosting Alignment for Post-Unlearning Text-to-Image Generative Models
di: Ko, Myeongseob, et al.
Pubblicazione: (2024)
di: Ko, Myeongseob, et al.
Pubblicazione: (2024)
Soft Prompting for Unlearning in Large Language Models
di: Bhaila, Karuna, et al.
Pubblicazione: (2024)
di: Bhaila, Karuna, et al.
Pubblicazione: (2024)
Multi-Objective Large Language Model Unlearning
di: Pan, Zibin, et al.
Pubblicazione: (2024)
di: Pan, Zibin, et al.
Pubblicazione: (2024)
Hierarchical Federated Unlearning for Large Language Models
di: Zhong, Yisheng, et al.
Pubblicazione: (2025)
di: Zhong, Yisheng, et al.
Pubblicazione: (2025)
Provable Robustness against Backdoor Attacks via the Primal-Dual Perspective on Differential Privacy
di: Saxena, Aman, et al.
Pubblicazione: (2026)
di: Saxena, Aman, et al.
Pubblicazione: (2026)
Adversarial Robustness of Graph Transformers
di: Foth, Philipp, et al.
Pubblicazione: (2024)
di: Foth, Philipp, et al.
Pubblicazione: (2024)
Diffusion LLMs are Natural Adversaries for any LLM
di: Lüdke, David, et al.
Pubblicazione: (2025)
di: Lüdke, David, et al.
Pubblicazione: (2025)
CAP: Controllable Alignment Prompting for Unlearning in LLMs
di: Wang, Zhaokun, et al.
Pubblicazione: (2026)
di: Wang, Zhaokun, et al.
Pubblicazione: (2026)
Distinguishable Deletion: Unifying Knowledge Erasure and Refusal for Large Language Model Unlearning
di: Yang, Puning, et al.
Pubblicazione: (2026)
di: Yang, Puning, et al.
Pubblicazione: (2026)
The Expressivity Boundary of Probabilistic Circuits: A Comparison with Large Language Models
di: Zhao, Zhiyu, et al.
Pubblicazione: (2026)
di: Zhao, Zhiyu, et al.
Pubblicazione: (2026)
A Closer Look at Machine Unlearning for Large Language Models
di: Yuan, Xiaojian, et al.
Pubblicazione: (2024)
di: Yuan, Xiaojian, et al.
Pubblicazione: (2024)
Automated Machine Learning: A Case Study on Non-Intrusive Appliance Load Monitoring
di: Moin, Armin, et al.
Pubblicazione: (2022)
di: Moin, Armin, et al.
Pubblicazione: (2022)
Ready2Unlearn: A Learning-Time Approach for Preparing Models with Future Unlearning Readiness
di: Duan, Hanyu, et al.
Pubblicazione: (2025)
di: Duan, Hanyu, et al.
Pubblicazione: (2025)
A Neuro-inspired Interpretation of Unlearning in Large Language Models through Sample-level Unlearning Difficulty
di: Feng, Xiaohua, et al.
Pubblicazione: (2025)
di: Feng, Xiaohua, et al.
Pubblicazione: (2025)
Existing Large Language Model Unlearning Evaluations Are Inconclusive
di: Feng, Zhili, et al.
Pubblicazione: (2025)
di: Feng, Zhili, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Model Collapse Is Not a Bug but a Feature in Machine Unlearning for LLMs
di: Scholten, Yan, et al.
Pubblicazione: (2025) -
Extracting Unlearned Information from LLMs with Activation Steering
di: Seyitoğlu, Atakan, et al.
Pubblicazione: (2024) -
Sampling-aware Adversarial Attacks Against Large Language Models
di: Beyer, Tim, et al.
Pubblicazione: (2025) -
Flow Matching with Gaussian Process Priors for Probabilistic Time Series Forecasting
di: Kollovieh, Marcel, et al.
Pubblicazione: (2024) -
Assessing Robustness via Score-Based Adversarial Image Generation
di: Kollovieh, Marcel, et al.
Pubblicazione: (2023)