Decoding-time Realignment of Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Tianlin, Guo, Shangmin, Bianco, Leonardo, Calandriello, Daniele, Berthet, Quentin, Llinares, Felipe, Hoffmann, Jessica, Dixon, Lucas, Valko, Michal, Blondel, Mathieu |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Direct Language Model Alignment from Online AI Feedback
by: Guo, Shangmin, et al.
Published: (2024)
by: Guo, Shangmin, et al.
Published: (2024)
On Teacher Hacking in Language Model Distillation
by: Tiapkin, Daniil, et al.
Published: (2025)
by: Tiapkin, Daniil, et al.
Published: (2025)
Large-scale semi-supervised learning with online spectral graph sparsification
by: Calandriello, Daniele, et al.
Published: (2026)
by: Calandriello, Daniele, et al.
Published: (2026)
Analysis of Nystrom method with sequential ridge leverage scores
by: Calandriello, Daniele, et al.
Published: (2026)
by: Calandriello, Daniele, et al.
Published: (2026)
Pack only the essentials: Adaptive dictionary learning for kernel ridge regression
by: Calandriello, Daniele, et al.
Published: (2026)
by: Calandriello, Daniele, et al.
Published: (2026)
Structured Context Recomposition for Large Language Models Using Probabilistic Layer Realignment
by: Teel, Jonathan, et al.
Published: (2025)
by: Teel, Jonathan, et al.
Published: (2025)
Improved large-scale graph learning through ridge spectral sparsification
by: Calandriello, Daniele, et al.
Published: (2026)
by: Calandriello, Daniele, et al.
Published: (2026)
Flexible Realignment of Language Models
by: Zhu, Wenhong, et al.
Published: (2025)
by: Zhu, Wenhong, et al.
Published: (2025)
The Elements of Differentiable Programming
by: Blondel, Mathieu, et al.
Published: (2024)
by: Blondel, Mathieu, et al.
Published: (2024)
Implicit Diffusion: Efficient Optimization through Stochastic Sampling
by: Marion, Pierre, et al.
Published: (2024)
by: Marion, Pierre, et al.
Published: (2024)
Bias Amplification in Language Model Evolution: An Iterated Learning Perspective
by: Ren, Yi, et al.
Published: (2024)
by: Ren, Yi, et al.
Published: (2024)
Latent Convergence Modulation in Large Language Models: A Novel Approach to Iterative Contextual Realignment
by: Porretta, Patricia, et al.
Published: (2025)
by: Porretta, Patricia, et al.
Published: (2025)
NLSR: Neuron-Level Safety Realignment of Large Language Models Against Harmful Fine-Tuning
by: Yi, Xin, et al.
Published: (2024)
by: Yi, Xin, et al.
Published: (2024)
Joint Learning of Energy-based Models and their Partition Function
by: Sander, Michael E., et al.
Published: (2025)
by: Sander, Michael E., et al.
Published: (2025)
Emergently Misaligned Language Models Show Behavioral Self-Awareness That Shifts With Subsequent Realignment
by: Vaugrante, Laurène, et al.
Published: (2026)
by: Vaugrante, Laurène, et al.
Published: (2026)
AlignFreeze: Navigating the Impact of Realignment on the Layers of Multilingual Models Across Diverse Languages
by: Bakos, Steve, et al.
Published: (2025)
by: Bakos, Steve, et al.
Published: (2025)
Routers in Vision Mixture of Experts: An Empirical Study
by: Liu, Tianlin, et al.
Published: (2024)
by: Liu, Tianlin, et al.
Published: (2024)
DeAL: Decoding-time Alignment for Large Language Models
by: Huang, James Y., et al.
Published: (2024)
by: Huang, James Y., et al.
Published: (2024)
A Study on Hidden Layer Distillation for Large Language Model Pre-Training
by: Guigon, Maxime, et al.
Published: (2026)
by: Guigon, Maxime, et al.
Published: (2026)
Autoregressive Language Models are Secretly Energy-Based Models: Insights into the Lookahead Capabilities of Next-Token Prediction
by: Blondel, Mathieu, et al.
Published: (2025)
by: Blondel, Mathieu, et al.
Published: (2025)
The Realignment Problem: When Right becomes Wrong in LLMs
by: Sharma, Aakash Sen, et al.
Published: (2025)
by: Sharma, Aakash Sen, et al.
Published: (2025)
Rethinking what Matters: Effective and Robust Multilingual Realignment for Low-Resource Languages
by: Nguyen, Quang Phuoc, et al.
Published: (2025)
by: Nguyen, Quang Phuoc, et al.
Published: (2025)
Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models
by: Li, Yue, et al.
Published: (2025)
by: Li, Yue, et al.
Published: (2025)
Detecting Hallucination and Coverage Errors in Retrieval Augmented Generation for Controversial Topics
by: Chang, Tyler A., et al.
Published: (2024)
by: Chang, Tyler A., et al.
Published: (2024)
Scalable Influence and Fact Tracing for Large Language Model Pretraining
by: Chang, Tyler A., et al.
Published: (2024)
by: Chang, Tyler A., et al.
Published: (2024)
Purifying Large Language Models by Ensembling a Small Language Model
by: Li, Tianlin, et al.
Published: (2024)
by: Li, Tianlin, et al.
Published: (2024)
Patchscopes: A Unifying Framework for Inspecting Hidden Representations of Language Models
by: Ghandeharioun, Asma, et al.
Published: (2024)
by: Ghandeharioun, Asma, et al.
Published: (2024)
The Mysterious Case of Neuron 1512: Injectable Realignment Architectures Reveal Internal Characteristics of Meta's Llama 2 Model
by: Smith, Brenden, et al.
Published: (2024)
by: Smith, Brenden, et al.
Published: (2024)
GeoAlign: Geometric Feature Realignment for MLLM Spatial Reasoning
by: Liu, Zhaochen, et al.
Published: (2026)
by: Liu, Zhaochen, et al.
Published: (2026)
Model-free Posterior Sampling via Learning Rate Randomization
by: Tiapkin, Daniil, et al.
Published: (2023)
by: Tiapkin, Daniil, et al.
Published: (2023)
EmoLLMs: A Series of Emotional Large Language Models and Annotation Tools for Comprehensive Affective Analysis
by: Liu, Zhiwei, et al.
Published: (2024)
by: Liu, Zhiwei, et al.
Published: (2024)
Proximal Point Nash Learning from Human Feedback
by: Tiapkin, Daniil, et al.
Published: (2025)
by: Tiapkin, Daniil, et al.
Published: (2025)
Demonstration-Regularized RL
by: Tiapkin, Daniil, et al.
Published: (2023)
by: Tiapkin, Daniil, et al.
Published: (2023)
Towards Interpretable Mental Health Analysis with Large Language Models
by: Yang, Kailai, et al.
Published: (2023)
by: Yang, Kailai, et al.
Published: (2023)
Think Before You Lie: How Reasoning Leads to Honesty
by: Yuan, Ann, et al.
Published: (2026)
by: Yuan, Ann, et al.
Published: (2026)
Encoder-Decoder or Decoder-Only? Revisiting Encoder-Decoder Large Language Model
by: Zhang, Biao, et al.
Published: (2025)
by: Zhang, Biao, et al.
Published: (2025)
ART: Attention Run-time Termination for Efficient Large Language Model Decoding
by: Qiu, Chen, et al.
Published: (2026)
by: Qiu, Chen, et al.
Published: (2026)
MentaLLaMA: Interpretable Mental Health Analysis on Social Media with Large Language Models
by: Yang, Kailai, et al.
Published: (2023)
by: Yang, Kailai, et al.
Published: (2023)
Bandits on graphs and structures
by: Valko, Michal
Published: (2026)
by: Valko, Michal
Published: (2026)
Adaptive graph-based algorithms for conditional anomaly detection and semi-supervised learning
by: Valko, Michal
Published: (2026)
by: Valko, Michal
Published: (2026)
Similar Items
-
Direct Language Model Alignment from Online AI Feedback
by: Guo, Shangmin, et al.
Published: (2024) -
On Teacher Hacking in Language Model Distillation
by: Tiapkin, Daniil, et al.
Published: (2025) -
Large-scale semi-supervised learning with online spectral graph sparsification
by: Calandriello, Daniele, et al.
Published: (2026) -
Analysis of Nystrom method with sequential ridge leverage scores
by: Calandriello, Daniele, et al.
Published: (2026) -
Pack only the essentials: Adaptive dictionary learning for kernel ridge regression
by: Calandriello, Daniele, et al.
Published: (2026)