Aligning to What? Limits to RLHF Based Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Barnhart, Logan, Bafghi, Reza Akbarian, Becker, Stephen, Raissi, Maziar |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
From Centerlines to Hemodynamics: Anisotropic RBF Decoders for Coronary Arteries
di: Bafghi, Reza Akbarian, et al.
Pubblicazione: (2026)
di: Bafghi, Reza Akbarian, et al.
Pubblicazione: (2026)
Test-Driven Agentic Framework for Reliable Robot Controller
di: Tripathi, Shivanshu, et al.
Pubblicazione: (2026)
di: Tripathi, Shivanshu, et al.
Pubblicazione: (2026)
MixDiff: Mixing Natural and Synthetic Images for Robust Self-Supervised Representations
di: Bafghi, Reza Akbarian, et al.
Pubblicazione: (2024)
di: Bafghi, Reza Akbarian, et al.
Pubblicazione: (2024)
Parameter Efficient Fine-tuning of Self-supervised ViTs without Catastrophic Forgetting
di: Bafghi, Reza Akbarian, et al.
Pubblicazione: (2024)
di: Bafghi, Reza Akbarian, et al.
Pubblicazione: (2024)
Fine Tuning without Catastrophic Forgetting via Selective Low Rank Adaptation
di: Bafghi, Reza Akbarian, et al.
Pubblicazione: (2025)
di: Bafghi, Reza Akbarian, et al.
Pubblicazione: (2025)
Where Did Your Model Learn That? Label-free Influence for Self-supervised Learning
di: Harilal, Nidhin, et al.
Pubblicazione: (2024)
di: Harilal, Nidhin, et al.
Pubblicazione: (2024)
Solving the Inverse Alignment Problem for Efficient RLHF
di: Krishna, Shambhavi, et al.
Pubblicazione: (2024)
di: Krishna, Shambhavi, et al.
Pubblicazione: (2024)
ChatGLM-RLHF: Practices of Aligning Large Language Models with Human Feedback
di: Hou, Zhenyu, et al.
Pubblicazione: (2024)
di: Hou, Zhenyu, et al.
Pubblicazione: (2024)
Why Is RLHF Alignment Shallow? A Gradient Analysis
di: Young, Robin
Pubblicazione: (2026)
di: Young, Robin
Pubblicazione: (2026)
MM-RLHF: The Next Step Forward in Multimodal LLM Alignment
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2025)
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2025)
More RLHF, More Trust? On The Impact of Preference Alignment On Trustworthiness
di: Li, Aaron J., et al.
Pubblicazione: (2024)
di: Li, Aaron J., et al.
Pubblicazione: (2024)
SenseAI: A Human-in-the-Loop Dataset for RLHF-Aligned Financial Sentiment Reasoning
di: Kabalisa, Berny
Pubblicazione: (2026)
di: Kabalisa, Berny
Pubblicazione: (2026)
MaxMin-RLHF: Alignment with Diverse Human Preferences
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
di: Chakraborty, Souradip, et al.
Pubblicazione: (2024)
Understanding Tool-Augmented Agents for Lean Formalization: A Factorial Analysis
di: Zhang, Ke, et al.
Pubblicazione: (2026)
di: Zhang, Ke, et al.
Pubblicazione: (2026)
A Systematic Evaluation of Preference Aggregation in Federated RLHF for Pluralistic Alignment of LLMs
di: Srewa, Mahmoud, et al.
Pubblicazione: (2025)
di: Srewa, Mahmoud, et al.
Pubblicazione: (2025)
RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment
di: Du, Yuhao, et al.
Pubblicazione: (2025)
di: Du, Yuhao, et al.
Pubblicazione: (2025)
Proxy-RLHF: Decoupling Generation and Alignment in Large Language Model with Proxy
di: Zhu, Yu, et al.
Pubblicazione: (2024)
di: Zhu, Yu, et al.
Pubblicazione: (2024)
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
di: Ji, Jiaming, et al.
Pubblicazione: (2024)
Derailing Non-Answers via Logit Suppression at Output Subspace Boundaries in RLHF-Aligned Language Models
di: Dam, Harvey, et al.
Pubblicazione: (2025)
di: Dam, Harvey, et al.
Pubblicazione: (2025)
Culturally Adaptive Explainable LLM Assessment for Multilingual Information Disorder: A Human-in-the-Loop Approach
di: Jouneghani, Maziar Kianimoghadam
Pubblicazione: (2026)
di: Jouneghani, Maziar Kianimoghadam
Pubblicazione: (2026)
From RLHF to Direct Alignment: A Theoretical Unification of Preference Learning for Large Language Models
di: Raheja, Tarun, et al.
Pubblicazione: (2026)
di: Raheja, Tarun, et al.
Pubblicazione: (2026)
RLHF: A comprehensive Survey for Cultural, Multimodal and Low Latency Alignment Methods
di: Sharma, Raghav, et al.
Pubblicazione: (2025)
di: Sharma, Raghav, et al.
Pubblicazione: (2025)
RLHF Workflow: From Reward Modeling to Online RLHF
di: Dong, Hanze, et al.
Pubblicazione: (2024)
di: Dong, Hanze, et al.
Pubblicazione: (2024)
Balanced Actor Initialization: Stable RLHF Training of Distillation-Based Reasoning Models
di: Zheng, Chen, et al.
Pubblicazione: (2025)
di: Zheng, Chen, et al.
Pubblicazione: (2025)
Deep LPPLS: Forecasting of temporal critical points in natural, engineering and financial systems
di: Nielsen, Joshua, et al.
Pubblicazione: (2024)
di: Nielsen, Joshua, et al.
Pubblicazione: (2024)
Taming Overconfidence in LLMs: Reward Calibration in RLHF
di: Leng, Jixuan, et al.
Pubblicazione: (2024)
di: Leng, Jixuan, et al.
Pubblicazione: (2024)
RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback
di: Yu, Tianyu, et al.
Pubblicazione: (2023)
di: Yu, Tianyu, et al.
Pubblicazione: (2023)
OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework
di: Hu, Jian, et al.
Pubblicazione: (2024)
di: Hu, Jian, et al.
Pubblicazione: (2024)
Language Models Learn to Mislead Humans via RLHF
di: Wen, Jiaxin, et al.
Pubblicazione: (2024)
di: Wen, Jiaxin, et al.
Pubblicazione: (2024)
TokAlign: Efficient Vocabulary Adaptation via Token Alignment
di: Li, Chong, et al.
Pubblicazione: (2025)
di: Li, Chong, et al.
Pubblicazione: (2025)
Divide-Then-Align: Honest Alignment based on the Knowledge Boundary of RAG
di: Sun, Xin, et al.
Pubblicazione: (2025)
di: Sun, Xin, et al.
Pubblicazione: (2025)
IterAlign: Iterative Constitutional Alignment of Large Language Models
di: Chen, Xiusi, et al.
Pubblicazione: (2024)
di: Chen, Xiusi, et al.
Pubblicazione: (2024)
SpeechAlign: a Framework for Speech Translation Alignment Evaluation
di: Alastruey, Belen, et al.
Pubblicazione: (2023)
di: Alastruey, Belen, et al.
Pubblicazione: (2023)
Failure Modes of Maximum Entropy RLHF
di: Çağatan, Ömer Veysel, et al.
Pubblicazione: (2025)
di: Çağatan, Ömer Veysel, et al.
Pubblicazione: (2025)
Physics-Informed Machine Learning for Smart Additive Manufacturing
di: Sharma, Rahul, et al.
Pubblicazione: (2024)
di: Sharma, Rahul, et al.
Pubblicazione: (2024)
Align-then-Unlearn: Embedding Alignment for LLM Unlearning
di: Spohn, Philipp, et al.
Pubblicazione: (2025)
di: Spohn, Philipp, et al.
Pubblicazione: (2025)
Fake Alignment: Are LLMs Really Aligned Well?
di: Wang, Yixu, et al.
Pubblicazione: (2023)
di: Wang, Yixu, et al.
Pubblicazione: (2023)
MKJ at SemEval-2026 Task 9: A Comparative Study of Generalist, Specialist, and Ensemble Strategies for Multilingual Polarization
di: Jouneghani, Maziar Kianimoghadam
Pubblicazione: (2026)
di: Jouneghani, Maziar Kianimoghadam
Pubblicazione: (2026)
CM-Align: Consistency-based Multilingual Alignment for Large Language Models
di: Zhang, Xue, et al.
Pubblicazione: (2025)
di: Zhang, Xue, et al.
Pubblicazione: (2025)
Align to the Pivot: Dual Alignment with Self-Feedback for Multilingual Math Reasoning
di: Zhao, Chunxu, et al.
Pubblicazione: (2026)
di: Zhao, Chunxu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
From Centerlines to Hemodynamics: Anisotropic RBF Decoders for Coronary Arteries
di: Bafghi, Reza Akbarian, et al.
Pubblicazione: (2026) -
Test-Driven Agentic Framework for Reliable Robot Controller
di: Tripathi, Shivanshu, et al.
Pubblicazione: (2026) -
MixDiff: Mixing Natural and Synthetic Images for Robust Self-Supervised Representations
di: Bafghi, Reza Akbarian, et al.
Pubblicazione: (2024) -
Parameter Efficient Fine-tuning of Self-supervised ViTs without Catastrophic Forgetting
di: Bafghi, Reza Akbarian, et al.
Pubblicazione: (2024) -
Fine Tuning without Catastrophic Forgetting via Selective Low Rank Adaptation
di: Bafghi, Reza Akbarian, et al.
Pubblicazione: (2025)