Don't Forget Your Reward Values: Language Model Alignment via Value-based Calibration
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mao, Xin, Li, Feng-Lin, Xu, Huimin, Zhang, Wei, Luu, Anh Tuan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Accuracy Paradox in RLHF: When Better Reward Models Don't Yield Better Language Models
par: Chen, Yanjun, et autres
Publié: (2024)
par: Chen, Yanjun, et autres
Publié: (2024)
Don't Forget to Connect! Improving RAG with Graph-based Reranking
par: Dong, Jialin, et autres
Publié: (2024)
par: Dong, Jialin, et autres
Publié: (2024)
As Simple as Fine-tuning: LLM Alignment via Bidirectional Negative Feedback Loss
par: Mao, Xin, et autres
Publié: (2024)
par: Mao, Xin, et autres
Publié: (2024)
HAVE: Head-Adaptive Gating and ValuE Calibration for Hallucination Mitigation in Large Language Models
par: Tong, Xin, et autres
Publié: (2025)
par: Tong, Xin, et autres
Publié: (2025)
sDPO: Don't Use Your Data All at Once
par: Kim, Dahyun, et autres
Publié: (2024)
par: Kim, Dahyun, et autres
Publié: (2024)
Language Models Don't Learn the Physical Manifestation of Language
par: Lee, Bruce W., et autres
Publié: (2024)
par: Lee, Bruce W., et autres
Publié: (2024)
Don't Think Twice! Over-Reasoning Impairs Confidence Calibration
par: Lacombe, Romain, et autres
Publié: (2025)
par: Lacombe, Romain, et autres
Publié: (2025)
Towards Reliable Truth-Aligned Uncertainty Estimation in Large Language Models
par: Srey, Ponhvoan, et autres
Publié: (2026)
par: Srey, Ponhvoan, et autres
Publié: (2026)
Learning Uncertainty from Sequential Internal Dispersion in Large Language Models
par: Srey, Ponhvoan, et autres
Publié: (2026)
par: Srey, Ponhvoan, et autres
Publié: (2026)
Inference-Time Language Model Alignment via Integrated Value Guidance
par: Liu, Zhixuan, et autres
Publié: (2024)
par: Liu, Zhixuan, et autres
Publié: (2024)
Prompt as Triggers for Backdoor Attack: Examining the Vulnerability in Language Models
par: Zhao, Shuai, et autres
Publié: (2023)
par: Zhao, Shuai, et autres
Publié: (2023)
Benchmarking Multi-National Value Alignment for Large Language Models
par: Shi, Weijie, et autres
Publié: (2025)
par: Shi, Weijie, et autres
Publié: (2025)
Internal Value Alignment in Large Language Models through Controlled Value Vector Activation
par: Jin, Haoran, et autres
Publié: (2025)
par: Jin, Haoran, et autres
Publié: (2025)
VALUEFLOW: Toward Pluralistic and Steerable Value-based Alignment in Large Language Models
par: Kim, Woojin, et autres
Publié: (2026)
par: Kim, Woojin, et autres
Publié: (2026)
Diverse Human Value Alignment for Large Language Models via Ethical Reasoning
par: Wang, Jiahao, et autres
Publié: (2025)
par: Wang, Jiahao, et autres
Publié: (2025)
SCOPE: Compress Mathematical Reasoning Steps for Efficient Automated Process Annotation
par: Xu, Huimin, et autres
Publié: (2025)
par: Xu, Huimin, et autres
Publié: (2025)
Unsupervised Hallucination Detection by Inspecting Reasoning Processes
par: Srey, Ponhvoan, et autres
Publié: (2025)
par: Srey, Ponhvoan, et autres
Publié: (2025)
A Survey on Neural Topic Models: Methods, Applications, and Challenges
par: Wu, Xiaobao, et autres
Publié: (2024)
par: Wu, Xiaobao, et autres
Publié: (2024)
Don't Pay Attention
par: Hammoud, Mohammad, et autres
Publié: (2025)
par: Hammoud, Mohammad, et autres
Publié: (2025)
Process Reward Model with Q-Value Rankings
par: Li, Wendi, et autres
Publié: (2024)
par: Li, Wendi, et autres
Publié: (2024)
Don't Forget the Critic: Value-Based Data Rehearsal for Multi-Cyclic Continual Reinforcement Learning
par: Poole, Benjamin, et autres
Publié: (2026)
par: Poole, Benjamin, et autres
Publié: (2026)
Do Retrieval Augmented Language Models Know When They Don't Know?
par: Zhou, Youchao, et autres
Publié: (2025)
par: Zhou, Youchao, et autres
Publié: (2025)
Don't Let It Fade: Preserving Edits in Diffusion Language Models via Token Timestep Allocation
par: Kim, Woojin, et autres
Publié: (2025)
par: Kim, Woojin, et autres
Publié: (2025)
Reasoning Models Reason Well, Until They Don't
par: Rameshkumar, Revanth, et autres
Publié: (2025)
par: Rameshkumar, Revanth, et autres
Publié: (2025)
Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoning
par: Xu, Huimin, et autres
Publié: (2025)
par: Xu, Huimin, et autres
Publié: (2025)
Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning
par: Zhao, Shuai, et autres
Publié: (2024)
par: Zhao, Shuai, et autres
Publié: (2024)
Who's Who: Large Language Models Meet Knowledge Conflicts in Practice
par: Pham, Quang Hieu, et autres
Publié: (2024)
par: Pham, Quang Hieu, et autres
Publié: (2024)
Don't Change My View: Ideological Bias Auditing in Large Language Models
par: Kröger, Paul, et autres
Publié: (2025)
par: Kröger, Paul, et autres
Publié: (2025)
Value Augmented Sampling for Language Model Alignment and Personalization
par: Han, Seungwook, et autres
Publié: (2024)
par: Han, Seungwook, et autres
Publié: (2024)
Towards the TopMost: A Topic Modeling System Toolkit
par: Wu, Xiaobao, et autres
Publié: (2023)
par: Wu, Xiaobao, et autres
Publié: (2023)
s3: You Don't Need That Much Data to Train a Search Agent via RL
par: Jiang, Pengcheng, et autres
Publié: (2025)
par: Jiang, Pengcheng, et autres
Publié: (2025)
F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare
par: Plyusov, Daniil, et autres
Publié: (2026)
par: Plyusov, Daniil, et autres
Publié: (2026)
VAL-Bench: Belief Consistency as a measure for Value Alignment in Language Models
par: Gupta, Aman, et autres
Publié: (2025)
par: Gupta, Aman, et autres
Publié: (2025)
Honest AI: Fine-Tuning "Small" Language Models to Say "I Don't Know", and Reducing Hallucination in RAG
par: Chen, Xinxi, et autres
Publié: (2024)
par: Chen, Xinxi, et autres
Publié: (2024)
Modeling Dynamic Topics in Chain-Free Fashion by Evolution-Tracking Contrastive Learning and Unassociated Word Exclusion
par: Wu, Xiaobao, et autres
Publié: (2024)
par: Wu, Xiaobao, et autres
Publié: (2024)
Gradual Vigilance and Interval Communication: Enhancing Value Alignment in Multi-Agent Debates
par: Zou, Rui, et autres
Publié: (2024)
par: Zou, Rui, et autres
Publié: (2024)
Flames: Benchmarking Value Alignment of LLMs in Chinese
par: Huang, Kexin, et autres
Publié: (2023)
par: Huang, Kexin, et autres
Publié: (2023)
ALI-Agent: Assessing LLMs' Alignment with Human Values via Agent-based Evaluation
par: Zheng, Jingnan, et autres
Publié: (2024)
par: Zheng, Jingnan, et autres
Publié: (2024)
Large Language Models Must Be Taught to Know What They Don't Know
par: Kapoor, Sanyam, et autres
Publié: (2024)
par: Kapoor, Sanyam, et autres
Publié: (2024)
Know What You Don't Know: Uncertainty Calibration of Process Reward Models
par: Park, Young-Jin, et autres
Publié: (2025)
par: Park, Young-Jin, et autres
Publié: (2025)
Documents similaires
-
The Accuracy Paradox in RLHF: When Better Reward Models Don't Yield Better Language Models
par: Chen, Yanjun, et autres
Publié: (2024) -
Don't Forget to Connect! Improving RAG with Graph-based Reranking
par: Dong, Jialin, et autres
Publié: (2024) -
As Simple as Fine-tuning: LLM Alignment via Bidirectional Negative Feedback Loss
par: Mao, Xin, et autres
Publié: (2024) -
HAVE: Head-Adaptive Gating and ValuE Calibration for Hallucination Mitigation in Large Language Models
par: Tong, Xin, et autres
Publié: (2025) -
sDPO: Don't Use Your Data All at Once
par: Kim, Dahyun, et autres
Publié: (2024)