Multi-Value Alignment for LLMs via Value Decorrelation and Extrapolation
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Hefei, Wu, Le, Cheng, Chen, Liu, Hao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VC-Soup: Value-Consistency Guided Multi-Value Alignment for Large Language Models
by: Xu, Hefei, et al.
Published: (2026)
by: Xu, Hefei, et al.
Published: (2026)
Mesa-Extrapolation: A Weave Position Encoding Method for Enhanced Extrapolation in LLMs
by: Ma, Xin, et al.
Published: (2024)
by: Ma, Xin, et al.
Published: (2024)
GADPN: Graph Adaptive Denoising and Perturbation Networks via Singular Value Decomposition
by: Deng, Hao, et al.
Published: (2026)
by: Deng, Hao, et al.
Published: (2026)
Internal Value Alignment in Large Language Models through Controlled Value Vector Activation
by: Jin, Haoran, et al.
Published: (2025)
by: Jin, Haoran, et al.
Published: (2025)
MAP: Multi-Human-Value Alignment Palette
by: Wang, Xinran, et al.
Published: (2024)
by: Wang, Xinran, et al.
Published: (2024)
Model Extrapolation Expedites Alignment
by: Zheng, Chujie, et al.
Published: (2024)
by: Zheng, Chujie, et al.
Published: (2024)
VISPA: Pluralistic Alignment via Automatic Value Selection and Activation
by: Zheng, Shenyan, et al.
Published: (2026)
by: Zheng, Shenyan, et al.
Published: (2026)
Evolutionary Guided Decoding: Iterative Value Refinement for LLMs
by: Liu, Zhenhua, et al.
Published: (2025)
by: Liu, Zhenhua, et al.
Published: (2025)
Reinforcement Learning via Value Gradient Flow
by: Xu, Haoran, et al.
Published: (2026)
by: Xu, Haoran, et al.
Published: (2026)
Decorrelative Network Architecture for Robust Electrocardiogram Classification
by: Wiedeman, Christopher, et al.
Published: (2022)
by: Wiedeman, Christopher, et al.
Published: (2022)
ExtremeCast: Boosting Extreme Value Prediction for Global Weather Forecast
by: Xu, Wanghan, et al.
Published: (2024)
by: Xu, Wanghan, et al.
Published: (2024)
Meta-Aligner: Bidirectional Preference-Policy Optimization for Multi-Objective LLMs Alignment
by: Xu, Wenzhe, et al.
Published: (2026)
by: Xu, Wenzhe, et al.
Published: (2026)
Extrapolation of Periodic Functions Using Binary Encoding of Continuous Numerical Values
by: Powell, Brian P., et al.
Published: (2025)
by: Powell, Brian P., et al.
Published: (2025)
On the Inflation of KNN-Shapley Value
by: Yang, Ziao, et al.
Published: (2024)
by: Yang, Ziao, et al.
Published: (2024)
Counterfactual Reasoning for Steerable Pluralistic Value Alignment of Large Language Models
by: Guo, Hanze, et al.
Published: (2025)
by: Guo, Hanze, et al.
Published: (2025)
Adaptive Action Chunking via Multi-Chunk Q Value Estimation
by: Shin, Yongjae, et al.
Published: (2026)
by: Shin, Yongjae, et al.
Published: (2026)
PARM: Multi-Objective Test-Time Alignment via Preference-Aware Autoregressive Reward Model
by: Lin, Baijiong, et al.
Published: (2025)
by: Lin, Baijiong, et al.
Published: (2025)
Regression-adjusted Monte Carlo Estimators for Shapley Values and Probabilistic Values
by: Witter, R. Teal, et al.
Published: (2025)
by: Witter, R. Teal, et al.
Published: (2025)
GAC: Stabilizing Asynchronous RL Training for LLMs via Gradient Alignment Control
by: Xu, Haofeng, et al.
Published: (2026)
by: Xu, Haofeng, et al.
Published: (2026)
Decorrelated Soft Actor-Critic for Efficient Deep Reinforcement Learning
by: Küçükoğlu, Burcu, et al.
Published: (2025)
by: Küçükoğlu, Burcu, et al.
Published: (2025)
Pessimistic Value Iteration for Multi-Task Data Sharing in Offline Reinforcement Learning
by: Bai, Chenjia, et al.
Published: (2024)
by: Bai, Chenjia, et al.
Published: (2024)
Open-Book Neural Algorithmic Reasoning
by: Li, Hefei, et al.
Published: (2024)
by: Li, Hefei, et al.
Published: (2024)
TabularMath: Evaluating Computational Extrapolation in Tabular Learning via Program-Verified Synthesis
by: Cheng, Zerui, et al.
Published: (2026)
by: Cheng, Zerui, et al.
Published: (2026)
Highway Value Iteration Networks
by: Wang, Yuhui, et al.
Published: (2024)
by: Wang, Yuhui, et al.
Published: (2024)
Value Augmented Sampling for Language Model Alignment and Personalization
by: Han, Seungwook, et al.
Published: (2024)
by: Han, Seungwook, et al.
Published: (2024)
PVPO: Pre-Estimated Value-Based Policy Optimization for Agentic Reasoning
by: Feng, Wenfeng, et al.
Published: (2025)
by: Feng, Wenfeng, et al.
Published: (2025)
SAFLEX: Self-Adaptive Augmentation via Feature Label Extrapolation
by: Ding, Mucong, et al.
Published: (2024)
by: Ding, Mucong, et al.
Published: (2024)
Pretrain Value, Not Reward: Decoupled Value Policy Optimization
by: Huang, Chenghua, et al.
Published: (2025)
by: Huang, Chenghua, et al.
Published: (2025)
Representation Learning of Lab Values via Masked AutoEncoders
by: Restrepo, David, et al.
Published: (2025)
by: Restrepo, David, et al.
Published: (2025)
Uniboost: Global Coordination with Value Alignment for Fair and Efficient Traffic Allocation
by: Fan, Ge, et al.
Published: (2026)
by: Fan, Ge, et al.
Published: (2026)
Value-guided action planning with JEPA world models
by: Destrade, Matthieu, et al.
Published: (2025)
by: Destrade, Matthieu, et al.
Published: (2025)
Error Broadcast and Decorrelation as a Potential Artificial and Natural Learning Mechanism
by: Erdogan, Mete, et al.
Published: (2025)
by: Erdogan, Mete, et al.
Published: (2025)
Factor Decorrelation Enhanced Data Removal from Deep Predictive Models
by: Yang, Wenhao, et al.
Published: (2025)
by: Yang, Wenhao, et al.
Published: (2025)
Decorrelating the Future: Joint Frequency Domain Learning for Spatio-temporal Forecasting
by: Wang, Zepu, et al.
Published: (2026)
by: Wang, Zepu, et al.
Published: (2026)
Stitched Value Model for Diffusion Alignment
by: Go, Hyojun, et al.
Published: (2026)
by: Go, Hyojun, et al.
Published: (2026)
Are the Values of LLMs Structurally Aligned with Humans? A Causal Perspective
by: Kang, Yipeng, et al.
Published: (2024)
by: Kang, Yipeng, et al.
Published: (2024)
Value Flows
by: Dong, Perry, et al.
Published: (2025)
by: Dong, Perry, et al.
Published: (2025)
Rethinking KL Regularization in RLHF: From Value Estimation to Gradient Optimization
by: Liu, Kezhao, et al.
Published: (2025)
by: Liu, Kezhao, et al.
Published: (2025)
RiskQ: Risk-sensitive Multi-Agent Reinforcement Learning Value Factorization
by: Shen, Siqi, et al.
Published: (2023)
by: Shen, Siqi, et al.
Published: (2023)
Towards Safe Reinforcement Learning via Constraining Conditional Value-at-Risk
by: Ying, Chengyang, et al.
Published: (2022)
by: Ying, Chengyang, et al.
Published: (2022)
Similar Items
-
VC-Soup: Value-Consistency Guided Multi-Value Alignment for Large Language Models
by: Xu, Hefei, et al.
Published: (2026) -
Mesa-Extrapolation: A Weave Position Encoding Method for Enhanced Extrapolation in LLMs
by: Ma, Xin, et al.
Published: (2024) -
GADPN: Graph Adaptive Denoising and Perturbation Networks via Singular Value Decomposition
by: Deng, Hao, et al.
Published: (2026) -
Internal Value Alignment in Large Language Models through Controlled Value Vector Activation
by: Jin, Haoran, et al.
Published: (2025) -
MAP: Multi-Human-Value Alignment Palette
by: Wang, Xinran, et al.
Published: (2024)