UniARM: Towards a Unified Autoregressive Reward Model for Multi-Objective Test-Time Alignment
Fuente:
arXiv
Saved in:
| Main Authors: | Xie, Hongyan, Ban, Yikun, Fang, Ruiyu, Huang, Zixuan, Wang, Deqing, Li, Jianxin, Yao, Yitong, Wang, Chao, Song, Shuangyong |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Mitigating Spurious Correlations Between Question and Answer via Chain-of-Thought Correctness Perception Distillation
by: Xie, Hongyan, et al.
Published: (2025)
by: Xie, Hongyan, et al.
Published: (2025)
UniFAR: A Unified Facet-Aware Retrieval Framework for Scientific Documents
by: Dou, Zheng, et al.
Published: (2026)
by: Dou, Zheng, et al.
Published: (2026)
Real-Time Aligned Reward Model beyond Semantics
by: Huang, Zixuan, et al.
Published: (2026)
by: Huang, Zixuan, et al.
Published: (2026)
GenARM: Reward Guided Generation with Autoregressive Reward Model for Test-time Alignment
by: Xu, Yuancheng, et al.
Published: (2024)
by: Xu, Yuancheng, et al.
Published: (2024)
Adaptive Batch-Wise Sample Scheduling for Direct Preference Optimization
by: Huang, Zixuan, et al.
Published: (2025)
by: Huang, Zixuan, et al.
Published: (2025)
Policy Improvement Reinforcement Learning
by: Wang, Huaiyang, et al.
Published: (2026)
by: Wang, Huaiyang, et al.
Published: (2026)
PARM: Multi-Objective Test-Time Alignment via Preference-Aware Autoregressive Reward Model
by: Lin, Baijiong, et al.
Published: (2025)
by: Lin, Baijiong, et al.
Published: (2025)
Stop Rewarding Hallucinated Steps: Faithfulness-Aware Step-Level Reinforcement Learning for Small Reasoning Models
by: Nie, Shuo, et al.
Published: (2026)
by: Nie, Shuo, et al.
Published: (2026)
Emotional Support with LLM-based Empathetic Dialogue Generation
by: Wang, Shiquan, et al.
Published: (2025)
by: Wang, Shiquan, et al.
Published: (2025)
Does Your Reasoning Model Implicitly Know When to Stop Thinking?
by: Huang, Zixuan, et al.
Published: (2026)
by: Huang, Zixuan, et al.
Published: (2026)
Autoregressive End-to-End Planning with Time-Invariant Spatial Alignment and Multi-Objective Policy Refinement
by: Zhao, Jianbo, et al.
Published: (2025)
by: Zhao, Jianbo, et al.
Published: (2025)
Weak-Driven Learning: How Weak Agents make Strong Agents Stronger
by: Chen, Zehao, et al.
Published: (2026)
by: Chen, Zehao, et al.
Published: (2026)
TCNN: Triple Convolutional Neural Network Models for Retrieval-based Question Answering System in E-commerce
by: Song, Shuangyong, et al.
Published: (2020)
by: Song, Shuangyong, et al.
Published: (2020)
Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards
by: Lu, Xiaodong, et al.
Published: (2026)
by: Lu, Xiaodong, et al.
Published: (2026)
Dynamic Knowledge Fusion for Multi-Domain Dialogue State Tracking
by: Su, Haoxiang, et al.
Published: (2026)
by: Su, Haoxiang, et al.
Published: (2026)
UniTTA: Unified Benchmark and Versatile Framework Towards Realistic Test-Time Adaptation
by: Du, Chaoqun, et al.
Published: (2024)
by: Du, Chaoqun, et al.
Published: (2024)
UniT: Unified Geometry Learning with Group Autoregressive Transformer
by: Wang, Haotian, et al.
Published: (2026)
by: Wang, Haotian, et al.
Published: (2026)
Learning to Optimize Multi-Objective Alignment Through Dynamic Reward Weighting
by: Lu, Yining, et al.
Published: (2025)
by: Lu, Yining, et al.
Published: (2025)
Uni-Animator: Towards Unified Visual Colorization
by: Chen, Xinyuan, et al.
Published: (2026)
by: Chen, Xinyuan, et al.
Published: (2026)
Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and Generation
by: Wang, Peiyu, et al.
Published: (2025)
by: Wang, Peiyu, et al.
Published: (2025)
UniPredict: Large Language Models are Universal Tabular Classifiers
by: Wang, Ruiyu, et al.
Published: (2023)
by: Wang, Ruiyu, et al.
Published: (2023)
Introducing Visual Scenes and Reasoning: A More Realistic Benchmark for Spoken Language Understanding
by: Wu, Di, et al.
Published: (2025)
by: Wu, Di, et al.
Published: (2025)
Reward-Forcing: Autoregressive Video Generation with Reward Feedback
by: Zhang, Jingran, et al.
Published: (2026)
by: Zhang, Jingran, et al.
Published: (2026)
UniX: Unifying Autoregression and Diffusion for Chest X-Ray Understanding and Generation
by: Zhang, Ruiheng, et al.
Published: (2026)
by: Zhang, Ruiheng, et al.
Published: (2026)
UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
by: Guan, Wenhao, et al.
Published: (2025)
by: Guan, Wenhao, et al.
Published: (2025)
Heterogeneous Agent Collaborative Reinforcement Learning
by: Zhang, Zhixia, et al.
Published: (2026)
by: Zhang, Zhixia, et al.
Published: (2026)
UniAlignment: Semantic Alignment for Unified Image Generation, Understanding, Manipulation and Perception
by: Song, Xinyang, et al.
Published: (2025)
by: Song, Xinyang, et al.
Published: (2025)
Reward-free Alignment for Conflicting Objectives
by: Chen, Peter, et al.
Published: (2026)
by: Chen, Peter, et al.
Published: (2026)
UniVideo: Unified Understanding, Generation, and Editing for Videos
by: Wei, Cong, et al.
Published: (2025)
by: Wei, Cong, et al.
Published: (2025)
T-POP: Test-Time Personalization with Online Preference Feedback
by: Qu, Zikun, et al.
Published: (2025)
by: Qu, Zikun, et al.
Published: (2025)
UniECG: Understanding and Generating ECG in One Unified Model
by: Jin, Jiarui, et al.
Published: (2025)
by: Jin, Jiarui, et al.
Published: (2025)
UniCBE: An Uniformity-driven Comparing Based Evaluation Framework with Unified Multi-Objective Optimization
by: Yuan, Peiwen, et al.
Published: (2025)
by: Yuan, Peiwen, et al.
Published: (2025)
Automatic Reward Shaping from Multi-Objective Human Heuristics
by: Xie, Yuqing, et al.
Published: (2025)
by: Xie, Yuqing, et al.
Published: (2025)
Pathwise Test-Time Correction for Autoregressive Long Video Generation
by: Xiang, Xunzhi, et al.
Published: (2026)
by: Xiang, Xunzhi, et al.
Published: (2026)
UniCon: Unified Framework for Efficient Contrastive Alignment via Kernels
by: Sui, Hangke, et al.
Published: (2026)
by: Sui, Hangke, et al.
Published: (2026)
MR-UIE: Multi-Perspective Reasoning with Reinforcement Learning for Universal Information Extraction
by: Li, Zhongqiu, et al.
Published: (2025)
by: Li, Zhongqiu, et al.
Published: (2025)
Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models
by: Li, Chengao, et al.
Published: (2025)
by: Li, Chengao, et al.
Published: (2025)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
by: Ding, Shengyuan, et al.
Published: (2025)
by: Ding, Shengyuan, et al.
Published: (2025)
Common-agency Games for Multi-Objective Test-Time Alignment
by: Chen, Baiting, et al.
Published: (2026)
by: Chen, Baiting, et al.
Published: (2026)
ARM: Advantage Reward Modeling for Long-Horizon Manipulation
by: Mao, Yiming, et al.
Published: (2026)
by: Mao, Yiming, et al.
Published: (2026)
Similar Items
-
Mitigating Spurious Correlations Between Question and Answer via Chain-of-Thought Correctness Perception Distillation
by: Xie, Hongyan, et al.
Published: (2025) -
UniFAR: A Unified Facet-Aware Retrieval Framework for Scientific Documents
by: Dou, Zheng, et al.
Published: (2026) -
Real-Time Aligned Reward Model beyond Semantics
by: Huang, Zixuan, et al.
Published: (2026) -
GenARM: Reward Guided Generation with Autoregressive Reward Model for Test-time Alignment
by: Xu, Yuancheng, et al.
Published: (2024) -
Adaptive Batch-Wise Sample Scheduling for Direct Preference Optimization
by: Huang, Zixuan, et al.
Published: (2025)