Structural Reward Model: Enhancing Interpretability, Efficiency, and Scalability in Reward Modeling
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Xiaoyu, Liang, Di, Dai, Chang, Shan, Hongyu, Liu, Peiyang, Liu, Yonghao, Wu, Muling, Li, Yuntao, Wu, Xianjie, Miao, LI, Shen, Jiangrong, Peng, Minlong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty
por: Xue, Chao, et al.
Publicado: (2026)
por: Xue, Chao, et al.
Publicado: (2026)
DeCoRL: Decoupling Reasoning Chains via Parallel Sub-Step Generation and Cascaded Reinforcement for Interpretable and Scalable RLHF
por: Gao, Ziyuan, et al.
Publicado: (2025)
por: Gao, Ziyuan, et al.
Publicado: (2025)
DPI: Exploiting Parameter Heterogeneity for Interference-Free Fine-Tuning
por: Liu, Xiaoyu, et al.
Publicado: (2026)
por: Liu, Xiaoyu, et al.
Publicado: (2026)
Parameter Importance is Not Static: Evolving Parameter Isolation for Supervised Fine-Tuning
por: Lin, Zekai, et al.
Publicado: (2026)
por: Lin, Zekai, et al.
Publicado: (2026)
Why Supervised Fine-Tuning Fails to Learn: A Systematic Study of Incomplete Learning in Large Language Models
por: Xue, Chao, et al.
Publicado: (2026)
por: Xue, Chao, et al.
Publicado: (2026)
Inference-Time Scaling for Generalist Reward Modeling
por: Liu, Zijun, et al.
Publicado: (2025)
por: Liu, Zijun, et al.
Publicado: (2025)
RRM: Robust Reward Model Training Mitigates Reward Hacking
por: Liu, Tianqi, et al.
Publicado: (2024)
por: Liu, Tianqi, et al.
Publicado: (2024)
DocReward: A Document Reward Model for Structuring and Stylizing
por: Liu, Junpeng, et al.
Publicado: (2025)
por: Liu, Junpeng, et al.
Publicado: (2025)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
por: Liu, Chris Yuhao, et al.
Publicado: (2024)
SemiReward: A General Reward Model for Semi-supervised Learning
por: Li, Siyuan, et al.
Publicado: (2023)
por: Li, Siyuan, et al.
Publicado: (2023)
Training Data Efficiency in Multimodal Process Reward Models
por: Li, Jinyuan, et al.
Publicado: (2026)
por: Li, Jinyuan, et al.
Publicado: (2026)
EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing
por: Wu, Keming, et al.
Publicado: (2025)
por: Wu, Keming, et al.
Publicado: (2025)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
por: Xie, Tianbao, et al.
Publicado: (2023)
por: Xie, Tianbao, et al.
Publicado: (2023)
Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning
por: Wang, Xiaokun, et al.
Publicado: (2025)
por: Wang, Xiaokun, et al.
Publicado: (2025)
Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency
por: Li, Hongyu, et al.
Publicado: (2025)
por: Li, Hongyu, et al.
Publicado: (2025)
Motivating Effort with Information about Future Rewards
por: Liu, Chang
Publicado: (2021)
por: Liu, Chang
Publicado: (2021)
StructKV: Preserving the Structural Skeleton for Scalable Long-Context Inference
por: Chen, Zhirui, et al.
Publicado: (2026)
por: Chen, Zhirui, et al.
Publicado: (2026)
Reward Model Routing in Alignment
por: Wu, Xinle, et al.
Publicado: (2025)
por: Wu, Xinle, et al.
Publicado: (2025)
Sailing by the Stars: A Survey on Reward Models and Learning Strategies for Learning from Rewards
por: Wu, Xiaobao
Publicado: (2025)
por: Wu, Xiaobao
Publicado: (2025)
RoVer: Robot Reward Model as Test-Time Verifier for Vision-Language-Action Model
por: Dai, Mingtong, et al.
Publicado: (2025)
por: Dai, Mingtong, et al.
Publicado: (2025)
From Captions to Rewards (CAREVL): Leveraging Large Language Model Experts for Enhanced Reward Modeling in Large Vision-Language Models
por: Dai, Muzhi, et al.
Publicado: (2025)
por: Dai, Muzhi, et al.
Publicado: (2025)
HAF-RM: A Hybrid Alignment Framework for Reward Model Training
por: Liu, Shujun, et al.
Publicado: (2024)
por: Liu, Shujun, et al.
Publicado: (2024)
HoPE: Hyperbolic Rotary Positional Encoding for Stable Long-Range Dependency Modeling in Large Language Models
por: Dai, Chang, et al.
Publicado: (2025)
por: Dai, Chang, et al.
Publicado: (2025)
StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models
por: Zhang, Xiangxiang, et al.
Publicado: (2025)
por: Zhang, Xiangxiang, et al.
Publicado: (2025)
Policy Learning for Balancing Short-Term and Long-Term Rewards
por: Wu, Peng, et al.
Publicado: (2024)
por: Wu, Peng, et al.
Publicado: (2024)
Intra-Trajectory Consistency for Reward Modeling
por: Zhou, Chaoyang, et al.
Publicado: (2025)
por: Zhou, Chaoyang, et al.
Publicado: (2025)
Fast-Slow Thinking RM: Efficient Integration of Scalar and Generative Reward Models
por: Wu, Jiayun, et al.
Publicado: (2026)
por: Wu, Jiayun, et al.
Publicado: (2026)
Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling
por: Li, Zhaoyan, et al.
Publicado: (2026)
por: Li, Zhaoyan, et al.
Publicado: (2026)
OS-Themis: A Scalable Critic Framework for Generalist GUI Rewards
por: Li, Zehao, et al.
Publicado: (2026)
por: Li, Zehao, et al.
Publicado: (2026)
Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey
por: Liu, Qiyuan, et al.
Publicado: (2025)
por: Liu, Qiyuan, et al.
Publicado: (2025)
Confidence as a Reward: Transforming LLMs into Reward Models
por: Du, He, et al.
Publicado: (2025)
por: Du, He, et al.
Publicado: (2025)
What Are Step-Level Reward Models Rewarding? Counterintuitive Findings from MCTS-Boosted Mathematical Reasoning
por: Ma, Yiran, et al.
Publicado: (2024)
por: Ma, Yiran, et al.
Publicado: (2024)
RewardDance: Reward Scaling in Visual Generation
por: Wu, Jie, et al.
Publicado: (2025)
por: Wu, Jie, et al.
Publicado: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
por: Ding, Meidan, et al.
Publicado: (2025)
por: Ding, Meidan, et al.
Publicado: (2025)
Reward Reasoning Model
por: Guo, Jiaxin, et al.
Publicado: (2025)
por: Guo, Jiaxin, et al.
Publicado: (2025)
Interpretable Reward Modeling with Active Concept Bottlenecks
por: Laguna, Sonia, et al.
Publicado: (2025)
por: Laguna, Sonia, et al.
Publicado: (2025)
Interpretable Reward Model via Sparse Autoencoder
por: Zhang, Shuyi, et al.
Publicado: (2025)
por: Zhang, Shuyi, et al.
Publicado: (2025)
Efficient Reasoning via Reward Model
por: Wang, Yuhao, et al.
Publicado: (2025)
por: Wang, Yuhao, et al.
Publicado: (2025)
Long-form RewardBench: Evaluating Reward Models for Long-form Generation
por: Huang, Hui, et al.
Publicado: (2026)
por: Huang, Hui, et al.
Publicado: (2026)
CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling
por: Liu, Dengcan, et al.
Publicado: (2026)
por: Liu, Dengcan, et al.
Publicado: (2026)
Ejemplares similares
-
Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty
por: Xue, Chao, et al.
Publicado: (2026) -
DeCoRL: Decoupling Reasoning Chains via Parallel Sub-Step Generation and Cascaded Reinforcement for Interpretable and Scalable RLHF
por: Gao, Ziyuan, et al.
Publicado: (2025) -
DPI: Exploiting Parameter Heterogeneity for Interference-Free Fine-Tuning
por: Liu, Xiaoyu, et al.
Publicado: (2026) -
Parameter Importance is Not Static: Evolving Parameter Isolation for Supervised Fine-Tuning
por: Lin, Zekai, et al.
Publicado: (2026) -
Why Supervised Fine-Tuning Fails to Learn: A Systematic Study of Incomplete Learning in Large Language Models
por: Xue, Chao, et al.
Publicado: (2026)