ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework
Fuente:
arXiv
Salvato in:
| Autori principali: | Qin, Kai, Liu, Liangxin, Liang, Yu, Wang, Longzheng, Wang, Yan, Zhang, Yueyang, Xia, Long, Sun, Zhiyuan, Liu, Houde, Shi, Daiting |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training
di: Liang, Yu, et al.
Pubblicazione: (2026)
di: Liang, Yu, et al.
Pubblicazione: (2026)
Advancing General-Purpose Reasoning Models with Modular Gradient Surgery
di: Cai, Min, et al.
Pubblicazione: (2026)
di: Cai, Min, et al.
Pubblicazione: (2026)
When Less is More: The LLM Scaling Paradox in Context Compression
di: Guo, Ruishan, et al.
Pubblicazione: (2026)
di: Guo, Ruishan, et al.
Pubblicazione: (2026)
SelectIT: Selective Instruction Tuning for LLMs via Uncertainty-Aware Self-Reflection
di: Liu, Liangxin, et al.
Pubblicazione: (2024)
di: Liu, Liangxin, et al.
Pubblicazione: (2024)
TRE: Encouraging Exploration in the Trust Region
di: Huang, Chao, et al.
Pubblicazione: (2026)
di: Huang, Chao, et al.
Pubblicazione: (2026)
AgentRM: Enhancing Agent Generalization with Reward Modeling
di: Xia, Yu, et al.
Pubblicazione: (2025)
di: Xia, Yu, et al.
Pubblicazione: (2025)
ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains
di: Zhao, Ziqi, et al.
Pubblicazione: (2026)
di: Zhao, Ziqi, et al.
Pubblicazione: (2026)
Intuition First or Reflection Before Judgment? The Impact of Evaluation Sequence on Consumer Ratings
di: Wang, He, et al.
Pubblicazione: (2025)
di: Wang, He, et al.
Pubblicazione: (2025)
Thinking as Compression: Your Reasoning Model is Secretly a Context Compressor
di: Ma, Guoxin, et al.
Pubblicazione: (2026)
di: Ma, Guoxin, et al.
Pubblicazione: (2026)
MARS: Memory-Enhanced Agents with Reflective Self-improvement
di: Liang, Xuechen, et al.
Pubblicazione: (2025)
di: Liang, Xuechen, et al.
Pubblicazione: (2025)
Rewarding Reflection
di: Harvey, Carl A., II
Pubblicazione: (2008)
di: Harvey, Carl A., II
Pubblicazione: (2008)
HAF-RM: A Hybrid Alignment Framework for Reward Model Training
di: Liu, Shujun, et al.
Pubblicazione: (2024)
di: Liu, Shujun, et al.
Pubblicazione: (2024)
Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models
di: Hong, Ilgee, et al.
Pubblicazione: (2025)
di: Hong, Ilgee, et al.
Pubblicazione: (2025)
GUI-Reflection: Empowering Multimodal GUI Models with Self-Reflection Behavior
di: Wu, Penghao, et al.
Pubblicazione: (2025)
di: Wu, Penghao, et al.
Pubblicazione: (2025)
Reflection in the Dark: Exposing and Escaping the Black Box in Reflective Prompt Optimization
di: Liu, Shiyan, et al.
Pubblicazione: (2026)
di: Liu, Shiyan, et al.
Pubblicazione: (2026)
Self-Verifying Reflection Helps Transformers with CoT Reasoning
di: Yu, Zhongwei, et al.
Pubblicazione: (2025)
di: Yu, Zhongwei, et al.
Pubblicazione: (2025)
ReflectEvo: Improving Meta Introspection of Small LLMs by Learning Self-Reflection
di: Li, Jiaqi, et al.
Pubblicazione: (2025)
di: Li, Jiaqi, et al.
Pubblicazione: (2025)
RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems
di: Zeng, Wenwen, et al.
Pubblicazione: (2026)
di: Zeng, Wenwen, et al.
Pubblicazione: (2026)
CAMEL: Confidence-Gated Reflection for Reward Modeling
di: Zhu, Zirui, et al.
Pubblicazione: (2026)
di: Zhu, Zirui, et al.
Pubblicazione: (2026)
Phoenix: A Motion-based Self-Reflection Framework for Fine-grained Robotic Action Correction
di: Xia, Wenke, et al.
Pubblicazione: (2025)
di: Xia, Wenke, et al.
Pubblicazione: (2025)
Enhancing Long-Chain Reasoning Distillation through Error-Aware Self-Reflection
di: Wu, Zhuoyang, et al.
Pubblicazione: (2025)
di: Wu, Zhuoyang, et al.
Pubblicazione: (2025)
GRPO and Reflection Reward for Mathematical Reasoning in Large Language Models
di: Wang, Zhijie
Pubblicazione: (2026)
di: Wang, Zhijie
Pubblicazione: (2026)
Self-Reflective Generation at Test Time
di: Mu, Jian, et al.
Pubblicazione: (2025)
di: Mu, Jian, et al.
Pubblicazione: (2025)
RM-R1: Reward Modeling as Reasoning
di: Chen, Xiusi, et al.
Pubblicazione: (2025)
di: Chen, Xiusi, et al.
Pubblicazione: (2025)
AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward
di: Huang, Runhui, et al.
Pubblicazione: (2026)
di: Huang, Runhui, et al.
Pubblicazione: (2026)
ALaRM: Align Language Models via Hierarchical Rewards Modeling
di: Lai, Yuhang, et al.
Pubblicazione: (2024)
di: Lai, Yuhang, et al.
Pubblicazione: (2024)
RL-RIG: A Generative Spatial Reasoner via Intrinsic Reflection
di: Wang, Tianyu, et al.
Pubblicazione: (2026)
di: Wang, Tianyu, et al.
Pubblicazione: (2026)
CE-RM: A Pointwise Generative Reward Model Optimized via Two-Stage Rollout and Unified Criteria
di: Hu, Xinyu, et al.
Pubblicazione: (2026)
di: Hu, Xinyu, et al.
Pubblicazione: (2026)
Judicial review and transitional justice: Reflective Judgment in three contexts
di: Mihaela Mihai
Pubblicazione: (2010)
di: Mihaela Mihai
Pubblicazione: (2010)
Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models
di: Weng, Fenghua, et al.
Pubblicazione: (2025)
di: Weng, Fenghua, et al.
Pubblicazione: (2025)
LongRM: Revealing and Unlocking the Context Boundary of Reward Modeling
di: Tang, Zecheng, et al.
Pubblicazione: (2025)
di: Tang, Zecheng, et al.
Pubblicazione: (2025)
Reflecting Twice before Speaking with Empathy: Self-Reflective Alternating Inference for Empathy-Aware End-to-End Spoken Dialogue
di: Jia, Yuhang, et al.
Pubblicazione: (2026)
di: Jia, Yuhang, et al.
Pubblicazione: (2026)
Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning
di: Bensal, Shelly, et al.
Pubblicazione: (2025)
di: Bensal, Shelly, et al.
Pubblicazione: (2025)
CommSense: Facilitating Bias-Aware and Reflective Navigation of Online Comments for Rational Judgment
di: Ouyang, Yang, et al.
Pubblicazione: (2026)
di: Ouyang, Yang, et al.
Pubblicazione: (2026)
A Unified Representation Underlying the Judgment of Large Language Models
di: Lu, Yi-Long, et al.
Pubblicazione: (2025)
di: Lu, Yi-Long, et al.
Pubblicazione: (2025)
Towards Reason-Informed Video Editing in Unified Models with Self-Reflective Learning
di: Liu, Xinyu, et al.
Pubblicazione: (2025)
di: Liu, Xinyu, et al.
Pubblicazione: (2025)
SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards
di: Hong, Jixiang, et al.
Pubblicazione: (2025)
di: Hong, Jixiang, et al.
Pubblicazione: (2025)
RM-Distiller: Exploiting Generative LLM for Reward Model Distillation
di: Zhou, Hongli, et al.
Pubblicazione: (2026)
di: Zhou, Hongli, et al.
Pubblicazione: (2026)
Reflection-Based Task Adaptation for Self-Improving VLA
di: Li, Baicheng, et al.
Pubblicazione: (2025)
di: Li, Baicheng, et al.
Pubblicazione: (2025)
Meta-Reflection: A Feedback-Free Reflection Learning Framework
di: Wang, Yaoke, et al.
Pubblicazione: (2024)
di: Wang, Yaoke, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training
di: Liang, Yu, et al.
Pubblicazione: (2026) -
Advancing General-Purpose Reasoning Models with Modular Gradient Surgery
di: Cai, Min, et al.
Pubblicazione: (2026) -
When Less is More: The LLM Scaling Paradox in Context Compression
di: Guo, Ruishan, et al.
Pubblicazione: (2026) -
SelectIT: Selective Instruction Tuning for LLMs via Uncertainty-Aware Self-Reflection
di: Liu, Liangxin, et al.
Pubblicazione: (2024) -
TRE: Encouraging Exploration in the Trust Region
di: Huang, Chao, et al.
Pubblicazione: (2026)