Rewarding the Journey, Not Just the Destination: A Composite Path and Answer Self-Scoring Reward Mechanism for Test-Time Reinforcement Learning
Fuente:
arXiv
Saved in:
| Main Authors: | Xing, Jingyu, Tang, Chenwei, Liu, Xinyu, Xiong, Deng, Huang, Shudong, Ju, Wei, Lv, Jiancheng, Qiao, Ziyue |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Multi-view Granular-ball Contrastive Clustering
by: Su, Peng, et al.
Published: (2024)
by: Su, Peng, et al.
Published: (2024)
Not Just the Destination, But the Journey: Reasoning Traces Causally Shape Generalization Behaviors
by: Wen, Pengcheng, et al.
Published: (2026)
by: Wen, Pengcheng, et al.
Published: (2026)
Memory-Augmented Dual-Decoder Networks for Multi-Class Unsupervised Anomaly Detection
by: Xing, Jingyu, et al.
Published: (2025)
by: Xing, Jingyu, et al.
Published: (2025)
SaENeRF: Suppressing Artifacts in Event-based Neural Radiance Fields
by: Wang, Yuanjian, et al.
Published: (2025)
by: Wang, Yuanjian, et al.
Published: (2025)
SAG-Agent: Enabling Long-Horizon Reasoning in Strategy Games via Dynamic Knowledge Graphs
by: Tang, Chenwei, et al.
Published: (2025)
by: Tang, Chenwei, et al.
Published: (2025)
Rethinking KV Cache Eviction via a Unified Information-Theoretic Objective
by: Yang, Jiaming, et al.
Published: (2026)
by: Yang, Jiaming, et al.
Published: (2026)
Dual Prompt Learning for Adapting Vision-Language Models to Downstream Image-Text Retrieval
by: Wang, Yifan, et al.
Published: (2025)
by: Wang, Yifan, et al.
Published: (2025)
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
by: Zhang, Kongcheng, et al.
Published: (2025)
by: Zhang, Kongcheng, et al.
Published: (2025)
Signature Approach for Contextual Bandits with Nonlinear and Path-dependent Rewards
by: Guo, Xin, et al.
Published: (2026)
by: Guo, Xin, et al.
Published: (2026)
Opportunity-Cost-Driven Reward Mechanisms for Crowd-Sourced Computing Platforms
by: Zheng, Shuhao, et al.
Published: (2025)
by: Zheng, Shuhao, et al.
Published: (2025)
Reward-Zero: Language Embedding Driven Implicit Reward Mechanisms for Reinforcement Learning
by: Zhang, Heng, et al.
Published: (2026)
by: Zhang, Heng, et al.
Published: (2026)
EBAD-Gaussian: Event-driven Bundle Adjusted Deblur Gaussian Splatting
by: Deng, Yufei, et al.
Published: (2025)
by: Deng, Yufei, et al.
Published: (2025)
Asymmetric Visual Semantic Embedding Framework for Efficient Vision-Language Alignment
by: Liu, Yang, et al.
Published: (2025)
by: Liu, Yang, et al.
Published: (2025)
Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards
by: Tang, Xinyu, et al.
Published: (2025)
by: Tang, Xinyu, et al.
Published: (2025)
Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward
by: Tang, Xinyu, et al.
Published: (2025)
by: Tang, Xinyu, et al.
Published: (2025)
Adaptive Image Zoom-in with Bounding Box Transformation for UAV Object Detection
by: Wang, Tao, et al.
Published: (2026)
by: Wang, Tao, et al.
Published: (2026)
GPT-NAS: Evolutionary Neural Architecture Search with the Generative Pre-Trained Model
by: Yu, Caiyang, et al.
Published: (2023)
by: Yu, Caiyang, et al.
Published: (2023)
Zero-Shot Aerial Object Detection with Visual Description Regularization
by: Zang, Zhengqing, et al.
Published: (2024)
by: Zang, Zhengqing, et al.
Published: (2024)
Dr. Seg: Revisiting GRPO Training for Visual Large Language Models through Perception-Oriented Design
by: Sun, Haoxiang, et al.
Published: (2026)
by: Sun, Haoxiang, et al.
Published: (2026)
RLSR: Reinforcement Learning from Self Reward
by: Simonds, Toby, et al.
Published: (2025)
by: Simonds, Toby, et al.
Published: (2025)
Lookahead Tree-Based Rollouts for Enhanced Trajectory-Level Exploration in Reinforcement Learning with Verifiable Rewards
by: Xing, Shangyu, et al.
Published: (2025)
by: Xing, Shangyu, et al.
Published: (2025)
RewardSDS: Aligning Score Distillation via Reward-Weighted Sampling
by: Chachy, Itay, et al.
Published: (2025)
by: Chachy, Itay, et al.
Published: (2025)
Multi-Path Collaborative Reasoning via Reinforcement Learning
by: Lv, Jindi, et al.
Published: (2025)
by: Lv, Jindi, et al.
Published: (2025)
Reward Augmentation in Reinforcement Learning for Testing Distributed Systems
by: Borgarelli, Andrea, et al.
Published: (2024)
by: Borgarelli, Andrea, et al.
Published: (2024)
Reward Hacking Mitigation using Verifiable Composite Rewards
by: Tarek, Mirza Farhan Bin, et al.
Published: (2025)
by: Tarek, Mirza Farhan Bin, et al.
Published: (2025)
Multi-Agent Reinforcement Learning with Submodular Reward
by: Chen, Wenjing, et al.
Published: (2026)
by: Chen, Wenjing, et al.
Published: (2026)
Autoregressive Multi-trait Essay Scoring via Reinforcement Learning with Scoring-aware Multiple Rewards
by: Do, Heejin, et al.
Published: (2024)
by: Do, Heejin, et al.
Published: (2024)
ELO-Rated Sequence Rewards: Advancing Reinforcement Learning Models
by: Ju, Qi, et al.
Published: (2024)
by: Ju, Qi, et al.
Published: (2024)
Reinforcement Learning from Bagged Reward
by: Tang, Yuting, et al.
Published: (2024)
by: Tang, Yuting, et al.
Published: (2024)
Beyond Simple Sum of Delayed Rewards: Non-Markovian Reward Modeling for Reinforcement Learning
by: Tang, Yuting, et al.
Published: (2024)
by: Tang, Yuting, et al.
Published: (2024)
Reinforcing Consistency in Video MLLMs with Structured Rewards
by: Quan, Yihao, et al.
Published: (2026)
by: Quan, Yihao, et al.
Published: (2026)
Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models
by: Wang, Shuting, et al.
Published: (2025)
by: Wang, Shuting, et al.
Published: (2025)
Distribution-Aware Reward Estimation for Test-Time Reinforcement Learning
by: Du, Bodong, et al.
Published: (2026)
by: Du, Bodong, et al.
Published: (2026)
Constraints as Rewards: Reinforcement Learning for Robots without Reward Functions
by: Ishihara, Yu, et al.
Published: (2025)
by: Ishihara, Yu, et al.
Published: (2025)
Reward Score Matching: Unifying Reward-based Fine-tuning for Flow and Diffusion Models
by: Lee, Jeongjae, et al.
Published: (2026)
by: Lee, Jeongjae, et al.
Published: (2026)
Test-Time Matching: Unlocking Compositional Reasoning in Multimodal Models
by: Zhu, Yinglun, et al.
Published: (2025)
by: Zhu, Yinglun, et al.
Published: (2025)
Aligning Information Capacity Between Vision and Language via Dense-to-Sparse Feature Distillation for Image-Text Matching
by: Liu, Yang, et al.
Published: (2025)
by: Liu, Yang, et al.
Published: (2025)
Precision Neural Network Quantization via Learnable Adaptive Modules
by: Zhou, Wenqiang, et al.
Published: (2025)
by: Zhou, Wenqiang, et al.
Published: (2025)
Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling
by: Wang, Yuan, et al.
Published: (2026)
by: Wang, Yuan, et al.
Published: (2026)
Process Reinforcement through Implicit Rewards
by: Cui, Ganqu, et al.
Published: (2025)
by: Cui, Ganqu, et al.
Published: (2025)
Similar Items
-
Multi-view Granular-ball Contrastive Clustering
by: Su, Peng, et al.
Published: (2024) -
Not Just the Destination, But the Journey: Reasoning Traces Causally Shape Generalization Behaviors
by: Wen, Pengcheng, et al.
Published: (2026) -
Memory-Augmented Dual-Decoder Networks for Multi-Class Unsupervised Anomaly Detection
by: Xing, Jingyu, et al.
Published: (2025) -
SaENeRF: Suppressing Artifacts in Event-based Neural Radiance Fields
by: Wang, Yuanjian, et al.
Published: (2025) -
SAG-Agent: Enabling Long-Horizon Reasoning in Strategy Games via Dynamic Knowledge Graphs
by: Tang, Chenwei, et al.
Published: (2025)