AURORA:Automated Training Framework of Universal Process Reward Models via Ensemble Prompting and Reverse Verification
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tan, Xiaoyu, Yao, Tianchu, Qu, Chao, Li, Bin, Yang, Minghao, Lu, Dakuan, Wang, Haozhe, Qiu, Xihe, Chu, Wei, Xu, Yinghui, Qi, Yuan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SCP-116K: A High-Quality Problem-Solution Dataset and a Generalized Pipeline for Automated Extraction in the Higher Education Science Domain
par: Lu, Dakuan, et autres
Publié: (2025)
par: Lu, Dakuan, et autres
Publié: (2025)
Robust Deep Hawkes Process under Label Noise of Both Event and Occurrence
par: Tan, Xiaoyu, et autres
Publié: (2024)
par: Tan, Xiaoyu, et autres
Publié: (2024)
CogniDual Framework: Self-Training Large Language Models within a Dual-System Theoretical Framework for Improving Cognitive Tasks
par: Deng, Yongxin, et autres
Publié: (2024)
par: Deng, Yongxin, et autres
Publié: (2024)
Subequivariant Reinforcement Learning Framework for Coordinated Motion Control
par: Wang, Haoyu, et autres
Publié: (2024)
par: Wang, Haoyu, et autres
Publié: (2024)
Thought-Like-Pro: Enhancing Reasoning of Large Language Models through Self-Driven Prolog-based Chain-of-Thought
par: Tan, Xiaoyu, et autres
Publié: (2024)
par: Tan, Xiaoyu, et autres
Publié: (2024)
Reward Guidance for Reinforcement Learning Tasks Based on Large Language Models: The LMGT Framework
par: Deng, Yongxin, et autres
Publié: (2024)
par: Deng, Yongxin, et autres
Publié: (2024)
Towards Collaborative Intelligence: Propagating Intentions and Reasoning for Multi-Agent Coordination with Large Language Models
par: Qiu, Xihe, et autres
Publié: (2024)
par: Qiu, Xihe, et autres
Publié: (2024)
An Attentive Dual-Encoder Framework Leveraging Multimodal Visual and Semantic Information for Automatic OSAHS Diagnosis
par: Wei, Yingchen, et autres
Publié: (2024)
par: Wei, Yingchen, et autres
Publié: (2024)
Struct-X: Enhancing Large Language Models Reasoning with Structured Data
par: Tan, Xiaoyu, et autres
Publié: (2024)
par: Tan, Xiaoyu, et autres
Publié: (2024)
Adaptive Learning on User Segmentation: Universal to Specific Representation via Bipartite Neural Interaction
par: Tan, Xiaoyu, et autres
Publié: (2024)
par: Tan, Xiaoyu, et autres
Publié: (2024)
MINDECHO: Role-Playing Language Agents for Key Opinion Leaders
par: Xu, Rui, et autres
Publié: (2024)
par: Xu, Rui, et autres
Publié: (2024)
Guess What I am Thinking: A Benchmark for Inner Thought Reasoning of Role-Playing Language Agents
par: Xu, Rui, et autres
Publié: (2025)
par: Xu, Rui, et autres
Publié: (2025)
PILLOW: Enhancing Efficient Instruction Fine-tuning via Prompt Matching
par: Qi, Zhenting, et autres
Publié: (2023)
par: Qi, Zhenting, et autres
Publié: (2023)
Reflective Personalization Optimization: A Post-hoc Rewriting Framework for Black-Box Large Language Models
par: Hao, Teqi, et autres
Publié: (2025)
par: Hao, Teqi, et autres
Publié: (2025)
FedSlate:A Federated Deep Reinforcement Learning Recommender System
par: Deng, Yongxin, et autres
Publié: (2024)
par: Deng, Yongxin, et autres
Publié: (2024)
Promoting Equality in Large Language Models: Identifying and Mitigating the Implicit Bias based on Bayesian Theory
par: Deng, Yongxin, et autres
Publié: (2024)
par: Deng, Yongxin, et autres
Publié: (2024)
ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints
par: Xu, Rui, et autres
Publié: (2025)
par: Xu, Rui, et autres
Publié: (2025)
Controllable and Verifiable Process Data Synthesis for Process Reward Models
par: Chi, Yinghui, et autres
Publié: (2026)
par: Chi, Yinghui, et autres
Publié: (2026)
Structured Visual Evidence Decomposition for Evidence-Grounded Multimodal Screening of Obstructive Sleep Apnea-Hypopnea Syndrome
par: Zhan, Chen, et autres
Publié: (2026)
par: Zhan, Chen, et autres
Publié: (2026)
PRISM: Festina Lente Proactivity -- Risk-Sensitive, Uncertainty-Aware Deliberation for Proactive Agents
par: Fu, Yuxuan, et autres
Publié: (2026)
par: Fu, Yuxuan, et autres
Publié: (2026)
The Law of Multi-Model Collaboration: Scaling Limits of Model Ensembling for Large Language Models
par: Lu, Dakuan, et autres
Publié: (2025)
par: Lu, Dakuan, et autres
Publié: (2025)
OR-VSKC: Resolving Visual-Semantic Knowledge Conflicts in Operating Rooms with Synthetic Data-Guided Alignment
par: Zhao, Weiyi, et autres
Publié: (2025)
par: Zhao, Weiyi, et autres
Publié: (2025)
EEG-VLM: A Hierarchical Vision-Language Model with Multi-Level Feature Alignment and Visually Enhanced Language-Guided Reasoning for EEG Image-Based Sleep Stage Prediction
par: Qiu, Xihe, et autres
Publié: (2025)
par: Qiu, Xihe, et autres
Publié: (2025)
VIVID-Med: LLM-Supervised Structured Pretraining for Deployable Medical ViTs
par: Wang, Xiyao, et autres
Publié: (2026)
par: Wang, Xiyao, et autres
Publié: (2026)
Curiosity Driven Knowledge Retrieval for Mobile Agents
par: Li, Sijia, et autres
Publié: (2026)
par: Li, Sijia, et autres
Publié: (2026)
AURORA: Navigating UI Tarpits via Automated Neural Screen Understanding
par: Khan, Safwat Ali, et autres
Publié: (2024)
par: Khan, Safwat Ali, et autres
Publié: (2024)
Adapt2Reward: Adapting Video-Language Models to Generalizable Robotic Rewards via Failure Prompts
par: Yang, Yanting, et autres
Publié: (2024)
par: Yang, Yanting, et autres
Publié: (2024)
From Answers to Arguments: Toward Trustworthy Clinical Diagnostic Reasoning with Toulmin-Guided Curriculum Goal-Conditioned Learning
par: Zhan, Chen, et autres
Publié: (2026)
par: Zhan, Chen, et autres
Publié: (2026)
RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time
par: Wang, Haozhe, et autres
Publié: (2026)
par: Wang, Haozhe, et autres
Publié: (2026)
SRU-Pix2Pix: A Fusion-Driven Generator Network for Medical Image Translation with Few-Shot Learning
par: Qiu, Xihe, et autres
Publié: (2026)
par: Qiu, Xihe, et autres
Publié: (2026)
Demystifying Multilingual Chain-of-Thought in Process Reward Modeling
par: Wang, Weixuan, et autres
Publié: (2025)
par: Wang, Weixuan, et autres
Publié: (2025)
Dataset
par: Gao, Xihe
Publié: (2026)
par: Gao, Xihe
Publié: (2026)
AURORA: Automated Unleash of 3D Room Outlines for VR Applications
par: Han, Huijun, et autres
Publié: (2024)
par: Han, Huijun, et autres
Publié: (2024)
QEDCartographer: Automating Formal Verification Using Reward-Free Reinforcement Learning
par: Sanchez-Stern, Alex, et autres
Publié: (2024)
par: Sanchez-Stern, Alex, et autres
Publié: (2024)
ConcEPT: Concept-Enhanced Pre-Training for Language Models
par: Wang, Xintao, et autres
Publié: (2024)
par: Wang, Xintao, et autres
Publié: (2024)
Automating Formal Verification with Reinforcement Learning and Recursive Inference
par: Tan, Max
Publié: (2026)
par: Tan, Max
Publié: (2026)
A Classification System Approach in Predicting Chinese Censorship
par: Prodani, Matt, et autres
Publié: (2025)
par: Prodani, Matt, et autres
Publié: (2025)
Grounding the Score: Explicit Visual Premise Verification for Reliable Vision-Language Process Reward Models
par: Wang, Junxin, et autres
Publié: (2026)
par: Wang, Junxin, et autres
Publié: (2026)
VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning
par: Wang, Haozhe, et autres
Publié: (2025)
par: Wang, Haozhe, et autres
Publié: (2025)
PTQ4RIS: Post-Training Quantization for Referring Image Segmentation
par: Jiang, Xiaoyan, et autres
Publié: (2024)
par: Jiang, Xiaoyan, et autres
Publié: (2024)
Documents similaires
-
SCP-116K: A High-Quality Problem-Solution Dataset and a Generalized Pipeline for Automated Extraction in the Higher Education Science Domain
par: Lu, Dakuan, et autres
Publié: (2025) -
Robust Deep Hawkes Process under Label Noise of Both Event and Occurrence
par: Tan, Xiaoyu, et autres
Publié: (2024) -
CogniDual Framework: Self-Training Large Language Models within a Dual-System Theoretical Framework for Improving Cognitive Tasks
par: Deng, Yongxin, et autres
Publié: (2024) -
Subequivariant Reinforcement Learning Framework for Coordinated Motion Control
par: Wang, Haoyu, et autres
Publié: (2024) -
Thought-Like-Pro: Enhancing Reasoning of Large Language Models through Self-Driven Prolog-based Chain-of-Thought
par: Tan, Xiaoyu, et autres
Publié: (2024)