DreamPRM: Domain-Reweighted Process Reward Model for Multimodal Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cao, Qi, Wang, Ruiyi, Zhang, Ruiyi, Somayajula, Sai Ashish, Xie, Pengtao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DreamPRM-Code: Function-as-Step Process Reward Model with Label Correction for LLM Coding
par: Zhang, Ruiyi, et autres
Publié: (2025)
par: Zhang, Ruiyi, et autres
Publié: (2025)
DreamPRM-1.5: Unlocking the Potential of Each Instance for Multimodal Process Reward Model Training
par: Cao, Qi, et autres
Publié: (2025)
par: Cao, Qi, et autres
Publié: (2025)
TapWeight: Reweighting Pretraining Objectives for Task-Adaptive Pretraining
par: Zhang, Ruiyi, et autres
Publié: (2024)
par: Zhang, Ruiyi, et autres
Publié: (2024)
AutoLoRA: Automatically Tuning Matrix Ranks in Low-Rank Adaptation Based on Meta Learning
par: Zhang, Ruiyi, et autres
Publié: (2024)
par: Zhang, Ruiyi, et autres
Publié: (2024)
FunPRM: Function-as-Step Process Reward Model with Meta Reward Correction for Code Generation
par: Zhang, Ruiyi, et autres
Publié: (2026)
par: Zhang, Ruiyi, et autres
Publié: (2026)
DAJ: Data-Reweighted LLM Judge for Test-Time Scaling in Code Generation
par: Qin, Peijia, et autres
Publié: (2026)
par: Qin, Peijia, et autres
Publié: (2026)
Generalizable and Stable Finetuning of Pretrained Language Models on Low-Resource Texts
par: Somayajula, Sai Ashish, et autres
Publié: (2024)
par: Somayajula, Sai Ashish, et autres
Publié: (2024)
Can Prompts Rewind Time for LLMs? Evaluating the Effectiveness of Prompted Knowledge Cutoffs
par: Gao, Xin, et autres
Publié: (2025)
par: Gao, Xin, et autres
Publié: (2025)
AIBuildAI: An AI Agent for Automatically Building AI Models
par: Zhang, Ruiyi, et autres
Publié: (2026)
par: Zhang, Ruiyi, et autres
Publié: (2026)
A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning
par: Wang, Ruiyi, et autres
Publié: (2025)
par: Wang, Ruiyi, et autres
Publié: (2025)
Improving the Language Understanding Capabilities of Large Language Models Using Reinforcement Learning
par: Hu, Bokai, et autres
Publié: (2024)
par: Hu, Bokai, et autres
Publié: (2024)
Models Under SCOPE: Scalable and Controllable Routing via Pre-hoc Reasoning
par: Cao, Qi, et autres
Publié: (2026)
par: Cao, Qi, et autres
Publié: (2026)
Send a SCOUT First: Pre-hoc Reasoning for Adaptive Detector Allocation in Prompt-Injection Defense
par: Zhang, Shuhao, et autres
Publié: (2026)
par: Zhang, Shuhao, et autres
Publié: (2026)
Downstream Task Guided Masking Learning in Masked Autoencoders Using Multi-Level Optimization
par: Guo, Han, et autres
Publié: (2024)
par: Guo, Han, et autres
Publié: (2024)
BiLoRA: A Bi-level Optimization Framework for Overfitting-Resilient Low-Rank Adaptation of Large Pre-trained Models
par: Qiang, Rushi, et autres
Publié: (2024)
par: Qiang, Rushi, et autres
Publié: (2024)
PRPO: Aligning Process Reward with Outcome Reward in Policy Optimization
par: Ding, Ruiyi, et autres
Publié: (2026)
par: Ding, Ruiyi, et autres
Publié: (2026)
SteganoBackdoor: Stealthy and Data-Efficient Backdoor Attacks on Language Models
par: Xue, Eric, et autres
Publié: (2025)
par: Xue, Eric, et autres
Publié: (2025)
BiDoRA: Bi-level Optimization-Based Weight-Decomposed Low-Rank Adaptation
par: Qin, Peijia, et autres
Publié: (2024)
par: Qin, Peijia, et autres
Publié: (2024)
rePIRL: Learn PRM with Inverse RL for LLM Reasoning
par: Wu, Xian, et autres
Publié: (2026)
par: Wu, Xian, et autres
Publié: (2026)
Unlocking Multimodal Mathematical Reasoning via Process Reward Model
par: Luo, Ruilin, et autres
Publié: (2025)
par: Luo, Ruilin, et autres
Publié: (2025)
Scaling-Aware Adapter for Structure-Grounded LLM Reasoning
par: Jing, Zihao, et autres
Publié: (2026)
par: Jing, Zihao, et autres
Publié: (2026)
On the Benefits of Attribute-Driven Graph Domain Adaptation
par: Fang, Ruiyi, et autres
Publié: (2025)
par: Fang, Ruiyi, et autres
Publié: (2025)
CFNN: Continued Fraction Neural Network
par: Wang, Chao, et autres
Publié: (2026)
par: Wang, Chao, et autres
Publié: (2026)
Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS
par: Jin, Can, et autres
Publié: (2025)
par: Jin, Can, et autres
Publié: (2025)
Is PRM Necessary? Problem-Solving RL Implicitly Induces PRM Capability in LLMs
par: Feng, Zhangying, et autres
Publié: (2025)
par: Feng, Zhangying, et autres
Publié: (2025)
Limits of PRM-Guided Tree Search for Mathematical Reasoning with LLMs
par: Cinquin, Tristan, et autres
Publié: (2025)
par: Cinquin, Tristan, et autres
Publié: (2025)
Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models
par: Yang, Shidong, et autres
Publié: (2026)
par: Yang, Shidong, et autres
Publié: (2026)
Post-Training as Reweighting: A Stochastic View of Reasoning Trajectories in Language Models
par: Bu, Dake, et autres
Publié: (2025)
par: Bu, Dake, et autres
Publié: (2025)
Entropy-Guided Dynamic Tokens for Graph-LLM Alignment in Molecular Understanding
par: Jing, Zihao, et autres
Publié: (2026)
par: Jing, Zihao, et autres
Publié: (2026)
Token-Specific Watermarking with Enhanced Detectability and Semantic Coherence for Large Language Models
par: Huo, Mingjia, et autres
Publié: (2024)
par: Huo, Mingjia, et autres
Publié: (2024)
VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data
par: Zeng, Thomas, et autres
Publié: (2025)
par: Zeng, Thomas, et autres
Publié: (2025)
The Lessons of Developing Process Reward Models in Mathematical Reasoning
par: Zhang, Zhenru, et autres
Publié: (2025)
par: Zhang, Zhenru, et autres
Publié: (2025)
Structure-Centric Graph Foundation Model via Geometric Bases
par: He, Xiaodong, et autres
Publié: (2026)
par: He, Xiaodong, et autres
Publié: (2026)
DoGE: Domain Reweighting with Generalization Estimation
par: Fan, Simin, et autres
Publié: (2023)
par: Fan, Simin, et autres
Publié: (2023)
Stop Summation: Min-Form Credit Assignment Is All Process Reward Model Needs for Reasoning
par: Cheng, Jie, et autres
Publié: (2025)
par: Cheng, Jie, et autres
Publié: (2025)
Dreaming of Many Worlds: Learning Contextual World Models Aids Zero-Shot Generalization
par: Prasanna, Sai, et autres
Publié: (2024)
par: Prasanna, Sai, et autres
Publié: (2024)
Adversarial Training for Process Reward Models
par: Juneja, Gurusha, et autres
Publié: (2025)
par: Juneja, Gurusha, et autres
Publié: (2025)
Athena: Enhancing Multimodal Reasoning with Data-efficient Process Reward Models
par: Wang, Shuai, et autres
Publié: (2025)
par: Wang, Shuai, et autres
Publié: (2025)
LLM Reasoning with Process Rewards for Outcome-Guided Steps
par: Rezaei, Mohammad, et autres
Publié: (2026)
par: Rezaei, Mohammad, et autres
Publié: (2026)
V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization
par: Jiang, Yubo, et autres
Publié: (2026)
par: Jiang, Yubo, et autres
Publié: (2026)
Documents similaires
-
DreamPRM-Code: Function-as-Step Process Reward Model with Label Correction for LLM Coding
par: Zhang, Ruiyi, et autres
Publié: (2025) -
DreamPRM-1.5: Unlocking the Potential of Each Instance for Multimodal Process Reward Model Training
par: Cao, Qi, et autres
Publié: (2025) -
TapWeight: Reweighting Pretraining Objectives for Task-Adaptive Pretraining
par: Zhang, Ruiyi, et autres
Publié: (2024) -
AutoLoRA: Automatically Tuning Matrix Ranks in Low-Rank Adaptation Based on Meta Learning
par: Zhang, Ruiyi, et autres
Publié: (2024) -
FunPRM: Function-as-Step Process Reward Model with Meta Reward Correction for Code Generation
par: Zhang, Ruiyi, et autres
Publié: (2026)