MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scalable Step-Level Supervision
Fuente:
arXiv
Salvato in:
| Autori principali: | Du, Lingxiao, Meng, Fanqing, Liu, Zongkai, Zhou, Zhixiang, Luo, Ping, Zhang, Qiaosheng, Shao, Wenqi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning
di: Meng, Fanqing, et al.
Pubblicazione: (2025)
di: Meng, Fanqing, et al.
Pubblicazione: (2025)
ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
CPGD: Toward Stable Rule-based Reinforcement Learning for Language Models
di: Liu, Zongkai, et al.
Pubblicazione: (2025)
di: Liu, Zongkai, et al.
Pubblicazione: (2025)
GUIOdyssey: A Comprehensive Dataset for Cross-App GUI Navigation on Mobile Devices
di: Lu, Quanfeng, et al.
Pubblicazione: (2024)
di: Lu, Quanfeng, et al.
Pubblicazione: (2024)
CiQi-Agent: Aligning Vision, Tools and Aesthetics in Multimodal Agent for Cultural Reasoning on Chinese Porcelains
di: Wang, Wenhan, et al.
Pubblicazione: (2026)
di: Wang, Wenhan, et al.
Pubblicazione: (2026)
From Diagnosis to Improvement: Probing Spatio-Physical Reasoning in Vision Language Models
di: Han, Tiancheng, et al.
Pubblicazione: (2025)
di: Han, Tiancheng, et al.
Pubblicazione: (2025)
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
InfiMM-WebMath-40B: Advancing Multimodal Pre-Training for Enhanced Mathematical Reasoning
di: Han, Xiaotian, et al.
Pubblicazione: (2024)
di: Han, Xiaotian, et al.
Pubblicazione: (2024)
VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos
di: Munasinghe, Shehan, et al.
Pubblicazione: (2024)
di: Munasinghe, Shehan, et al.
Pubblicazione: (2024)
Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
Benchmarking Multimodal Mathematical Reasoning with Explicit Visual Dependency
di: Wang, Zhikai, et al.
Pubblicazione: (2025)
di: Wang, Zhikai, et al.
Pubblicazione: (2025)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
di: Wang, Weiyun, et al.
Pubblicazione: (2025)
di: Wang, Weiyun, et al.
Pubblicazione: (2025)
MM-ACT: Learn from Multimodal Parallel Generation to Act
di: Liang, Haotian, et al.
Pubblicazione: (2025)
di: Liang, Haotian, et al.
Pubblicazione: (2025)
MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought Verification
di: Sun, Linzhuang, et al.
Pubblicazione: (2025)
di: Sun, Linzhuang, et al.
Pubblicazione: (2025)
TinyLVLM-eHub: Towards Comprehensive and Efficient Evaluation for Large Vision-Language Models
di: Shao, Wenqi, et al.
Pubblicazione: (2023)
di: Shao, Wenqi, et al.
Pubblicazione: (2023)
MM-RLHF: The Next Step Forward in Multimodal LLM Alignment
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2025)
di: Zhang, Yi-Fan, et al.
Pubblicazione: (2025)
Dynamic Multimodal Evaluation with Flexible Complexity by Vision-Language Bootstrapping
di: Yang, Yue, et al.
Pubblicazione: (2024)
di: Yang, Yue, et al.
Pubblicazione: (2024)
Task-Oriented Diffusion Inversion for High-Fidelity Text-based Editing
di: Xu, Yangyang, et al.
Pubblicazione: (2024)
di: Xu, Yangyang, et al.
Pubblicazione: (2024)
MM-HELIX: Boosting Multimodal Long-Chain Reflective Reasoning with Holistic Platform and Adaptive Hybrid Policy Optimization
di: Zhao, Xiangyu, et al.
Pubblicazione: (2025)
di: Zhao, Xiangyu, et al.
Pubblicazione: (2025)
VSF: Simple, Efficient, and Effective Negative Guidance in Few-Step Image Generation Models By Value Sign Flip
di: Guo, Wenqi, et al.
Pubblicazione: (2025)
di: Guo, Wenqi, et al.
Pubblicazione: (2025)
EvoEmpirBench: Dynamic Spatial Reasoning with Agent-ExpVer
di: Zhao, Pukun, et al.
Pubblicazione: (2025)
di: Zhao, Pukun, et al.
Pubblicazione: (2025)
The Role of Visual Modality in Multimodal Mathematical Reasoning: Challenges and Insights
di: Liu, Yufang, et al.
Pubblicazione: (2025)
di: Liu, Yufang, et al.
Pubblicazione: (2025)
VTPerception-R1: Enhancing Multimodal Reasoning via Explicit Visual and Textual Perceptual Grounding
di: Ding, Yizhuo, et al.
Pubblicazione: (2025)
di: Ding, Yizhuo, et al.
Pubblicazione: (2025)
ICAL: Implicit Character-Aided Learning for Enhanced Handwritten Mathematical Expression Recognition
di: Zhu, Jianhua, et al.
Pubblicazione: (2024)
di: Zhu, Jianhua, et al.
Pubblicazione: (2024)
MM-IQ: Benchmarking Human-Like Abstraction and Reasoning in Multimodal Models
di: Cai, Huanqia, et al.
Pubblicazione: (2025)
di: Cai, Huanqia, et al.
Pubblicazione: (2025)
MM-IFEngine: Towards Multimodal Instruction Following
di: Ding, Shengyuan, et al.
Pubblicazione: (2025)
di: Ding, Shengyuan, et al.
Pubblicazione: (2025)
MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
di: Ying, Kaining, et al.
Pubblicazione: (2024)
di: Ying, Kaining, et al.
Pubblicazione: (2024)
STAR: Mitigating Cascading Errors in Spatial Reasoning via Turn-point Alignment and Segment-level DPO
di: Zhao, Pukun, et al.
Pubblicazione: (2026)
di: Zhao, Pukun, et al.
Pubblicazione: (2026)
Pixel-Level Domain Adaptation: A New Perspective for Enhancing Weakly Supervised Semantic Segmentation
di: Du, Ye, et al.
Pubblicazione: (2024)
di: Du, Ye, et al.
Pubblicazione: (2024)
The Evolution of Dataset Distillation: Toward Scalable and Generalizable Solutions
di: Liu, Ping, et al.
Pubblicazione: (2025)
di: Liu, Ping, et al.
Pubblicazione: (2025)
MM-Skin: Enhancing Dermatology Vision-Language Model with an Image-Text Dataset Derived from Textbooks
di: Zeng, Wenqi, et al.
Pubblicazione: (2025)
di: Zeng, Wenqi, et al.
Pubblicazione: (2025)
Gym-V: A Unified Vision Environment System for Agentic Vision Research
di: Meng, Fanqing, et al.
Pubblicazione: (2026)
di: Meng, Fanqing, et al.
Pubblicazione: (2026)
MM-WLAuslan: Multi-View Multi-Modal Word-Level Australian Sign Language Recognition Dataset
di: Shen, Xin, et al.
Pubblicazione: (2024)
di: Shen, Xin, et al.
Pubblicazione: (2024)
MPBench: A Comprehensive Multimodal Reasoning Benchmark for Process Errors Identification
di: Xu, Zhaopan, et al.
Pubblicazione: (2025)
di: Xu, Zhaopan, et al.
Pubblicazione: (2025)
Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs
di: Li, Qi, et al.
Pubblicazione: (2026)
di: Li, Qi, et al.
Pubblicazione: (2026)
Design First, Code Later: Aesthetically Pleasing Template-Free Slides Generation
di: Cui, Zhiyao, et al.
Pubblicazione: (2026)
di: Cui, Zhiyao, et al.
Pubblicazione: (2026)
JiSAM: Alleviate Labeling Burden and Corner Case Problems in Autonomous Driving via Minimal Real-World Data
di: Chen, Runjian, et al.
Pubblicazione: (2025)
di: Chen, Runjian, et al.
Pubblicazione: (2025)
Efficient High-Resolution Visual Representation Learning with State Space Model for Human Pose Estimation
di: Zhang, Hao, et al.
Pubblicazione: (2024)
di: Zhang, Hao, et al.
Pubblicazione: (2024)
TREND: Unsupervised 3D Representation Learning via Temporal Forecasting for LiDAR Perception
di: Chen, Runjian, et al.
Pubblicazione: (2024)
di: Chen, Runjian, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning
di: Meng, Fanqing, et al.
Pubblicazione: (2025) -
ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning
di: Meng, Fanqing, et al.
Pubblicazione: (2024) -
CPGD: Toward Stable Rule-based Reinforcement Learning for Language Models
di: Liu, Zongkai, et al.
Pubblicazione: (2025) -
GUIOdyssey: A Comprehensive Dataset for Cross-App GUI Navigation on Mobile Devices
di: Lu, Quanfeng, et al.
Pubblicazione: (2024) -
CiQi-Agent: Aligning Vision, Tools and Aesthetics in Multimodal Agent for Cultural Reasoning on Chinese Porcelains
di: Wang, Wenhan, et al.
Pubblicazione: (2026)