Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Huang, Qihan, Zhang, Haofei, Wei, Rong, Wang, Yi, Tang, Rui, Song, Mingli, Song, Jie |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Boosting MLLM Reasoning with Text-Debiased Hint-GRPO
by: Huang, Qihan, et al.
Published: (2025)
by: Huang, Qihan, et al.
Published: (2025)
On the Concept Trustworthiness in Concept Bottleneck Models
by: Huang, Qihan, et al.
Published: (2024)
by: Huang, Qihan, et al.
Published: (2024)
ProtoPFormer: Concentrating on Prototypical Parts in Vision Transformers for Interpretable Image Recognition
by: Xue, Mengqi, et al.
Published: (2022)
by: Xue, Mengqi, et al.
Published: (2022)
LG-CAV: Train Any Concept Activation Vector with Language Guidance
by: Huang, Qihan, et al.
Published: (2024)
by: Huang, Qihan, et al.
Published: (2024)
RS3DBench: A Comprehensive Benchmark for 3D Spatial Perception in Remote Sensing
by: Wang, Jiayu, et al.
Published: (2025)
by: Wang, Jiayu, et al.
Published: (2025)
Rethinking Token Reduction for Large Vision-Language Models
by: Wang, Yi, et al.
Published: (2026)
by: Wang, Yi, et al.
Published: (2026)
AnomalyR1: A GRPO-based End-to-end MLLM for Industrial Anomaly Detection
by: Chao, Yuhao, et al.
Published: (2025)
by: Chao, Yuhao, et al.
Published: (2025)
PatchDPO: Patch-level DPO for Finetuning-free Personalized Image Generation
by: Huang, Qihan, et al.
Published: (2024)
by: Huang, Qihan, et al.
Published: (2024)
SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models
by: Xie, Yuechen, et al.
Published: (2026)
by: Xie, Yuechen, et al.
Published: (2026)
Training Data Provenance Verification: Did Your Model Use Synthetic Data from My Generative Model for Training?
by: Xie, Yuechen, et al.
Published: (2025)
by: Xie, Yuechen, et al.
Published: (2025)
On the Evaluation Consistency of Attribution-based Explanations
by: Duan, Jiarui, et al.
Published: (2024)
by: Duan, Jiarui, et al.
Published: (2024)
Knowledge Amalgamation for Object Detection with Transformers
by: Zhang, Haofei, et al.
Published: (2022)
by: Zhang, Haofei, et al.
Published: (2022)
Angle Robustness Unmanned Aerial Vehicle Navigation in GNSS-Denied Scenarios
by: Wang, Yuxin, et al.
Published: (2024)
by: Wang, Yuxin, et al.
Published: (2024)
$D^3$-RSMDE: 40$\times$ Faster and High-Fidelity Remote Sensing Monocular Depth Estimation
by: Wang, Ruizhi, et al.
Published: (2026)
by: Wang, Ruizhi, et al.
Published: (2026)
DEVIS-GRPO: Unleashing GRPO on Dynamic Extreme View Synthesis
by: Zuo, Yi, et al.
Published: (2026)
by: Zuo, Yi, et al.
Published: (2026)
Beyond Matching to Tiles: Bridging Unaligned Aerial and Satellite Views for Vision-Only UAV Navigation
by: Liu, Kejia, et al.
Published: (2026)
by: Liu, Kejia, et al.
Published: (2026)
CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning
by: Song, Qi, et al.
Published: (2025)
by: Song, Qi, et al.
Published: (2025)
Diffusion Model Quantization: A Review
by: Zeng, Qian, et al.
Published: (2025)
by: Zeng, Qian, et al.
Published: (2025)
Dataset Ownership Verification in Contrastive Pre-trained Models
by: Xie, Yuechen, et al.
Published: (2025)
by: Xie, Yuechen, et al.
Published: (2025)
DanceGRPO: Unleashing GRPO on Visual Generation
by: Xue, Zeyue, et al.
Published: (2025)
by: Xue, Zeyue, et al.
Published: (2025)
MR-MLLM: Mutual Reinforcement of Multimodal Comprehension and Vision Perception
by: Wang, Guanqun, et al.
Published: (2024)
by: Wang, Guanqun, et al.
Published: (2024)
UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation
by: Liu, Jie, et al.
Published: (2026)
by: Liu, Jie, et al.
Published: (2026)
Sampling-Aware Quantization for Diffusion Models
by: Zeng, Qian, et al.
Published: (2025)
by: Zeng, Qian, et al.
Published: (2025)
MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding
by: Tan, Wenhui, et al.
Published: (2026)
by: Tan, Wenhui, et al.
Published: (2026)
Elysium: Exploring Object-level Perception in Videos via MLLM
by: Wang, Han, et al.
Published: (2024)
by: Wang, Han, et al.
Published: (2024)
SynPlay: Large-Scale Synthetic Human Data with Real-World Diversity for Aerial-View Perception
by: Yim, Jinsub, et al.
Published: (2024)
by: Yim, Jinsub, et al.
Published: (2024)
Reasoning Guided Embeddings: Leveraging MLLM Reasoning for Improved Multimodal Retrieval
by: Liu, Chunxu, et al.
Published: (2025)
by: Liu, Chunxu, et al.
Published: (2025)
RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video
by: Xun, Shuhang, et al.
Published: (2025)
by: Xun, Shuhang, et al.
Published: (2025)
Image Aesthetic Reasoning via HCM-GRPO: Empowering Compact Model for Superior Performance
by: Hu, Zhiyuan, et al.
Published: (2025)
by: Hu, Zhiyuan, et al.
Published: (2025)
EvolveReason: Self-Evolving Reasoning Paradigm for Explainable Deepfake Facial Image Identification
by: Zhou, Binjia, et al.
Published: (2026)
by: Zhou, Binjia, et al.
Published: (2026)
UNICBench: UNIfied Counting Benchmark for MLLM
by: Rong, Chenggang, et al.
Published: (2026)
by: Rong, Chenggang, et al.
Published: (2026)
Training-Free Pretrained Model Merging
by: Xu, Zhengqi, et al.
Published: (2024)
by: Xu, Zhengqi, et al.
Published: (2024)
R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation
by: Guo, Meng-Hao, et al.
Published: (2025)
by: Guo, Meng-Hao, et al.
Published: (2025)
K-Syn: K-space Data Synthesis in Ultra Low-data Regimes
by: Yu, Guan, et al.
Published: (2025)
by: Yu, Guan, et al.
Published: (2025)
MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation
by: Ma, Xiaoxiao, et al.
Published: (2026)
by: Ma, Xiaoxiao, et al.
Published: (2026)
SynMind: Reducing Semantic Hallucination in fMRI-Based Image Reconstruction
by: Yang, Lan, et al.
Published: (2026)
by: Yang, Lan, et al.
Published: (2026)
ApET: Approximation-Error Guided Token Compression for Efficient VLMs
by: Ma, Qiankun, et al.
Published: (2026)
by: Ma, Qiankun, et al.
Published: (2026)
Resolving Multi-Condition Confusion for Finetuning-Free Personalized Image Generation
by: Huang, Qihan, et al.
Published: (2024)
by: Huang, Qihan, et al.
Published: (2024)
Follow-Your-Instruction: A Comprehensive MLLM Agent for World Data Synthesis
by: Feng, Kunyu, et al.
Published: (2025)
by: Feng, Kunyu, et al.
Published: (2025)
SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization
by: Rong, Xuankun, et al.
Published: (2025)
by: Rong, Xuankun, et al.
Published: (2025)
Similar Items
-
Boosting MLLM Reasoning with Text-Debiased Hint-GRPO
by: Huang, Qihan, et al.
Published: (2025) -
On the Concept Trustworthiness in Concept Bottleneck Models
by: Huang, Qihan, et al.
Published: (2024) -
ProtoPFormer: Concentrating on Prototypical Parts in Vision Transformers for Interpretable Image Recognition
by: Xue, Mengqi, et al.
Published: (2022) -
LG-CAV: Train Any Concept Activation Vector with Language Guidance
by: Huang, Qihan, et al.
Published: (2024) -
RS3DBench: A Comprehensive Benchmark for 3D Spatial Perception in Remote Sensing
by: Wang, Jiayu, et al.
Published: (2025)