Boosting MLLM Reasoning with Text-Debiased Hint-GRPO
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Qihan, Dai, Weilong, Liu, Jinlong, He, Wanggui, Jiang, Hao, Song, Mingli, Chen, Jingyuan, Yao, Chang, Song, Jie |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PatchDPO: Patch-level DPO for Finetuning-free Personalized Image Generation
par: Huang, Qihan, et autres
Publié: (2024)
par: Huang, Qihan, et autres
Publié: (2024)
Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning
par: Huang, Qihan, et autres
Publié: (2025)
par: Huang, Qihan, et autres
Publié: (2025)
MS-Diffusion: Multi-subject Zero-shot Image Personalization with Layout Guidance
par: Wang, Xierui, et autres
Publié: (2024)
par: Wang, Xierui, et autres
Publié: (2024)
Resolving Multi-Condition Confusion for Finetuning-Free Personalized Image Generation
par: Huang, Qihan, et autres
Publié: (2024)
par: Huang, Qihan, et autres
Publié: (2024)
Towards Enhanced Image Generation Via Multi-modal Chain of Thought in Unified Generative Models
par: Wang, Yi, et autres
Publié: (2025)
par: Wang, Yi, et autres
Publié: (2025)
PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning
par: Liu, Jinlong, et autres
Publié: (2026)
par: Liu, Jinlong, et autres
Publié: (2026)
On the Concept Trustworthiness in Concept Bottleneck Models
par: Huang, Qihan, et autres
Publié: (2024)
par: Huang, Qihan, et autres
Publié: (2024)
Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO
par: Tong, Yunze, et autres
Publié: (2026)
par: Tong, Yunze, et autres
Publié: (2026)
AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs
par: Chang, Boyu, et autres
Publié: (2026)
par: Chang, Boyu, et autres
Publié: (2026)
LG-CAV: Train Any Concept Activation Vector with Language Guidance
par: Huang, Qihan, et autres
Publié: (2024)
par: Huang, Qihan, et autres
Publié: (2024)
DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding
par: Zhang, Peng, et autres
Publié: (2026)
par: Zhang, Peng, et autres
Publié: (2026)
ProtoPFormer: Concentrating on Prototypical Parts in Vision Transformers for Interpretable Image Recognition
par: Xue, Mengqi, et autres
Publié: (2022)
par: Xue, Mengqi, et autres
Publié: (2022)
IRPO: Boosting Image Restoration via Post-training GRPO
par: Xu, Haoxuan, et autres
Publié: (2025)
par: Xu, Haoxuan, et autres
Publié: (2025)
AnomalyR1: A GRPO-based End-to-end MLLM for Industrial Anomaly Detection
par: Chao, Yuhao, et autres
Publié: (2025)
par: Chao, Yuhao, et autres
Publié: (2025)
Debiasing Text-to-Image Diffusion Models
par: He, Ruifei, et autres
Publié: (2024)
par: He, Ruifei, et autres
Publié: (2024)
D$^2$-DPM: Dual Denoising for Quantized Diffusion Probabilistic Models
par: Zeng, Qian, et autres
Publié: (2025)
par: Zeng, Qian, et autres
Publié: (2025)
CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning
par: Song, Qi, et autres
Publié: (2025)
par: Song, Qi, et autres
Publié: (2025)
Training Data Provenance Verification: Did Your Model Use Synthetic Data from My Generative Model for Training?
par: Xie, Yuechen, et autres
Publié: (2025)
par: Xie, Yuechen, et autres
Publié: (2025)
Diffusion Model Quantization: A Review
par: Zeng, Qian, et autres
Publié: (2025)
par: Zeng, Qian, et autres
Publié: (2025)
ConciseHint: Boosting Efficient Reasoning via Continuous Concise Hints during Generation
par: Tang, Siao, et autres
Publié: (2025)
par: Tang, Siao, et autres
Publié: (2025)
MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation
par: Ma, Xiaoxiao, et autres
Publié: (2026)
par: Ma, Xiaoxiao, et autres
Publié: (2026)
MotionGRPO: Overcoming Low Intra-Group Diversity in GRPO-Based Egocentric Motion Recovery
par: Yao, Nanjie, et autres
Publié: (2026)
par: Yao, Nanjie, et autres
Publié: (2026)
UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation
par: Liu, Jie, et autres
Publié: (2026)
par: Liu, Jie, et autres
Publié: (2026)
Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture
par: Zhang, Longxiang, et autres
Publié: (2026)
par: Zhang, Longxiang, et autres
Publié: (2026)
Boosting MLLM Spatial Reasoning with Geometrically Referenced 3D Scene Representations
par: Yuan, Jiangye, et autres
Publié: (2026)
par: Yuan, Jiangye, et autres
Publié: (2026)
Rethinking Token Reduction for Large Vision-Language Models
par: Wang, Yi, et autres
Publié: (2026)
par: Wang, Yi, et autres
Publié: (2026)
DanceGRPO: Unleashing GRPO on Visual Generation
par: Xue, Zeyue, et autres
Publié: (2025)
par: Xue, Zeyue, et autres
Publié: (2025)
Improving Alignment in LVLMs with Debiased Self-Judgment
par: Yang, Sihan, et autres
Publié: (2025)
par: Yang, Sihan, et autres
Publié: (2025)
D2Pruner: Debiased Importance and Structural Diversity for MLLM Token Pruning
par: Zhang, Evelyn, et autres
Publié: (2025)
par: Zhang, Evelyn, et autres
Publié: (2025)
Sampling-Aware Quantization for Diffusion Models
par: Zeng, Qian, et autres
Publié: (2025)
par: Zeng, Qian, et autres
Publié: (2025)
On the Evaluation Consistency of Attribution-based Explanations
par: Duan, Jiarui, et autres
Publié: (2024)
par: Duan, Jiarui, et autres
Publié: (2024)
MME-CoF-Pro: Evaluating Reasoning Coherence in Video Generative Models with Text and Visual Hints
par: Qi, Yu, et autres
Publié: (2026)
par: Qi, Yu, et autres
Publié: (2026)
FAIRT2V: Training-Free Debiasing for Text-to-Video Diffusion Models
par: Zhong, Haonan, et autres
Publié: (2026)
par: Zhong, Haonan, et autres
Publié: (2026)
TEACH: Text Encoding as Curriculum Hints for Scene Text Recognition
par: Yang, Xiahan, et autres
Publié: (2025)
par: Yang, Xiahan, et autres
Publié: (2025)
HoloFair: Unified T2I Fairness Evaluation and Fair-GRPO Debiasing
par: Chen, Ruyi, et autres
Publié: (2026)
par: Chen, Ruyi, et autres
Publié: (2026)
SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models
par: Xie, Yuechen, et autres
Publié: (2026)
par: Xie, Yuechen, et autres
Publié: (2026)
Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning
par: Wang, Yibin, et autres
Publié: (2025)
par: Wang, Yibin, et autres
Publié: (2025)
DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning
par: Huang, Chao, et autres
Publié: (2025)
par: Huang, Chao, et autres
Publié: (2025)
MAL: Motion-Aware Loss with Temporal and Distillation Hints for Self-Supervised Depth Estimation
par: Dong, Yue-Jiang, et autres
Publié: (2024)
par: Dong, Yue-Jiang, et autres
Publié: (2024)
HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes
par: Li, Keliang, et autres
Publié: (2025)
par: Li, Keliang, et autres
Publié: (2025)
Documents similaires
-
PatchDPO: Patch-level DPO for Finetuning-free Personalized Image Generation
par: Huang, Qihan, et autres
Publié: (2024) -
Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning
par: Huang, Qihan, et autres
Publié: (2025) -
MS-Diffusion: Multi-subject Zero-shot Image Personalization with Layout Guidance
par: Wang, Xierui, et autres
Publié: (2024) -
Resolving Multi-Condition Confusion for Finetuning-Free Personalized Image Generation
par: Huang, Qihan, et autres
Publié: (2024) -
Towards Enhanced Image Generation Via Multi-modal Chain of Thought in Unified Generative Models
par: Wang, Yi, et autres
Publié: (2025)