Reinforcing Multimodal Reasoning Against Visual Degradation
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Rui, Yu, Dian, Liu, Haolin, Shi, Yucheng, Zheng, Tong, Dai, Runpeng, Mi, Haitao, Tokekar, Pratap, Leoweiliang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification
di: Liu, Rui, et al.
Pubblicazione: (2026)
di: Liu, Rui, et al.
Pubblicazione: (2026)
Stable and Efficient Single-Rollout RL for Multimodal Reasoning
di: Liu, Rui, et al.
Pubblicazione: (2025)
di: Liu, Rui, et al.
Pubblicazione: (2025)
Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning
di: Liu, Rui, et al.
Pubblicazione: (2025)
di: Liu, Rui, et al.
Pubblicazione: (2025)
CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
di: Dai, Runpeng, et al.
Pubblicazione: (2025)
di: Dai, Runpeng, et al.
Pubblicazione: (2025)
Adaptive Visual Imitation Learning for Robotic Assisted Feeding Across Varied Bowl Configurations and Food Types
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning
di: Liu, Haolin, et al.
Pubblicazione: (2026)
di: Liu, Haolin, et al.
Pubblicazione: (2026)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
di: Shi, Weikang, et al.
Pubblicazione: (2025)
di: Shi, Weikang, et al.
Pubblicazione: (2025)
Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention
di: Tian, Changyuan, et al.
Pubblicazione: (2026)
di: Tian, Changyuan, et al.
Pubblicazione: (2026)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
di: Wang, Weiyun, et al.
Pubblicazione: (2025)
di: Wang, Weiyun, et al.
Pubblicazione: (2025)
One Token to Fool LLM-as-a-Judge
di: Zhao, Yulai, et al.
Pubblicazione: (2025)
di: Zhao, Yulai, et al.
Pubblicazione: (2025)
Parallel-R1: Towards Parallel Thinking via Reinforcement Learning
di: Zheng, Tong, et al.
Pubblicazione: (2025)
di: Zheng, Tong, et al.
Pubblicazione: (2025)
Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization
di: Deng, Haolin, et al.
Pubblicazione: (2026)
di: Deng, Haolin, et al.
Pubblicazione: (2026)
From Sight to Insight: Improving Visual Reasoning Capabilities of Multimodal Models via Reinforcement Learning
di: Sharif, Omar, et al.
Pubblicazione: (2026)
di: Sharif, Omar, et al.
Pubblicazione: (2026)
Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
di: Chen, Yi, et al.
Pubblicazione: (2025)
di: Chen, Yi, et al.
Pubblicazione: (2025)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
di: Zhang, Ce, et al.
Pubblicazione: (2025)
di: Zhang, Ce, et al.
Pubblicazione: (2025)
Latent Visual Reasoning
di: Li, Bangzheng, et al.
Pubblicazione: (2025)
di: Li, Bangzheng, et al.
Pubblicazione: (2025)
SIaM: Self-Improving Code-Assisted Mathematical Reasoning of Large Language Models
di: Yu, Dian, et al.
Pubblicazione: (2024)
di: Yu, Dian, et al.
Pubblicazione: (2024)
MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning
di: Gan, Ziliang, et al.
Pubblicazione: (2024)
di: Gan, Ziliang, et al.
Pubblicazione: (2024)
R1-RE: Cross-Domain Relation Extraction with RLVR
di: Dai, Runpeng, et al.
Pubblicazione: (2025)
di: Dai, Runpeng, et al.
Pubblicazione: (2025)
v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
di: Chung, Jiwan, et al.
Pubblicazione: (2025)
di: Chung, Jiwan, et al.
Pubblicazione: (2025)
VisRAG 2.0: Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation
di: Sun, Yubo, et al.
Pubblicazione: (2025)
di: Sun, Yubo, et al.
Pubblicazione: (2025)
MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment
di: Shi, Yucheng, et al.
Pubblicazione: (2025)
di: Shi, Yucheng, et al.
Pubblicazione: (2025)
NoLan: Mitigating Object Hallucinations in Large Vision-Language Models via Dynamic Suppression of Language Priors
di: Ren, Lingfeng, et al.
Pubblicazione: (2026)
di: Ren, Lingfeng, et al.
Pubblicazione: (2026)
VP-MEL: Visual Prompts Guided Multimodal Entity Linking
di: Mi, Hongze, et al.
Pubblicazione: (2024)
di: Mi, Hongze, et al.
Pubblicazione: (2024)
Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training
di: Luo, Gen, et al.
Pubblicazione: (2024)
di: Luo, Gen, et al.
Pubblicazione: (2024)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
GenFlowRL: Shaping Rewards with Generative Object-Centric Flow in Visual Reinforcement Learning
di: Yu, Kelin, et al.
Pubblicazione: (2025)
di: Yu, Kelin, et al.
Pubblicazione: (2025)
DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search
di: Yue, Murong, et al.
Pubblicazione: (2024)
di: Yue, Murong, et al.
Pubblicazione: (2024)
Every Question Has Its Own Value: Reinforcement Learning with Explicit Human Values
di: Yu, Dian, et al.
Pubblicazione: (2025)
di: Yu, Dian, et al.
Pubblicazione: (2025)
TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models
di: Shangguan, Ziyao, et al.
Pubblicazione: (2024)
di: Shangguan, Ziyao, et al.
Pubblicazione: (2024)
LLMs Improving LLMs: Agentic Discovery for Test-Time Scaling
di: Zheng, Tong, et al.
Pubblicazione: (2026)
di: Zheng, Tong, et al.
Pubblicazione: (2026)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
di: Zhang, Huanyu, et al.
Pubblicazione: (2025)
di: Zhang, Huanyu, et al.
Pubblicazione: (2025)
Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!
di: Imam, Mohamed Fazli, et al.
Pubblicazione: (2025)
di: Imam, Mohamed Fazli, et al.
Pubblicazione: (2025)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
di: Li, Yunxin, et al.
Pubblicazione: (2025)
di: Li, Yunxin, et al.
Pubblicazione: (2025)
SpaceDG: Benchmarking Spatial Intelligence under Visual Degradation
di: Zhou, Xiaolong, et al.
Pubblicazione: (2026)
di: Zhou, Xiaolong, et al.
Pubblicazione: (2026)
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
di: Pi, Renjie, et al.
Pubblicazione: (2024)
di: Pi, Renjie, et al.
Pubblicazione: (2024)
V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning
di: Ning, Zhiwei, et al.
Pubblicazione: (2026)
di: Ning, Zhiwei, et al.
Pubblicazione: (2026)
Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space
di: Liu, Chengzhi, et al.
Pubblicazione: (2025)
di: Liu, Chengzhi, et al.
Pubblicazione: (2025)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
Documenti analoghi
-
DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification
di: Liu, Rui, et al.
Pubblicazione: (2026) -
Stable and Efficient Single-Rollout RL for Multimodal Reasoning
di: Liu, Rui, et al.
Pubblicazione: (2025) -
Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning
di: Liu, Rui, et al.
Pubblicazione: (2025) -
CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
di: Dai, Runpeng, et al.
Pubblicazione: (2025) -
Adaptive Visual Imitation Learning for Robotic Assisted Feeding Across Varied Bowl Configurations and Food Types
di: Liu, Rui, et al.
Pubblicazione: (2024)