The Role of Visual Modality in Multimodal Mathematical Reasoning: Challenges and Insights
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Yufang, Du, Yao, Ji, Tao, Wang, Jianing, Liu, Yang, Wu, Yuanbin, Zhou, Aimin, Zhang, Mengdi, Cai, Xunliang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Investigating and Mitigating Object Hallucinations in Pretrained Vision-Language (CLIP) Models
di: Liu, Yufang, et al.
Pubblicazione: (2024)
di: Liu, Yufang, et al.
Pubblicazione: (2024)
EAGLE: Elevating Geometric Reasoning through LLM-empowered Visual Instruction Tuning
di: Li, Zhihao, et al.
Pubblicazione: (2024)
di: Li, Zhihao, et al.
Pubblicazione: (2024)
CodePlot-CoT: Mathematical Visual Reasoning by Thinking with Code-Driven Images
di: Duan, Chengqi, et al.
Pubblicazione: (2025)
di: Duan, Chengqi, et al.
Pubblicazione: (2025)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
di: Shi, Weikang, et al.
Pubblicazione: (2025)
di: Shi, Weikang, et al.
Pubblicazione: (2025)
Benchmarking Multimodal Mathematical Reasoning with Explicit Visual Dependency
di: Wang, Zhikai, et al.
Pubblicazione: (2025)
di: Wang, Zhikai, et al.
Pubblicazione: (2025)
Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models
di: Dong, Yuhao, et al.
Pubblicazione: (2024)
di: Dong, Yuhao, et al.
Pubblicazione: (2024)
MM-PRM: Enhancing Multimodal Mathematical Reasoning with Scalable Step-Level Supervision
di: Du, Lingxiao, et al.
Pubblicazione: (2025)
di: Du, Lingxiao, et al.
Pubblicazione: (2025)
Multimodal Causal Reasoning Benchmark: Challenging Vision Large Language Models to Discern Causal Links Across Modalities
di: Li, Zhiyuan, et al.
Pubblicazione: (2024)
di: Li, Zhiyuan, et al.
Pubblicazione: (2024)
Reasoning-OCR: Can Large Multimodal Models Solve Complex Logical Reasoning Problems from OCR Cues?
di: He, Haibin, et al.
Pubblicazione: (2025)
di: He, Haibin, et al.
Pubblicazione: (2025)
Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains
di: Zhang, Jesen, et al.
Pubblicazione: (2025)
di: Zhang, Jesen, et al.
Pubblicazione: (2025)
Diagnosing Visual Reasoning: Challenges, Insights, and a Path Forward
di: Bi, Jing, et al.
Pubblicazione: (2025)
di: Bi, Jing, et al.
Pubblicazione: (2025)
Mask What Matters: Mitigating Object Hallucinations in Multimodal Large Language Models with Object-Aligned Visual Contrastive Decoding
di: Chen, Boqi, et al.
Pubblicazione: (2026)
di: Chen, Boqi, et al.
Pubblicazione: (2026)
Autonomous Imagination: Closed-Loop Decomposition of Visual-to-Textual Conversion in Visual Reasoning for Multimodal Large Language Models
di: Liu, Jingming, et al.
Pubblicazione: (2024)
di: Liu, Jingming, et al.
Pubblicazione: (2024)
See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs
di: Zhang, Yongchang, et al.
Pubblicazione: (2026)
di: Zhang, Yongchang, et al.
Pubblicazione: (2026)
Continual Retinal Vision-Language Pre-training upon Incremental Imaging Modalities
di: Yao, Yuang, et al.
Pubblicazione: (2025)
di: Yao, Yuang, et al.
Pubblicazione: (2025)
VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
di: Zhao, Shiji, et al.
Pubblicazione: (2025)
Mixture of Rationale: Multi-Modal Reasoning Mixture for Visual Question Answering
di: Li, Tao, et al.
Pubblicazione: (2024)
di: Li, Tao, et al.
Pubblicazione: (2024)
Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
di: Dong, Yuhao, et al.
Pubblicazione: (2026)
di: Dong, Yuhao, et al.
Pubblicazione: (2026)
Beyond Modality Collapse: Representations Blending for Multimodal Dataset Distillation
di: Zhang, Xin, et al.
Pubblicazione: (2025)
di: Zhang, Xin, et al.
Pubblicazione: (2025)
Open-set Cross Modal Generalization via Multimodal Unified Representation
di: Huang, Hai, et al.
Pubblicazione: (2025)
di: Huang, Hai, et al.
Pubblicazione: (2025)
Conan: Progressive Learning to Reason Like a Detective over Multi-Scale Visual Evidence
di: Ouyang, Kun, et al.
Pubblicazione: (2025)
di: Ouyang, Kun, et al.
Pubblicazione: (2025)
ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking
di: Wang, Lihong, et al.
Pubblicazione: (2025)
di: Wang, Lihong, et al.
Pubblicazione: (2025)
Mixture-of-Modality-Experts with Holistic Token Learning for Fine-Grained Multimodal Visual Analytics in Driver Action Recognition
di: Liu, Tianyi, et al.
Pubblicazione: (2026)
di: Liu, Tianyi, et al.
Pubblicazione: (2026)
Preserving Cross-Modal Stability for Visual Unlearning in Multimodal Scenarios
di: Li, Jinghan Xu Yuyang Zhang Qixuan Cai Jiancheng Chen Keqiu
Pubblicazione: (2025)
di: Li, Jinghan Xu Yuyang Zhang Qixuan Cai Jiancheng Chen Keqiu
Pubblicazione: (2025)
ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language Models
di: Hei, Xusen, et al.
Pubblicazione: (2025)
di: Hei, Xusen, et al.
Pubblicazione: (2025)
DIVER: Dynamic Iterative Visual Evidence Reasoning for Multimodal Fake News Detection
di: Zhou, Weilin, et al.
Pubblicazione: (2026)
di: Zhou, Weilin, et al.
Pubblicazione: (2026)
MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation
di: Wu, Changli, et al.
Pubblicazione: (2026)
di: Wu, Changli, et al.
Pubblicazione: (2026)
Reinforcing Multimodal Reasoning Against Visual Degradation
di: Liu, Rui, et al.
Pubblicazione: (2026)
di: Liu, Rui, et al.
Pubblicazione: (2026)
MedThink: Explaining Medical Visual Question Answering via Multimodal Decision-Making Rationale
di: Gai, Xiaotang, et al.
Pubblicazione: (2024)
di: Gai, Xiaotang, et al.
Pubblicazione: (2024)
Learn to Think: Improving Multimodal Reasoning through Vision-Aware Self-Improvement Training
di: Zhong, Qihuang, et al.
Pubblicazione: (2026)
di: Zhong, Qihuang, et al.
Pubblicazione: (2026)
DiMo-GUI: Advancing Test-time Scaling in GUI Grounding via Modality-Aware Visual Reasoning
di: Wu, Hang, et al.
Pubblicazione: (2025)
di: Wu, Hang, et al.
Pubblicazione: (2025)
ModalPrompt: Towards Efficient Multimodal Continual Instruction Tuning with Dual-Modality Guided Prompt
di: Zeng, Fanhu, et al.
Pubblicazione: (2024)
di: Zeng, Fanhu, et al.
Pubblicazione: (2024)
Prejudge-Before-Think: Enhancing Large Language Models at Test-Time by Process Prejudge Reasoning
di: Wang, Jianing, et al.
Pubblicazione: (2025)
di: Wang, Jianing, et al.
Pubblicazione: (2025)
Improving Multimodal Sentiment Analysis via Modality Optimization and Dynamic Primary Modality Selection
di: Yang, Dingkang, et al.
Pubblicazione: (2025)
di: Yang, Dingkang, et al.
Pubblicazione: (2025)
MedVLThinker: Simple Baselines for Multimodal Medical Reasoning
di: Huang, Xiaoke, et al.
Pubblicazione: (2025)
di: Huang, Xiaoke, et al.
Pubblicazione: (2025)
Self-Adapting Large Visual-Language Models to Edge Devices across Visual Modalities
di: Cai, Kaiwen, et al.
Pubblicazione: (2024)
di: Cai, Kaiwen, et al.
Pubblicazione: (2024)
PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns
di: Chia, Yew Ken, et al.
Pubblicazione: (2024)
di: Chia, Yew Ken, et al.
Pubblicazione: (2024)
MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems
di: Chen, Shuhang, et al.
Pubblicazione: (2025)
di: Chen, Shuhang, et al.
Pubblicazione: (2025)
Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks
di: Jin, Jing, et al.
Pubblicazione: (2026)
di: Jin, Jing, et al.
Pubblicazione: (2026)
MARS2 2025 Challenge on Multimodal Reasoning: Datasets, Methods, Results, Discussion, and Outlook
di: Xu, Peng, et al.
Pubblicazione: (2025)
di: Xu, Peng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Investigating and Mitigating Object Hallucinations in Pretrained Vision-Language (CLIP) Models
di: Liu, Yufang, et al.
Pubblicazione: (2024) -
EAGLE: Elevating Geometric Reasoning through LLM-empowered Visual Instruction Tuning
di: Li, Zhihao, et al.
Pubblicazione: (2024) -
CodePlot-CoT: Mathematical Visual Reasoning by Thinking with Code-Driven Images
di: Duan, Chengqi, et al.
Pubblicazione: (2025) -
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
di: Shi, Weikang, et al.
Pubblicazione: (2025) -
Benchmarking Multimodal Mathematical Reasoning with Explicit Visual Dependency
di: Wang, Zhikai, et al.
Pubblicazione: (2025)