MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Shen, Haozhan, Yan, Shilin, Xue, Hongwei, Lu, Shuaiqi, Tang, Xiaojun, Zhang, Guannan, Zhao, Tiancheng, Yin, Jianwei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models
von: Shen, Haozhan, et al.
Veröffentlicht: (2026)
von: Shen, Haozhan, et al.
Veröffentlicht: (2026)
SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs
von: Tong, Jintao, et al.
Veröffentlicht: (2026)
von: Tong, Jintao, et al.
Veröffentlicht: (2026)
GUI Testing Arena: A Unified Benchmark for Advancing Autonomous GUI Testing Agent
von: Zhao, Kangjia, et al.
Veröffentlicht: (2024)
von: Zhao, Kangjia, et al.
Veröffentlicht: (2024)
MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought Verification
von: Sun, Linzhuang, et al.
Veröffentlicht: (2025)
von: Sun, Linzhuang, et al.
Veröffentlicht: (2025)
ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
von: Shen, Haozhan, et al.
Veröffentlicht: (2024)
von: Shen, Haozhan, et al.
Veröffentlicht: (2024)
You Only Forward Once: An Efficient Compositional Judging Paradigm
von: Zhang, Tianlong, et al.
Veröffentlicht: (2025)
von: Zhang, Tianlong, et al.
Veröffentlicht: (2025)
TACIT Benchmark: A Programmatic Visual Reasoning Benchmark for Generative and Discriminative Models
von: Medeiros, Daniel Nobrega
Veröffentlicht: (2026)
von: Medeiros, Daniel Nobrega
Veröffentlicht: (2026)
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
Talking to Yourself: Defying Forgetting in Large Language Models
von: Sun, Yutao, et al.
Veröffentlicht: (2026)
von: Sun, Yutao, et al.
Veröffentlicht: (2026)
CoRGI: Verified Chain-of-Thought Reasoning with Post-hoc Visual Grounding
von: Yi, Shixin, et al.
Veröffentlicht: (2025)
von: Yi, Shixin, et al.
Veröffentlicht: (2025)
VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
von: Liu, Peng, et al.
Veröffentlicht: (2025)
von: Liu, Peng, et al.
Veröffentlicht: (2025)
Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models
von: Yan, Shilin, et al.
Veröffentlicht: (2026)
von: Yan, Shilin, et al.
Veröffentlicht: (2026)
EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs
von: Dai, Yang, et al.
Veröffentlicht: (2026)
von: Dai, Yang, et al.
Veröffentlicht: (2026)
AgriChain Visually Grounded Expert Verified Reasoning for Interpretable Agricultural Vision Language Models
von: Mahmood, Hazza, et al.
Veröffentlicht: (2026)
von: Mahmood, Hazza, et al.
Veröffentlicht: (2026)
PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning
von: Zhang, Qiran, et al.
Veröffentlicht: (2026)
von: Zhang, Qiran, et al.
Veröffentlicht: (2026)
Trust but Verify: Programmatic VLM Evaluation in the Wild
von: Prabhu, Viraj, et al.
Veröffentlicht: (2024)
von: Prabhu, Viraj, et al.
Veröffentlicht: (2024)
ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning
von: Lv, Guannan, et al.
Veröffentlicht: (2026)
von: Lv, Guannan, et al.
Veröffentlicht: (2026)
FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning
von: Xie, Zhuohan, et al.
Veröffentlicht: (2025)
von: Xie, Zhuohan, et al.
Veröffentlicht: (2025)
Geo-R1: Improving Few-Shot Geospatial Referring Expression Understanding with Reinforcement Fine-Tuning
von: Zhang, Zilun, et al.
Veröffentlicht: (2025)
von: Zhang, Zilun, et al.
Veröffentlicht: (2025)
ImageRAG: Enhancing Ultra High Resolution Remote Sensing Imagery Analysis with ImageRAG
von: Zhang, Zilun, et al.
Veröffentlicht: (2024)
von: Zhang, Zilun, et al.
Veröffentlicht: (2024)
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
von: Zhang, Zilun, et al.
Veröffentlicht: (2025)
von: Zhang, Zilun, et al.
Veröffentlicht: (2025)
Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models
von: Hu, Yushi, et al.
Veröffentlicht: (2023)
von: Hu, Yushi, et al.
Veröffentlicht: (2023)
Visual Reasoning Tracer: Object-Level Grounded Reasoning Benchmark
von: Yuan, Haobo, et al.
Veröffentlicht: (2025)
von: Yuan, Haobo, et al.
Veröffentlicht: (2025)
Chain of Functions: A Programmatic Pipeline for Fine-Grained Chart Reasoning Data
von: Li, Zijian, et al.
Veröffentlicht: (2025)
von: Li, Zijian, et al.
Veröffentlicht: (2025)
A Chain-of-Thought Is as Strong as Its Weakest Link: A Benchmark for Verifiers of Reasoning Chains
von: Jacovi, Alon, et al.
Veröffentlicht: (2024)
von: Jacovi, Alon, et al.
Veröffentlicht: (2024)
AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs
von: Lu, Lidong, et al.
Veröffentlicht: (2025)
von: Lu, Lidong, et al.
Veröffentlicht: (2025)
ToolGate: Contract-Grounded and Verified Tool Execution for LLMs
von: Liu, Yanming, et al.
Veröffentlicht: (2026)
von: Liu, Yanming, et al.
Veröffentlicht: (2026)
InteractScience: Programmatic and Visually-Grounded Evaluation of Interactive Scientific Demonstration Code Generation
von: Chen, Qiaosheng, et al.
Veröffentlicht: (2025)
von: Chen, Qiaosheng, et al.
Veröffentlicht: (2025)
Long Grounded Thoughts: Synthesizing Visual Problems and Reasoning Chains at Scale
von: Acuna, David, et al.
Veröffentlicht: (2025)
von: Acuna, David, et al.
Veröffentlicht: (2025)
Composition-Grounded Data Synthesis for Visual Reasoning
von: Gu, Xinyi, et al.
Veröffentlicht: (2025)
von: Gu, Xinyi, et al.
Veröffentlicht: (2025)
Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning
von: Cao, Meng, et al.
Veröffentlicht: (2025)
von: Cao, Meng, et al.
Veröffentlicht: (2025)
TroVE: Inducing Verifiable and Efficient Toolboxes for Solving Programmatic Tasks
von: Wang, Zhiruo, et al.
Veröffentlicht: (2024)
von: Wang, Zhiruo, et al.
Veröffentlicht: (2024)
Anderson-type acceleration method for Deep Neural Network optimization
von: Ito, Kazufumi, et al.
Veröffentlicht: (2025)
von: Ito, Kazufumi, et al.
Veröffentlicht: (2025)
MORSE-500: A Programmatically Controllable Video Benchmark to Stress-Test Multimodal Reasoning
von: Cai, Zikui, et al.
Veröffentlicht: (2025)
von: Cai, Zikui, et al.
Veröffentlicht: (2025)
MM-SCALE: Grounded Multimodal Moral Reasoning via Scalar Judgment and Listwise Alignment
von: Park, Eunkyu, et al.
Veröffentlicht: (2026)
von: Park, Eunkyu, et al.
Veröffentlicht: (2026)
The Self-Improvement Paradox: Can Language Models Bootstrap Reasoning Capabilities without External Scaffolding?
von: Sun, Yutao, et al.
Veröffentlicht: (2025)
von: Sun, Yutao, et al.
Veröffentlicht: (2025)
PoE-World: Compositional World Modeling with Products of Programmatic Experts
von: Piriyakulkij, Wasu Top, et al.
Veröffentlicht: (2025)
von: Piriyakulkij, Wasu Top, et al.
Veröffentlicht: (2025)
Seeing Culture: A Benchmark for Visual Reasoning and Grounding
von: Satar, Burak, et al.
Veröffentlicht: (2025)
von: Satar, Burak, et al.
Veröffentlicht: (2025)
MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
von: Chen, Xinyan, et al.
Veröffentlicht: (2025)
von: Chen, Xinyan, et al.
Veröffentlicht: (2025)
When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought
von: Zhou, Yiyang, et al.
Veröffentlicht: (2025)
von: Zhou, Yiyang, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models
von: Shen, Haozhan, et al.
Veröffentlicht: (2026) -
SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs
von: Tong, Jintao, et al.
Veröffentlicht: (2026) -
GUI Testing Arena: A Unified Benchmark for Advancing Autonomous GUI Testing Agent
von: Zhao, Kangjia, et al.
Veröffentlicht: (2024) -
MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought Verification
von: Sun, Linzhuang, et al.
Veröffentlicht: (2025) -
ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
von: Shen, Haozhan, et al.
Veröffentlicht: (2024)