AdaptMMBench: Benchmarking Adaptive Multimodal Reasoning for Mode Selection and Reasoning Process
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Xintong, Zhang, Xiaowen, Wu, Jingrong, Gao, Zhi, Yan, Shilin, Diao, Zhenxin, Gao, Kunpeng, Chen, Xuanyan, Wu, Yuwei, Jia, Yunde, Li, Qing |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MIRROR: Multimodal Iterative Reasoning via Reflection on Visual Regions
von: Zhang, Haoyu, et al.
Veröffentlicht: (2026)
von: Zhang, Haoyu, et al.
Veröffentlicht: (2026)
Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs
von: Zhang, Xintong, et al.
Veröffentlicht: (2025)
von: Zhang, Xintong, et al.
Veröffentlicht: (2025)
Memory-Centric Embodied Question Answering
von: Zhai, Mingliang, et al.
Veröffentlicht: (2025)
von: Zhai, Mingliang, et al.
Veröffentlicht: (2025)
Long-Horizon Visual Imitation Learning via Plan and Code Reflection
von: Chen, Quan, et al.
Veröffentlicht: (2025)
von: Chen, Quan, et al.
Veröffentlicht: (2025)
Adaptive Model Ensemble for Continual Learning
von: Mao, Yuchuan, et al.
Veröffentlicht: (2025)
von: Mao, Yuchuan, et al.
Veröffentlicht: (2025)
Large-Scale Riemannian Meta-Optimization via Subspace Adaptation
von: Yu, Peilin, et al.
Veröffentlicht: (2025)
von: Yu, Peilin, et al.
Veröffentlicht: (2025)
Curvature Learning for Generalization of Hyperbolic Neural Networks
von: Fan, Xiaomeng, et al.
Veröffentlicht: (2025)
von: Fan, Xiaomeng, et al.
Veröffentlicht: (2025)
Multi-Step Reasoning for Embodied Question Answering via Tool Augmentation
von: Zhai, Mingliang, et al.
Veröffentlicht: (2025)
von: Zhai, Mingliang, et al.
Veröffentlicht: (2025)
FIRE: A Dataset for Feedback Integration and Refinement Evaluation of Multimodal Models
von: Li, Pengxiang, et al.
Veröffentlicht: (2024)
von: Li, Pengxiang, et al.
Veröffentlicht: (2024)
STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning
von: Zhang, Xiaowen, et al.
Veröffentlicht: (2026)
von: Zhang, Xiaowen, et al.
Veröffentlicht: (2026)
Facial Expression Generation Aligned with Human Preference for Natural Dyadic Interaction
von: Chen, Xu, et al.
Veröffentlicht: (2026)
von: Chen, Xu, et al.
Veröffentlicht: (2026)
Hyperbolic Dual Feature Augmentation for Open-Environment
von: Yu, Peilin, et al.
Veröffentlicht: (2025)
von: Yu, Peilin, et al.
Veröffentlicht: (2025)
Beyond the Seen: Bounded Distribution Estimation for Open-Vocabulary Learning
von: Fan, Xiaomeng, et al.
Veröffentlicht: (2025)
von: Fan, Xiaomeng, et al.
Veröffentlicht: (2025)
FewMMBench: A Benchmark for Multimodal Few-Shot Learning
von: Dogan, Mustafa, et al.
Veröffentlicht: (2026)
von: Dogan, Mustafa, et al.
Veröffentlicht: (2026)
Efficient Multi-turn RL for GUI Agents via Decoupled Training and Adaptive Data Curation
von: Li, Pengxiang, et al.
Veröffentlicht: (2025)
von: Li, Pengxiang, et al.
Veröffentlicht: (2025)
DiffAdapt: Difficulty-Adaptive Reasoning for Token-Efficient LLM Inference
von: Liu, Xiang, et al.
Veröffentlicht: (2025)
von: Liu, Xiang, et al.
Veröffentlicht: (2025)
Modality Alignment across Trees on Heterogeneous Hyperbolic Manifolds
von: Wu, Wei, et al.
Veröffentlicht: (2025)
von: Wu, Wei, et al.
Veröffentlicht: (2025)
Fine-Grained 3D Facial Reconstruction for Micro-Expressions
von: Sun, Che, et al.
Veröffentlicht: (2026)
von: Sun, Che, et al.
Veröffentlicht: (2026)
AstroMMBench: A Benchmark for Evaluating Multimodal Large Language Models Capabilities in Astronomy
von: Shi, Jinghang, et al.
Veröffentlicht: (2025)
von: Shi, Jinghang, et al.
Veröffentlicht: (2025)
Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning
von: Li, Pengxiang, et al.
Veröffentlicht: (2025)
von: Li, Pengxiang, et al.
Veröffentlicht: (2025)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
von: Wu, Yuhang, et al.
Veröffentlicht: (2024)
von: Wu, Yuhang, et al.
Veröffentlicht: (2024)
ResAdapt: Adaptive Resolution for Efficient Multimodal Reasoning
von: Liao, Huanxuan, et al.
Veröffentlicht: (2026)
von: Liao, Huanxuan, et al.
Veröffentlicht: (2026)
GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI
von: Chen, Pengcheng, et al.
Veröffentlicht: (2024)
von: Chen, Pengcheng, et al.
Veröffentlicht: (2024)
Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning
von: Ma, Qinghe, et al.
Veröffentlicht: (2026)
von: Ma, Qinghe, et al.
Veröffentlicht: (2026)
Adapt to Thrive! Adaptive Power-Mean Policy Optimization for Improved LLM Reasoning
von: Huang, Yiming, et al.
Veröffentlicht: (2026)
von: Huang, Yiming, et al.
Veröffentlicht: (2026)
Geometry-aware Distance Measure for Diverse Hierarchical Structures in Hyperbolic Spaces
von: Li, Pengxiang, et al.
Veröffentlicht: (2025)
von: Li, Pengxiang, et al.
Veröffentlicht: (2025)
Benchmarking and Improving GUI Agents in High-Dynamic Environments
von: Liu, Enqi, et al.
Veröffentlicht: (2026)
von: Liu, Enqi, et al.
Veröffentlicht: (2026)
PhysicsArena: The First Multimodal Physics Reasoning Benchmark Exploring Variable, Process, and Solution Dimensions
von: Dai, Song, et al.
Veröffentlicht: (2025)
von: Dai, Song, et al.
Veröffentlicht: (2025)
LongSplat: Online Generalizable 3D Gaussian Splatting from Long Sequence Images
von: Huang, Guichen, et al.
Veröffentlicht: (2025)
von: Huang, Guichen, et al.
Veröffentlicht: (2025)
Learning to Adapt SFT Data for Better Reasoning Generalization
von: Sun, Lisong, et al.
Veröffentlicht: (2026)
von: Sun, Lisong, et al.
Veröffentlicht: (2026)
Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning
von: Li, Zejun, et al.
Veröffentlicht: (2025)
von: Li, Zejun, et al.
Veröffentlicht: (2025)
Temporally Consistent Stereo Matching
von: Zeng, Jiaxi, et al.
Veröffentlicht: (2024)
von: Zeng, Jiaxi, et al.
Veröffentlicht: (2024)
Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool Usage
von: Gao, Zhi, et al.
Veröffentlicht: (2024)
von: Gao, Zhi, et al.
Veröffentlicht: (2024)
ViLLA-MMBench: A Unified Benchmark Suite for LLM-Augmented Multimodal Movie Recommendation
von: Nazary, Fatemeh, et al.
Veröffentlicht: (2025)
von: Nazary, Fatemeh, et al.
Veröffentlicht: (2025)
Chain of Mindset: Reasoning with Adaptive Cognitive Modes
von: Jiang, Tianyi, et al.
Veröffentlicht: (2026)
von: Jiang, Tianyi, et al.
Veröffentlicht: (2026)
A Set-to-Set Distance Measure in Hyperbolic Space
von: Li, Pengxiang, et al.
Veröffentlicht: (2025)
von: Li, Pengxiang, et al.
Veröffentlicht: (2025)
Toward Multi-Session Personalized Conversation: A Large-Scale Dataset and Hierarchical Tree Framework for Implicit Reasoning
von: Li, Xintong, et al.
Veröffentlicht: (2025)
von: Li, Xintong, et al.
Veröffentlicht: (2025)
Entropy-based Exploration Conduction for Multi-step Reasoning
von: Zhang, Jinghan, et al.
Veröffentlicht: (2025)
von: Zhang, Jinghan, et al.
Veröffentlicht: (2025)
GUI Knowledge Bench: Revealing the Knowledge Gap of VLMs in GUI Tasks
von: Shi, Chenrui, et al.
Veröffentlicht: (2025)
von: Shi, Chenrui, et al.
Veröffentlicht: (2025)
DIVA-GRPO: Enhancing Multimodal Reasoning through Difficulty-Adaptive Variant Advantage
von: Gao, Haowen, et al.
Veröffentlicht: (2026)
von: Gao, Haowen, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
MIRROR: Multimodal Iterative Reasoning via Reflection on Visual Regions
von: Zhang, Haoyu, et al.
Veröffentlicht: (2026) -
Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs
von: Zhang, Xintong, et al.
Veröffentlicht: (2025) -
Memory-Centric Embodied Question Answering
von: Zhai, Mingliang, et al.
Veröffentlicht: (2025) -
Long-Horizon Visual Imitation Learning via Plan and Code Reflection
von: Chen, Quan, et al.
Veröffentlicht: (2025) -
Adaptive Model Ensemble for Continual Learning
von: Mao, Yuchuan, et al.
Veröffentlicht: (2025)