VTC-Bench: Evaluating Agentic Multimodal Models via Compositional Visual Tool Chaining
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhu, Xuanyu, Dong, Yuhao, Wang, Rundong, Shi, Yang, Wu, Zhipeng, Peng, Yinlun, Zhang, YiFan, Lou, Yihang, Zhang, Yuanxing, Liu, Ziwei, Bai, Yan, Zhou, Yuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization
por: Zhu, Xuanyu, et al.
Publicado: (2026)
por: Zhu, Xuanyu, et al.
Publicado: (2026)
Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks
por: Jin, Jing, et al.
Publicado: (2026)
por: Jin, Jing, et al.
Publicado: (2026)
Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
por: Dong, Yuhao, et al.
Publicado: (2026)
por: Dong, Yuhao, et al.
Publicado: (2026)
MCIE: Multimodal LLM-Driven Complex Instruction Image Editing with Spatial Guidance
por: Bai, Xuehai, et al.
Publicado: (2026)
por: Bai, Xuehai, et al.
Publicado: (2026)
Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models
por: Dong, Yuhao, et al.
Publicado: (2024)
por: Dong, Yuhao, et al.
Publicado: (2024)
Examen VTC Barcelona
por: Easy Quizzz
Publicado: (2026)
por: Easy Quizzz
Publicado: (2026)
Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning
por: Tian, Shulin, et al.
Publicado: (2025)
por: Tian, Shulin, et al.
Publicado: (2025)
QG-VTC: Question-Guided Visual Token Compression in MLLMs for Efficient VQA
por: Li, Shuai, et al.
Publicado: (2025)
por: Li, Shuai, et al.
Publicado: (2025)
OMEGA: Optimized Multimodal Position Encoding Index Derivation with Global Adaptive Scaling for Vision-Language Models
por: Huang, Ruoxiang, et al.
Publicado: (2025)
por: Huang, Ruoxiang, et al.
Publicado: (2025)
ChainRec: An Agentic Recommender Learning to Route Tool Chains for Diverse and Evolving Interests
por: Li, Fuchun, et al.
Publicado: (2026)
por: Li, Fuchun, et al.
Publicado: (2026)
Debiasing Multimodal Large Language Models via Penalization of Language Priors
por: Zhang, YiFan, et al.
Publicado: (2024)
por: Zhang, YiFan, et al.
Publicado: (2024)
Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos
por: Tang, Yuqi, et al.
Publicado: (2026)
por: Tang, Yuqi, et al.
Publicado: (2026)
ATP-Bench: Towards Agentic Tool Planning for MLLM Interleaved Generation
por: Liu, Yinuo, et al.
Publicado: (2026)
por: Liu, Yinuo, et al.
Publicado: (2026)
VisBrowse-Bench: Benchmarking Visual-Native Search for Multimodal Browsing Agents
por: Zhang, Zhengbo, et al.
Publicado: (2026)
por: Zhang, Zhengbo, et al.
Publicado: (2026)
VTC: DNN Compilation with Virtual Tensors for Data Movement Elimination
por: Hu, Muyan, et al.
Publicado: (2026)
por: Hu, Muyan, et al.
Publicado: (2026)
Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling
por: Bai, Xuehai, et al.
Publicado: (2026)
por: Bai, Xuehai, et al.
Publicado: (2026)
OpaqueToolsBench: Learning Nuances of Tool Behavior Through Interaction
por: Hallinan, Skyler, et al.
Publicado: (2026)
por: Hallinan, Skyler, et al.
Publicado: (2026)
Vibe AIGC: A New Paradigm for Content Generation via Agentic Orchestration
por: Liu, Jiaheng, et al.
Publicado: (2026)
por: Liu, Jiaheng, et al.
Publicado: (2026)
SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature
por: Ren, Yiming, et al.
Publicado: (2026)
por: Ren, Yiming, et al.
Publicado: (2026)
Patho-AgenticRAG: Towards Multimodal Agentic Retrieval-Augmented Generation for Pathology VLMs via Reinforcement Learning
por: Zhang, Wenchuan, et al.
Publicado: (2025)
por: Zhang, Wenchuan, et al.
Publicado: (2025)
ChainCaps: Composition-Safe Tool-Using Agents via Monotonic Capability Attenuation
por: Jiang, Xiaochong, et al.
Publicado: (2026)
por: Jiang, Xiaochong, et al.
Publicado: (2026)
ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
por: Li, Yuhang, et al.
Publicado: (2025)
por: Li, Yuhang, et al.
Publicado: (2025)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
por: Ding, Shengyuan, et al.
Publicado: (2025)
por: Ding, Shengyuan, et al.
Publicado: (2025)
MemReread: Enhancing Agentic Long-Context Reasoning via Memory-Guided Rereading
por: Ji, Baibei, et al.
Publicado: (2026)
por: Ji, Baibei, et al.
Publicado: (2026)
Agentic Tool Use in Large Language Models
por: Hu, Jinchao, et al.
Publicado: (2026)
por: Hu, Jinchao, et al.
Publicado: (2026)
Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models
por: Yan, Shilin, et al.
Publicado: (2026)
por: Yan, Shilin, et al.
Publicado: (2026)
LensNet: An End-to-End Learning Framework for Empirical Point Spread Function Modeling and Lensless Imaging Reconstruction
por: Bai, Jiesong, et al.
Publicado: (2025)
por: Bai, Jiesong, et al.
Publicado: (2025)
ArtifactsBench: Bridging the Visual-Interactive Gap in LLM Code Generation Evaluation
por: Zhang, Chenchen, et al.
Publicado: (2025)
por: Zhang, Chenchen, et al.
Publicado: (2025)
Learning to Edit Knowledge via Instruction-based Chain-of-Thought Prompting
por: Fu, Jinhu, et al.
Publicado: (2026)
por: Fu, Jinhu, et al.
Publicado: (2026)
ToolFG: Towards Well-Grounded Fine-Grained Image Classification
por: Xue, Yu, et al.
Publicado: (2026)
por: Xue, Yu, et al.
Publicado: (2026)
ToolMisuseBench: An Offline Deterministic Benchmark for Tool Misuse and Recovery in Agentic Systems
por: Sigdel, Akshey, et al.
Publicado: (2026)
por: Sigdel, Akshey, et al.
Publicado: (2026)
NeuroSwift: A Lightweight Cross-Subject Framework for fMRI Visual Reconstruction of Complex Scenes
por: Zhang, Shiyi, et al.
Publicado: (2025)
por: Zhang, Shiyi, et al.
Publicado: (2025)
Tool-MCoT: Tool Augmented Multimodal Chain-of-Thought for Content Safety Moderation
por: Zhang, Shutong, et al.
Publicado: (2026)
por: Zhang, Shutong, et al.
Publicado: (2026)
Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning
por: Ma, Qinghe, et al.
Publicado: (2026)
por: Ma, Qinghe, et al.
Publicado: (2026)
ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better
por: Zhang, Yuan, et al.
Publicado: (2025)
por: Zhang, Yuan, et al.
Publicado: (2025)
ASTER: Agentic Scaling with Tool-integrated Extended Reasoning
por: Zhang, Xuqin, et al.
Publicado: (2026)
por: Zhang, Xuqin, et al.
Publicado: (2026)
RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmark
por: Shi, Yang, et al.
Publicado: (2025)
por: Shi, Yang, et al.
Publicado: (2025)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
por: Liu, Xiao, et al.
Publicado: (2024)
por: Liu, Xiao, et al.
Publicado: (2024)
A computable biomedical knowledge system: Toward rapidly building candidate‐directed acyclic graphs
por: Yongmei Bai, et al.
Publicado: (2024)
por: Yongmei Bai, et al.
Publicado: (2024)
MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence
por: Chen, Yifan, et al.
Publicado: (2026)
por: Chen, Yifan, et al.
Publicado: (2026)
Ejemplares similares
-
Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization
por: Zhu, Xuanyu, et al.
Publicado: (2026) -
Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks
por: Jin, Jing, et al.
Publicado: (2026) -
Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
por: Dong, Yuhao, et al.
Publicado: (2026) -
MCIE: Multimodal LLM-Driven Complex Instruction Image Editing with Spatial Guidance
por: Bai, Xuehai, et al.
Publicado: (2026) -
Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models
por: Dong, Yuhao, et al.
Publicado: (2024)