m&m's: A Benchmark to Evaluate Tool-Use for multi-step multi-modal Tasks
Fuente:
arXiv
Guardado en:
| Autores principales: | Ma, Zixian, Huang, Weikai, Zhang, Jieyu, Gupta, Tanmay, Krishna, Ranjay |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Task Me Anything
por: Zhang, Jieyu, et al.
Publicado: (2024)
por: Zhang, Jieyu, et al.
Publicado: (2024)
Video-Based Reward Modeling for Computer-Use Agents
por: Song, Linxin, et al.
Publicado: (2026)
por: Song, Linxin, et al.
Publicado: (2026)
Reinforced Visual Perception with Tools
por: Zhou, Zetong, et al.
Publicado: (2025)
por: Zhou, Zetong, et al.
Publicado: (2025)
You Only Judge Once: Multi-response Reward Modeling in a Single Forward Pass
por: Yang, Yinuo, et al.
Publicado: (2026)
por: Yang, Yinuo, et al.
Publicado: (2026)
Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training
por: Gao, Ziqi, et al.
Publicado: (2024)
por: Gao, Ziqi, et al.
Publicado: (2024)
NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples
por: Li, Baiqi, et al.
Publicado: (2024)
por: Li, Baiqi, et al.
Publicado: (2024)
Iterated Learning Improves Compositionality in Large Vision-Language Models
por: Zheng, Chenhao, et al.
Publicado: (2024)
por: Zheng, Chenhao, et al.
Publicado: (2024)
Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data Generation
por: Yang, Yue, et al.
Publicado: (2025)
por: Yang, Yue, et al.
Publicado: (2025)
Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models
por: Hu, Yushi, et al.
Publicado: (2023)
por: Hu, Yushi, et al.
Publicado: (2023)
TrajTok: Learning Trajectory Tokens enables better Video Understanding
por: Zheng, Chenhao, et al.
Publicado: (2026)
por: Zheng, Chenhao, et al.
Publicado: (2026)
MultiTaskVIF: Segmentation-oriented visible and infrared image fusion via multi-task learning
por: Zhao, Zixian, et al.
Publicado: (2025)
por: Zhao, Zixian, et al.
Publicado: (2025)
Visual Language Tracking with Multi-modal Interaction: A Robust Benchmark
por: Li, Xuchen, et al.
Publicado: (2024)
por: Li, Xuchen, et al.
Publicado: (2024)
The Hard Positive Truth about Vision-Language Compositionality
por: Kamath, Amita, et al.
Publicado: (2024)
por: Kamath, Amita, et al.
Publicado: (2024)
M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought
por: Chen, Qiguang, et al.
Publicado: (2024)
por: Chen, Qiguang, et al.
Publicado: (2024)
Synthetic Object Compositions for Scalable and Accurate Learning in Detection, Segmentation, and Grounding
por: Huang, Weikai, et al.
Publicado: (2025)
por: Huang, Weikai, et al.
Publicado: (2025)
OmAgent: A Multi-modal Agent Framework for Complex Video Understanding with Task Divide-and-Conquer
por: Zhang, Lu, et al.
Publicado: (2024)
por: Zhang, Lu, et al.
Publicado: (2024)
DTVLT: A Multi-modal Diverse Text Benchmark for Visual Language Tracking Based on LLM
por: Li, Xuchen, et al.
Publicado: (2024)
por: Li, Xuchen, et al.
Publicado: (2024)
Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations
por: Li, Linjie, et al.
Publicado: (2025)
por: Li, Linjie, et al.
Publicado: (2025)
Sandboxed Coding Agents are Competitive Omni-modal Task Solvers
por: Chen, Dongping, et al.
Publicado: (2026)
por: Chen, Dongping, et al.
Publicado: (2026)
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
por: Fu, Chaoyou, et al.
Publicado: (2024)
por: Fu, Chaoyou, et al.
Publicado: (2024)
Visual Representations inside the Language Model
por: Liu, Benlin, et al.
Publicado: (2025)
por: Liu, Benlin, et al.
Publicado: (2025)
Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models
por: Villa, Andrés, et al.
Publicado: (2023)
por: Villa, Andrés, et al.
Publicado: (2023)
ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models
por: Zhang, Jieyu, et al.
Publicado: (2024)
por: Zhang, Jieyu, et al.
Publicado: (2024)
AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning
por: Song, Mingyang, et al.
Publicado: (2026)
por: Song, Mingyang, et al.
Publicado: (2026)
Scale Can't Overcome Pragmatics: The Impact of Reporting Bias on Vision-Language Reasoning
por: Kamath, Amita, et al.
Publicado: (2026)
por: Kamath, Amita, et al.
Publicado: (2026)
mRAG: Elucidating the Design Space of Multi-modal Retrieval-Augmented Generation
por: Hu, Chan-Wei, et al.
Publicado: (2025)
por: Hu, Chan-Wei, et al.
Publicado: (2025)
SAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learning
por: Jain, Jitesh, et al.
Publicado: (2025)
por: Jain, Jitesh, et al.
Publicado: (2025)
Automating construction safety inspections using a multi-modal vision-language RAG framework
por: Wang, Chenxin, et al.
Publicado: (2025)
por: Wang, Chenxin, et al.
Publicado: (2025)
LATTE: Learning to Think with Vision Specialists
por: Ma, Zixian, et al.
Publicado: (2024)
por: Ma, Zixian, et al.
Publicado: (2024)
Plot2Code: A Comprehensive Benchmark for Evaluating Multi-modal Large Language Models in Code Generation from Scientific Plots
por: Wu, Chengyue, et al.
Publicado: (2024)
por: Wu, Chengyue, et al.
Publicado: (2024)
InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models
por: Nguyen, Pha, et al.
Publicado: (2025)
por: Nguyen, Pha, et al.
Publicado: (2025)
Automatic Evaluation for Text-to-image Generation: Task-decomposed Framework, Distilled Training, and Meta-evaluation Benchmark
por: Tu, Rong-Cheng, et al.
Publicado: (2024)
por: Tu, Rong-Cheng, et al.
Publicado: (2024)
AI Sees Your Location, But With A Bias Toward The Wealthy World
por: Huang, Jingyuan, et al.
Publicado: (2025)
por: Huang, Jingyuan, et al.
Publicado: (2025)
Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models
por: Hu, Yushi, et al.
Publicado: (2024)
por: Hu, Yushi, et al.
Publicado: (2024)
MindCube: Spatial Mental Modeling from Limited Views
por: Wang, Qineng, et al.
Publicado: (2025)
por: Wang, Qineng, et al.
Publicado: (2025)
Seeking and Updating with Live Visual Knowledge
por: Fu, Mingyang, et al.
Publicado: (2025)
por: Fu, Mingyang, et al.
Publicado: (2025)
SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval
por: Wu, Siwei, et al.
Publicado: (2024)
por: Wu, Siwei, et al.
Publicado: (2024)
Interleaved Scene Graphs for Interleaved Text-and-Image Generation Assessment
por: Chen, Dongping, et al.
Publicado: (2024)
por: Chen, Dongping, et al.
Publicado: (2024)
Quilt-LLaVA: Visual Instruction Tuning by Extracting Localized Narratives from Open-Source Histopathology Videos
por: Seyfioglu, Mehmet Saygin, et al.
Publicado: (2023)
por: Seyfioglu, Mehmet Saygin, et al.
Publicado: (2023)
Multi-modal Semantic Understanding with Contrastive Cross-modal Feature Alignment
por: Zhang, Ming, et al.
Publicado: (2024)
por: Zhang, Ming, et al.
Publicado: (2024)
Ejemplares similares
-
Task Me Anything
por: Zhang, Jieyu, et al.
Publicado: (2024) -
Video-Based Reward Modeling for Computer-Use Agents
por: Song, Linxin, et al.
Publicado: (2026) -
Reinforced Visual Perception with Tools
por: Zhou, Zetong, et al.
Publicado: (2025) -
You Only Judge Once: Multi-response Reward Modeling in a Single Forward Pass
por: Yang, Yinuo, et al.
Publicado: (2026) -
Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training
por: Gao, Ziqi, et al.
Publicado: (2024)