TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Ming, Zhong, Jike, Zhao, Shitian, Zhang, Haoquan, Lin, Shaoheng, Lai, Yuxiang, Wei, Chen, Psounis, Konstantinos, Zhang, Kaipeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
EEE-Bench: A Comprehensive Multimodal Electrical And Electronics Engineering Benchmark
por: Li, Ming, et al.
Publicado: (2024)
por: Li, Ming, et al.
Publicado: (2024)
Think or Not Think: A Study of Explicit Thinking in Rule-Based Visual Reinforcement Fine-Tuning
por: Li, Ming, et al.
Publicado: (2025)
por: Li, Ming, et al.
Publicado: (2025)
Med-R1: Reinforcement Learning for Generalizable Medical Reasoning in Vision-Language Models
por: Lai, Yuxiang, et al.
Publicado: (2025)
por: Lai, Yuxiang, et al.
Publicado: (2025)
PyVision-RL: Forging Open Agentic Vision Models via RL
por: Zhao, Shitian, et al.
Publicado: (2026)
por: Zhao, Shitian, et al.
Publicado: (2026)
PyVision: Agentic Vision with Dynamic Tooling
por: Zhao, Shitian, et al.
Publicado: (2025)
por: Zhao, Shitian, et al.
Publicado: (2025)
VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs
por: Khezresmaeilzadeh, Tina, et al.
Publicado: (2026)
por: Khezresmaeilzadeh, Tina, et al.
Publicado: (2026)
Context Matters: Learning Global Semantics via Object-Centric Representation
por: Zhong, Jike, et al.
Publicado: (2025)
por: Zhong, Jike, et al.
Publicado: (2025)
Are Video Models Emerging as Zero-Shot Learners and Reasoners in Medical Imaging?
por: Lai, Yuxiang, et al.
Publicado: (2025)
por: Lai, Yuxiang, et al.
Publicado: (2025)
Patient-Specific Autoregressive Models for Organ Motion Prediction in Radiotherapy
por: Lai, Yuxiang, et al.
Publicado: (2025)
por: Lai, Yuxiang, et al.
Publicado: (2025)
MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models
por: Zhou, Pengfei, et al.
Publicado: (2025)
por: Zhou, Pengfei, et al.
Publicado: (2025)
TIR-Agent: Training an Explorative and Efficient Agent for Image Restoration
por: Zhang, Yisheng, et al.
Publicado: (2026)
por: Zhang, Yisheng, et al.
Publicado: (2026)
TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models
por: Chen, Harold Haodong, et al.
Publicado: (2025)
por: Chen, Harold Haodong, et al.
Publicado: (2025)
DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning
por: Wei, Yuancheng, et al.
Publicado: (2026)
por: Wei, Yuancheng, et al.
Publicado: (2026)
MedVista3D: Vision-Language Modeling for Reducing Diagnostic Errors in 3D CT Disease Detection, Understanding and Reporting
por: Li, Yuheng, et al.
Publicado: (2025)
por: Li, Yuheng, et al.
Publicado: (2025)
TIR-Flow: Active Video Search and Reasoning with Frozen VLMs
por: Jin, Hongbo, et al.
Publicado: (2026)
por: Jin, Hongbo, et al.
Publicado: (2026)
MPBench: A Comprehensive Multimodal Reasoning Benchmark for Process Errors Identification
por: Xu, Zhaopan, et al.
Publicado: (2025)
por: Xu, Zhaopan, et al.
Publicado: (2025)
SridBench: Benchmark of Scientific Research Illustration Drawing of Image Generation Model
por: Chang, Yifan, et al.
Publicado: (2025)
por: Chang, Yifan, et al.
Publicado: (2025)
GIR-Bench: Versatile Benchmark for Generating Images with Reasoning
por: Li, Hongxiang, et al.
Publicado: (2025)
por: Li, Hongxiang, et al.
Publicado: (2025)
MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
por: Ying, Kaining, et al.
Publicado: (2024)
por: Ying, Kaining, et al.
Publicado: (2024)
ICE-Bench: A Unified and Comprehensive Benchmark for Image Creating and Editing
por: Pan, Yulin, et al.
Publicado: (2025)
por: Pan, Yulin, et al.
Publicado: (2025)
PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models
por: Meng, Fanqing, et al.
Publicado: (2024)
por: Meng, Fanqing, et al.
Publicado: (2024)
EventBench: Towards Comprehensive Benchmarking of Event-based MLLMs
por: Liu, Shaoyu, et al.
Publicado: (2025)
por: Liu, Shaoyu, et al.
Publicado: (2025)
Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization
por: Yang, Wenhao, et al.
Publicado: (2026)
por: Yang, Wenhao, et al.
Publicado: (2026)
VTEdit-Bench: A Comprehensive Benchmark for Multi-Reference Image Editing Models in Virtual Try-On
por: Liang, Xiaoye, et al.
Publicado: (2026)
por: Liang, Xiaoye, et al.
Publicado: (2026)
VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models
por: Ren, Yufan, et al.
Publicado: (2025)
por: Ren, Yufan, et al.
Publicado: (2025)
EchoVLM: Measurement-Grounded Multimodal Learning for Echocardiography
por: Li, Yuheng, et al.
Publicado: (2025)
por: Li, Yuheng, et al.
Publicado: (2025)
OCRGenBench: A Comprehensive Benchmark for Evaluating OCR Generative Capabilities
por: Zhang, Peirong, et al.
Publicado: (2025)
por: Zhang, Peirong, et al.
Publicado: (2025)
Saliency-Bench: A Comprehensive Benchmark for Evaluating Visual Explanations
por: Zhang, Yifei, et al.
Publicado: (2023)
por: Zhang, Yifei, et al.
Publicado: (2023)
3DGen-Bench: Comprehensive Benchmark Suite for 3D Generative Models
por: Zhang, Yuhan, et al.
Publicado: (2025)
por: Zhang, Yuhan, et al.
Publicado: (2025)
FTII-Bench: A Comprehensive Multimodal Benchmark for Flow Text with Image Insertion
por: Ruan, Jiacheng, et al.
Publicado: (2024)
por: Ruan, Jiacheng, et al.
Publicado: (2024)
SmartHome-Bench: A Comprehensive Benchmark for Video Anomaly Detection in Smart Homes Using Multi-Modal Large Language Models
por: Zhao, Xinyi, et al.
Publicado: (2025)
por: Zhao, Xinyi, et al.
Publicado: (2025)
R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation
por: Chen, Kaijie, et al.
Publicado: (2025)
por: Chen, Kaijie, et al.
Publicado: (2025)
DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain
por: Jin, Song, et al.
Publicado: (2026)
por: Jin, Song, et al.
Publicado: (2026)
ViStoryBench: Comprehensive Benchmark Suite for Story Visualization
por: Zhuang, Cailin, et al.
Publicado: (2025)
por: Zhuang, Cailin, et al.
Publicado: (2025)
BackdoorBench: A Comprehensive Benchmark and Analysis of Backdoor Learning
por: Wu, Baoyuan, et al.
Publicado: (2024)
por: Wu, Baoyuan, et al.
Publicado: (2024)
Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans
por: Qiu, Yansheng, et al.
Publicado: (2025)
por: Qiu, Yansheng, et al.
Publicado: (2025)
ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models
por: Xue, Kaiwen, et al.
Publicado: (2026)
por: Xue, Kaiwen, et al.
Publicado: (2026)
DIR-TIR: Dialog-Iterative Refinement for Text-to-Image Retrieval
por: Zhen, Zongwei, et al.
Publicado: (2025)
por: Zhen, Zongwei, et al.
Publicado: (2025)
RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension
por: Gao, Tianyi, et al.
Publicado: (2025)
por: Gao, Tianyi, et al.
Publicado: (2025)
FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding
por: Tu, Chongjun, et al.
Publicado: (2025)
por: Tu, Chongjun, et al.
Publicado: (2025)
Ejemplares similares
-
EEE-Bench: A Comprehensive Multimodal Electrical And Electronics Engineering Benchmark
por: Li, Ming, et al.
Publicado: (2024) -
Think or Not Think: A Study of Explicit Thinking in Rule-Based Visual Reinforcement Fine-Tuning
por: Li, Ming, et al.
Publicado: (2025) -
Med-R1: Reinforcement Learning for Generalizable Medical Reasoning in Vision-Language Models
por: Lai, Yuxiang, et al.
Publicado: (2025) -
PyVision-RL: Forging Open Agentic Vision Models via RL
por: Zhao, Shitian, et al.
Publicado: (2026) -
PyVision: Agentic Vision with Dynamic Tooling
por: Zhao, Shitian, et al.
Publicado: (2025)