TRIP-Evaluate: An Open Multimodal Benchmark for Evaluating Large Models in Transportation
Fuente:
arXiv
Salvato in:
| Autori principali: | Gong, Han, Zhou, Zhen, Shi, Yunyang, Tan, Yan, Huo, Jinbiao, Hong, Qi, Liu, Zhiyuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
di: Li, Jingyao, et al.
Pubblicazione: (2025)
di: Li, Jingyao, et al.
Pubblicazione: (2025)
SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation
di: Guo, Longteng, et al.
Pubblicazione: (2026)
di: Guo, Longteng, et al.
Pubblicazione: (2026)
SHIELD : An Evaluation Benchmark for Face Spoofing and Forgery Detection with Multimodal Large Language Models
di: Shi, Yichen, et al.
Pubblicazione: (2024)
di: Shi, Yichen, et al.
Pubblicazione: (2024)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
di: Fu, Chaoyou, et al.
Pubblicazione: (2023)
di: Fu, Chaoyou, et al.
Pubblicazione: (2023)
LMOD+: A Comprehensive Multimodal Dataset and Benchmark for Developing and Evaluating Multimodal Large Language Models in Ophthalmology
di: Qin, Zhenyue, et al.
Pubblicazione: (2025)
di: Qin, Zhenyue, et al.
Pubblicazione: (2025)
MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models
di: Liu, Xin, et al.
Pubblicazione: (2023)
di: Liu, Xin, et al.
Pubblicazione: (2023)
Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
di: Liu, Yuansen, et al.
Pubblicazione: (2025)
di: Liu, Yuansen, et al.
Pubblicazione: (2025)
MIBench: Evaluating Multimodal Large Language Models over Multiple Images
di: Liu, Haowei, et al.
Pubblicazione: (2024)
di: Liu, Haowei, et al.
Pubblicazione: (2024)
Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain
di: Luo, Yulin, et al.
Pubblicazione: (2025)
di: Luo, Yulin, et al.
Pubblicazione: (2025)
Evaluating Durability: Benchmark Insights into Multimodal Watermarking
di: Qiu, Jielin, et al.
Pubblicazione: (2024)
di: Qiu, Jielin, et al.
Pubblicazione: (2024)
OpenPSG: Open-set Panoptic Scene Graph Generation via Large Multimodal Models
di: Zhou, Zijian, et al.
Pubblicazione: (2024)
di: Zhou, Zijian, et al.
Pubblicazione: (2024)
OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language Model
di: Zhang, Zhenhao, et al.
Pubblicazione: (2025)
di: Zhang, Zhenhao, et al.
Pubblicazione: (2025)
MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models
di: Yan, Bei, et al.
Pubblicazione: (2024)
di: Yan, Bei, et al.
Pubblicazione: (2024)
MMR: Evaluating Reading Ability of Large Multimodal Models
di: Chen, Jian, et al.
Pubblicazione: (2024)
di: Chen, Jian, et al.
Pubblicazione: (2024)
CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy
di: Yang, Zhibo, et al.
Pubblicazione: (2024)
di: Yang, Zhibo, et al.
Pubblicazione: (2024)
SmokeBench: Evaluating Multimodal Large Language Models for Wildfire Smoke Detection
di: Qi, Tianye, et al.
Pubblicazione: (2025)
di: Qi, Tianye, et al.
Pubblicazione: (2025)
Open3D-VQA: A Benchmark for Comprehensive Spatial Reasoning with Multimodal Large Language Model in Open Space
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
di: Zhang, Weichen, et al.
Pubblicazione: (2025)
A Survey of Multimodal Hallucination Evaluation and Detection
di: Chen, Zhiyuan, et al.
Pubblicazione: (2025)
di: Chen, Zhiyuan, et al.
Pubblicazione: (2025)
ODE: Open-Set Evaluation of Hallucinations in Multimodal Large Language Models
di: Tu, Yahan, et al.
Pubblicazione: (2024)
di: Tu, Yahan, et al.
Pubblicazione: (2024)
MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI
di: Ying, Kaining, et al.
Pubblicazione: (2024)
di: Ying, Kaining, et al.
Pubblicazione: (2024)
EvalCrafter: Benchmarking and Evaluating Large Video Generation Models
di: Liu, Yaofang, et al.
Pubblicazione: (2023)
di: Liu, Yaofang, et al.
Pubblicazione: (2023)
Tangram: Benchmark for Evaluating Geometric Element Recognition in Large Multimodal Models
di: Zhang, Chao, et al.
Pubblicazione: (2024)
di: Zhang, Chao, et al.
Pubblicazione: (2024)
Towards Open-Vocabulary Industrial Defect Understanding with a Large-Scale Multimodal Dataset
di: Ni, TsaiChing, et al.
Pubblicazione: (2025)
di: Ni, TsaiChing, et al.
Pubblicazione: (2025)
An Open-Source Software Toolkit & Benchmark Suite for the Evaluation and Adaptation of Multimodal Action Models
di: Guruprasad, Pranav, et al.
Pubblicazione: (2025)
di: Guruprasad, Pranav, et al.
Pubblicazione: (2025)
Towards Realistic Open-Vocabulary Remote Sensing Segmentation: Benchmark and Baseline
di: Li, Bingyu, et al.
Pubblicazione: (2026)
di: Li, Bingyu, et al.
Pubblicazione: (2026)
Recover and Match: Open-Vocabulary Multi-Label Recognition through Knowledge-Constrained Optimal Transport
di: Tan, Hao, et al.
Pubblicazione: (2025)
di: Tan, Hao, et al.
Pubblicazione: (2025)
ReactBench: A Cause-Driven Benchmark for Multimodal Hallucination via Systematic Evaluation
di: Zhou, Shizhe, et al.
Pubblicazione: (2026)
di: Zhou, Shizhe, et al.
Pubblicazione: (2026)
MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models
di: Zhou, Pengfei, et al.
Pubblicazione: (2025)
di: Zhou, Pengfei, et al.
Pubblicazione: (2025)
SDEval: Safety Dynamic Evaluation for Multimodal Large Language Models
di: Wang, Hanqing, et al.
Pubblicazione: (2025)
di: Wang, Hanqing, et al.
Pubblicazione: (2025)
SPR-128K: A New Benchmark for Spatial Plausibility Reasoning with Multimodal Large Language Models
di: Hu, Zhiyuan, et al.
Pubblicazione: (2025)
di: Hu, Zhiyuan, et al.
Pubblicazione: (2025)
OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning
di: Fu, Ling, et al.
Pubblicazione: (2024)
di: Fu, Ling, et al.
Pubblicazione: (2024)
OpenEvents V1: Large-Scale Benchmark Dataset for Multimodal Event Grounding
di: Nguyen, Hieu, et al.
Pubblicazione: (2025)
di: Nguyen, Hieu, et al.
Pubblicazione: (2025)
Comprehensive Evaluation of Large Multimodal Models for Nutrition Analysis: A New Benchmark Enriched with Contextual Metadata
di: Coburn, Bruce, et al.
Pubblicazione: (2025)
di: Coburn, Bruce, et al.
Pubblicazione: (2025)
ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding
di: Cheng, Ao, et al.
Pubblicazione: (2026)
di: Cheng, Ao, et al.
Pubblicazione: (2026)
ViBe: A Text-to-Video Benchmark for Evaluating Hallucination in Large Multimodal Models
di: Rawte, Vipula, et al.
Pubblicazione: (2024)
di: Rawte, Vipula, et al.
Pubblicazione: (2024)
MathReal: We Keep It Real! A Real Scene Benchmark for Evaluating Math Reasoning in Multimodal Large Language Models
di: Feng, Jun, et al.
Pubblicazione: (2025)
di: Feng, Jun, et al.
Pubblicazione: (2025)
An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation
di: Li, Bingyu, et al.
Pubblicazione: (2026)
di: Li, Bingyu, et al.
Pubblicazione: (2026)
SHALE: A Scalable Benchmark for Fine-grained Hallucination Evaluation in LVLMs
di: Yan, Bei, et al.
Pubblicazione: (2025)
di: Yan, Bei, et al.
Pubblicazione: (2025)
RoboCerebra: A Large-scale Benchmark for Long-horizon Robotic Manipulation Evaluation
di: Han, Songhao, et al.
Pubblicazione: (2025)
di: Han, Songhao, et al.
Pubblicazione: (2025)
Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
di: Yu, Hong-Tao, et al.
Pubblicazione: (2025)
di: Yu, Hong-Tao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
di: Li, Jingyao, et al.
Pubblicazione: (2025) -
SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation
di: Guo, Longteng, et al.
Pubblicazione: (2026) -
SHIELD : An Evaluation Benchmark for Face Spoofing and Forgery Detection with Multimodal Large Language Models
di: Shi, Yichen, et al.
Pubblicazione: (2024) -
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
di: Fu, Chaoyou, et al.
Pubblicazione: (2023) -
LMOD+: A Comprehensive Multimodal Dataset and Benchmark for Developing and Evaluating Multimodal Large Language Models in Ophthalmology
di: Qin, Zhenyue, et al.
Pubblicazione: (2025)