MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Yao, Xincheng, Qian, Zefeng, Shi, Chao, Song, Jiayang, Zhang, Chongyang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ADPretrain: Advancing Industrial Anomaly Detection via Anomaly Representation Pretraining
por: Yao, Xincheng, et al.
Publicado: (2025)
por: Yao, Xincheng, et al.
Publicado: (2025)
ResAD++: Towards Class Agnostic Anomaly Detection via Residual Feature Learning
por: Yao, Xincheng, et al.
Publicado: (2025)
por: Yao, Xincheng, et al.
Publicado: (2025)
Hierarchical Gaussian Mixture Normalizing Flow Modeling for Unified Anomaly Detection
por: Yao, Xincheng, et al.
Publicado: (2024)
por: Yao, Xincheng, et al.
Publicado: (2024)
ResAD: A Simple Framework for Class Generalizable Anomaly Detection
por: Yao, Xincheng, et al.
Publicado: (2024)
por: Yao, Xincheng, et al.
Publicado: (2024)
MMAD: A Comprehensive Benchmark for Multimodal Large Language Models in Industrial Anomaly Detection
por: Jiang, Xi, et al.
Publicado: (2024)
por: Jiang, Xi, et al.
Publicado: (2024)
MMR: Evaluating Reading Ability of Large Multimodal Models
por: Chen, Jian, et al.
Publicado: (2024)
por: Chen, Jian, et al.
Publicado: (2024)
Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset
por: Chen, Qian, et al.
Publicado: (2026)
por: Chen, Qian, et al.
Publicado: (2026)
Beyond Label Semantics: Language-Guided Action Anatomy for Few-shot Action Recognition
por: Qian, Zefeng, et al.
Publicado: (2025)
por: Qian, Zefeng, et al.
Publicado: (2025)
MITS: A Large-Scale Multimodal Benchmark Dataset for Intelligent Traffic Surveillance
por: Zhao, Kaikai, et al.
Publicado: (2025)
por: Zhao, Kaikai, et al.
Publicado: (2025)
Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
por: Ye, Zhipeng, et al.
Publicado: (2026)
por: Ye, Zhipeng, et al.
Publicado: (2026)
Texture-AD: An Anomaly Detection Dataset and Benchmark for Real Algorithm Development
por: Lei, Tianwu, et al.
Publicado: (2024)
por: Lei, Tianwu, et al.
Publicado: (2024)
A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning
por: Jiang, Siyang, et al.
Publicado: (2025)
por: Jiang, Siyang, et al.
Publicado: (2025)
SurgMLLMBench: A Multimodal Large Language Model Benchmark Dataset for Surgical Scene Understanding
por: Choi, Tae-Min, et al.
Publicado: (2025)
por: Choi, Tae-Min, et al.
Publicado: (2025)
Tangram: Benchmark for Evaluating Geometric Element Recognition in Large Multimodal Models
por: Zhang, Chao, et al.
Publicado: (2024)
por: Zhang, Chao, et al.
Publicado: (2024)
MOSABench: Multi-Object Sentiment Analysis Benchmark for Evaluating Multimodal Large Language Models Understanding of Complex Image
por: Song, Shezheng, et al.
Publicado: (2024)
por: Song, Shezheng, et al.
Publicado: (2024)
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
por: Li, Jingyao, et al.
Publicado: (2025)
por: Li, Jingyao, et al.
Publicado: (2025)
Contextual Object Detection with Multimodal Large Language Models
por: Zang, Yuhang, et al.
Publicado: (2023)
por: Zang, Yuhang, et al.
Publicado: (2023)
LMVD: A Large-Scale Multimodal Vlog Dataset for Depression Detection in the Wild
por: He, Lang, et al.
Publicado: (2024)
por: He, Lang, et al.
Publicado: (2024)
AD4AD: Benchmarking Visual Anomaly Detection Models for Safer Autonomous Driving
por: Genilotti, Fabrizio, et al.
Publicado: (2026)
por: Genilotti, Fabrizio, et al.
Publicado: (2026)
RU-AI: A Large Multimodal Dataset for Machine-Generated Content Detection
por: Huang, Liting, et al.
Publicado: (2024)
por: Huang, Liting, et al.
Publicado: (2024)
Temporal Grounding of Activities using Multimodal Large Language Models
por: Song, Young Chol
Publicado: (2024)
por: Song, Young Chol
Publicado: (2024)
On the Out-Of-Distribution Generalization of Multimodal Large Language Models
por: Zhang, Xingxuan, et al.
Publicado: (2024)
por: Zhang, Xingxuan, et al.
Publicado: (2024)
EventVL: Understand Event Streams via Multimodal Large Language Model
por: Li, Pengteng, et al.
Publicado: (2025)
por: Li, Pengteng, et al.
Publicado: (2025)
Benchmarking Multimodal Large Language Models for Face Recognition
por: Shahreza, Hatef Otroshi, et al.
Publicado: (2025)
por: Shahreza, Hatef Otroshi, et al.
Publicado: (2025)
A Survey on Benchmarks of Multimodal Large Language Models
por: Li, Jian, et al.
Publicado: (2024)
por: Li, Jian, et al.
Publicado: (2024)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
por: Chen, Tao, et al.
Publicado: (2026)
por: Chen, Tao, et al.
Publicado: (2026)
Reasoning-Guided Grounding: Elevating Video Anomaly Detection through Multimodal Large Language Models
por: Agarwal, Sakshi, et al.
Publicado: (2026)
por: Agarwal, Sakshi, et al.
Publicado: (2026)
Adversarial Prompt Injection Attack on Multimodal Large Language Models
por: Ding, Meiwen, et al.
Publicado: (2026)
por: Ding, Meiwen, et al.
Publicado: (2026)
See&Trek: Training-Free Spatial Prompting for Multimodal Large Language Model
por: Li, Pengteng, et al.
Publicado: (2025)
por: Li, Pengteng, et al.
Publicado: (2025)
UniSVG: A Unified Dataset for Vector Graphic Understanding and Generation with Multimodal Large Language Models
por: Li, Jinke, et al.
Publicado: (2025)
por: Li, Jinke, et al.
Publicado: (2025)
AgriBench: A Hierarchical Agriculture Benchmark for Multimodal Large Language Models
por: Zhou, Yutong, et al.
Publicado: (2024)
por: Zhou, Yutong, et al.
Publicado: (2024)
HM-Bench: A Comprehensive Benchmark for Multimodal Large Language Models in Hyperspectral Remote Sensing
por: Zhang, Xinyu, et al.
Publicado: (2026)
por: Zhang, Xinyu, et al.
Publicado: (2026)
EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering
por: Li, Yanjun, et al.
Publicado: (2025)
por: Li, Yanjun, et al.
Publicado: (2025)
Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders
por: Wang, Yizhou, et al.
Publicado: (2025)
por: Wang, Yizhou, et al.
Publicado: (2025)
Semantically Aware UAV Landing Site Assessment from Remote Sensing Imagery via Multimodal Large Language Models
por: Hua, Chunliang, et al.
Publicado: (2026)
por: Hua, Chunliang, et al.
Publicado: (2026)
OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning
por: Zhao, Shifang, et al.
Publicado: (2025)
por: Zhao, Shifang, et al.
Publicado: (2025)
MME-Emotion: A Holistic Evaluation Benchmark for Emotional Intelligence in Multimodal Large Language Models
por: Zhang, Fan, et al.
Publicado: (2025)
por: Zhang, Fan, et al.
Publicado: (2025)
AG-VAS: Anchor-Guided Zero-Shot Visual Anomaly Segmentation with Large Multimodal Models
por: Qu, Zhen, et al.
Publicado: (2026)
por: Qu, Zhen, et al.
Publicado: (2026)
LMOD: A Large Multimodal Ophthalmology Dataset and Benchmark for Large Vision-Language Models
por: Qin, Zhenyue, et al.
Publicado: (2024)
por: Qin, Zhenyue, et al.
Publicado: (2024)
PEBench: A Fictitious Dataset to Benchmark Machine Unlearning for Multimodal Large Language Models
por: Xu, Zhaopan, et al.
Publicado: (2025)
por: Xu, Zhaopan, et al.
Publicado: (2025)
Ejemplares similares
-
ADPretrain: Advancing Industrial Anomaly Detection via Anomaly Representation Pretraining
por: Yao, Xincheng, et al.
Publicado: (2025) -
ResAD++: Towards Class Agnostic Anomaly Detection via Residual Feature Learning
por: Yao, Xincheng, et al.
Publicado: (2025) -
Hierarchical Gaussian Mixture Normalizing Flow Modeling for Unified Anomaly Detection
por: Yao, Xincheng, et al.
Publicado: (2024) -
ResAD: A Simple Framework for Class Generalizable Anomaly Detection
por: Yao, Xincheng, et al.
Publicado: (2024) -
MMAD: A Comprehensive Benchmark for Multimodal Large Language Models in Industrial Anomaly Detection
por: Jiang, Xi, et al.
Publicado: (2024)