MMRel: Benchmarking Relation Understanding in Multi-Modal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nie, Jiahao, Zhang, Gongjie, An, Wenbin, Xing, Yun, Tan, Yap-Peng, Kot, Alex C., Lu, Shijian |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
E.M.Ground: A Temporal Grounding Vid-LLM with Holistic Event Perception and Matching
par: Nie, Jiahao, et autres
Publié: (2026)
par: Nie, Jiahao, et autres
Publié: (2026)
Cross-Domain Few-Shot Segmentation via Multi-view Progressive Adaptation
par: Nie, Jiahao, et autres
Publié: (2026)
par: Nie, Jiahao, et autres
Publié: (2026)
Cross-Domain Few-Shot Segmentation via Iterative Support-Query Correspondence Mining
par: Nie, Jiahao, et autres
Publié: (2024)
par: Nie, Jiahao, et autres
Publié: (2024)
Boosting SAM for Cross-Domain Few-Shot Segmentation via Conditional Point Sparsification
par: Nie, Jiahao, et autres
Publié: (2026)
par: Nie, Jiahao, et autres
Publié: (2026)
Referring Multiple Regions with Large Multimodal Models via Contextual Latent Steering
par: Xing, Yun, et autres
Publié: (2026)
par: Xing, Yun, et autres
Publié: (2026)
Rewrite Caption Semantics: Bridging Semantic Gaps for Language-Supervised Semantic Segmentation
par: Xing, Yun, et autres
Publié: (2023)
par: Xing, Yun, et autres
Publié: (2023)
Backdoor Attacks against No-Reference Image Quality Assessment Models via a Scalable Trigger
par: Yu, Yi, et autres
Publié: (2024)
par: Yu, Yi, et autres
Publié: (2024)
The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio
par: Leng, Sicong, et autres
Publié: (2024)
par: Leng, Sicong, et autres
Publié: (2024)
Color Space Learning for Cross-Color Person Re-Identification
par: Nie, Jiahao, et autres
Publié: (2024)
par: Nie, Jiahao, et autres
Publié: (2024)
LongHalQA: Long-Context Hallucination Evaluation for MultiModal Large Language Models
par: Qiu, Han, et autres
Publié: (2024)
par: Qiu, Han, et autres
Publié: (2024)
MTL-UE: Learning to Learn Nothing for Multi-Task Learning
par: Yu, Yi, et autres
Publié: (2025)
par: Yu, Yi, et autres
Publié: (2025)
STS-Mixer: Spatio-Temporal-Spectral Mixer for 4D Point Cloud Video Understanding
par: Li, Wenhao, et autres
Publié: (2026)
par: Li, Wenhao, et autres
Publié: (2026)
Towards Model Resistant to Transferable Adversarial Examples via Trigger Activation
par: Yu, Yi, et autres
Publié: (2025)
par: Yu, Yi, et autres
Publié: (2025)
Segment Anything with Multiple Modalities
par: Xiao, Aoran, et autres
Publié: (2024)
par: Xiao, Aoran, et autres
Publié: (2024)
Robust and Transferable Backdoor Attacks Against Deep Image Compression With Selective Frequency Prior
par: Yu, Yi, et autres
Publié: (2024)
par: Yu, Yi, et autres
Publié: (2024)
Empowering Multimodal LLMs with External Tools: A Comprehensive Survey
par: An, Wenbin, et autres
Publié: (2025)
par: An, Wenbin, et autres
Publié: (2025)
Mitigating Object Hallucinations in Large Vision-Language Models with Assembly of Global and Local Attention
par: An, Wenbin, et autres
Publié: (2024)
par: An, Wenbin, et autres
Publié: (2024)
Purify Unlearnable Examples via Rate-Constrained Variational Autoencoders
par: Yu, Yi, et autres
Publié: (2024)
par: Yu, Yi, et autres
Publié: (2024)
Unlearnable Examples Detection via Iterative Filtering
par: Yu, Yi, et autres
Publié: (2024)
par: Yu, Yi, et autres
Publié: (2024)
Modeling Continuous Motion for 3D Point Cloud Object Tracking
par: Luo, Zhipeng, et autres
Publié: (2023)
par: Luo, Zhipeng, et autres
Publié: (2023)
One-Shot Action Recognition via Multi-Scale Spatial-Temporal Skeleton Matching
par: Yang, Siyuan, et autres
Publié: (2023)
par: Yang, Siyuan, et autres
Publié: (2023)
Towards Online Multi-Modal Social Interaction Understanding
par: Li, Xinpeng, et autres
Publié: (2025)
par: Li, Xinpeng, et autres
Publié: (2025)
IdentiFace: Multi-Modal Iterative Diffusion Framework for Identifiable Suspect Face Generation in Crime Investigations
par: Liu, Weichen, et autres
Publié: (2026)
par: Liu, Weichen, et autres
Publié: (2026)
Boosting Reasoning in Large Multimodal Models via Activation Replay
par: Xing, Yun, et autres
Publié: (2025)
par: Xing, Yun, et autres
Publié: (2025)
Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs
par: Jiang, Xueying, et autres
Publié: (2026)
par: Jiang, Xueying, et autres
Publié: (2026)
RelationVLM: Making Large Vision-Language Models Understand Visual Relations
par: Huang, Zhipeng, et autres
Publié: (2024)
par: Huang, Zhipeng, et autres
Publié: (2024)
Efficient Test-Time Adaptation of Vision-Language Models
par: Karmanov, Adilbek, et autres
Publié: (2024)
par: Karmanov, Adilbek, et autres
Publié: (2024)
Slow-Fast Architecture for Video Multi-Modal Large Language Models
par: Shi, Min, et autres
Publié: (2025)
par: Shi, Min, et autres
Publié: (2025)
Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
par: Xin, Yi, et autres
Publié: (2025)
par: Xin, Yi, et autres
Publié: (2025)
Spatial Preference Rewarding for MLLMs Spatial Understanding
par: Qiu, Han, et autres
Publié: (2025)
par: Qiu, Han, et autres
Publié: (2025)
MambaTAD: When State-Space Models Meet Long-Range Temporal Action Detection
par: Lu, Hui, et autres
Publié: (2025)
par: Lu, Hui, et autres
Publié: (2025)
ML-Mamba: Efficient Multi-Modal Large Language Model Utilizing Mamba-2
par: Huang, Wenjun, et autres
Publié: (2024)
par: Huang, Wenjun, et autres
Publié: (2024)
Relation3D: Enhancing Relation Modeling for Point Cloud Instance Segmentation
par: Lu, Jiahao, et autres
Publié: (2025)
par: Lu, Jiahao, et autres
Publié: (2025)
Mitigating Object Hallucination via Concentric Causal Attention
par: Xing, Yun, et autres
Publié: (2024)
par: Xing, Yun, et autres
Publié: (2024)
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models
par: Xu, Runsen, et autres
Publié: (2025)
par: Xu, Runsen, et autres
Publié: (2025)
GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing
par: Ou, Ruizhe, et autres
Publié: (2025)
par: Ou, Ruizhe, et autres
Publié: (2025)
A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language Models
par: Liu, Jie, et autres
Publié: (2024)
par: Liu, Jie, et autres
Publié: (2024)
Suppress and Rebalance: Towards Generalized Multi-Modal Face Anti-Spoofing
par: Lin, Xun, et autres
Publié: (2024)
par: Lin, Xun, et autres
Publié: (2024)
VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models
par: Xu, Weiye, et autres
Publié: (2025)
par: Xu, Weiye, et autres
Publié: (2025)
MammothModa: Multi-Modal Large Language Model
par: She, Qi, et autres
Publié: (2024)
par: She, Qi, et autres
Publié: (2024)
Documents similaires
-
E.M.Ground: A Temporal Grounding Vid-LLM with Holistic Event Perception and Matching
par: Nie, Jiahao, et autres
Publié: (2026) -
Cross-Domain Few-Shot Segmentation via Multi-view Progressive Adaptation
par: Nie, Jiahao, et autres
Publié: (2026) -
Cross-Domain Few-Shot Segmentation via Iterative Support-Query Correspondence Mining
par: Nie, Jiahao, et autres
Publié: (2024) -
Boosting SAM for Cross-Domain Few-Shot Segmentation via Conditional Point Sparsification
par: Nie, Jiahao, et autres
Publié: (2026) -
Referring Multiple Regions with Large Multimodal Models via Contextual Latent Steering
par: Xing, Yun, et autres
Publié: (2026)