ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Zhaoyang, Ling, Zhan, Zhou, Yuchen, Gong, Litian, Bıyık, Erdem, Su, Hao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AutoFocus-IL: VLM-based Saliency Maps for Data-Efficient Visual Imitation Learning without Extra Human Annotations
par: Gong, Litian, et autres
Publié: (2025)
par: Gong, Litian, et autres
Publié: (2025)
Contextual Emotion Recognition using Large Vision Language Models
par: Etesam, Yasaman, et autres
Publié: (2024)
par: Etesam, Yasaman, et autres
Publié: (2024)
Enhancing HOI Detection with Contextual Cues from Large Vision-Language Models
par: Zhan, Yu-Wei, et autres
Publié: (2023)
par: Zhan, Yu-Wei, et autres
Publié: (2023)
AI-based Wearable Vision Assistance System for the Visually Impaired: Integrating Real-Time Object Recognition and Contextual Understanding Using Large Vision-Language Models
par: Baig, Mirza Samad Ahmed, et autres
Publié: (2024)
par: Baig, Mirza Samad Ahmed, et autres
Publié: (2024)
Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models
par: Li, Ling, et autres
Publié: (2025)
par: Li, Ling, et autres
Publié: (2025)
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
par: Cheng, An-Chieh, et autres
Publié: (2024)
par: Cheng, An-Chieh, et autres
Publié: (2024)
Contextual Object Detection with Multimodal Large Language Models
par: Zang, Yuhang, et autres
Publié: (2023)
par: Zang, Yuhang, et autres
Publié: (2023)
OODBench: Out-of-Distribution Benchmark for Large Vision-Language Models
par: Lin, Ling, et autres
Publié: (2026)
par: Lin, Ling, et autres
Publié: (2026)
Benchmarking Vision-Language Models under Contradictory Virtual Content Attacks in Augmented Reality
par: Xiu, Yanming, et autres
Publié: (2026)
par: Xiu, Yanming, et autres
Publié: (2026)
MarvelOVD: Marrying Object Recognition and Vision-Language Models for Robust Open-Vocabulary Object Detection
par: Wang, Kuo, et autres
Publié: (2024)
par: Wang, Kuo, et autres
Publié: (2024)
TARGO: Benchmarking Target-driven Object Grasping under Occlusions
par: Xia, Yan, et autres
Publié: (2024)
par: Xia, Yan, et autres
Publié: (2024)
Effectively Enhancing Vision Language Large Models by Prompt Augmentation and Caption Utilization
par: Zhao, Minyi, et autres
Publié: (2024)
par: Zhao, Minyi, et autres
Publié: (2024)
A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features
par: Karanfil, Enes, et autres
Publié: (2025)
par: Karanfil, Enes, et autres
Publié: (2025)
COUNTS: Benchmarking Object Detectors and Multimodal Large Language Models under Distribution Shifts
par: Li, Jiansheng, et autres
Publié: (2025)
par: Li, Jiansheng, et autres
Publié: (2025)
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
par: Chen, Xiuyuan, et autres
Publié: (2023)
par: Chen, Xiuyuan, et autres
Publié: (2023)
Benchmarking Large Language Models for Handwritten Text Recognition
par: Crosilla, Giorgia, et autres
Publié: (2025)
par: Crosilla, Giorgia, et autres
Publié: (2025)
Shape and Texture Recognition in Large Vision-Language Models
par: Eppel, Sagi, et autres
Publié: (2025)
par: Eppel, Sagi, et autres
Publié: (2025)
Complex Mathematical Expression Recognition: Benchmark, Large-Scale Dataset and Strong Baseline
par: Bai, Weikang, et autres
Publié: (2025)
par: Bai, Weikang, et autres
Publié: (2025)
What Makes "Good" Distractors for Object Hallucination Evaluation in Large Vision-Language Models?
par: Xie, Ming-Kun, et autres
Publié: (2025)
par: Xie, Ming-Kun, et autres
Publié: (2025)
A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions
par: Zhou, Ji, et autres
Publié: (2026)
par: Zhou, Ji, et autres
Publié: (2026)
TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models
par: Zhou, Jiaying, et autres
Publié: (2026)
par: Zhou, Jiaying, et autres
Publié: (2026)
Mitigating Entangled Steering in Large Vision-Language Models for Hallucination Reduction
par: Zhang, Yuanhong, et autres
Publié: (2026)
par: Zhang, Yuanhong, et autres
Publié: (2026)
Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment
par: Guo, Yuchen, et autres
Publié: (2026)
par: Guo, Yuchen, et autres
Publié: (2026)
CLIPAway: Harmonizing Focused Embeddings for Removing Objects via Diffusion Models
par: Ekin, Yigit, et autres
Publié: (2024)
par: Ekin, Yigit, et autres
Publié: (2024)
Vocabulary-free Fine-grained Visual Recognition via Enriched Contextually Grounded Vision-Language Model
par: Demidov, Dmitry, et autres
Publié: (2025)
par: Demidov, Dmitry, et autres
Publié: (2025)
Contextualized Visual Personalization in Vision-Language Models
par: Oh, Yeongtak, et autres
Publié: (2026)
par: Oh, Yeongtak, et autres
Publié: (2026)
LaVPR: Benchmarking Language and Vision for Place Recognition
par: Idan, Ofer, et autres
Publié: (2026)
par: Idan, Ofer, et autres
Publié: (2026)
DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models
par: Li, Yangfu, et autres
Publié: (2026)
par: Li, Yangfu, et autres
Publié: (2026)
Examining Modality Incongruity in Multimodal Federated Learning for Medical Vision and Language-based Disease Detection
par: Saha, Pramit, et autres
Publié: (2024)
par: Saha, Pramit, et autres
Publié: (2024)
Benchmarking Vision-Language Models on Optical Character Recognition in Dynamic Video Environments
par: Nagaonkar, Sankalp, et autres
Publié: (2025)
par: Nagaonkar, Sankalp, et autres
Publié: (2025)
Object Hallucination-Free Reinforcement Unlearning for Vision-Language Models
par: Jia, Kaidi, et autres
Publié: (2026)
par: Jia, Kaidi, et autres
Publié: (2026)
Dual-Pathway Circuits of Object Hallucination in Vision-Language Models
par: Liu, Jiaxin, et autres
Publié: (2026)
par: Liu, Jiaxin, et autres
Publié: (2026)
Learning from Observer Gaze:Zero-Shot Attention Prediction Oriented by Human-Object Interaction Recognition
par: Zhou, Yuchen, et autres
Publié: (2024)
par: Zhou, Yuchen, et autres
Publié: (2024)
THRONE: An Object-based Hallucination Benchmark for the Free-form Generations of Large Vision-Language Models
par: Kaul, Prannay, et autres
Publié: (2024)
par: Kaul, Prannay, et autres
Publié: (2024)
How to Augment for Atmospheric Turbulence Effects on Thermal Adapted Object Detection Models?
par: Uzun, Engin, et autres
Publié: (2024)
par: Uzun, Engin, et autres
Publié: (2024)
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
par: Xia, Peng, et autres
Publié: (2024)
par: Xia, Peng, et autres
Publié: (2024)
Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning
par: Lu, Fan, et autres
Publié: (2024)
par: Lu, Fan, et autres
Publié: (2024)
FinChart-Bench: Benchmarking Financial Chart Comprehension in Vision-Language Models
par: Shu, Dong, et autres
Publié: (2025)
par: Shu, Dong, et autres
Publié: (2025)
MPCAR: Multi-Perspective Contextual Augmentation for Enhanced Visual Reasoning in Large Vision-Language Models
par: Rahman, Amirul, et autres
Publié: (2025)
par: Rahman, Amirul, et autres
Publié: (2025)
African or European Swallow? Benchmarking Large Vision-Language Models for Fine-Grained Object Classification
par: Geigle, Gregor, et autres
Publié: (2024)
par: Geigle, Gregor, et autres
Publié: (2024)
Documents similaires
-
AutoFocus-IL: VLM-based Saliency Maps for Data-Efficient Visual Imitation Learning without Extra Human Annotations
par: Gong, Litian, et autres
Publié: (2025) -
Contextual Emotion Recognition using Large Vision Language Models
par: Etesam, Yasaman, et autres
Publié: (2024) -
Enhancing HOI Detection with Contextual Cues from Large Vision-Language Models
par: Zhan, Yu-Wei, et autres
Publié: (2023) -
AI-based Wearable Vision Assistance System for the Visually Impaired: Integrating Real-Time Object Recognition and Contextual Understanding Using Large Vision-Language Models
par: Baig, Mirza Samad Ahmed, et autres
Publié: (2024) -
Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models
par: Li, Ling, et autres
Publié: (2025)