Do Vision-Language Models Understand Compound Nouns?
Fuente:
arXiv
Guardado en:
| Autores principales: | Kumar, Sonal, Ghosh, Sreyan, Sakshi, S, Tyagi, Utkarsh, Manocha, Dinesh |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ASPIRE: Language-Guided Data Augmentation for Improving Robustness Against Spurious Correlations
por: Ghosh, Sreyan, et al.
Publicado: (2023)
por: Ghosh, Sreyan, et al.
Publicado: (2023)
Visual Description Grounding Reduces Hallucinations and Boosts Reasoning in LVLMs
por: Ghosh, Sreyan, et al.
Publicado: (2024)
por: Ghosh, Sreyan, et al.
Publicado: (2024)
EGOILLUSION: Benchmarking Hallucinations in Egocentric Video Understanding
por: Seth, Ashish, et al.
Publicado: (2025)
por: Seth, Ashish, et al.
Publicado: (2025)
AV-RIR: Audio-Visual Room Impulse Response Estimation
por: Ratnarajah, Anton, et al.
Publicado: (2023)
por: Ratnarajah, Anton, et al.
Publicado: (2023)
ABEX: Data Augmentation for Low-Resource NLU via Expanding Abstract Descriptions
por: Ghosh, Sreyan, et al.
Publicado: (2024)
por: Ghosh, Sreyan, et al.
Publicado: (2024)
CoDa: Constrained Generation based Data Augmentation for Low-Resource NLP
por: Evuru, Chandra Kiran Reddy, et al.
Publicado: (2024)
por: Evuru, Chandra Kiran Reddy, et al.
Publicado: (2024)
GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities
por: Ghosh, Sreyan, et al.
Publicado: (2024)
por: Ghosh, Sreyan, et al.
Publicado: (2024)
MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark
por: Sakshi, S, et al.
Publicado: (2024)
por: Sakshi, S, et al.
Publicado: (2024)
MultiVox: A Benchmark for Evaluating Voice Assistants for Multimodal Interactions
por: Selvakumar, Ramaneswaran, et al.
Publicado: (2025)
por: Selvakumar, Ramaneswaran, et al.
Publicado: (2025)
Vision-Language Models Do Not Understand Negation
por: Alhamoud, Kumail, et al.
Publicado: (2025)
por: Alhamoud, Kumail, et al.
Publicado: (2025)
CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models
por: Ghosh, Sreyan, et al.
Publicado: (2023)
por: Ghosh, Sreyan, et al.
Publicado: (2023)
Do Vision-Language Models Really Understand Visual Language?
por: Hou, Yifan, et al.
Publicado: (2024)
por: Hou, Yifan, et al.
Publicado: (2024)
Do Vision-Language Models Understand Visual Persuasiveness?
por: Park, Gyuwon
Publicado: (2025)
por: Park, Gyuwon
Publicado: (2025)
LipGER: Visually-Conditioned Generative Error Correction for Robust Automatic Speech Recognition
por: Ghosh, Sreyan, et al.
Publicado: (2024)
por: Ghosh, Sreyan, et al.
Publicado: (2024)
EH-MAM: Easy-to-Hard Masked Acoustic Modeling for Self-Supervised Speech Representation Learning
por: Seth, Ashish, et al.
Publicado: (2024)
por: Seth, Ashish, et al.
Publicado: (2024)
AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Models
por: Wu, Xiyang, et al.
Publicado: (2024)
por: Wu, Xiyang, et al.
Publicado: (2024)
HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
por: Guan, Tianrui, et al.
Publicado: (2023)
por: Guan, Tianrui, et al.
Publicado: (2023)
Video-Robin: Autoregressive Diffusion Planning for Intent-Grounded Video-to-Music Generation
por: Lokegaonkar, Vaibhavi, et al.
Publicado: (2026)
por: Lokegaonkar, Vaibhavi, et al.
Publicado: (2026)
MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos
por: Goel, Arushi, et al.
Publicado: (2026)
por: Goel, Arushi, et al.
Publicado: (2026)
A Review on Large Language Models for Visual Analytics
por: Agarwal, Navya Sonal, et al.
Publicado: (2025)
por: Agarwal, Navya Sonal, et al.
Publicado: (2025)
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
por: Ghosh, Sreyan, et al.
Publicado: (2025)
por: Ghosh, Sreyan, et al.
Publicado: (2025)
Do Multimodal Large Language Models Understand Welding?
por: Khvatskii, Grigorii, et al.
Publicado: (2025)
por: Khvatskii, Grigorii, et al.
Publicado: (2025)
Towards a Systematic Evaluation of Hallucinations in Large-Vision Language Models
por: Seth, Ashish, et al.
Publicado: (2024)
por: Seth, Ashish, et al.
Publicado: (2024)
Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly
por: Chetan, Aditya, et al.
Publicado: (2026)
por: Chetan, Aditya, et al.
Publicado: (2026)
Toward Interactive Regional Understanding in Vision-Large Language Models
por: Lee, Jungbeom, et al.
Publicado: (2024)
por: Lee, Jungbeom, et al.
Publicado: (2024)
PUMGPT: A Large Vision-Language Model for Product Understanding
por: Xue, Wei, et al.
Publicado: (2023)
por: Xue, Wei, et al.
Publicado: (2023)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
por: Wang, Xinyu, et al.
Publicado: (2025)
por: Wang, Xinyu, et al.
Publicado: (2025)
Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
por: Xu, Yige, et al.
Publicado: (2026)
por: Xu, Yige, et al.
Publicado: (2026)
What Do Vision-Language Models Encode for Personalized Image Aesthetics Assessment?
por: Ryu, Koki, et al.
Publicado: (2026)
por: Ryu, Koki, et al.
Publicado: (2026)
Do Vision Models Develop Human-Like Progressive Difficulty Understanding?
por: Huang, Zeyi, et al.
Publicado: (2025)
por: Huang, Zeyi, et al.
Publicado: (2025)
Do Large Vision-Language Models Distinguish between the Actual and Apparent Features of Illusions?
por: Shinozaki, Taiga, et al.
Publicado: (2025)
por: Shinozaki, Taiga, et al.
Publicado: (2025)
Investigating Spatial Attention Bias in Vision-Language Models
por: Chaudhary, Aryan, et al.
Publicado: (2025)
por: Chaudhary, Aryan, et al.
Publicado: (2025)
Understanding Museum Exhibits using Vision-Language Reasoning
por: Balauca, Ada-Astrid, et al.
Publicado: (2024)
por: Balauca, Ada-Astrid, et al.
Publicado: (2024)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
por: Zhu, Yingjie, et al.
Publicado: (2024)
por: Zhu, Yingjie, et al.
Publicado: (2024)
HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning
por: Wei, Yanbin, et al.
Publicado: (2026)
por: Wei, Yanbin, et al.
Publicado: (2026)
Benchmarking Vision Language Models for Cultural Understanding
por: Nayak, Shravan, et al.
Publicado: (2024)
por: Nayak, Shravan, et al.
Publicado: (2024)
Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities
por: Zhang, Zheyuan, et al.
Publicado: (2024)
por: Zhang, Zheyuan, et al.
Publicado: (2024)
Inference-Time Structural Reasoning for Compositional Vision-Language Understanding
por: Bhattacharya, Amartya
Publicado: (2026)
por: Bhattacharya, Amartya
Publicado: (2026)
Inst4DGS: Instance-Decomposed 4D Gaussian Splatting with Multi-Video Label Permutation Learning
por: Lee, Yonghan, et al.
Publicado: (2026)
por: Lee, Yonghan, et al.
Publicado: (2026)
Bi-VLM: Pushing Ultra-Low Precision Post-Training Quantization Boundaries in Vision-Language Models
por: Wang, Xijun, et al.
Publicado: (2025)
por: Wang, Xijun, et al.
Publicado: (2025)
Ejemplares similares
-
ASPIRE: Language-Guided Data Augmentation for Improving Robustness Against Spurious Correlations
por: Ghosh, Sreyan, et al.
Publicado: (2023) -
Visual Description Grounding Reduces Hallucinations and Boosts Reasoning in LVLMs
por: Ghosh, Sreyan, et al.
Publicado: (2024) -
EGOILLUSION: Benchmarking Hallucinations in Egocentric Video Understanding
por: Seth, Ashish, et al.
Publicado: (2025) -
AV-RIR: Audio-Visual Room Impulse Response Estimation
por: Ratnarajah, Anton, et al.
Publicado: (2023) -
ABEX: Data Augmentation for Low-Resource NLU via Expanding Abstract Descriptions
por: Ghosh, Sreyan, et al.
Publicado: (2024)