Revisiting the Role of Language Priors in Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Zhiqiu, Chen, Xinyue, Pathak, Deepak, Zhang, Pengchuan, Ramanan, Deva |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Evaluating Text-to-Visual Generation with Image-to-Text Generation
di: Lin, Zhiqiu, et al.
Pubblicazione: (2024)
di: Lin, Zhiqiu, et al.
Pubblicazione: (2024)
Language Models as Black-Box Optimizers for Vision-Language Models
di: Liu, Shihong, et al.
Pubblicazione: (2023)
di: Liu, Shihong, et al.
Pubblicazione: (2023)
GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation
di: Li, Baiqi, et al.
Pubblicazione: (2024)
di: Li, Baiqi, et al.
Pubblicazione: (2024)
Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features
di: Mitra, Chancharik, et al.
Pubblicazione: (2024)
di: Mitra, Chancharik, et al.
Pubblicazione: (2024)
Multimodality Helps Unimodality: Cross-Modal Few-Shot Learning with Multimodal Models
di: Lin, Zhiqiu, et al.
Pubblicazione: (2023)
di: Lin, Zhiqiu, et al.
Pubblicazione: (2023)
The Neglected Tails in Vision-Language Models
di: Parashar, Shubham, et al.
Pubblicazione: (2024)
di: Parashar, Shubham, et al.
Pubblicazione: (2024)
VLind-Bench: Measuring Language Priors in Large Vision-Language Models
di: Lee, Kang-il, et al.
Pubblicazione: (2024)
di: Lee, Kang-il, et al.
Pubblicazione: (2024)
NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples
di: Li, Baiqi, et al.
Pubblicazione: (2024)
di: Li, Baiqi, et al.
Pubblicazione: (2024)
Revisiting Few-Shot Object Detection with Vision-Language Models
di: Madan, Anish, et al.
Pubblicazione: (2023)
di: Madan, Anish, et al.
Pubblicazione: (2023)
NoLan: Mitigating Object Hallucinations in Large Vision-Language Models via Dynamic Suppression of Language Priors
di: Ren, Lingfeng, et al.
Pubblicazione: (2026)
di: Ren, Lingfeng, et al.
Pubblicazione: (2026)
WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences
di: Lu, Yujie, et al.
Pubblicazione: (2024)
di: Lu, Yujie, et al.
Pubblicazione: (2024)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
di: Zhang, Jianke, et al.
Pubblicazione: (2026)
di: Zhang, Jianke, et al.
Pubblicazione: (2026)
Building a Precise Video Language with Human-AI Oversight
di: Lin, Zhiqiu, et al.
Pubblicazione: (2026)
di: Lin, Zhiqiu, et al.
Pubblicazione: (2026)
Multi-Object Hallucination in Vision-Language Models
di: Chen, Xuweiyi, et al.
Pubblicazione: (2024)
di: Chen, Xuweiyi, et al.
Pubblicazione: (2024)
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
di: Zhang, Juntian, et al.
Pubblicazione: (2025)
di: Zhang, Juntian, et al.
Pubblicazione: (2025)
Can Vision Language Models Understand Mimed Actions?
di: Cho, Hyundong, et al.
Pubblicazione: (2025)
di: Cho, Hyundong, et al.
Pubblicazione: (2025)
Mitigating Object Hallucinations in Large Vision-Language Models with Assembly of Global and Local Attention
di: An, Wenbin, et al.
Pubblicazione: (2024)
di: An, Wenbin, et al.
Pubblicazione: (2024)
Survey on Vision-Language-Action Models
di: Adilkhanov, Adilzhan, et al.
Pubblicazione: (2025)
di: Adilkhanov, Adilzhan, et al.
Pubblicazione: (2025)
Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models
di: Li, Yanwei, et al.
Pubblicazione: (2024)
di: Li, Yanwei, et al.
Pubblicazione: (2024)
Probing and Inducing Combinational Creativity in Vision-Language Models
di: Peng, Yongqian, et al.
Pubblicazione: (2025)
di: Peng, Yongqian, et al.
Pubblicazione: (2025)
Built Environment Reasoning from Remote Sensing Imagery Using Large Vision--Language Models
di: Wang, Dongdong, et al.
Pubblicazione: (2026)
di: Wang, Dongdong, et al.
Pubblicazione: (2026)
EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training
di: Du, Yiyang, et al.
Pubblicazione: (2026)
di: Du, Yiyang, et al.
Pubblicazione: (2026)
Aesthetic Assessment of Chinese Handwritings Based on Vision Language Models
di: Zheng, Chen, et al.
Pubblicazione: (2026)
di: Zheng, Chen, et al.
Pubblicazione: (2026)
Correctable Landmark Discovery via Large Models for Vision-Language Navigation
di: Lin, Bingqian, et al.
Pubblicazione: (2024)
di: Lin, Bingqian, et al.
Pubblicazione: (2024)
A Cognitive Evaluation Benchmark of Image Reasoning and Description for Large Vision-Language Models
di: Song, Xiujie, et al.
Pubblicazione: (2024)
di: Song, Xiujie, et al.
Pubblicazione: (2024)
Data Metabolism: An Efficient Data Design Schema For Vision Language Model
di: Zhang, Jingyuan, et al.
Pubblicazione: (2025)
di: Zhang, Jingyuan, et al.
Pubblicazione: (2025)
Structured Preference Optimization for Vision-Language Long-Horizon Task Planning
di: Liang, Xiwen, et al.
Pubblicazione: (2025)
di: Liang, Xiwen, et al.
Pubblicazione: (2025)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
di: Zhou, Chenyu, et al.
Pubblicazione: (2024)
di: Zhou, Chenyu, et al.
Pubblicazione: (2024)
Benchmarking Vision Language Models for Cultural Understanding
di: Nayak, Shravan, et al.
Pubblicazione: (2024)
di: Nayak, Shravan, et al.
Pubblicazione: (2024)
VTCBench: Can Vision-Language Models Understand Long Context with Vision-Text Compression?
di: Zhao, Hongbo, et al.
Pubblicazione: (2025)
di: Zhao, Hongbo, et al.
Pubblicazione: (2025)
Panoptic Vision-Language Feature Fields
di: Chen, Haoran, et al.
Pubblicazione: (2023)
di: Chen, Haoran, et al.
Pubblicazione: (2023)
Unveiling the "Fairness Seesaw": Discovering and Mitigating Gender and Race Bias in Vision-Language Models
di: Lan, Jian, et al.
Pubblicazione: (2025)
di: Lan, Jian, et al.
Pubblicazione: (2025)
Referring Expressions as a Lens into Spatial Language Grounding in Vision-Language Models
di: Tumu, Akshar, et al.
Pubblicazione: (2025)
di: Tumu, Akshar, et al.
Pubblicazione: (2025)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
di: Zhang, Beichen, et al.
Pubblicazione: (2025)
di: Zhang, Beichen, et al.
Pubblicazione: (2025)
Alleviating Hallucination in Large Vision-Language Models with Active Retrieval Augmentation
di: Qu, Xiaoye, et al.
Pubblicazione: (2024)
di: Qu, Xiaoye, et al.
Pubblicazione: (2024)
Mixture of Decoding: An Attention-Inspired Adaptive Decoding Strategy to Mitigate Hallucinations in Large Vision-Language Models
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
Robust Vision-Language Models via Tensor Decomposition: A Defense Against Adversarial Attacks
di: Patel, Het, et al.
Pubblicazione: (2025)
di: Patel, Het, et al.
Pubblicazione: (2025)
Anthropogenic Regional Adaptation in Multimodal Vision-Language Model
di: Cahyawijaya, Samuel, et al.
Pubblicazione: (2026)
di: Cahyawijaya, Samuel, et al.
Pubblicazione: (2026)
ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models
di: Li, Dingming, et al.
Pubblicazione: (2025)
di: Li, Dingming, et al.
Pubblicazione: (2025)
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
di: Wang, Ye, et al.
Pubblicazione: (2025)
di: Wang, Ye, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Evaluating Text-to-Visual Generation with Image-to-Text Generation
di: Lin, Zhiqiu, et al.
Pubblicazione: (2024) -
Language Models as Black-Box Optimizers for Vision-Language Models
di: Liu, Shihong, et al.
Pubblicazione: (2023) -
GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation
di: Li, Baiqi, et al.
Pubblicazione: (2024) -
Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features
di: Mitra, Chancharik, et al.
Pubblicazione: (2024) -
Multimodality Helps Unimodality: Cross-Modal Few-Shot Learning with Multimodal Models
di: Lin, Zhiqiu, et al.
Pubblicazione: (2023)