Clean Evaluations on Contaminated Visual Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Lu, Hongyuan, Miao, Shujie, Lam, Wai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Harnessing Webpage UIs for Text-Rich Visual Understanding
di: Liu, Junpeng, et al.
Pubblicazione: (2024)
di: Liu, Junpeng, et al.
Pubblicazione: (2024)
Scalable Vision Language Model Training via High Quality Data Curation
di: Dong, Hongyuan, et al.
Pubblicazione: (2025)
di: Dong, Hongyuan, et al.
Pubblicazione: (2025)
Learning Speaker-Invariant Visual Features for Lipreading
di: Li, Yu, et al.
Pubblicazione: (2025)
di: Li, Yu, et al.
Pubblicazione: (2025)
The Visual Iconicity Challenge: Evaluating Vision-Language Models on Sign Language Form-Meaning Mapping
di: Keleş, Onur, et al.
Pubblicazione: (2025)
di: Keleş, Onur, et al.
Pubblicazione: (2025)
Asking Multimodal Clarifying Questions in Mixed-Initiative Conversational Search
di: Yuan, Yifei, et al.
Pubblicazione: (2024)
di: Yuan, Yifei, et al.
Pubblicazione: (2024)
Defining and Evaluating Visual Language Models' Basic Spatial Abilities: A Perspective from Psychometrics
di: Xu, Wenrui, et al.
Pubblicazione: (2025)
di: Xu, Wenrui, et al.
Pubblicazione: (2025)
Visual Representations inside the Language Model
di: Liu, Benlin, et al.
Pubblicazione: (2025)
di: Liu, Benlin, et al.
Pubblicazione: (2025)
Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models
di: Hu, Yushi, et al.
Pubblicazione: (2023)
di: Hu, Yushi, et al.
Pubblicazione: (2023)
Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
di: Lu, Jiaying, et al.
Pubblicazione: (2023)
di: Lu, Jiaying, et al.
Pubblicazione: (2023)
Do Vision-Language Models Really Understand Visual Language?
di: Hou, Yifan, et al.
Pubblicazione: (2024)
di: Hou, Yifan, et al.
Pubblicazione: (2024)
Grounding Language Models for Visual Entity Recognition
di: Xiao, Zilin, et al.
Pubblicazione: (2024)
di: Xiao, Zilin, et al.
Pubblicazione: (2024)
Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models
di: Hu, Yushi, et al.
Pubblicazione: (2024)
di: Hu, Yushi, et al.
Pubblicazione: (2024)
MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models
di: Wu, Siwei, et al.
Pubblicazione: (2024)
di: Wu, Siwei, et al.
Pubblicazione: (2024)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
di: Wang, Yanling, et al.
Pubblicazione: (2025)
di: Wang, Yanling, et al.
Pubblicazione: (2025)
Transcrib3D: 3D Referring Expression Resolution through Large Language Models
di: Fang, Jiading, et al.
Pubblicazione: (2024)
di: Fang, Jiading, et al.
Pubblicazione: (2024)
V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction
di: Zhao, Yiming, et al.
Pubblicazione: (2025)
di: Zhao, Yiming, et al.
Pubblicazione: (2025)
Evaluating Vision-Language Models as Evaluators in Path Planning
di: Aghzal, Mohamed, et al.
Pubblicazione: (2024)
di: Aghzal, Mohamed, et al.
Pubblicazione: (2024)
Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models
di: Shao, Zhenwei, et al.
Pubblicazione: (2025)
di: Shao, Zhenwei, et al.
Pubblicazione: (2025)
ShortV: Efficient Multimodal Large Language Models by Freezing Visual Tokens in Ineffective Layers
di: Yuan, Qianhao, et al.
Pubblicazione: (2025)
di: Yuan, Qianhao, et al.
Pubblicazione: (2025)
Visual In-Context Learning for Large Vision-Language Models
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
di: Zhou, Yucheng, et al.
Pubblicazione: (2024)
Do Vision-Language Models Understand Visual Persuasiveness?
di: Park, Gyuwon
Pubblicazione: (2025)
di: Park, Gyuwon
Pubblicazione: (2025)
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
di: Chen, Yukang, et al.
Pubblicazione: (2024)
di: Chen, Yukang, et al.
Pubblicazione: (2024)
Visually Grounded Speech Models for Low-resource Languages and Cognitive Modelling
di: Nortje, Leanne
Pubblicazione: (2024)
di: Nortje, Leanne
Pubblicazione: (2024)
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
di: Atuhurra, Jesse, et al.
Pubblicazione: (2024)
di: Atuhurra, Jesse, et al.
Pubblicazione: (2024)
Phoneme-Level Visual Speech Recognition via Point-Visual Fusion and Language Model Reconstruction
di: Teng, Matthew Kit Khinn, et al.
Pubblicazione: (2025)
di: Teng, Matthew Kit Khinn, et al.
Pubblicazione: (2025)
Task-Aware Resolution Optimization for Visual Large Language Models
di: Luo, Weiqing, et al.
Pubblicazione: (2025)
di: Luo, Weiqing, et al.
Pubblicazione: (2025)
PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
di: Xing, Long, et al.
Pubblicazione: (2024)
di: Xing, Long, et al.
Pubblicazione: (2024)
Evaluating Vision-Language Models for Emotion Recognition
di: Bhattacharyya, Sree, et al.
Pubblicazione: (2025)
di: Bhattacharyya, Sree, et al.
Pubblicazione: (2025)
Evaluation of Cultural Competence of Vision-Language Models
di: Yadav, Srishti, et al.
Pubblicazione: (2025)
di: Yadav, Srishti, et al.
Pubblicazione: (2025)
Large Vision-Language Models for Remote Sensing Visual Question Answering
di: Siripong, Surasakdi, et al.
Pubblicazione: (2024)
di: Siripong, Surasakdi, et al.
Pubblicazione: (2024)
VividMed: Vision Language Model with Versatile Visual Grounding for Medicine
di: Luo, Lingxiao, et al.
Pubblicazione: (2024)
di: Luo, Lingxiao, et al.
Pubblicazione: (2024)
Vision-Language Modeling in PET/CT for Visual Grounding of Positive Findings
di: Huemann, Zachary, et al.
Pubblicazione: (2025)
di: Huemann, Zachary, et al.
Pubblicazione: (2025)
Teaching Vision-Language Models to Ask: Resolving Ambiguity in Visual Questions
di: Jian, Pu, et al.
Pubblicazione: (2025)
di: Jian, Pu, et al.
Pubblicazione: (2025)
CHURRO: Making History Readable with an Open-Weight Large Vision-Language Model for High-Accuracy, Low-Cost Historical Text Recognition
di: Semnani, Sina J., et al.
Pubblicazione: (2025)
di: Semnani, Sina J., et al.
Pubblicazione: (2025)
BabyVision: Visual Reasoning Beyond Language
di: Chen, Liang, et al.
Pubblicazione: (2026)
di: Chen, Liang, et al.
Pubblicazione: (2026)
Seeing Through Their Eyes: Evaluating Visual Perspective Taking in Vision Language Models
di: Góral, Gracjan, et al.
Pubblicazione: (2024)
di: Góral, Gracjan, et al.
Pubblicazione: (2024)
Can Vision-Language Models Evaluate Handwritten Math?
di: Nath, Oikantik, et al.
Pubblicazione: (2025)
di: Nath, Oikantik, et al.
Pubblicazione: (2025)
Instruction-Following Evaluation of Large Vision-Language Models
di: Shiono, Daiki, et al.
Pubblicazione: (2025)
di: Shiono, Daiki, et al.
Pubblicazione: (2025)
MuDPT: Multi-modal Deep-symphysis Prompt Tuning for Large Pre-trained Vision-Language Models
di: Miao, Yongzhu, et al.
Pubblicazione: (2023)
di: Miao, Yongzhu, et al.
Pubblicazione: (2023)
Refining Skewed Perceptions in Vision-Language Contrastive Models through Visual Representations
di: Dai, Haocheng, et al.
Pubblicazione: (2024)
di: Dai, Haocheng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Harnessing Webpage UIs for Text-Rich Visual Understanding
di: Liu, Junpeng, et al.
Pubblicazione: (2024) -
Scalable Vision Language Model Training via High Quality Data Curation
di: Dong, Hongyuan, et al.
Pubblicazione: (2025) -
Learning Speaker-Invariant Visual Features for Lipreading
di: Li, Yu, et al.
Pubblicazione: (2025) -
The Visual Iconicity Challenge: Evaluating Vision-Language Models on Sign Language Form-Meaning Mapping
di: Keleş, Onur, et al.
Pubblicazione: (2025) -
Asking Multimodal Clarifying Questions in Mixed-Initiative Conversational Search
di: Yuan, Yifei, et al.
Pubblicazione: (2024)