Can We Predict Performance of Large Models across Vision-Language Tasks?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Qinyu, Xu, Ming, Gupta, Kartik, Asthana, Akshay, Zheng, Liang, Gould, Stephen |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The First to Know: How Token Distributions Reveal Hidden Knowledge in Large Vision-Language Models?
par: Zhao, Qinyu, et autres
Publié: (2024)
par: Zhao, Qinyu, et autres
Publié: (2024)
DiSA: Diffusion Step Annealing in Autoregressive Image Generation
par: Zhao, Qinyu, et autres
Publié: (2025)
par: Zhao, Qinyu, et autres
Publié: (2025)
Towards Optimal Feature-Shaping Methods for Out-of-Distribution Detection
par: Zhao, Qinyu, et autres
Publié: (2024)
par: Zhao, Qinyu, et autres
Publié: (2024)
Gromov Wasserstein Optimal Transport for Semantic Correspondences
par: Snelgar, Francis, et autres
Publié: (2026)
par: Snelgar, Francis, et autres
Publié: (2026)
Flexible Geometric Guidance for Probabilistic Human Pose Estimation with Diffusion Models
par: Snelgar, Francis, et autres
Publié: (2026)
par: Snelgar, Francis, et autres
Publié: (2026)
ARINAR: Bi-Level Autoregressive Feature-by-Feature Generative Models
par: Zhao, Qinyu, et autres
Publié: (2025)
par: Zhao, Qinyu, et autres
Publié: (2025)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
par: Wang, Xinyu, et autres
Publié: (2025)
par: Wang, Xinyu, et autres
Publié: (2025)
Shakti-VLMs: Scalable Vision-Language Models for Enterprise AI
par: Shakhadri, Syed Abdul Gaffar, et autres
Publié: (2025)
par: Shakhadri, Syed Abdul Gaffar, et autres
Publié: (2025)
From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models
par: Wang, Qidong, et autres
Publié: (2026)
par: Wang, Qidong, et autres
Publié: (2026)
A Joint Study of Phrase Grounding and Task Performance in Vision and Language Models
par: Kojima, Noriyuki, et autres
Publié: (2023)
par: Kojima, Noriyuki, et autres
Publié: (2023)
Can We Edit Multimodal Large Language Models?
par: Cheng, Siyuan, et autres
Publié: (2023)
par: Cheng, Siyuan, et autres
Publié: (2023)
Structured Preference Optimization for Vision-Language Long-Horizon Task Planning
par: Liang, Xiwen, et autres
Publié: (2025)
par: Liang, Xiwen, et autres
Publié: (2025)
Judging the Judges: Can Large Vision-Language Models Fairly Evaluate Chart Comprehension and Reasoning?
par: Laskar, Md Tahmid Rahman, et autres
Publié: (2025)
par: Laskar, Md Tahmid Rahman, et autres
Publié: (2025)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
par: Wu, Yuhang, et autres
Publié: (2024)
par: Wu, Yuhang, et autres
Publié: (2024)
Can Vision Language Models Learn from Visual Demonstrations of Ambiguous Spatial Reasoning?
par: Zhao, Bowen, et autres
Publié: (2024)
par: Zhao, Bowen, et autres
Publié: (2024)
Can Vision-Language Models Solve the Shell Game?
par: Liu, Tiedong, et autres
Publié: (2026)
par: Liu, Tiedong, et autres
Publié: (2026)
Can Vision-Language Models Evaluate Handwritten Math?
par: Nath, Oikantik, et autres
Publié: (2025)
par: Nath, Oikantik, et autres
Publié: (2025)
Expanding the Boundaries of Vision Prior Knowledge in Multi-modal Large Language Models
par: Liang, Qiao, et autres
Publié: (2025)
par: Liang, Qiao, et autres
Publié: (2025)
Can Large Vision-Language Models Detect Images Copyright Infringement from GenAI?
par: Xu, Qipan, et autres
Publié: (2025)
par: Xu, Qipan, et autres
Publié: (2025)
SimFlow: Simplified and End-to-End Training of Latent Normalizing Flows
par: Zhao, Qinyu, et autres
Publié: (2025)
par: Zhao, Qinyu, et autres
Publié: (2025)
TUBench: Benchmarking Large Vision-Language Models on Trustworthiness with Unanswerable Questions
par: He, Xingwei, et autres
Publié: (2024)
par: He, Xingwei, et autres
Publié: (2024)
ERVQA: A Dataset to Benchmark the Readiness of Large Vision Language Models in Hospital Environments
par: Ray, Sourjyadip, et autres
Publié: (2024)
par: Ray, Sourjyadip, et autres
Publié: (2024)
Large Multilingual Models Pivot Zero-Shot Multimodal Learning across Languages
par: Hu, Jinyi, et autres
Publié: (2023)
par: Hu, Jinyi, et autres
Publié: (2023)
Task-Aware Resolution Optimization for Visual Large Language Models
par: Luo, Weiqing, et autres
Publié: (2025)
par: Luo, Weiqing, et autres
Publié: (2025)
Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance
par: Zhao, Haozhe, et autres
Publié: (2024)
par: Zhao, Haozhe, et autres
Publié: (2024)
PUMGPT: A Large Vision-Language Model for Product Understanding
par: Xue, Wei, et autres
Publié: (2023)
par: Xue, Wei, et autres
Publié: (2023)
Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models
par: Zhong, Weihong, et autres
Publié: (2024)
par: Zhong, Weihong, et autres
Publié: (2024)
Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
par: Xu, Yige, et autres
Publié: (2026)
par: Xu, Yige, et autres
Publié: (2026)
Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models
par: Xu, Shicheng, et autres
Publié: (2024)
par: Xu, Shicheng, et autres
Publié: (2024)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
par: Wen, Zichen, et autres
Publié: (2025)
par: Wen, Zichen, et autres
Publié: (2025)
VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering
par: Wang, Zihu, et autres
Publié: (2025)
par: Wang, Zihu, et autres
Publié: (2025)
Where do Large Vision-Language Models Look at when Answering Questions?
par: Xing, Xiaoying, et autres
Publié: (2025)
par: Xing, Xiaoying, et autres
Publié: (2025)
VTCBench: Can Vision-Language Models Understand Long Context with Vision-Text Compression?
par: Zhao, Hongbo, et autres
Publié: (2025)
par: Zhao, Hongbo, et autres
Publié: (2025)
VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment
par: Li, Lei, et autres
Publié: (2024)
par: Li, Lei, et autres
Publié: (2024)
An Examination of the Compositionality of Large Generative Vision-Language Models
par: Ma, Teli, et autres
Publié: (2023)
par: Ma, Teli, et autres
Publié: (2023)
VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model
par: Shen, Haozhan, et autres
Publié: (2025)
par: Shen, Haozhan, et autres
Publié: (2025)
Scale Can't Overcome Pragmatics: The Impact of Reporting Bias on Vision-Language Reasoning
par: Kamath, Amita, et autres
Publié: (2026)
par: Kamath, Amita, et autres
Publié: (2026)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
par: Jiang, Lei, et autres
Publié: (2025)
par: Jiang, Lei, et autres
Publié: (2025)
Vision Language Models Are Not (Yet) Spelling Correctors
par: Liang, Junhong, et autres
Publié: (2025)
par: Liang, Junhong, et autres
Publié: (2025)
"See the World, Discover Knowledge": A Chinese Factuality Evaluation for Large Vision Language Models
par: Gu, Jihao, et autres
Publié: (2025)
par: Gu, Jihao, et autres
Publié: (2025)
Documents similaires
-
The First to Know: How Token Distributions Reveal Hidden Knowledge in Large Vision-Language Models?
par: Zhao, Qinyu, et autres
Publié: (2024) -
DiSA: Diffusion Step Annealing in Autoregressive Image Generation
par: Zhao, Qinyu, et autres
Publié: (2025) -
Towards Optimal Feature-Shaping Methods for Out-of-Distribution Detection
par: Zhao, Qinyu, et autres
Publié: (2024) -
Gromov Wasserstein Optimal Transport for Semantic Correspondences
par: Snelgar, Francis, et autres
Publié: (2026) -
Flexible Geometric Guidance for Probabilistic Human Pose Estimation with Diffusion Models
par: Snelgar, Francis, et autres
Publié: (2026)