Guardado en:
| Autores principales: | He, Xingwei, Zhang, Qianru, Jin, A-Long, Yuan, Yuan, Yiu, Siu-Ming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2410.04107 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ConInstruct: Evaluating Large Language Models on Conflict Detection and Resolution in Instructions
por: He, Xingwei, et al.
Publicado: (2025)
por: He, Xingwei, et al.
Publicado: (2025)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
por: Xu, Yichen, et al.
Publicado: (2025)
por: Xu, Yichen, et al.
Publicado: (2025)
Where do Large Vision-Language Models Look at when Answering Questions?
por: Xing, Xiaoying, et al.
Publicado: (2025)
por: Xing, Xiaoying, et al.
Publicado: (2025)
CARES: A Comprehensive Benchmark of Trustworthiness in Medical Vision Language Models
por: Xia, Peng, et al.
Publicado: (2024)
por: Xia, Peng, et al.
Publicado: (2024)
VisionTrap: Unanswerable Questions On Visual Data
por: Saadat, Asir, et al.
Publicado: (2025)
por: Saadat, Asir, et al.
Publicado: (2025)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
por: Wang, Yanling, et al.
Publicado: (2025)
por: Wang, Yanling, et al.
Publicado: (2025)
ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter
por: Yuan, Zhengqing, et al.
Publicado: (2023)
por: Yuan, Zhengqing, et al.
Publicado: (2023)
MMEvalPro: Calibrating Multimodal Benchmarks Towards Trustworthy and Efficient Evaluation
por: Huang, Jinsheng, et al.
Publicado: (2024)
por: Huang, Jinsheng, et al.
Publicado: (2024)
Large Vision-Language Models for Remote Sensing Visual Question Answering
por: Siripong, Surasakdi, et al.
Publicado: (2024)
por: Siripong, Surasakdi, et al.
Publicado: (2024)
Frame-Voyager: Learning to Query Frames for Video Large Language Models
por: Yu, Sicheng, et al.
Publicado: (2024)
por: Yu, Sicheng, et al.
Publicado: (2024)
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
por: Lu, Yifan, et al.
Publicado: (2025)
por: Lu, Yifan, et al.
Publicado: (2025)
Med-MoE: Mixture of Domain-Specific Experts for Lightweight Medical Vision-Language Models
por: Jiang, Songtao, et al.
Publicado: (2024)
por: Jiang, Songtao, et al.
Publicado: (2024)
Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language Models
por: Liao, Yuan-Hong, et al.
Publicado: (2024)
por: Liao, Yuan-Hong, et al.
Publicado: (2024)
Benchmarking Direct Preference Optimization for Medical Large Vision-Language Models
por: Kim, Dain, et al.
Publicado: (2026)
por: Kim, Dain, et al.
Publicado: (2026)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
por: Zhu, Yingjie, et al.
Publicado: (2024)
por: Zhu, Yingjie, et al.
Publicado: (2024)
Extreme Two-View Geometry From Object Poses with Diffusion Models
por: Sun, Yujing, et al.
Publicado: (2024)
por: Sun, Yujing, et al.
Publicado: (2024)
Evaluating Fairness in Large Vision-Language Models Across Diverse Demographic Attributes and Prompts
por: Wu, Xuyang, et al.
Publicado: (2024)
por: Wu, Xuyang, et al.
Publicado: (2024)
CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence
por: Ma, Dongsheng, et al.
Publicado: (2026)
por: Ma, Dongsheng, et al.
Publicado: (2026)
Teaching Vision-Language Models to Ask: Resolving Ambiguity in Visual Questions
por: Jian, Pu, et al.
Publicado: (2025)
por: Jian, Pu, et al.
Publicado: (2025)
Light Up the Shadows: Enhance Long-Tailed Entity Grounding with Concept-Guided Vision-Language Models
por: Zhang, Yikai, et al.
Publicado: (2024)
por: Zhang, Yikai, et al.
Publicado: (2024)
Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution Input
por: Li, Chenxu, et al.
Publicado: (2025)
por: Li, Chenxu, et al.
Publicado: (2025)
SPORTU: A Comprehensive Sports Understanding Benchmark for Multimodal Large Language Models
por: Xia, Haotian, et al.
Publicado: (2024)
por: Xia, Haotian, et al.
Publicado: (2024)
Intriguing Properties of Large Language and Vision Models
por: Lee, Young-Jun, et al.
Publicado: (2024)
por: Lee, Young-Jun, et al.
Publicado: (2024)
MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models
por: Wu, Siwei, et al.
Publicado: (2024)
por: Wu, Siwei, et al.
Publicado: (2024)
HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning
por: Wei, Yanbin, et al.
Publicado: (2026)
por: Wei, Yanbin, et al.
Publicado: (2026)
Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings
por: Agrawal, Aakriti, et al.
Publicado: (2025)
por: Agrawal, Aakriti, et al.
Publicado: (2025)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
por: Wang, Shengkang, et al.
Publicado: (2024)
por: Wang, Shengkang, et al.
Publicado: (2024)
LLAVADI: What Matters For Multimodal Large Language Models Distillation
por: Xu, Shilin, et al.
Publicado: (2024)
por: Xu, Shilin, et al.
Publicado: (2024)
VLMT: Vision-Language Multimodal Transformer for Multimodal Multi-hop Question Answering
por: Lim, Qi Zhi, et al.
Publicado: (2025)
por: Lim, Qi Zhi, et al.
Publicado: (2025)
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
por: Zhang, Yichi, et al.
Publicado: (2024)
por: Zhang, Yichi, et al.
Publicado: (2024)
Benchmarking Deflection and Hallucination in Large Vision-Language Models
por: Moratelli, Nicholas, et al.
Publicado: (2026)
por: Moratelli, Nicholas, et al.
Publicado: (2026)
VLMInferSlow: Evaluating the Efficiency Robustness of Large Vision-Language Models as a Service
por: Wang, Xiasi, et al.
Publicado: (2025)
por: Wang, Xiasi, et al.
Publicado: (2025)
MMLongCite: A Benchmark for Evaluating Fidelity of Long-Context Vision-Language Models
por: Zhou, Keyan, et al.
Publicado: (2025)
por: Zhou, Keyan, et al.
Publicado: (2025)
PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus
por: Gao, Junyuan, et al.
Publicado: (2025)
por: Gao, Junyuan, et al.
Publicado: (2025)
CLoVe: Encoding Compositional Language in Contrastive Vision-Language Models
por: Castro, Santiago, et al.
Publicado: (2024)
por: Castro, Santiago, et al.
Publicado: (2024)
ERVQA: A Dataset to Benchmark the Readiness of Large Vision Language Models in Hospital Environments
por: Ray, Sourjyadip, et al.
Publicado: (2024)
por: Ray, Sourjyadip, et al.
Publicado: (2024)
AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception
por: Huang, Yipo, et al.
Publicado: (2024)
por: Huang, Yipo, et al.
Publicado: (2024)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
por: Wu, Yuhang, et al.
Publicado: (2024)
por: Wu, Yuhang, et al.
Publicado: (2024)
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
por: You, Haoxuan, et al.
Publicado: (2023)
por: You, Haoxuan, et al.
Publicado: (2023)
Vision-Braille: A Curriculum Learning Toolkit and Braille-Chinese Corpus for Braille Translation
por: Wu, Alan, et al.
Publicado: (2024)
por: Wu, Alan, et al.
Publicado: (2024)
Ejemplares similares
-
ConInstruct: Evaluating Large Language Models on Conflict Detection and Resolution in Instructions
por: He, Xingwei, et al.
Publicado: (2025) -
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
por: Xu, Yichen, et al.
Publicado: (2025) -
Where do Large Vision-Language Models Look at when Answering Questions?
por: Xing, Xiaoying, et al.
Publicado: (2025) -
CARES: A Comprehensive Benchmark of Trustworthiness in Medical Vision Language Models
por: Xia, Peng, et al.
Publicado: (2024) -
VisionTrap: Unanswerable Questions On Visual Data
por: Saadat, Asir, et al.
Publicado: (2025)