A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Xiu, Lixin, Luo, Xufang, Nakayama, Hideki |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards Efficient Large Vision-Language Models: A Comprehensive Survey on Inference Strategies
por: Pathak, Surendra, et al.
Publicado: (2026)
por: Pathak, Surendra, et al.
Publicado: (2026)
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
por: Xia, Peng, et al.
Publicado: (2024)
por: Xia, Peng, et al.
Publicado: (2024)
EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models
por: Wang, Zekun, et al.
Publicado: (2025)
por: Wang, Zekun, et al.
Publicado: (2025)
How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey
por: Qi, Yayun, et al.
Publicado: (2024)
por: Qi, Yayun, et al.
Publicado: (2024)
Reefknot: A Comprehensive Benchmark for Relation Hallucination Evaluation, Analysis and Mitigation in Multimodal Large Language Models
por: Zheng, Kening, et al.
Publicado: (2024)
por: Zheng, Kening, et al.
Publicado: (2024)
A Survey on Hallucination in Large Vision-Language Models
por: Liu, Hanchao, et al.
Publicado: (2024)
por: Liu, Hanchao, et al.
Publicado: (2024)
Shotluck Holmes: A Family of Efficient Small-Scale Large Language Vision Models For Video Captioning and Summarization
por: Luo, Richard, et al.
Publicado: (2024)
por: Luo, Richard, et al.
Publicado: (2024)
Matryoshka Query Transformer for Large Vision-Language Models
por: Hu, Wenbo, et al.
Publicado: (2024)
por: Hu, Wenbo, et al.
Publicado: (2024)
CARES: A Comprehensive Benchmark of Trustworthiness in Medical Vision Language Models
por: Xia, Peng, et al.
Publicado: (2024)
por: Xia, Peng, et al.
Publicado: (2024)
Vision-Language Models Create Cross-Modal Task Representations
por: Luo, Grace, et al.
Publicado: (2024)
por: Luo, Grace, et al.
Publicado: (2024)
S-GRPO: Unified Post-Training for Large Vision-Language Models
por: Yan, Yuming, et al.
Publicado: (2026)
por: Yan, Yuming, et al.
Publicado: (2026)
Analyzing and Mitigating Object Hallucination in Large Vision-Language Models
por: Zhou, Yiyang, et al.
Publicado: (2023)
por: Zhou, Yiyang, et al.
Publicado: (2023)
TroL: Traversal of Layers for Large Language and Vision Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
Towards Statistical Factuality Guarantee for Large Vision-Language Models
por: Li, Zhuohang, et al.
Publicado: (2025)
por: Li, Zhuohang, et al.
Publicado: (2025)
Overconfidence is Key: Verbalized Uncertainty Evaluation in Large Language and Vision-Language Models
por: Groot, Tobias, et al.
Publicado: (2024)
por: Groot, Tobias, et al.
Publicado: (2024)
Rethinking RL Scaling for Vision Language Models: A Transparent, From-Scratch Framework and Comprehensive Evaluation Scheme
por: Ma, Yan, et al.
Publicado: (2025)
por: Ma, Yan, et al.
Publicado: (2025)
TLDR: Token-Level Detective Reward Model for Large Vision Language Models
por: Fu, Deqing, et al.
Publicado: (2024)
por: Fu, Deqing, et al.
Publicado: (2024)
Debiasing Large Vision-Language Models by Ablating Protected Attribute Representations
por: Ratzlaff, Neale, et al.
Publicado: (2024)
por: Ratzlaff, Neale, et al.
Publicado: (2024)
Mixture of Experts Made Personalized: Federated Prompt Learning for Vision-Language Models
por: Luo, Jun, et al.
Publicado: (2024)
por: Luo, Jun, et al.
Publicado: (2024)
Visual Question Decomposition on Multimodal Large Language Models
por: Zhang, Haowei, et al.
Publicado: (2024)
por: Zhang, Haowei, et al.
Publicado: (2024)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
por: Zhou, Yiyang, et al.
Publicado: (2024)
por: Zhou, Yiyang, et al.
Publicado: (2024)
Lever LM: Configuring In-Context Sequence to Lever Large Vision Language Models
por: Yang, Xu, et al.
Publicado: (2023)
por: Yang, Xu, et al.
Publicado: (2023)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
por: Le, Quang-Hung, et al.
Publicado: (2024)
por: Le, Quang-Hung, et al.
Publicado: (2024)
Language-Pretraining-Induced Bias: A Strong Foundation for General Vision Tasks
por: Luo, Yaxin, et al.
Publicado: (2026)
por: Luo, Yaxin, et al.
Publicado: (2026)
DRESS: Instructing Large Vision-Language Models to Align and Interact with Humans via Natural Language Feedback
por: Chen, Yangyi, et al.
Publicado: (2023)
por: Chen, Yangyi, et al.
Publicado: (2023)
Federated Learning from Vision-Language Foundation Models: Theoretical Analysis and Method
por: Pan, Bikang, et al.
Publicado: (2024)
por: Pan, Bikang, et al.
Publicado: (2024)
Hierarchical Safety Realignment: Lightweight Restoration of Safety in Pruned Large Vision-Language Models
por: Li, Yue, et al.
Publicado: (2025)
por: Li, Yue, et al.
Publicado: (2025)
A Vision Check-up for Language Models
por: Sharma, Pratyusha, et al.
Publicado: (2024)
por: Sharma, Pratyusha, et al.
Publicado: (2024)
Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension
por: Wang, Xiyao, et al.
Publicado: (2024)
por: Wang, Xiyao, et al.
Publicado: (2024)
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
por: Li, Sijie, et al.
Publicado: (2026)
por: Li, Sijie, et al.
Publicado: (2026)
The Neglected Tails in Vision-Language Models
por: Parashar, Shubham, et al.
Publicado: (2024)
por: Parashar, Shubham, et al.
Publicado: (2024)
SOLO: A Single Transformer for Scalable Vision-Language Modeling
por: Chen, Yangyi, et al.
Publicado: (2024)
por: Chen, Yangyi, et al.
Publicado: (2024)
Calibrated Self-Rewarding Vision Language Models
por: Zhou, Yiyang, et al.
Publicado: (2024)
por: Zhou, Yiyang, et al.
Publicado: (2024)
Kiki or Bouba? Sound Symbolism in Vision-and-Language Models
por: Alper, Morris, et al.
Publicado: (2023)
por: Alper, Morris, et al.
Publicado: (2023)
Sherlock: Self-Correcting Reasoning in Vision-Language Models
por: Ding, Yi, et al.
Publicado: (2025)
por: Ding, Yi, et al.
Publicado: (2025)
IPO: Interpretable Prompt Optimization for Vision-Language Models
por: Du, Yingjun, et al.
Publicado: (2024)
por: Du, Yingjun, et al.
Publicado: (2024)
Towards Efficient Vision-Language Tuning: More Information Density, More Generalizability
por: Hao, Tianxiang, et al.
Publicado: (2023)
por: Hao, Tianxiang, et al.
Publicado: (2023)
Benchmarking Vision-Language Models for French PDF-to-Markdown Conversion
por: Rigal, Bruno, et al.
Publicado: (2026)
por: Rigal, Bruno, et al.
Publicado: (2026)
MoPD: Mixture-of-Prompts Distillation for Vision-Language Models
por: Chen, Yang, et al.
Publicado: (2024)
por: Chen, Yang, et al.
Publicado: (2024)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
por: Chen, Yangyi, et al.
Publicado: (2023)
por: Chen, Yangyi, et al.
Publicado: (2023)
Ejemplares similares
-
Towards Efficient Large Vision-Language Models: A Comprehensive Survey on Inference Strategies
por: Pathak, Surendra, et al.
Publicado: (2026) -
MMIE: Massive Multimodal Interleaved Comprehension Benchmark for Large Vision-Language Models
por: Xia, Peng, et al.
Publicado: (2024) -
EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models
por: Wang, Zekun, et al.
Publicado: (2025) -
How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey
por: Qi, Yayun, et al.
Publicado: (2024) -
Reefknot: A Comprehensive Benchmark for Relation Hallucination Evaluation, Analysis and Mitigation in Multimodal Large Language Models
por: Zheng, Kening, et al.
Publicado: (2024)