Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Ghosh, Dhruba, Zhang, Yuhui, Schmidt, Ludwig |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Data or Language Supervision: What Makes CLIP Better than DINO?
por: Liu, Yiming, et al.
Publicado: (2025)
por: Liu, Yiming, et al.
Publicado: (2025)
Deciphering Personalization: Towards Fine-Grained Explainability in Natural Language for Personalized Image Generation Models
por: Wang, Haoming, et al.
Publicado: (2025)
por: Wang, Haoming, et al.
Publicado: (2025)
UniF$^2$ace: A Unified Fine-grained Face Understanding and Generation Model
por: Li, Junzhe, et al.
Publicado: (2025)
por: Li, Junzhe, et al.
Publicado: (2025)
Dual Memory Networks: A Versatile Adaptation Approach for Vision-Language Models
por: Zhang, Yabin, et al.
Publicado: (2024)
por: Zhang, Yabin, et al.
Publicado: (2024)
PAND: Prompt-Aware Neighborhood Distillation for Lightweight Fine-Grained Visual Classification
por: Luo, Qiuming, et al.
Publicado: (2026)
por: Luo, Qiuming, et al.
Publicado: (2026)
MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs
por: Barrios, Wayner, et al.
Publicado: (2025)
por: Barrios, Wayner, et al.
Publicado: (2025)
Vision-Language Meets the Skeleton: Progressively Distillation with Cross-Modal Knowledge for 3D Action Representation Learning
por: Chen, Yang, et al.
Publicado: (2024)
por: Chen, Yang, et al.
Publicado: (2024)
RMAdapter: Reconstruction-based Multi-Modal Adapter for Vision-Language Models
por: Lin, Xiang, et al.
Publicado: (2025)
por: Lin, Xiang, et al.
Publicado: (2025)
Reducing Hallucinations in Vision-Language Models via Latent Space Steering
por: Liu, Sheng, et al.
Publicado: (2024)
por: Liu, Sheng, et al.
Publicado: (2024)
X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models
por: Sun, Zeyi, et al.
Publicado: (2024)
por: Sun, Zeyi, et al.
Publicado: (2024)
Who Brings the Frisbee: Probing Hidden Hallucination Factors in Large Vision-Language Model via Causality Analysis
por: Huang, Po-Hsuan, et al.
Publicado: (2024)
por: Huang, Po-Hsuan, et al.
Publicado: (2024)
Why are Visually-Grounded Language Models Bad at Image Classification?
por: Zhang, Yuhui, et al.
Publicado: (2024)
por: Zhang, Yuhui, et al.
Publicado: (2024)
To Forget or Not? Towards Practical Knowledge Unlearning for Large Language Models
por: Tian, Bozhong, et al.
Publicado: (2024)
por: Tian, Bozhong, et al.
Publicado: (2024)
Words or Vision: Do Vision-Language Models Have Blind Faith in Text?
por: Deng, Ailin, et al.
Publicado: (2025)
por: Deng, Ailin, et al.
Publicado: (2025)
LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention
por: Zhang, Renrui, et al.
Publicado: (2023)
por: Zhang, Renrui, et al.
Publicado: (2023)
Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding
por: Deng, Ailin, et al.
Publicado: (2024)
por: Deng, Ailin, et al.
Publicado: (2024)
PlanLLM: Video Procedure Planning with Refinable Large Language Models
por: Yang, Dejie, et al.
Publicado: (2024)
por: Yang, Dejie, et al.
Publicado: (2024)
Adv-KD: Adversarial Knowledge Distillation for Faster Diffusion Sampling
por: Mekonnen, Kidist Amde, et al.
Publicado: (2024)
por: Mekonnen, Kidist Amde, et al.
Publicado: (2024)
Lightning Fast Video Anomaly Detection via Adversarial Knowledge Distillation
por: Croitoru, Florinel-Alin, et al.
Publicado: (2022)
por: Croitoru, Florinel-Alin, et al.
Publicado: (2022)
T-TAME: Trainable Attention Mechanism for Explaining Convolutional Networks and Vision Transformers
por: Ntrougkas, Mariano V., et al.
Publicado: (2024)
por: Ntrougkas, Mariano V., et al.
Publicado: (2024)
Aligning Agentic World Models via Knowledgeable Experience Learning
por: Ren, Baochang, et al.
Publicado: (2026)
por: Ren, Baochang, et al.
Publicado: (2026)
Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models
por: Zhou, Shengli, et al.
Publicado: (2026)
por: Zhou, Shengli, et al.
Publicado: (2026)
Image Complexity-Aware Adaptive Retrieval for Efficient Vision-Language Models
por: Williams-Lekuona, Mikel, et al.
Publicado: (2025)
por: Williams-Lekuona, Mikel, et al.
Publicado: (2025)
Integrating Large Language Models into a Tri-Modal Architecture for Automated Depression Classification on the DAIC-WOZ
por: Patapati, Santosh V.
Publicado: (2024)
por: Patapati, Santosh V.
Publicado: (2024)
A Low-Resolution Image is Worth 1x1 Words: Enabling Fine Image Super-Resolution with Transformers and TaylorShift
por: Nagaraju, Sanath Budakegowdanadoddi, et al.
Publicado: (2024)
por: Nagaraju, Sanath Budakegowdanadoddi, et al.
Publicado: (2024)
David and Goliath: Small One-step Model Beats Large Diffusion with Score Post-training
por: Luo, Weijian, et al.
Publicado: (2024)
por: Luo, Weijian, et al.
Publicado: (2024)
Neuron Abandoning Attention Flow: Visual Explanation of Dynamics inside CNN Models
por: Liao, Yi, et al.
Publicado: (2024)
por: Liao, Yi, et al.
Publicado: (2024)
Spatial Knowledge Graph-Guided Multimodal Synthesis
por: Xue, Yida, et al.
Publicado: (2025)
por: Xue, Yida, et al.
Publicado: (2025)
STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models
por: Ukai, Mahiro, et al.
Publicado: (2025)
por: Ukai, Mahiro, et al.
Publicado: (2025)
LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation
por: Mo, Shentong, et al.
Publicado: (2026)
por: Mo, Shentong, et al.
Publicado: (2026)
GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning
por: Duan, Chengqi, et al.
Publicado: (2025)
por: Duan, Chengqi, et al.
Publicado: (2025)
Can We Edit Multimodal Large Language Models?
por: Cheng, Siyuan, et al.
Publicado: (2023)
por: Cheng, Siyuan, et al.
Publicado: (2023)
Continuous Sign Language Recognition System using Deep Learning with MediaPipe Holistic
por: Srivastava, Sharvani, et al.
Publicado: (2024)
por: Srivastava, Sharvani, et al.
Publicado: (2024)
Human-Centric Foundation Models: Perception, Generation and Agentic Modeling
por: Tang, Shixiang, et al.
Publicado: (2025)
por: Tang, Shixiang, et al.
Publicado: (2025)
Learning to See Before Seeing: Demystifying LLM Visual Priors from Language Pre-training
por: Han, Junlin, et al.
Publicado: (2025)
por: Han, Junlin, et al.
Publicado: (2025)
Causal Graphical Models for Vision-Language Compositional Understanding
por: Parascandolo, Fiorenzo, et al.
Publicado: (2024)
por: Parascandolo, Fiorenzo, et al.
Publicado: (2024)
Diffusion Model-Based Video Editing: A Survey
por: Sun, Wenhao, et al.
Publicado: (2024)
por: Sun, Wenhao, et al.
Publicado: (2024)
Squeezing Capacity from Multimodal Large Language Models for Subject-driven Generation
por: Zheng, Shuhong, et al.
Publicado: (2026)
por: Zheng, Shuhong, et al.
Publicado: (2026)
Infinite Video Understanding
por: Zhang, Dell, et al.
Publicado: (2025)
por: Zhang, Dell, et al.
Publicado: (2025)
LookAhead Tuning: Safer Language Models via Partial Answer Previews
por: Liu, Kangwei, et al.
Publicado: (2025)
por: Liu, Kangwei, et al.
Publicado: (2025)
Ejemplares similares
-
Data or Language Supervision: What Makes CLIP Better than DINO?
por: Liu, Yiming, et al.
Publicado: (2025) -
Deciphering Personalization: Towards Fine-Grained Explainability in Natural Language for Personalized Image Generation Models
por: Wang, Haoming, et al.
Publicado: (2025) -
UniF$^2$ace: A Unified Fine-grained Face Understanding and Generation Model
por: Li, Junzhe, et al.
Publicado: (2025) -
Dual Memory Networks: A Versatile Adaptation Approach for Vision-Language Models
por: Zhang, Yabin, et al.
Publicado: (2024) -
PAND: Prompt-Aware Neighborhood Distillation for Lightweight Fine-Grained Visual Classification
por: Luo, Qiuming, et al.
Publicado: (2026)