Q-GroundCAM: Quantifying Grounding in Vision Language Models via GradCAM
Fuente:
arXiv
Guardado en:
| Autores principales: | Rajabi, Navid, Kosecka, Jana |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
por: Rajabi, Navid, et al.
Publicado: (2023)
por: Rajabi, Navid, et al.
Publicado: (2023)
GSR-BENCH: A Benchmark for Grounded Spatial Reasoning Evaluation via Multimodal LLMs
por: Rajabi, Navid, et al.
Publicado: (2024)
por: Rajabi, Navid, et al.
Publicado: (2024)
TRAVEL: Training-Free Retrieval and Alignment for Vision-and-Language Navigation
por: Rajabi, Navid, et al.
Publicado: (2025)
por: Rajabi, Navid, et al.
Publicado: (2025)
Generalizing GradCAM for Embedding Networks
por: Bachhawat, Mudit
Publicado: (2024)
por: Bachhawat, Mudit
Publicado: (2024)
Expected Grad-CAM: Towards gradient faithfulness
por: Buono, Vincenzo, et al.
Publicado: (2024)
por: Buono, Vincenzo, et al.
Publicado: (2024)
Gloss2Text: Sign Language Gloss translation using LLMs and Semantically Aware Label Smoothing
por: Fayyazsanavi, Pooya, et al.
Publicado: (2024)
por: Fayyazsanavi, Pooya, et al.
Publicado: (2024)
Enhancing Tea Leaf Disease Recognition with Attention Mechanisms and Grad-CAM Visualization
por: Shikdar, Omar Faruq, et al.
Publicado: (2025)
por: Shikdar, Omar Faruq, et al.
Publicado: (2025)
Progressive Multi-granular Alignments for Grounded Reasoning in Large Vision-Language Models
por: Le, Quang-Hung, et al.
Publicado: (2024)
por: Le, Quang-Hung, et al.
Publicado: (2024)
Enhancing Explainable AI: A Hybrid Approach Combining GradCAM and LRP for CNN Interpretability
por: Dhore, Vaibhav, et al.
Publicado: (2024)
por: Dhore, Vaibhav, et al.
Publicado: (2024)
Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance
por: Zhao, Linxi, et al.
Publicado: (2024)
por: Zhao, Linxi, et al.
Publicado: (2024)
Toward Reliable and Explainable Nail Disease Classification: Leveraging Adversarial Training and Grad-CAM Visualization
por: Hossain, Farzia, et al.
Publicado: (2026)
por: Hossain, Farzia, et al.
Publicado: (2026)
Rephrase, Augment, Reason: Visual Grounding of Questions for Vision-Language Models
por: Prasad, Archiki, et al.
Publicado: (2023)
por: Prasad, Archiki, et al.
Publicado: (2023)
Breast Cancer Classification with Enhanced Interpretability: DALAResNet50 and DT Grad-CAM
por: Liu, Suxing
Publicado: (2023)
por: Liu, Suxing
Publicado: (2023)
Contrastive Region Guidance: Improving Grounding in Vision-Language Models without Training
por: Wan, David, et al.
Publicado: (2024)
por: Wan, David, et al.
Publicado: (2024)
Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering
por: Lagos, Maximiliano Hormazábal, et al.
Publicado: (2025)
por: Lagos, Maximiliano Hormazábal, et al.
Publicado: (2025)
Explainable Image Similarity: Integrating Siamese Networks and Grad-CAM
por: Livieris, Ioannis E., et al.
Publicado: (2023)
por: Livieris, Ioannis E., et al.
Publicado: (2023)
TransUNet-GradCAM: A Hybrid Transformer-U-Net with Self-Attention and Explainable Visualizations for Foot Ulcer Segmentation
por: Asare, Akwasi, et al.
Publicado: (2025)
por: Asare, Akwasi, et al.
Publicado: (2025)
GutenOCR: A Grounded Vision-Language Front-End for Documents
por: Heidenreich, Hunter, et al.
Publicado: (2026)
por: Heidenreich, Hunter, et al.
Publicado: (2026)
Is Grad-CAM Explainable in Medical Images?
por: Suara, Subhashis, et al.
Publicado: (2023)
por: Suara, Subhashis, et al.
Publicado: (2023)
CAM-Based Methods Can See through Walls
por: Taimeskhanov, Magamed, et al.
Publicado: (2024)
por: Taimeskhanov, Magamed, et al.
Publicado: (2024)
Evaluation of Audio-Visual Alignments in Visually Grounded Speech Models
por: Khorrami, Khazar, et al.
Publicado: (2021)
por: Khorrami, Khazar, et al.
Publicado: (2021)
Compositional Image-Text Matching and Retrieval by Grounding Entities
por: Vongala, Madhukar Reddy, et al.
Publicado: (2025)
por: Vongala, Madhukar Reddy, et al.
Publicado: (2025)
Meanings and Measurements: Multi-Agent Probabilistic Grounding for Vision-Language Navigation
por: Padhan, Swagat, et al.
Publicado: (2026)
por: Padhan, Swagat, et al.
Publicado: (2026)
Why are Visually-Grounded Language Models Bad at Image Classification?
por: Zhang, Yuhui, et al.
Publicado: (2024)
por: Zhang, Yuhui, et al.
Publicado: (2024)
Towards Visual Text Grounding of Multimodal Large Language Model
por: Li, Ming, et al.
Publicado: (2025)
por: Li, Ming, et al.
Publicado: (2025)
By My Eyes: Grounding Multimodal Large Language Models with Sensor Data via Visual Prompting
por: Yoon, Hyungjun, et al.
Publicado: (2024)
por: Yoon, Hyungjun, et al.
Publicado: (2024)
Learning from Synthetic Data for Visual Grounding
por: He, Ruozhen, et al.
Publicado: (2024)
por: He, Ruozhen, et al.
Publicado: (2024)
Composition-Grounded Data Synthesis for Visual Reasoning
por: Gu, Xinyi, et al.
Publicado: (2025)
por: Gu, Xinyi, et al.
Publicado: (2025)
Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models
por: Ma, Chuofan, et al.
Publicado: (2024)
por: Ma, Chuofan, et al.
Publicado: (2024)
Multi-Modal Hallucination Control by Visual Information Grounding
por: Favero, Alessandro, et al.
Publicado: (2024)
por: Favero, Alessandro, et al.
Publicado: (2024)
FM-G-CAM: A Holistic Approach for Explainable AI in Computer Vision
por: Silva, Ravidu Suien Rammuni, et al.
Publicado: (2023)
por: Silva, Ravidu Suien Rammuni, et al.
Publicado: (2023)
SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding
por: Jia, Baoxiong, et al.
Publicado: (2024)
por: Jia, Baoxiong, et al.
Publicado: (2024)
Grounding and Evaluation for Large Language Models: Practical Challenges and Lessons Learned (Survey)
por: Kenthapadi, Krishnaram, et al.
Publicado: (2024)
por: Kenthapadi, Krishnaram, et al.
Publicado: (2024)
The ART of Composition: Attention-Regularized Training for Compositional Visual Grounding
por: Luo, Jiayun, et al.
Publicado: (2024)
por: Luo, Jiayun, et al.
Publicado: (2024)
Cross-modal Causal Relation Alignment for Video Question Grounding
por: Chen, Weixing, et al.
Publicado: (2025)
por: Chen, Weixing, et al.
Publicado: (2025)
Improving Visual Grounding by Encouraging Consistent Gradient-based Explanations
por: Yang, Ziyan, et al.
Publicado: (2022)
por: Yang, Ziyan, et al.
Publicado: (2022)
Learning Self-Correction in Vision-Language Models via Rollout Augmentation
por: Ding, Yi, et al.
Publicado: (2026)
por: Ding, Yi, et al.
Publicado: (2026)
ExpVG: Investigating the Design Space of Visual Grounding in Multimodal Large Language Model
por: Kang, Weitai, et al.
Publicado: (2025)
por: Kang, Weitai, et al.
Publicado: (2025)
FeCAM: Exploiting the Heterogeneity of Class Distributions in Exemplar-Free Continual Learning
por: Goswami, Dipam, et al.
Publicado: (2023)
por: Goswami, Dipam, et al.
Publicado: (2023)
Aligning Modalities in Vision Large Language Models via Preference Fine-tuning
por: Zhou, Yiyang, et al.
Publicado: (2024)
por: Zhou, Yiyang, et al.
Publicado: (2024)
Ejemplares similares
-
Towards Grounded Visual Spatial Reasoning in Multi-Modal Vision Language Models
por: Rajabi, Navid, et al.
Publicado: (2023) -
GSR-BENCH: A Benchmark for Grounded Spatial Reasoning Evaluation via Multimodal LLMs
por: Rajabi, Navid, et al.
Publicado: (2024) -
TRAVEL: Training-Free Retrieval and Alignment for Vision-and-Language Navigation
por: Rajabi, Navid, et al.
Publicado: (2025) -
Generalizing GradCAM for Embedding Networks
por: Bachhawat, Mudit
Publicado: (2024) -
Expected Grad-CAM: Towards gradient faithfulness
por: Buono, Vincenzo, et al.
Publicado: (2024)