DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Bousselham, Walid, Boggust, Angie, Strobelt, Hendrik, Kuehne, Hilde |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LeGrad: An Explainability Method for Vision Transformers via Feature Formation Sensitivity
di: Bousselham, Walid, et al.
Pubblicazione: (2024)
di: Bousselham, Walid, et al.
Pubblicazione: (2024)
VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation
di: Bousselham, Walid, et al.
Pubblicazione: (2025)
di: Bousselham, Walid, et al.
Pubblicazione: (2025)
When LLaVA Meets Objects: Token Composition for Vision-Language-Models
di: Jahagirdar, Soumya, et al.
Pubblicazione: (2026)
di: Jahagirdar, Soumya, et al.
Pubblicazione: (2026)
VideoGEM: Training-free Action Grounding in Videos
di: Vogel, Felix, et al.
Pubblicazione: (2025)
di: Vogel, Felix, et al.
Pubblicazione: (2025)
MaskInversion: Localized Embeddings via Optimization of Explainability Maps
di: Bousselham, Walid, et al.
Pubblicazione: (2024)
di: Bousselham, Walid, et al.
Pubblicazione: (2024)
REVEAL: Relation-based Video Representation Learning for Video-Question-Answering
di: Chaybouti, Sofian, et al.
Pubblicazione: (2025)
di: Chaybouti, Sofian, et al.
Pubblicazione: (2025)
DiffusionWorldViewer: Exposing and Broadening the Worldview Reflected by Generative Text-to-Image Models
di: De Simone, Zoe, et al.
Pubblicazione: (2023)
di: De Simone, Zoe, et al.
Pubblicazione: (2023)
Abstraction Alignment: Comparing Model-Learned and Human-Encoded Conceptual Relationships
di: Boggust, Angie, et al.
Pubblicazione: (2024)
di: Boggust, Angie, et al.
Pubblicazione: (2024)
MM-TS: Multi-Modal Temperature and Margin Schedules for Contrastive Learning with Long-Tail Data
di: Sheludzko, Siarhei, et al.
Pubblicazione: (2026)
di: Sheludzko, Siarhei, et al.
Pubblicazione: (2026)
Creo: From One-Shot Image Generation to Progressive, Co-Creative Ideation
di: De Simone, Zoe, et al.
Pubblicazione: (2026)
di: De Simone, Zoe, et al.
Pubblicazione: (2026)
A Survey on Vision Autoregressive Model
di: Jiang, Kai, et al.
Pubblicazione: (2024)
di: Jiang, Kai, et al.
Pubblicazione: (2024)
RandAR: Decoder-only Autoregressive Visual Generation in Random Orders
di: Pang, Ziqi, et al.
Pubblicazione: (2024)
di: Pang, Ziqi, et al.
Pubblicazione: (2024)
VideoAR: Autoregressive Video Generation via Next-Frame & Scale Prediction
di: Ji, Longbin, et al.
Pubblicazione: (2026)
di: Ji, Longbin, et al.
Pubblicazione: (2026)
GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models
di: Shen, Guanxi
Pubblicazione: (2025)
di: Shen, Guanxi
Pubblicazione: (2025)
SpectralAR: Spectral Autoregressive Visual Generation
di: Huang, Yuanhui, et al.
Pubblicazione: (2025)
di: Huang, Yuanhui, et al.
Pubblicazione: (2025)
StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation
di: Wu, Yi, et al.
Pubblicazione: (2025)
di: Wu, Yi, et al.
Pubblicazione: (2025)
DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer
di: Wu, Yecheng, et al.
Pubblicazione: (2025)
di: Wu, Yecheng, et al.
Pubblicazione: (2025)
GranViT: A Fine-Grained Vision Model With Autoregressive Perception For MLLMs
di: Zheng, Guanghao, et al.
Pubblicazione: (2025)
di: Zheng, Guanghao, et al.
Pubblicazione: (2025)
Vision Foundation Models as Effective Visual Tokenizers for Autoregressive Image Generation
di: Zheng, Anlin, et al.
Pubblicazione: (2025)
di: Zheng, Anlin, et al.
Pubblicazione: (2025)
Explainable Adversarial-Robust Vision-Language-Action Model for Robotic Manipulation
di: Kim, Ju-Young, et al.
Pubblicazione: (2025)
di: Kim, Ju-Young, et al.
Pubblicazione: (2025)
Fine-tuning Vision Language Models with Graph-based Knowledge for Explainable Medical Image Analysis
di: Li, Chenjun, et al.
Pubblicazione: (2025)
di: Li, Chenjun, et al.
Pubblicazione: (2025)
Separators in Enhancing Autoregressive Pretraining for Vision Mamba
di: Liu, Hanpeng, et al.
Pubblicazione: (2026)
di: Liu, Hanpeng, et al.
Pubblicazione: (2026)
Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space
di: Wang, Zihang, et al.
Pubblicazione: (2026)
di: Wang, Zihang, et al.
Pubblicazione: (2026)
An Explainable Vision-Language Model Framework with Adaptive PID-Tversky Loss for Lumbar Spinal Stenosis Diagnosis
di: Sk., Md. Sajeebul Islam, et al.
Pubblicazione: (2026)
di: Sk., Md. Sajeebul Islam, et al.
Pubblicazione: (2026)
Sparks of Explainability: Recent Advancements in Explaining Large Vision Models
di: Fel, Thomas
Pubblicazione: (2025)
di: Fel, Thomas
Pubblicazione: (2025)
Tokensome: Towards a Genetic Vision-Language GPT for Explainable and Cognitive Karyotyping
di: Zhang, Haoxi, et al.
Pubblicazione: (2024)
di: Zhang, Haoxi, et al.
Pubblicazione: (2024)
XAI-CLIP: ROI-Guided Perturbation Framework for Explainable Medical Image Segmentation in Multimodal Vision-Language Models
di: Alzubaidi, Thuraya, et al.
Pubblicazione: (2026)
di: Alzubaidi, Thuraya, et al.
Pubblicazione: (2026)
T2S-GPT: Dynamic Vector Quantization for Autoregressive Sign Language Production from Text
di: Yin, Aoxiong, et al.
Pubblicazione: (2024)
di: Yin, Aoxiong, et al.
Pubblicazione: (2024)
An archaeological Catalog Collection Method Based on Large Vision-Language Models
di: Pang, Honglin, et al.
Pubblicazione: (2024)
di: Pang, Honglin, et al.
Pubblicazione: (2024)
GTMA: Dynamic Representation Optimization for OOD Vision-Language Models
di: Zhang, Jensen, et al.
Pubblicazione: (2025)
di: Zhang, Jensen, et al.
Pubblicazione: (2025)
Dynamic Token Reduction during Generation for Vision Language Models
di: Liang, Xiaoyu, et al.
Pubblicazione: (2025)
di: Liang, Xiaoyu, et al.
Pubblicazione: (2025)
From Pixels to Explanations: Interpretable Diabetic Retinopathy Grading with CNN-Transformer Ensembles, Visual Explainability and Vision-Language Models
di: Khokhar, Pir Bakhsh, et al.
Pubblicazione: (2026)
di: Khokhar, Pir Bakhsh, et al.
Pubblicazione: (2026)
FiVL: A Framework for Improved Vision-Language Alignment through the Lens of Training, Evaluation and Explainability
di: Aflalo, Estelle, et al.
Pubblicazione: (2024)
di: Aflalo, Estelle, et al.
Pubblicazione: (2024)
Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble
di: Duan, Lin, et al.
Pubblicazione: (2025)
di: Duan, Lin, et al.
Pubblicazione: (2025)
MENTOR: Efficient Multimodal-Conditioned Tuning for Autoregressive Vision Generation Models
di: Zhao, Haozhe, et al.
Pubblicazione: (2025)
di: Zhao, Haozhe, et al.
Pubblicazione: (2025)
SleepVLM: Explainable and Rule-Grounded Sleep Staging via a Vision-Language Model
di: Deng, Guifeng, et al.
Pubblicazione: (2026)
di: Deng, Guifeng, et al.
Pubblicazione: (2026)
A Spark of Vision-Language Intelligence: 2-Dimensional Autoregressive Transformer for Efficient Finegrained Image Generation
di: Chen, Liang, et al.
Pubblicazione: (2024)
di: Chen, Liang, et al.
Pubblicazione: (2024)
Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction
di: Maeda, Koki, et al.
Pubblicazione: (2024)
di: Maeda, Koki, et al.
Pubblicazione: (2024)
Meta-Prompting for Automating Zero-shot Visual Recognition with LLMs
di: Mirza, M. Jehanzeb, et al.
Pubblicazione: (2024)
di: Mirza, M. Jehanzeb, et al.
Pubblicazione: (2024)
KPCA-CAM: Visual Explainability of Deep Computer Vision Models using Kernel PCA
di: Karmani, Sachin, et al.
Pubblicazione: (2024)
di: Karmani, Sachin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
LeGrad: An Explainability Method for Vision Transformers via Feature Formation Sensitivity
di: Bousselham, Walid, et al.
Pubblicazione: (2024) -
VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation
di: Bousselham, Walid, et al.
Pubblicazione: (2025) -
When LLaVA Meets Objects: Token Composition for Vision-Language-Models
di: Jahagirdar, Soumya, et al.
Pubblicazione: (2026) -
VideoGEM: Training-free Action Grounding in Videos
di: Vogel, Felix, et al.
Pubblicazione: (2025) -
MaskInversion: Localized Embeddings via Optimization of Explainability Maps
di: Bousselham, Walid, et al.
Pubblicazione: (2024)