Neuron Abandoning Attention Flow: Visual Explanation of Dynamics inside CNN Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liao, Yi, Gao, Yongsheng, Zhang, Weichuan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Dynamic Accumulated Attention Map for Interpreting Evolution of Decision-Making in Vision Transformer
par: Liao, Yi, et autres
Publié: (2025)
par: Liao, Yi, et autres
Publié: (2025)
Progressive Confident Masking Attention Network for Audio-Visual Segmentation
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
TbExplain: A Text-based Explanation Method for Scene Classification Models with the Statistical Prediction Correction
par: Aminimehr, Amirhossein, et autres
Publié: (2023)
par: Aminimehr, Amirhossein, et autres
Publié: (2023)
TP-Blend: Textual-Prompt Attention Pairing for Precise Object-Style Blending in Diffusion Models
par: Jin, Xin, et autres
Publié: (2026)
par: Jin, Xin, et autres
Publié: (2026)
Diffusion Model-Based Video Editing: A Survey
par: Sun, Wenhao, et autres
Publié: (2024)
par: Sun, Wenhao, et autres
Publié: (2024)
Flow Generator Matching
par: Huang, Zemin, et autres
Publié: (2024)
par: Huang, Zemin, et autres
Publié: (2024)
LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention
par: Zhang, Renrui, et autres
Publié: (2023)
par: Zhang, Renrui, et autres
Publié: (2023)
Multi-layer Learnable Attention Mask for Multimodal Tasks
par: Barrios, Wayner, et autres
Publié: (2024)
par: Barrios, Wayner, et autres
Publié: (2024)
Deciphering Personalization: Towards Fine-Grained Explainability in Natural Language for Personalized Image Generation Models
par: Wang, Haoming, et autres
Publié: (2025)
par: Wang, Haoming, et autres
Publié: (2025)
MAVEN: Multi-modal Attention for Valence-Arousal Emotion Network
par: Ahire, Vrushank, et autres
Publié: (2025)
par: Ahire, Vrushank, et autres
Publié: (2025)
T-TAME: Trainable Attention Mechanism for Explaining Convolutional Networks and Vision Transformers
par: Ntrougkas, Mariano V., et autres
Publié: (2024)
par: Ntrougkas, Mariano V., et autres
Publié: (2024)
Improving Visual Representation Alignment Generation with GRPO
par: Mo, Shentong, et autres
Publié: (2026)
par: Mo, Shentong, et autres
Publié: (2026)
VSTAR: Generative Temporal Nursing for Longer Dynamic Video Synthesis
par: Li, Yumeng, et autres
Publié: (2024)
par: Li, Yumeng, et autres
Publié: (2024)
Pay Less Attention to Deceptive Artifacts: Robust Detection of Compressed Deepfakes on Online Social Networks
par: Li, Manyi, et autres
Publié: (2025)
par: Li, Manyi, et autres
Publié: (2025)
HaloQuest: A Visual Hallucination Dataset for Advancing Multimodal Reasoning
par: Wang, Zhecan, et autres
Publié: (2024)
par: Wang, Zhecan, et autres
Publié: (2024)
MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs
par: Barrios, Wayner, et autres
Publié: (2025)
par: Barrios, Wayner, et autres
Publié: (2025)
PAND: Prompt-Aware Neighborhood Distillation for Lightweight Fine-Grained Visual Classification
par: Luo, Qiuming, et autres
Publié: (2026)
par: Luo, Qiuming, et autres
Publié: (2026)
Make VLM Recognize Visual Hallucination on Cartoon Character Image with Pose Information
par: Kim, Bumsoo, et autres
Publié: (2024)
par: Kim, Bumsoo, et autres
Publié: (2024)
CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception
par: Li, Liupeng, et autres
Publié: (2026)
par: Li, Liupeng, et autres
Publié: (2026)
Learning to See Before Seeing: Demystifying LLM Visual Priors from Language Pre-training
par: Han, Junlin, et autres
Publié: (2025)
par: Han, Junlin, et autres
Publié: (2025)
Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation
par: Zhang, Zhicheng, et autres
Publié: (2026)
par: Zhang, Zhicheng, et autres
Publié: (2026)
David and Goliath: Small One-step Model Beats Large Diffusion with Score Post-training
par: Luo, Weijian, et autres
Publié: (2024)
par: Luo, Weijian, et autres
Publié: (2024)
Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models
par: Ghosh, Dhruba, et autres
Publié: (2026)
par: Ghosh, Dhruba, et autres
Publié: (2026)
Dual Memory Networks: A Versatile Adaptation Approach for Vision-Language Models
par: Zhang, Yabin, et autres
Publié: (2024)
par: Zhang, Yabin, et autres
Publié: (2024)
IllumiCraft: Unified Geometry and Illumination Diffusion for Controllable Video Generation
par: Lin, Yuanze, et autres
Publié: (2025)
par: Lin, Yuanze, et autres
Publié: (2025)
Multimodal Long Video Modeling Based on Temporal Dynamic Context
par: Hao, Haoran, et autres
Publié: (2025)
par: Hao, Haoran, et autres
Publié: (2025)
Discover Your Neighbors: Advanced Stable Test-Time Adaptation in Dynamic World
par: Jiang, Qinting, et autres
Publié: (2024)
par: Jiang, Qinting, et autres
Publié: (2024)
LayerT2V: A Unified Multi-Layer Video Generation Framework
par: Li, Guangzhao, et autres
Publié: (2025)
par: Li, Guangzhao, et autres
Publié: (2025)
HER2 Expression Prediction with Flexible Multi-Modal Inputs via Dynamic Bidirectional Reconstruction
par: Qin, Jie, et autres
Publié: (2025)
par: Qin, Jie, et autres
Publié: (2025)
Improving Prediction Performance and Model Interpretability through Attention Mechanisms from Basic and Applied Research Perspectives
par: Kitada, Shunsuke
Publié: (2023)
par: Kitada, Shunsuke
Publié: (2023)
Human-Centric Foundation Models: Perception, Generation and Agentic Modeling
par: Tang, Shixiang, et autres
Publié: (2025)
par: Tang, Shixiang, et autres
Publié: (2025)
X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models
par: Sun, Zeyi, et autres
Publié: (2024)
par: Sun, Zeyi, et autres
Publié: (2024)
Beyond Embeddings: The Promise of Visual Table in Visual Reasoning
par: Zhong, Yiwu, et autres
Publié: (2024)
par: Zhong, Yiwu, et autres
Publié: (2024)
DesignAsCode: Bridging Structural Editability and Visual Fidelity in Graphic Design Generation
par: Liu, Ziyuan, et autres
Publié: (2026)
par: Liu, Ziyuan, et autres
Publié: (2026)
VidCRAFT3: Camera, Object, and Lighting Control for Image-to-Video Generation
par: Zheng, Sixiao, et autres
Publié: (2025)
par: Zheng, Sixiao, et autres
Publié: (2025)
VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection
par: Wang, Qiang, et autres
Publié: (2025)
par: Wang, Qiang, et autres
Publié: (2025)
Evaluating Text-to-Visual Generation with Image-to-Text Generation
par: Lin, Zhiqiu, et autres
Publié: (2024)
par: Lin, Zhiqiu, et autres
Publié: (2024)
Diffusion Models, Image Super-Resolution And Everything: A Survey
par: Moser, Brian B., et autres
Publié: (2024)
par: Moser, Brian B., et autres
Publié: (2024)
RMAdapter: Reconstruction-based Multi-Modal Adapter for Vision-Language Models
par: Lin, Xiang, et autres
Publié: (2025)
par: Lin, Xiang, et autres
Publié: (2025)
Latent Space Probing for Adult Content Detection in Video Generative Models
par: Khatri, Alizishaan, et autres
Publié: (2026)
par: Khatri, Alizishaan, et autres
Publié: (2026)
Documents similaires
-
Dynamic Accumulated Attention Map for Interpreting Evolution of Decision-Making in Vision Transformer
par: Liao, Yi, et autres
Publié: (2025) -
Progressive Confident Masking Attention Network for Audio-Visual Segmentation
par: Wang, Yuxuan, et autres
Publié: (2024) -
TbExplain: A Text-based Explanation Method for Scene Classification Models with the Statistical Prediction Correction
par: Aminimehr, Amirhossein, et autres
Publié: (2023) -
TP-Blend: Textual-Prompt Attention Pairing for Precise Object-Style Blending in Diffusion Models
par: Jin, Xin, et autres
Publié: (2026) -
Diffusion Model-Based Video Editing: A Survey
par: Sun, Wenhao, et autres
Publié: (2024)