Dissecting Query-Key Interaction in Vision Transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pan, Xu, Philip, Aaron, Xie, Ziqian, Schwartz, Odelia |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhancing Vision Transformer Explainability Using Artificial Astrocytes
par: Echevarrieta-Catalan, Nicolas, et autres
Publié: (2025)
par: Echevarrieta-Catalan, Nicolas, et autres
Publié: (2025)
Category Query Learning for Human-Object Interaction Classification
par: Xie, Chi, et autres
Publié: (2023)
par: Xie, Chi, et autres
Publié: (2023)
QAVA: Query-Agnostic Visual Attack to Large Vision-Language Models
par: Zhang, Yudong, et autres
Publié: (2025)
par: Zhang, Yudong, et autres
Publié: (2025)
EfficientFSL: Enhancing Few-Shot Classification via Query-Only Tuning in Vision Transformers
par: Liao, Wenwen, et autres
Publié: (2026)
par: Liao, Wenwen, et autres
Publié: (2026)
STARFISH: faST Accuracy Recovery in pruned networks From Internal State Healing
par: Maon, Shir, et autres
Publié: (2026)
par: Maon, Shir, et autres
Publié: (2026)
Hybrid Spiking Vision Transformer for Object Detection with Event Cameras
par: Xu, Qi, et autres
Publié: (2025)
par: Xu, Qi, et autres
Publié: (2025)
Dissecting Multimodality in VideoQA Transformer Models by Impairing Modality Fusion
par: Rawal, Ishaan Singh, et autres
Publié: (2023)
par: Rawal, Ishaan Singh, et autres
Publié: (2023)
SPARO: Selective Attention for Robust and Compositional Transformer Encodings for Vision
par: Vani, Ankit, et autres
Publié: (2024)
par: Vani, Ankit, et autres
Publié: (2024)
Representation Separation for Semantic Segmentation with Vision Transformers
par: Hong, Yuanduo, et autres
Publié: (2022)
par: Hong, Yuanduo, et autres
Publié: (2022)
PDZSeg: Adapting the Foundation Model for Dissection Zone Segmentation with Visual Prompts in Robot-assisted Endoscopic Submucosal Dissection
par: Xu, Mengya, et autres
Publié: (2024)
par: Xu, Mengya, et autres
Publié: (2024)
AdaCluster: Adaptive Query-Key Clustering for Sparse Attention in Video Generation
par: Tan, Haoyue, et autres
Publié: (2026)
par: Tan, Haoyue, et autres
Publié: (2026)
GQKVA: Efficient Pre-training of Transformers by Grouping Queries, Keys, and Values
par: Javadi, Farnoosh, et autres
Publié: (2023)
par: Javadi, Farnoosh, et autres
Publié: (2023)
Improving Skeleton-based Action Recognition with Interactive Object Information
par: Wen, Hao, et autres
Publié: (2025)
par: Wen, Hao, et autres
Publié: (2025)
Dynamic Object Queries for Transformer-based Incremental Object Detection
par: Zhang, Jichuan, et autres
Publié: (2024)
par: Zhang, Jichuan, et autres
Publié: (2024)
Attention Hijacking: Response Manipulation Across Queries in Vision-Language Models
par: Wang, Zhiqiang, et autres
Publié: (2026)
par: Wang, Zhiqiang, et autres
Publié: (2026)
AUFormer: Vision Transformers are Parameter-Efficient Facial Action Unit Detectors
par: Yuan, Kaishen, et autres
Publié: (2024)
par: Yuan, Kaishen, et autres
Publié: (2024)
VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models
par: Gao, Chongkai, et autres
Publié: (2025)
par: Gao, Chongkai, et autres
Publié: (2025)
Structured Click Control in Transformer-based Interactive Segmentation
par: Xu, Long, et autres
Publié: (2024)
par: Xu, Long, et autres
Publié: (2024)
Self-Aug: Query and Entropy Adaptive Decoding for Large Vision-Language Models
par: Im, Eun Woo, et autres
Publié: (2025)
par: Im, Eun Woo, et autres
Publié: (2025)
Towards Robust Vision Transformer via Masked Adaptive Ensemble
par: Lin, Fudong, et autres
Publié: (2024)
par: Lin, Fudong, et autres
Publié: (2024)
See then Tell: Enhancing Key Information Extraction with Vision Grounding
par: Liu, Shuhang, et autres
Publié: (2024)
par: Liu, Shuhang, et autres
Publié: (2024)
IMPACT-Scribe: Interactive Temporal Action Segmentation with Boundary Scribbles and Query Planning
par: Yin, Qian, et autres
Publié: (2026)
par: Yin, Qian, et autres
Publié: (2026)
MADTempo: An Interactive System for Multi-Event Temporal Video Retrieval with Query Augmentation
par: Vu, Huu-An, et autres
Publié: (2025)
par: Vu, Huu-An, et autres
Publié: (2025)
Benchmarking Unlearning for Vision Transformers
par: Zhao, Kairan, et autres
Publié: (2026)
par: Zhao, Kairan, et autres
Publié: (2026)
Vision Bridge Transformer at Scale
par: Tan, Zhenxiong, et autres
Publié: (2025)
par: Tan, Zhenxiong, et autres
Publié: (2025)
Localizing Events in Videos with Multimodal Queries
par: Zhang, Gengyuan, et autres
Publié: (2024)
par: Zhang, Gengyuan, et autres
Publié: (2024)
Heatmap Guided Query Transformers for Robust Astrocyte Detection across Immunostains and Resolutions
par: Zhang, Xizhe, et autres
Publié: (2025)
par: Zhang, Xizhe, et autres
Publié: (2025)
What Users Leave Unsaid: Under-Specified Queries Limit Vision-Language Models
par: Choi, Dasol, et autres
Publié: (2026)
par: Choi, Dasol, et autres
Publié: (2026)
V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization
par: Xie, Yuxi, et autres
Publié: (2024)
par: Xie, Yuxi, et autres
Publié: (2024)
Sensitive Image Classification by Vision Transformers
par: He, Hanxian, et autres
Publié: (2024)
par: He, Hanxian, et autres
Publié: (2024)
The Linear Attention Resurrection in Vision Transformer
par: Zheng, Chuanyang
Publié: (2025)
par: Zheng, Chuanyang
Publié: (2025)
Weierstrass Positional Encoding for Vision Transformers
par: Xin, Zhihang, et autres
Publié: (2026)
par: Xin, Zhihang, et autres
Publié: (2026)
Spiking Vision Transformer with Saccadic Attention
par: Wang, Shuai, et autres
Publié: (2025)
par: Wang, Shuai, et autres
Publié: (2025)
Rotation-Aligned Key Channel Pruning for Efficient Vision-Language Model Inference
par: Kang, Beomseok, et autres
Publié: (2026)
par: Kang, Beomseok, et autres
Publié: (2026)
GTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation
par: Xu, Xuwei, et autres
Publié: (2023)
par: Xu, Xuwei, et autres
Publié: (2023)
Efficient Adaptation of Pre-trained Vision Transformer via Householder Transformation
par: Dong, Wei, et autres
Publié: (2024)
par: Dong, Wei, et autres
Publié: (2024)
3D Occupancy Prediction with Low-Resolution Queries via Prototype-aware View Transformation
par: Oh, Gyeongrok, et autres
Publié: (2025)
par: Oh, Gyeongrok, et autres
Publié: (2025)
3D Motion Perception of Binocular Vision Target with PID-CNN
par: Shi, Jiazhao, et autres
Publié: (2025)
par: Shi, Jiazhao, et autres
Publié: (2025)
Cross-Layer Vision Smoothing: Enhancing Visual Understanding via Sustained Focus on Key Objects in Large Vision-Language Models
par: Zhao, Jianfei, et autres
Publié: (2025)
par: Zhao, Jianfei, et autres
Publié: (2025)
Mixed Non-linear Quantization for Vision Transformers
par: Kim, Gihwan, et autres
Publié: (2024)
par: Kim, Gihwan, et autres
Publié: (2024)
Documents similaires
-
Enhancing Vision Transformer Explainability Using Artificial Astrocytes
par: Echevarrieta-Catalan, Nicolas, et autres
Publié: (2025) -
Category Query Learning for Human-Object Interaction Classification
par: Xie, Chi, et autres
Publié: (2023) -
QAVA: Query-Agnostic Visual Attack to Large Vision-Language Models
par: Zhang, Yudong, et autres
Publié: (2025) -
EfficientFSL: Enhancing Few-Shot Classification via Query-Only Tuning in Vision Transformers
par: Liao, Wenwen, et autres
Publié: (2026) -
STARFISH: faST Accuracy Recovery in pruned networks From Internal State Healing
par: Maon, Shir, et autres
Publié: (2026)