Decomposing and Interpreting Image Representations via Text in ViTs Beyond CLIP
Fuente:
arXiv
Salvato in:
| Autori principali: | Balasubramanian, Sriram, Basu, Samyadeep, Feizi, Soheil |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Characterizing Model Robustness via Natural Input Gradients
di: Rodríguez-Muñoz, Adrián, et al.
Pubblicazione: (2024)
di: Rodríguez-Muñoz, Adrián, et al.
Pubblicazione: (2024)
ViTNF: Leveraging Neural Fields to Boost Vision Transformers in Generalized Category Discovery
di: Su, Jiayi, et al.
Pubblicazione: (2025)
di: Su, Jiayi, et al.
Pubblicazione: (2025)
Adaptive Cascading Network for Continual Test-Time Adaptation
di: Nguyen, Kien X., et al.
Pubblicazione: (2024)
di: Nguyen, Kien X., et al.
Pubblicazione: (2024)
Segmentation and Characterization of Macerated Fibers and Vessels Using Deep Learning
di: Qamar, Saqib, et al.
Pubblicazione: (2024)
di: Qamar, Saqib, et al.
Pubblicazione: (2024)
Conjuring Positive Pairs for Efficient Unification of Representation Learning and Image Synthesis
di: Estepa, Imanol G., et al.
Pubblicazione: (2025)
di: Estepa, Imanol G., et al.
Pubblicazione: (2025)
Learning from Semantic Dictionaries: Discriminative Codebook Contrastive Learning for Unified Visual Representation and Generation
di: Estepa, Imanol G., et al.
Pubblicazione: (2026)
di: Estepa, Imanol G., et al.
Pubblicazione: (2026)
FM-AE: Frequency-masked Multimodal Autoencoder for Zinc Electrolysis Plate Contact Abnormality Detection
di: Zhou, Canzong, et al.
Pubblicazione: (2024)
di: Zhou, Canzong, et al.
Pubblicazione: (2024)
Contrast: A Hybrid Architecture of Transformers and State Space Models for Low-Level Vision
di: Urumbekov, Aman, et al.
Pubblicazione: (2025)
di: Urumbekov, Aman, et al.
Pubblicazione: (2025)
LISTA-Transformer Model Based on Sparse Coding and Attention Mechanism and Its Application in Fault Diagnosis
di: Liu, Shuang, et al.
Pubblicazione: (2026)
di: Liu, Shuang, et al.
Pubblicazione: (2026)
SAM Fewshot Finetuning for Anatomical Segmentation in Medical Images
di: Xie, Weiyi, et al.
Pubblicazione: (2024)
di: Xie, Weiyi, et al.
Pubblicazione: (2024)
A General Ambiguity Model for Binary Edge Images with Edge Tracing and its Implementation
di: Hennig, Markus, et al.
Pubblicazione: (2024)
di: Hennig, Markus, et al.
Pubblicazione: (2024)
Compact and Efficient Neural Networks for Image Recognition Based on Learned 2D Separable Transform
di: Vashkevich, Maxim, et al.
Pubblicazione: (2025)
di: Vashkevich, Maxim, et al.
Pubblicazione: (2025)
SRPL-SFDA: SAM-Guided Reliable Pseudo-Labels for Source-Free Domain Adaptation in Medical Image Segmentation
di: Liu, Xinya, et al.
Pubblicazione: (2025)
di: Liu, Xinya, et al.
Pubblicazione: (2025)
MMM: Quantum-Chemical Molecular Representation Learning for Combinatorial Drug Recommendation
di: Kwon, Chongmyung, et al.
Pubblicazione: (2025)
di: Kwon, Chongmyung, et al.
Pubblicazione: (2025)
OUS: Scene-Guided Dynamic Facial Expression Recognition
di: Mai, Xinji, et al.
Pubblicazione: (2024)
di: Mai, Xinji, et al.
Pubblicazione: (2024)
dynActivation: A Trainable Activation Family for Adaptive Nonlinearity
di: Bachmann, Alois
Pubblicazione: (2026)
di: Bachmann, Alois
Pubblicazione: (2026)
When Does Margin Clamping Affect Training Variance? Dataset-Dependent Effects in Contrastive Forward-Forward Learning
di: Steier, Joshua
Pubblicazione: (2026)
di: Steier, Joshua
Pubblicazione: (2026)
Attention-Aware Transformer-Based Aggregation Network for Video Periocular Recognition
di: Carreira, Luiz G F, et al.
Pubblicazione: (2026)
di: Carreira, Luiz G F, et al.
Pubblicazione: (2026)
All4One: Symbiotic Neighbour Contrastive Learning via Self-Attention and Redundancy Reduction
di: Estepa, Imanol G., et al.
Pubblicazione: (2023)
di: Estepa, Imanol G., et al.
Pubblicazione: (2023)
FerretNet: Efficient Synthetic Image Detection via Local Pixel Dependencies
di: Liang, Shuqiao, et al.
Pubblicazione: (2025)
di: Liang, Shuqiao, et al.
Pubblicazione: (2025)
Data Augmentation for Image Classification using Generative AI
di: Rahat, Fazle, et al.
Pubblicazione: (2024)
di: Rahat, Fazle, et al.
Pubblicazione: (2024)
A Closer Look at Bias and Chain-of-Thought Faithfulness of Large (Vision) Language Models
di: Balasubramanian, Sriram, et al.
Pubblicazione: (2025)
di: Balasubramanian, Sriram, et al.
Pubblicazione: (2025)
Through-the-Wall Radar Human Activity Micro-Doppler Signature Representation Method Based on Joint Boulic-Sinusoidal Pendulum Model
di: Yang, Xiaopeng, et al.
Pubblicazione: (2024)
di: Yang, Xiaopeng, et al.
Pubblicazione: (2024)
RoNFA: Robust Neural Field-based Approach for Few-Shot Image Classification with Noisy Labels
di: Xiang, Nan, et al.
Pubblicazione: (2025)
di: Xiang, Nan, et al.
Pubblicazione: (2025)
Canonical Space Representation for 4D Panoptic Segmentation of Articulated Objects
di: Gomes, Manuel, et al.
Pubblicazione: (2025)
di: Gomes, Manuel, et al.
Pubblicazione: (2025)
CASE: Contrastive Activation for Saliency Estimation
di: Williamson, Dane, et al.
Pubblicazione: (2025)
di: Williamson, Dane, et al.
Pubblicazione: (2025)
Deep Learning Methods for Abstract Visual Reasoning: A Survey on Raven's Progressive Matrices
di: Małkiński, Mikołaj, et al.
Pubblicazione: (2022)
di: Małkiński, Mikołaj, et al.
Pubblicazione: (2022)
TabConv: Low-Computation CNN Inference via Table Lookups
di: Gupta, Neelesh, et al.
Pubblicazione: (2024)
di: Gupta, Neelesh, et al.
Pubblicazione: (2024)
A Sensorimotor Vision Transformer
di: Gadzicki, Konrad, et al.
Pubblicazione: (2025)
di: Gadzicki, Konrad, et al.
Pubblicazione: (2025)
Synergizing Deep Learning and Biological Heuristics for Extreme Long-Tail White Blood Cell Classification
di: Nguyen, Duc T., et al.
Pubblicazione: (2026)
di: Nguyen, Duc T., et al.
Pubblicazione: (2026)
GDDS: A Single Domain Generalized Defect Detection Frame of Open World Scenario using Gather and Distribute Domain-shift Suppression Network
di: Chen, Haiyong, et al.
Pubblicazione: (2024)
di: Chen, Haiyong, et al.
Pubblicazione: (2024)
Evaluation Before Generation: A Paradigm for Robust Multimodal Sentiment Analysis with Missing Modalities
di: Chen, Rongfei, et al.
Pubblicazione: (2026)
di: Chen, Rongfei, et al.
Pubblicazione: (2026)
Multi-Scale Spatial-Temporal Self-Attention Graph Convolutional Networks for Skeleton-based Action Recognition
di: Nakamura, Ikuo
Pubblicazione: (2024)
di: Nakamura, Ikuo
Pubblicazione: (2024)
Robust Confidence Intervals in Stereo Matching using Possibility Theory
di: Malinowski, Roman, et al.
Pubblicazione: (2024)
di: Malinowski, Roman, et al.
Pubblicazione: (2024)
Gaze-Guided Learning: Avoiding Shortcut Bias in Visual Classification
di: Li, Jiahang, et al.
Pubblicazione: (2025)
di: Li, Jiahang, et al.
Pubblicazione: (2025)
MAPS: A Synthetic Dataset for Probing Vision Models in a Controlled 3D Scene Space
di: Galella, Santiago, et al.
Pubblicazione: (2026)
di: Galella, Santiago, et al.
Pubblicazione: (2026)
Transformer-Based Vector Font Classification Using Different Font Formats: TrueType versus PostScript
di: Fujioka, Takumu, et al.
Pubblicazione: (2025)
di: Fujioka, Takumu, et al.
Pubblicazione: (2025)
SigLino: Efficient Multi-Teacher Distillation for Agglomerative Vision Foundation Models
di: Chaybouti, Sofian, et al.
Pubblicazione: (2025)
di: Chaybouti, Sofian, et al.
Pubblicazione: (2025)
Saccade Attention Networks: Using Transfer Learning of Attention to Reduce Network Sizes
di: Estafanous, Marc
Pubblicazione: (2026)
di: Estafanous, Marc
Pubblicazione: (2026)
Fusion and Grouping Strategies in Deep Learning for Local Climate Zone Classification of Multimodal Remote Sensing Data
di: Thomas, Ancymol, et al.
Pubblicazione: (2026)
di: Thomas, Ancymol, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Characterizing Model Robustness via Natural Input Gradients
di: Rodríguez-Muñoz, Adrián, et al.
Pubblicazione: (2024) -
ViTNF: Leveraging Neural Fields to Boost Vision Transformers in Generalized Category Discovery
di: Su, Jiayi, et al.
Pubblicazione: (2025) -
Adaptive Cascading Network for Continual Test-Time Adaptation
di: Nguyen, Kien X., et al.
Pubblicazione: (2024) -
Segmentation and Characterization of Macerated Fibers and Vessels Using Deep Learning
di: Qamar, Saqib, et al.
Pubblicazione: (2024) -
Conjuring Positive Pairs for Efficient Unification of Representation Learning and Image Synthesis
di: Estepa, Imanol G., et al.
Pubblicazione: (2025)