Empowering Vision Transformers with Multi-Scale Causal Intervention for Long-Tailed Image Classification
Fuente:
arXiv
Guardado en:
| Autores principales: | Yan, Xiaoshuo, Li, Zhaochuan, Meng, Lei, Qi, Zhuang, Wu, Wei, Li, Zixuan, Meng, Xiangxu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Semantic-Space-Intervened Diffusive Alignment for Visual Classification
por: Li, Zixuan, et al.
Publicado: (2025)
por: Li, Zixuan, et al.
Publicado: (2025)
Global Intervention and Distillation for Federated Out-of-Distribution Generalization
por: Qi, Zhuang, et al.
Publicado: (2025)
por: Qi, Zhuang, et al.
Publicado: (2025)
ProtoConNet: Prototypical Augmentation and Alignment for Open-Set Few-Shot Image Classification
por: Shi, Kexuan, et al.
Publicado: (2025)
por: Shi, Kexuan, et al.
Publicado: (2025)
LLM-Enabled Style and Content Regularization for Personalized Text-to-Image Generation
por: Yu, Anran, et al.
Publicado: (2025)
por: Yu, Anran, et al.
Publicado: (2025)
Federated Deconfounding and Debiasing Learning for Out-of-Distribution Generalization
por: Qi, Zhuang, et al.
Publicado: (2025)
por: Qi, Zhuang, et al.
Publicado: (2025)
Global Prompt Refinement with Non-Interfering Attention Masking for One-Shot Federated Learning
por: Qi, Zhuang, et al.
Publicado: (2025)
por: Qi, Zhuang, et al.
Publicado: (2025)
Class-wise Balancing Data Replay for Federated Class-Incremental Learning
por: Qi, Zhuang, et al.
Publicado: (2025)
por: Qi, Zhuang, et al.
Publicado: (2025)
Unifying Visual and Semantic Feature Spaces with Diffusion Models for Enhanced Cross-Modal Alignment
por: Zheng, Yuze, et al.
Publicado: (2024)
por: Zheng, Yuze, et al.
Publicado: (2024)
From Selection to Scheduling: Federated Geometry-Aware Correction Makes Exemplar Replay Work Better under Continual Dynamic Heterogeneity
por: Qi, Zhuang, et al.
Publicado: (2026)
por: Qi, Zhuang, et al.
Publicado: (2026)
Hierarchically-Structured Open-Vocabulary Indoor Scene Synthesis with Pre-trained Large Language Model
por: Sun, Weilin, et al.
Publicado: (2025)
por: Sun, Weilin, et al.
Publicado: (2025)
Learning from Reduced Labels for Long-Tailed Data
por: Wei, Meng, et al.
Publicado: (2024)
por: Wei, Meng, et al.
Publicado: (2024)
Towards Initialization-Agnostic Clustering with Iterative Adaptive Resonance Theory
por: Qu, Xiaozheng, et al.
Publicado: (2025)
por: Qu, Xiaozheng, et al.
Publicado: (2025)
Category-Prompt Refined Feature Learning for Long-Tailed Multi-Label Image Classification
por: Yan, Jiexuan, et al.
Publicado: (2024)
por: Yan, Jiexuan, et al.
Publicado: (2024)
Text-guided Foundation Model Adaptation for Long-Tailed Medical Image Classification
por: Li, Sirui, et al.
Publicado: (2024)
por: Li, Sirui, et al.
Publicado: (2024)
Multi-Tailed Vision Transformer for Efficient Inference
por: Wang, Yunke, et al.
Publicado: (2022)
por: Wang, Yunke, et al.
Publicado: (2022)
CausalCLIPSeg: Unlocking CLIP's Potential in Referring Medical Image Segmentation with Causal Intervention
por: Chen, Yaxiong, et al.
Publicado: (2025)
por: Chen, Yaxiong, et al.
Publicado: (2025)
Momentum-Anchored Multi-Scale Fusion Model for Long-Tailed Chest X-Ray Classification
por: Khuong, Duy Hoang, et al.
Publicado: (2026)
por: Khuong, Duy Hoang, et al.
Publicado: (2026)
Invariant Feature Learning for Generalized Long-Tailed Classification
por: Tang, Kaihua, et al.
Publicado: (2022)
por: Tang, Kaihua, et al.
Publicado: (2022)
Long-Tailed Classification Based on Coarse-Grained Leading Forest and Multi-Center Loss
por: Yang, Jinye, et al.
Publicado: (2023)
por: Yang, Jinye, et al.
Publicado: (2023)
HSVLT: Hierarchical Scale-Aware Vision-Language Transformer for Multi-Label Image Classification
por: Ouyang, Shuyi, et al.
Publicado: (2024)
por: Ouyang, Shuyi, et al.
Publicado: (2024)
Teacher-Guided Causal Interventions for Image Denoising: Orthogonal Content-Noise Disentanglement in Vision Transformers
por: Jiang, Kuai, et al.
Publicado: (2026)
por: Jiang, Kuai, et al.
Publicado: (2026)
Polyline Path Masked Attention for Vision Transformer
por: Zhao, Zhongchen, et al.
Publicado: (2025)
por: Zhao, Zhongchen, et al.
Publicado: (2025)
Long-Tailed Out-of-Distribution Detection: Prioritizing Attention to Tail
por: He, Yina, et al.
Publicado: (2024)
por: He, Yina, et al.
Publicado: (2024)
Long-Tailed Classification by Keeping the Good and Removing the Bad Momentum Causal Effect
por: Tang, Kaihua, et al.
Publicado: (2020)
por: Tang, Kaihua, et al.
Publicado: (2020)
ActiveSSF: An Active-Learning-Guided Self-Supervised Framework for Long-Tailed Megakaryocyte Classification
por: Zhuang, Linghao, et al.
Publicado: (2025)
por: Zhuang, Linghao, et al.
Publicado: (2025)
Efficient and Long-Tailed Generalization for Pre-trained Vision-Language Model
por: Shi, Jiang-Xin, et al.
Publicado: (2024)
por: Shi, Jiang-Xin, et al.
Publicado: (2024)
Unleashing the Power of Vision-Language Models for Long-Tailed Multi-Label Visual Recognition
por: Tang, Wei, et al.
Publicado: (2025)
por: Tang, Wei, et al.
Publicado: (2025)
MedConv: Convolutions Beat Transformers on Long-Tailed Bone Density Prediction
por: Qi, Xuyin, et al.
Publicado: (2025)
por: Qi, Xuyin, et al.
Publicado: (2025)
Cluster-Aware Neural Collapse Prompt Tuning for Long-Tailed Generalization of Vision-Language Models
por: Guo, Boyang, et al.
Publicado: (2026)
por: Guo, Boyang, et al.
Publicado: (2026)
Degradation-Aware Image Enhancement via Vision-Language Classification
por: Cai, Jie, et al.
Publicado: (2025)
por: Cai, Jie, et al.
Publicado: (2025)
AddressCLIP: Empowering Vision-Language Models for City-wide Image Address Localization
por: Xu, Shixiong, et al.
Publicado: (2024)
por: Xu, Shixiong, et al.
Publicado: (2024)
MADS: Multi-Attribute Document Supervision for Zero-Shot Image Classification
por: Qu, Xiangyan, et al.
Publicado: (2025)
por: Qu, Xiangyan, et al.
Publicado: (2025)
Vanilla Group Equivariant Vision Transformer: Simple and Effective
por: Fu, Jiahong, et al.
Publicado: (2026)
por: Fu, Jiahong, et al.
Publicado: (2026)
Text-Guided Mixup Towards Long-Tailed Image Categorization
por: Franklin, Richard, et al.
Publicado: (2024)
por: Franklin, Richard, et al.
Publicado: (2024)
Semi-Supervised Multi-Modal Medical Image Segmentation for Complex Situations
por: Meng, Dongdong, et al.
Publicado: (2025)
por: Meng, Dongdong, et al.
Publicado: (2025)
Towards SAR Automatic Target Recognition MultiCategory SAR Image Classification Based on Light Weight Vision Transformer
por: Zhao, Guibin, et al.
Publicado: (2024)
por: Zhao, Guibin, et al.
Publicado: (2024)
HQViT: Hybrid Quantum Vision Transformer for Image Classification
por: Zhang, Hui, et al.
Publicado: (2025)
por: Zhang, Hui, et al.
Publicado: (2025)
Long-Tailed Distribution-Aware Router For Mixture-of-Experts in Large Vision-Language Model
por: Cai, Chaoxiang, et al.
Publicado: (2025)
por: Cai, Chaoxiang, et al.
Publicado: (2025)
X-Edit: Exact, Explicit, and Explainable Null-Space Editing for Medical Vision Transformers
por: Liu, Yuanye, et al.
Publicado: (2026)
por: Liu, Yuanye, et al.
Publicado: (2026)
BlindDiff: Empowering Degradation Modelling in Diffusion Models for Blind Image Super-Resolution
por: Li, Feng, et al.
Publicado: (2024)
por: Li, Feng, et al.
Publicado: (2024)
Ejemplares similares
-
Semantic-Space-Intervened Diffusive Alignment for Visual Classification
por: Li, Zixuan, et al.
Publicado: (2025) -
Global Intervention and Distillation for Federated Out-of-Distribution Generalization
por: Qi, Zhuang, et al.
Publicado: (2025) -
ProtoConNet: Prototypical Augmentation and Alignment for Open-Set Few-Shot Image Classification
por: Shi, Kexuan, et al.
Publicado: (2025) -
LLM-Enabled Style and Content Regularization for Personalized Text-to-Image Generation
por: Yu, Anran, et al.
Publicado: (2025) -
Federated Deconfounding and Debiasing Learning for Out-of-Distribution Generalization
por: Qi, Zhuang, et al.
Publicado: (2025)