DC-ViT: Modulating Spatial and Channel Interactions for Multi-Channel Images
Fuente:
arXiv
Salvato in:
| Autori principali: | Marikkar, Umar, Husain, Syed Sameed, Awais, Muhammad, Atito, Sara |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Channel-Aware Probing for Multi-Channel Imaging
di: Marikkar, Umar, et al.
Pubblicazione: (2026)
di: Marikkar, Umar, et al.
Pubblicazione: (2026)
C3R: Channel Conditioned Cell Representations for unified evaluation in microscopy imaging
di: Marikkar, Umar, et al.
Pubblicazione: (2025)
di: Marikkar, Umar, et al.
Pubblicazione: (2025)
Domain Adaptation Without the Compute Burden for Efficient Whole Slide Image Analysis
di: Marikkar, Umar, et al.
Pubblicazione: (2026)
di: Marikkar, Umar, et al.
Pubblicazione: (2026)
ToaSt: Token Channel Selection and Structured Pruning for Efficient ViT
di: Moon, Hyunchan, et al.
Pubblicazione: (2026)
di: Moon, Hyunchan, et al.
Pubblicazione: (2026)
PRANCE: Joint Token-Optimization and Structural Channel-Pruning for Adaptive ViT Inference
di: Li, Ye, et al.
Pubblicazione: (2024)
di: Li, Ye, et al.
Pubblicazione: (2024)
Hybrid CNN-ViT Framework for Motion-Blurred Scene Text Restoration
di: Rashid, Umar, et al.
Pubblicazione: (2025)
di: Rashid, Umar, et al.
Pubblicazione: (2025)
Investigating Self-Supervised Methods for Label-Efficient Learning
di: Nandam, Srinivasa Rao, et al.
Pubblicazione: (2024)
di: Nandam, Srinivasa Rao, et al.
Pubblicazione: (2024)
ChAda-ViT : Channel Adaptive Attention for Joint Representation Learning of Heterogeneous Microscopy Images
di: Bourriez, Nicolas, et al.
Pubblicazione: (2023)
di: Bourriez, Nicolas, et al.
Pubblicazione: (2023)
One Model for ALL: Low-Level Task Interaction Is a Key to Task-Agnostic Image Fusion
di: Cheng, Chunyang, et al.
Pubblicazione: (2025)
di: Cheng, Chunyang, et al.
Pubblicazione: (2025)
Pseudo Labelling for Enhanced Masked Autoencoders
di: Nandam, Srinivasa Rao, et al.
Pubblicazione: (2024)
di: Nandam, Srinivasa Rao, et al.
Pubblicazione: (2024)
Attend-Fusion: Efficient Audio-Visual Fusion for Video Classification
di: Awan, Mahrukh, et al.
Pubblicazione: (2024)
di: Awan, Mahrukh, et al.
Pubblicazione: (2024)
Your ViT is Secretly an Image Segmentation Model
di: Kerssies, Tommie, et al.
Pubblicazione: (2025)
di: Kerssies, Tommie, et al.
Pubblicazione: (2025)
CNN and ViT Efficiency Study on Tiny ImageNet and DermaMNIST Datasets
di: Amangeldi, Aidar, et al.
Pubblicazione: (2025)
di: Amangeldi, Aidar, et al.
Pubblicazione: (2025)
Rethinking Positive Pairs in Contrastive Learning
di: Wu, Jiantao, et al.
Pubblicazione: (2024)
di: Wu, Jiantao, et al.
Pubblicazione: (2024)
DailyMAE: Towards Pretraining Masked Autoencoders in One Day
di: Wu, Jiantao, et al.
Pubblicazione: (2024)
di: Wu, Jiantao, et al.
Pubblicazione: (2024)
Deeper Inside Deep ViT
di: Hong, Sungrae
Pubblicazione: (2025)
di: Hong, Sungrae
Pubblicazione: (2025)
I&S-ViT: An Inclusive & Stable Method for Pushing the Limit of Post-Training ViTs Quantization
di: Zhong, Yunshan, et al.
Pubblicazione: (2023)
di: Zhong, Yunshan, et al.
Pubblicazione: (2023)
LF-ViT: Reducing Spatial Redundancy in Vision Transformer for Efficient Image Recognition
di: Hu, Youbing, et al.
Pubblicazione: (2024)
di: Hu, Youbing, et al.
Pubblicazione: (2024)
ASiT: Local-Global Audio Spectrogram vIsion Transformer for Event Classification
di: Atito, Sara, et al.
Pubblicazione: (2022)
di: Atito, Sara, et al.
Pubblicazione: (2022)
ViT-CoMer: Vision Transformer with Convolutional Multi-scale Feature Interaction for Dense Predictions
di: Xia, Chunlong, et al.
Pubblicazione: (2024)
di: Xia, Chunlong, et al.
Pubblicazione: (2024)
Let ViT Speak: Generative Language-Image Pre-training
di: Fang, Yan, et al.
Pubblicazione: (2026)
di: Fang, Yan, et al.
Pubblicazione: (2026)
Pretrained ViTs Yield Versatile Representations For Medical Images
di: Matsoukas, Christos, et al.
Pubblicazione: (2023)
di: Matsoukas, Christos, et al.
Pubblicazione: (2023)
IML-ViT: Benchmarking Image Manipulation Localization by Vision Transformer
di: Ma, Xiaochen, et al.
Pubblicazione: (2023)
di: Ma, Xiaochen, et al.
Pubblicazione: (2023)
ViT-Explainer: An Interactive Walkthrough of the Vision Transformer Pipeline
di: Hernandez, Juan Manuel, et al.
Pubblicazione: (2026)
di: Hernandez, Juan Manuel, et al.
Pubblicazione: (2026)
Probabilistically Aligned View-unaligned Clustering with Adaptive Template Selection
di: Dong, Wenhua, et al.
Pubblicazione: (2024)
di: Dong, Wenhua, et al.
Pubblicazione: (2024)
RepViT: Revisiting Mobile CNN From ViT Perspective
di: Wang, Ao, et al.
Pubblicazione: (2023)
di: Wang, Ao, et al.
Pubblicazione: (2023)
DisentangleFormer: Spatial-Channel Decoupling for Multi-Channel Vision
di: Liao, Jiashu, et al.
Pubblicazione: (2025)
di: Liao, Jiashu, et al.
Pubblicazione: (2025)
ViTs for Action Classification in Videos: An Approach to Risky Tackle Detection in American Football Practice Videos
di: Zaidi, Syed Ahsan Masud, et al.
Pubblicazione: (2026)
di: Zaidi, Syed Ahsan Masud, et al.
Pubblicazione: (2026)
Charm: The Missing Piece in ViT fine-tuning for Image Aesthetic Assessment
di: Behrad, Fatemeh, et al.
Pubblicazione: (2025)
di: Behrad, Fatemeh, et al.
Pubblicazione: (2025)
ViT-FIQA: Assessing Face Image Quality using Vision Transformers
di: Atzori, Andrea, et al.
Pubblicazione: (2025)
di: Atzori, Andrea, et al.
Pubblicazione: (2025)
Modulating CNN Features with Pre-Trained ViT Representations for Open-Vocabulary Object Detection
di: Gao, Xiangyu, et al.
Pubblicazione: (2025)
di: Gao, Xiangyu, et al.
Pubblicazione: (2025)
Exploring Plain ViT Reconstruction for Multi-class Unsupervised Anomaly Detection
di: Zhang, Jiangning, et al.
Pubblicazione: (2023)
di: Zhang, Jiangning, et al.
Pubblicazione: (2023)
C2C: Component-to-Composition Learning for Zero-Shot Compositional Action Recognition
di: Li, Rongchang, et al.
Pubblicazione: (2024)
di: Li, Rongchang, et al.
Pubblicazione: (2024)
ViT-5: Vision Transformers for The Mid-2020s
di: Wang, Feng, et al.
Pubblicazione: (2026)
di: Wang, Feng, et al.
Pubblicazione: (2026)
Rethinking Random Masking in Self-Distillation on ViT
di: Seong, Jihyeon, et al.
Pubblicazione: (2025)
di: Seong, Jihyeon, et al.
Pubblicazione: (2025)
YOLO-Former: YOLO Shakes Hand With ViT
di: Khoramdel, Javad, et al.
Pubblicazione: (2024)
di: Khoramdel, Javad, et al.
Pubblicazione: (2024)
Language-Unlocked ViT (LUViT): Empowering Self-Supervised Vision Transformers with LLMs
di: Kuzucu, Selim, et al.
Pubblicazione: (2025)
di: Kuzucu, Selim, et al.
Pubblicazione: (2025)
CubistMerge: Spatial-Preserving Token Merging For Diverse ViT Backbones
di: Gong, Wenyi, et al.
Pubblicazione: (2025)
di: Gong, Wenyi, et al.
Pubblicazione: (2025)
LAMM-ViT: AI Face Detection via Layer-Aware Modulation of Region-Guided Attention
di: Zhang, Jiangling, et al.
Pubblicazione: (2025)
di: Zhang, Jiangling, et al.
Pubblicazione: (2025)
NarrativeBridge: Enhancing Video Captioning with Causal-Temporal Narrative
di: Nadeem, Asmar, et al.
Pubblicazione: (2024)
di: Nadeem, Asmar, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Channel-Aware Probing for Multi-Channel Imaging
di: Marikkar, Umar, et al.
Pubblicazione: (2026) -
C3R: Channel Conditioned Cell Representations for unified evaluation in microscopy imaging
di: Marikkar, Umar, et al.
Pubblicazione: (2025) -
Domain Adaptation Without the Compute Burden for Efficient Whole Slide Image Analysis
di: Marikkar, Umar, et al.
Pubblicazione: (2026) -
ToaSt: Token Channel Selection and Structured Pruning for Efficient ViT
di: Moon, Hyunchan, et al.
Pubblicazione: (2026) -
PRANCE: Joint Token-Optimization and Structural Channel-Pruning for Adaptive ViT Inference
di: Li, Ye, et al.
Pubblicazione: (2024)