CAViT -- Channel-Aware Vision Transformer for Dynamic Feature Fusion
Fuente:
arXiv
Guardado en:
| Autores principales: | Safdar, Aon, Saadeldin, Mohamed |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CoMViT: An Efficient Vision Backbone for Supervised Classification in Medical Imaging
por: Safdar, Aon, et al.
Publicado: (2025)
por: Safdar, Aon, et al.
Publicado: (2025)
YOLOatr : Deep Learning Based Automatic Target Detection and Localization in Thermal Infrared Imagery
por: Safdar, Aon, et al.
Publicado: (2025)
por: Safdar, Aon, et al.
Publicado: (2025)
Enhancing Feature Diversity Boosts Channel-Adaptive Vision Transformers
por: Pham, Chau, et al.
Publicado: (2024)
por: Pham, Chau, et al.
Publicado: (2024)
Feature Fusion Transferability Aware Transformer for Unsupervised Domain Adaptation
por: Yu, Xiaowei, et al.
Publicado: (2024)
por: Yu, Xiaowei, et al.
Publicado: (2024)
Focal Modulation and Bidirectional Feature Fusion Network for Medical Image Segmentation
por: Safdar, Moin, et al.
Publicado: (2025)
por: Safdar, Moin, et al.
Publicado: (2025)
CoCAViT: Compact Vision Transformer with Robust Global Coordination
por: Wang, Xuyang, et al.
Publicado: (2025)
por: Wang, Xuyang, et al.
Publicado: (2025)
Environment-Aware Channel Prediction for Vehicular Communications: A Multimodal Visual Feature Fusion Framework
por: Zhang, Xuejian, et al.
Publicado: (2026)
por: Zhang, Xuejian, et al.
Publicado: (2026)
AFFormer: Adaptive Feature Fusion Transformer for V2X Cooperative Perception under Channel Impairments
por: Zhou, Xi, et al.
Publicado: (2026)
por: Zhou, Xi, et al.
Publicado: (2026)
DANCE: Dynamic 3D CNN Pruning: Joint Frame, Channel, and Feature Adaptation for Energy Efficiency on the Edge
por: Mejri, Mohamed, et al.
Publicado: (2026)
por: Mejri, Mohamed, et al.
Publicado: (2026)
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders
por: Lee, Dohun, et al.
Publicado: (2025)
por: Lee, Dohun, et al.
Publicado: (2025)
RGBD Gaze Tracking Using Transformer for Feature Fusion
por: Bauer, Tobias J.
Publicado: (2025)
por: Bauer, Tobias J.
Publicado: (2025)
FUSE-RSVLM: Feature Fusion Vision-Language Model for Remote Sensing
por: Dang, Yunkai, et al.
Publicado: (2025)
por: Dang, Yunkai, et al.
Publicado: (2025)
Frequency-Aware Token Reduction for Efficient Vision Transformer
por: Lee, Dong-Jae, et al.
Publicado: (2025)
por: Lee, Dong-Jae, et al.
Publicado: (2025)
Temporal and Spatial Feature Fusion Framework for Dynamic Micro Expression Recognition
por: Liu, Feng, et al.
Publicado: (2025)
por: Liu, Feng, et al.
Publicado: (2025)
CFMD: Dynamic Cross-layer Feature Fusion for Salient Object Detection
por: Lian, Jin, et al.
Publicado: (2025)
por: Lian, Jin, et al.
Publicado: (2025)
MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion
por: Hua, Wei, et al.
Publicado: (2025)
por: Hua, Wei, et al.
Publicado: (2025)
Nested-TNT: Hierarchical Vision Transformers with Multi-Scale Feature Processing
por: Liu, Yuang, et al.
Publicado: (2024)
por: Liu, Yuang, et al.
Publicado: (2024)
SAC-ViT: Semantic-Aware Clustering Vision Transformer with Early Exit
por: Hu, Youbing, et al.
Publicado: (2025)
por: Hu, Youbing, et al.
Publicado: (2025)
Token Pruning using a Lightweight Background Aware Vision Transformer
por: Sah, Sudhakar, et al.
Publicado: (2024)
por: Sah, Sudhakar, et al.
Publicado: (2024)
A 2D Semantic-Aware Position Encoding for Vision Transformers
por: Chen, Xi, et al.
Publicado: (2025)
por: Chen, Xi, et al.
Publicado: (2025)
LIDAR: Lightweight Adaptive Cue-Aware Fusion Vision Mamba for Multimodal Segmentation of Structural Cracks
por: Liu, Hui, et al.
Publicado: (2025)
por: Liu, Hui, et al.
Publicado: (2025)
Motion Blur Robust Wheat Pest Damage Detection with Dynamic Fuzzy Feature Fusion
por: Zhang, Han, et al.
Publicado: (2026)
por: Zhang, Han, et al.
Publicado: (2026)
Arabic-Nougat: Fine-Tuning Vision Transformers for Arabic OCR and Markdown Extraction
por: Rashad, Mohamed
Publicado: (2024)
por: Rashad, Mohamed
Publicado: (2024)
Arbitrary Data as Images: Fusion of Patient Data Across Modalities and Irregular Intervals with Vision Transformers
por: Tölle, Malte, et al.
Publicado: (2025)
por: Tölle, Malte, et al.
Publicado: (2025)
Temporal Object-Aware Vision Transformer for Few-Shot Video Object Detection
por: Kumar, Yogesh, et al.
Publicado: (2025)
por: Kumar, Yogesh, et al.
Publicado: (2025)
Surformer v1: Transformer-Based Surface Classification Using Tactile and Vision Features
por: Kansana, Manish, et al.
Publicado: (2025)
por: Kansana, Manish, et al.
Publicado: (2025)
Proximal Vision Transformer: Enhancing Feature Representation through Two-Stage Manifold Geometry
por: Yun, Haoyu, et al.
Publicado: (2025)
por: Yun, Haoyu, et al.
Publicado: (2025)
MDF-MLLM: Deep Fusion Through Cross-Modal Feature Alignment for Contextually Aware Fundoscopic Image Classification
por: Jordan, Jason, et al.
Publicado: (2025)
por: Jordan, Jason, et al.
Publicado: (2025)
Fusion of Pervasive RF Data with Spatial Images via Vision Transformers for Enhanced Mapping in Smart Cities
por: Mkrtchyan, Rafayel, et al.
Publicado: (2025)
por: Mkrtchyan, Rafayel, et al.
Publicado: (2025)
Cross-aware Early Fusion with Stage-divided Vision and Language Transformer Encoders for Referring Image Segmentation
por: Cho, Yubin, et al.
Publicado: (2024)
por: Cho, Yubin, et al.
Publicado: (2024)
Vision-Aware Text Features in Referring Image Segmentation: From Object Understanding to Context Understanding
por: Nguyen-Truong, Hai, et al.
Publicado: (2024)
por: Nguyen-Truong, Hai, et al.
Publicado: (2024)
CaTFormer: Causal Temporal Transformer with Dynamic Contextual Fusion for Driving Intention Prediction
por: Wang, Sirui, et al.
Publicado: (2025)
por: Wang, Sirui, et al.
Publicado: (2025)
RAZOR: Ratio-Aware Layer Editing for Targeted Unlearning in Vision Transformers and Diffusion Models
por: Ranjan, Ravi, et al.
Publicado: (2026)
por: Ranjan, Ravi, et al.
Publicado: (2026)
EVM-Fusion: An Explainable Vision Mamba Architecture with Neural Algorithmic Fusion
por: Yang, Zichuan, et al.
Publicado: (2025)
por: Yang, Zichuan, et al.
Publicado: (2025)
Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation
por: Yue, Junrong, et al.
Publicado: (2025)
por: Yue, Junrong, et al.
Publicado: (2025)
D2Fusion: Dual-domain Fusion with Feature Superposition for Deepfake Detection
por: Qiu, Xueqi, et al.
Publicado: (2025)
por: Qiu, Xueqi, et al.
Publicado: (2025)
Divide, Weight, and Route: Difficulty-Aware Optimization with Dynamic Expert Fusion for Long-tailed Recognition
por: Wei, Xiaolei, et al.
Publicado: (2025)
por: Wei, Xiaolei, et al.
Publicado: (2025)
Feature Fusion for Human Activity Recognition using Parameter-Optimized Multi-Stage Graph Convolutional Network and Transformer Models
por: Belal, Mohammad, et al.
Publicado: (2024)
por: Belal, Mohammad, et al.
Publicado: (2024)
LGBP-OrgaNet: Learnable Gaussian Band Pass Fusion of CNN and Transformer Features for Robust Organoid Segmentation and Tracking
por: Zhang, Jing, et al.
Publicado: (2025)
por: Zhang, Jing, et al.
Publicado: (2025)
physfusion: A Transformer-based Dual-Stream Radar and Vision Fusion Framework for Open Water Surface Object Detection
por: Wan, Yuting, et al.
Publicado: (2026)
por: Wan, Yuting, et al.
Publicado: (2026)
Ejemplares similares
-
CoMViT: An Efficient Vision Backbone for Supervised Classification in Medical Imaging
por: Safdar, Aon, et al.
Publicado: (2025) -
YOLOatr : Deep Learning Based Automatic Target Detection and Localization in Thermal Infrared Imagery
por: Safdar, Aon, et al.
Publicado: (2025) -
Enhancing Feature Diversity Boosts Channel-Adaptive Vision Transformers
por: Pham, Chau, et al.
Publicado: (2024) -
Feature Fusion Transferability Aware Transformer for Unsupervised Domain Adaptation
por: Yu, Xiaowei, et al.
Publicado: (2024) -
Focal Modulation and Bidirectional Feature Fusion Network for Medical Image Segmentation
por: Safdar, Moin, et al.
Publicado: (2025)