CascadedViT: Cascaded Chunk-FeedForward and Cascaded Group Attention Vision Transformer
Fuente:
arXiv
Saved in:
| Main Authors: | Sivakumar, Srivathsan, Qureshi, Faisal Z. |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Orthogonal Quadratic Complements for Vision Transformer Feed-Forward Networks
by: Zixian, Wang
Published: (2026)
by: Zixian, Wang
Published: (2026)
LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models
by: Gkalelis, Nikolaos, et al.
Published: (2026)
by: Gkalelis, Nikolaos, et al.
Published: (2026)
Self-Cascaded Diffusion Models for Arbitrary-Scale Image Super-Resolution
by: Bang, Junseo, et al.
Published: (2025)
by: Bang, Junseo, et al.
Published: (2025)
Block Cascading: Training Free Acceleration of Block-Causal Video Models
by: Bandyopadhyay, Hmrishav, et al.
Published: (2025)
by: Bandyopadhyay, Hmrishav, et al.
Published: (2025)
Tipiano: Cascaded Piano Hand Motion Synthesis via Fingertip Priors
by: Bae, Joonhyung, et al.
Published: (2026)
by: Bae, Joonhyung, et al.
Published: (2026)
FasterViT: Fast Vision Transformers with Hierarchical Attention
by: Hatamizadeh, Ali, et al.
Published: (2023)
by: Hatamizadeh, Ali, et al.
Published: (2023)
JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search
by: Zou, Dongyun, et al.
Published: (2026)
by: Zou, Dongyun, et al.
Published: (2026)
Staircase Cascaded Fusion of Lightweight Local Pattern Recognition and Long-Range Dependencies for Structural Crack Segmentation
by: Liu, Hui, et al.
Published: (2024)
by: Liu, Hui, et al.
Published: (2024)
COEF-VQ: Cost-Efficient Video Quality Understanding through a Cascaded Multimodal LLM Framework
by: Dong, Xin, et al.
Published: (2024)
by: Dong, Xin, et al.
Published: (2024)
Test-Time Adaptation with SaLIP: A Cascade of SAM and CLIP for Zero shot Medical Image Segmentation
by: Aleem, Sidra, et al.
Published: (2024)
by: Aleem, Sidra, et al.
Published: (2024)
A Cascaded Dilated Convolution Approach for Mpox Lesion Classification
by: Deshmukh, Ayush
Published: (2024)
by: Deshmukh, Ayush
Published: (2024)
A Multimodal Hybrid Late-Cascade Fusion Network for Enhanced 3D Object Detection
by: Sgaravatti, Carlo, et al.
Published: (2025)
by: Sgaravatti, Carlo, et al.
Published: (2025)
TinyViT-Batten: Few-Shot Vision Transformer with Explainable Attention for Early Batten-Disease Detection on Pediatric MRI
by: Uppalapati, Khartik, et al.
Published: (2025)
by: Uppalapati, Khartik, et al.
Published: (2025)
TreeGaussian: Tree-Guided Cascaded Contrastive Learning for Hierarchical Consistent 3D Gaussian Scene Segmentation and Understanding
by: You, Jingbin, et al.
Published: (2026)
by: You, Jingbin, et al.
Published: (2026)
Cascade-CLIP: Cascaded Vision-Language Embeddings Alignment for Zero-Shot Semantic Segmentation
by: Li, Yunheng, et al.
Published: (2024)
by: Li, Yunheng, et al.
Published: (2024)
Cascaded Dual Vision Transformer for Accurate Facial Landmark Detection
by: Dang, Ziqiang, et al.
Published: (2024)
by: Dang, Ziqiang, et al.
Published: (2024)
SAC-ViT: Semantic-Aware Clustering Vision Transformer with Early Exit
by: Hu, Youbing, et al.
Published: (2025)
by: Hu, Youbing, et al.
Published: (2025)
ButterflyViT: 354$\times$ Expert Compression for Edge Vision Transformers
by: Karmore, Aryan
Published: (2026)
by: Karmore, Aryan
Published: (2026)
Enhanced Cascade Prostate Cancer Classifier in mp-MRI Utilizing Recall Feedback Adaptive Loss and Prior Knowledge-Based Feature Extraction
by: Luo, Kun, et al.
Published: (2024)
by: Luo, Kun, et al.
Published: (2024)
InterACT: Inter-dependency Aware Action Chunking with Hierarchical Attention Transformers for Bimanual Manipulation
by: Lee, Andrew, et al.
Published: (2024)
by: Lee, Andrew, et al.
Published: (2024)
Bridging the Rural Healthcare Gap: A Cascaded Edge-Cloud Architecture for Automated Retinal Screening
by: Doshi, Nishi, et al.
Published: (2026)
by: Doshi, Nishi, et al.
Published: (2026)
DFQ-ViT: Data-Free Quantization for Vision Transformers without Fine-tuning
by: Tong, Yujia, et al.
Published: (2025)
by: Tong, Yujia, et al.
Published: (2025)
MDS-ViTNet: Improving saliency prediction for Eye-Tracking with Vision Transformer
by: Ignat, Polezhaev, et al.
Published: (2024)
by: Ignat, Polezhaev, et al.
Published: (2024)
bViT: Investigating Single-Block Recurrence in Vision Transformers for Image Recognition
by: Byra, Michal, et al.
Published: (2026)
by: Byra, Michal, et al.
Published: (2026)
LF-ViT: Reducing Spatial Redundancy in Vision Transformer for Efficient Image Recognition
by: Hu, Youbing, et al.
Published: (2024)
by: Hu, Youbing, et al.
Published: (2024)
GTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation
by: Xu, Xuwei, et al.
Published: (2023)
by: Xu, Xuwei, et al.
Published: (2023)
Prompt-Based Continual Compositional Zero-Shot Learning
by: Maryam, Sauda, et al.
Published: (2025)
by: Maryam, Sauda, et al.
Published: (2025)
The Linear Attention Resurrection in Vision Transformer
by: Zheng, Chuanyang
Published: (2025)
by: Zheng, Chuanyang
Published: (2025)
Spiking Vision Transformer with Saccadic Attention
by: Wang, Shuai, et al.
Published: (2025)
by: Wang, Shuai, et al.
Published: (2025)
CascadeFormer: A Family of Two-stage Cascading Transformers for Skeleton-based Human Action Recognition
by: Peng, Yusen, et al.
Published: (2025)
by: Peng, Yusen, et al.
Published: (2025)
A Cascading Cooperative Multi-agent Framework for On-ramp Merging Control Integrating Large Language Models
by: Zhang, Miao, et al.
Published: (2025)
by: Zhang, Miao, et al.
Published: (2025)
Unified Interactive Multimodal Moment Retrieval via Cascaded Embedding-Reranking and Temporal-Aware Score Fusion
by: Thanh, Toan Le Ngo, et al.
Published: (2025)
by: Thanh, Toan Le Ngo, et al.
Published: (2025)
Experience-Guided Self-Adaptive Cascaded Agents for Breast Cancer Screening and Diagnosis with Reduced Biopsy Referrals
by: Saha, Pramit, et al.
Published: (2026)
by: Saha, Pramit, et al.
Published: (2026)
ViTs are Everywhere: A Comprehensive Study Showcasing Vision Transformers in Different Domain
by: Mia, Md Sohag, et al.
Published: (2023)
by: Mia, Md Sohag, et al.
Published: (2023)
Trio-ViT: Post-Training Quantization and Acceleration for Softmax-Free Efficient Vision Transformer
by: Shi, Huihong, et al.
Published: (2024)
by: Shi, Huihong, et al.
Published: (2024)
Particulate: Feed-Forward 3D Object Articulation
by: Li, Ruining, et al.
Published: (2025)
by: Li, Ruining, et al.
Published: (2025)
IPTQ-ViT: Post-Training Quantization of Non-linear Functions for Integer-only Vision Transformers
by: Kim, Gihwan, et al.
Published: (2025)
by: Kim, Gihwan, et al.
Published: (2025)
Tiny-ViT: A Compact Vision Transformer for Efficient and Explainable Potato Leaf Disease Classification
by: Mia, Shakil, et al.
Published: (2026)
by: Mia, Shakil, et al.
Published: (2026)
Attention Retention for Continual Learning with Vision Transformers
by: Lu, Yue, et al.
Published: (2026)
by: Lu, Yue, et al.
Published: (2026)
CornViT: A Multi-Stage Convolutional Vision Transformer Framework for Hierarchical Corn Kernel Analysis
by: Erukude, Sai Teja, et al.
Published: (2025)
by: Erukude, Sai Teja, et al.
Published: (2025)
Similar Items
-
Orthogonal Quadratic Complements for Vision Transformer Feed-Forward Networks
by: Zixian, Wang
Published: (2026) -
LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models
by: Gkalelis, Nikolaos, et al.
Published: (2026) -
Self-Cascaded Diffusion Models for Arbitrary-Scale Image Super-Resolution
by: Bang, Junseo, et al.
Published: (2025) -
Block Cascading: Training Free Acceleration of Block-Causal Video Models
by: Bandyopadhyay, Hmrishav, et al.
Published: (2025) -
Tipiano: Cascaded Piano Hand Motion Synthesis via Fingertip Priors
by: Bae, Joonhyung, et al.
Published: (2026)