Nested-TNT: Hierarchical Vision Transformers with Multi-Scale Feature Processing
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Yuang, Qiu, Zhiheng, Qin, Xiaokai |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
HSVLT: Hierarchical Scale-Aware Vision-Language Transformer for Multi-Label Image Classification
by: Ouyang, Shuyi, et al.
Published: (2024)
by: Ouyang, Shuyi, et al.
Published: (2024)
Vision Bridge Transformer at Scale
by: Tan, Zhenxiong, et al.
Published: (2025)
by: Tan, Zhenxiong, et al.
Published: (2025)
Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation
by: Yue, Junrong, et al.
Published: (2025)
by: Yue, Junrong, et al.
Published: (2025)
CTA-Net: A CNN-Transformer Aggregation Network for Improving Multi-Scale Feature Extraction
by: Meng, Chunlei, et al.
Published: (2024)
by: Meng, Chunlei, et al.
Published: (2024)
Masked Generative Nested Transformers with Decode Time Scaling
by: Goyal, Sahil, et al.
Published: (2025)
by: Goyal, Sahil, et al.
Published: (2025)
Tighnari: Multi-modal Plant Species Prediction Based on Hierarchical Cross-Attention Using Graph-Based and Vision Backbone-Extracted Features
by: Liu, Haixu, et al.
Published: (2025)
by: Liu, Haixu, et al.
Published: (2025)
CornViT: A Multi-Stage Convolutional Vision Transformer Framework for Hierarchical Corn Kernel Analysis
by: Erukude, Sai Teja, et al.
Published: (2025)
by: Erukude, Sai Teja, et al.
Published: (2025)
Accelerating Vision Transformers on Brain Processing Unit
by: Tang, Jinchi, et al.
Published: (2026)
by: Tang, Jinchi, et al.
Published: (2026)
Hierarchical Multi-modal Transformer for Cross-modal Long Document Classification
by: Liu, Tengfei, et al.
Published: (2024)
by: Liu, Tengfei, et al.
Published: (2024)
Hierarchical Vision Transformer Enhanced by Graph Convolutional Network for Image Classification
by: Jiao, Haibin
Published: (2026)
by: Jiao, Haibin
Published: (2026)
Enhancing Feature Diversity Boosts Channel-Adaptive Vision Transformers
by: Pham, Chau, et al.
Published: (2024)
by: Pham, Chau, et al.
Published: (2024)
CAViT -- Channel-Aware Vision Transformer for Dynamic Feature Fusion
by: Safdar, Aon, et al.
Published: (2026)
by: Safdar, Aon, et al.
Published: (2026)
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders
by: Lee, Dohun, et al.
Published: (2025)
by: Lee, Dohun, et al.
Published: (2025)
Multi-Scale Correlation-Aware Transformer for Maritime Vessel Re-Identification
by: Liu, Yunhe
Published: (2025)
by: Liu, Yunhe
Published: (2025)
N2F2: Hierarchical Scene Understanding with Nested Neural Feature Fields
by: Bhalgat, Yash, et al.
Published: (2024)
by: Bhalgat, Yash, et al.
Published: (2024)
DMAGaze: Gaze Estimation Based on Feature Disentanglement and Multi-Scale Attention
by: Chen, Haohan, et al.
Published: (2025)
by: Chen, Haohan, et al.
Published: (2025)
Feature Learning with Multi-Stage Vision Transformers on Inter-Modality HER2 Status Scoring and Tumor Classification on Whole Slides
by: Oyelade, Olaide N., et al.
Published: (2025)
by: Oyelade, Olaide N., et al.
Published: (2025)
HMGIE: Hierarchical and Multi-Grained Inconsistency Evaluation for Vision-Language Data Cleansing
by: Zhu, Zihao, et al.
Published: (2024)
by: Zhu, Zihao, et al.
Published: (2024)
An Innovative Framework for Breast Cancer Detection Using Pyramid Adaptive Atrous Convolution, Transformer Integration, and Multi-Scale Feature Fusion
by: Pour, Ehsan Sadeghi, et al.
Published: (2026)
by: Pour, Ehsan Sadeghi, et al.
Published: (2026)
Edu-MMBias: A Three-Tier Multimodal Benchmark for Auditing Social Bias in Vision-Language Models under Educational Contexts
by: Li, Ruijia, et al.
Published: (2026)
by: Li, Ruijia, et al.
Published: (2026)
Contrastive Representation Distillation via Multi-Scale Feature Decoupling
by: Wang, Cuipeng, et al.
Published: (2025)
by: Wang, Cuipeng, et al.
Published: (2025)
Surformer v1: Transformer-Based Surface Classification Using Tactile and Vision Features
by: Kansana, Manish, et al.
Published: (2025)
by: Kansana, Manish, et al.
Published: (2025)
Proximal Vision Transformer: Enhancing Feature Representation through Two-Stage Manifold Geometry
by: Yun, Haoyu, et al.
Published: (2025)
by: Yun, Haoyu, et al.
Published: (2025)
Feature Identification for Hierarchical Contrastive Learning
by: Ott, Julius, et al.
Published: (2025)
by: Ott, Julius, et al.
Published: (2025)
FasterViT: Fast Vision Transformers with Hierarchical Attention
by: Hatamizadeh, Ali, et al.
Published: (2023)
by: Hatamizadeh, Ali, et al.
Published: (2023)
Local-Global Attention: An Adaptive Mechanism for Multi-Scale Feature Integration
by: Shao, Yifan
Published: (2024)
by: Shao, Yifan
Published: (2024)
DST-Net: A Dual-Stream Transformer with Illumination-Independent Feature Guidance and Multi-Scale Spatial Convolution for Low-Light Image Enhancement
by: Shi, Yicui, et al.
Published: (2026)
by: Shi, Yicui, et al.
Published: (2026)
MGHFT: Multi-Granularity Hierarchical Fusion Transformer for Cross-Modal Sticker Emotion Recognition
by: Chen, Jian, et al.
Published: (2025)
by: Chen, Jian, et al.
Published: (2025)
NESTOR: A Nested MOE-based Neural Operator for Large-Scale PDE Pre-Training
by: Sun, Dengdi, et al.
Published: (2026)
by: Sun, Dengdi, et al.
Published: (2026)
Multi-Scale Temporal Difference Transformer for Video-Text Retrieval
by: Wang, Ni, et al.
Published: (2024)
by: Wang, Ni, et al.
Published: (2024)
MuST: Multi-Scale Transformers for Surgical Phase Recognition
by: Pérez, Alejandra, et al.
Published: (2024)
by: Pérez, Alejandra, et al.
Published: (2024)
MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval
by: Zhu, Fengbin, et al.
Published: (2026)
by: Zhu, Fengbin, et al.
Published: (2026)
Trusted Unified Feature-Neighborhood Dynamics for Multi-View Classification
by: Huang, Haojian, et al.
Published: (2024)
by: Huang, Haojian, et al.
Published: (2024)
AHPA: Adaptive Hierarchical Prior Alignment for Diffusion Transformers
by: Min, Ruibin, et al.
Published: (2026)
by: Min, Ruibin, et al.
Published: (2026)
GFE-Mamba: Mamba-based AD Multi-modal Progression Assessment via Generative Feature Extraction from MCI
by: Fang, Zhaojie, et al.
Published: (2024)
by: Fang, Zhaojie, et al.
Published: (2024)
From Histopathology Images to Cell Clouds: Learning Slide Representations with Hierarchical Cell Transformer
by: Yang, Zijiang, et al.
Published: (2024)
by: Yang, Zijiang, et al.
Published: (2024)
ScaleKD: Strong Vision Transformers Could Be Excellent Teachers
by: Fan, Jiawei, et al.
Published: (2024)
by: Fan, Jiawei, et al.
Published: (2024)
Image Forgery Localization via Guided Noise and Multi-Scale Feature Aggregation
by: Niu, Yakun, et al.
Published: (2024)
by: Niu, Yakun, et al.
Published: (2024)
The Progression of Transformers from Language to Vision to MOT: A Literature Review on Multi-Object Tracking with Transformers
by: Kamboj, Abhi
Published: (2024)
by: Kamboj, Abhi
Published: (2024)
HAMLET-FFD: Hierarchical Adaptive Multi-modal Learning Embeddings Transformation for Face Forgery Detection
by: Cui, Jialei, et al.
Published: (2025)
by: Cui, Jialei, et al.
Published: (2025)
Similar Items
-
HSVLT: Hierarchical Scale-Aware Vision-Language Transformer for Multi-Label Image Classification
by: Ouyang, Shuyi, et al.
Published: (2024) -
Vision Bridge Transformer at Scale
by: Tan, Zhenxiong, et al.
Published: (2025) -
Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation
by: Yue, Junrong, et al.
Published: (2025) -
CTA-Net: A CNN-Transformer Aggregation Network for Improving Multi-Scale Feature Extraction
by: Meng, Chunlei, et al.
Published: (2024) -
Masked Generative Nested Transformers with Decode Time Scaling
by: Goyal, Sahil, et al.
Published: (2025)