Nested-TNT: Hierarchical Vision Transformers with Multi-Scale Feature Processing
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Yuang, Qiu, Zhiheng, Qin, Xiaokai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HSVLT: Hierarchical Scale-Aware Vision-Language Transformer for Multi-Label Image Classification
por: Ouyang, Shuyi, et al.
Publicado: (2024)
por: Ouyang, Shuyi, et al.
Publicado: (2024)
Vision Bridge Transformer at Scale
por: Tan, Zhenxiong, et al.
Publicado: (2025)
por: Tan, Zhenxiong, et al.
Publicado: (2025)
Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation
por: Yue, Junrong, et al.
Publicado: (2025)
por: Yue, Junrong, et al.
Publicado: (2025)
CTA-Net: A CNN-Transformer Aggregation Network for Improving Multi-Scale Feature Extraction
por: Meng, Chunlei, et al.
Publicado: (2024)
por: Meng, Chunlei, et al.
Publicado: (2024)
Masked Generative Nested Transformers with Decode Time Scaling
por: Goyal, Sahil, et al.
Publicado: (2025)
por: Goyal, Sahil, et al.
Publicado: (2025)
Tighnari: Multi-modal Plant Species Prediction Based on Hierarchical Cross-Attention Using Graph-Based and Vision Backbone-Extracted Features
por: Liu, Haixu, et al.
Publicado: (2025)
por: Liu, Haixu, et al.
Publicado: (2025)
CornViT: A Multi-Stage Convolutional Vision Transformer Framework for Hierarchical Corn Kernel Analysis
por: Erukude, Sai Teja, et al.
Publicado: (2025)
por: Erukude, Sai Teja, et al.
Publicado: (2025)
Accelerating Vision Transformers on Brain Processing Unit
por: Tang, Jinchi, et al.
Publicado: (2026)
por: Tang, Jinchi, et al.
Publicado: (2026)
Hierarchical Multi-modal Transformer for Cross-modal Long Document Classification
por: Liu, Tengfei, et al.
Publicado: (2024)
por: Liu, Tengfei, et al.
Publicado: (2024)
Hierarchical Vision Transformer Enhanced by Graph Convolutional Network for Image Classification
por: Jiao, Haibin
Publicado: (2026)
por: Jiao, Haibin
Publicado: (2026)
Enhancing Feature Diversity Boosts Channel-Adaptive Vision Transformers
por: Pham, Chau, et al.
Publicado: (2024)
por: Pham, Chau, et al.
Publicado: (2024)
CAViT -- Channel-Aware Vision Transformer for Dynamic Feature Fusion
por: Safdar, Aon, et al.
Publicado: (2026)
por: Safdar, Aon, et al.
Publicado: (2026)
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders
por: Lee, Dohun, et al.
Publicado: (2025)
por: Lee, Dohun, et al.
Publicado: (2025)
Multi-Scale Correlation-Aware Transformer for Maritime Vessel Re-Identification
por: Liu, Yunhe
Publicado: (2025)
por: Liu, Yunhe
Publicado: (2025)
N2F2: Hierarchical Scene Understanding with Nested Neural Feature Fields
por: Bhalgat, Yash, et al.
Publicado: (2024)
por: Bhalgat, Yash, et al.
Publicado: (2024)
DMAGaze: Gaze Estimation Based on Feature Disentanglement and Multi-Scale Attention
por: Chen, Haohan, et al.
Publicado: (2025)
por: Chen, Haohan, et al.
Publicado: (2025)
Feature Learning with Multi-Stage Vision Transformers on Inter-Modality HER2 Status Scoring and Tumor Classification on Whole Slides
por: Oyelade, Olaide N., et al.
Publicado: (2025)
por: Oyelade, Olaide N., et al.
Publicado: (2025)
HMGIE: Hierarchical and Multi-Grained Inconsistency Evaluation for Vision-Language Data Cleansing
por: Zhu, Zihao, et al.
Publicado: (2024)
por: Zhu, Zihao, et al.
Publicado: (2024)
An Innovative Framework for Breast Cancer Detection Using Pyramid Adaptive Atrous Convolution, Transformer Integration, and Multi-Scale Feature Fusion
por: Pour, Ehsan Sadeghi, et al.
Publicado: (2026)
por: Pour, Ehsan Sadeghi, et al.
Publicado: (2026)
Edu-MMBias: A Three-Tier Multimodal Benchmark for Auditing Social Bias in Vision-Language Models under Educational Contexts
por: Li, Ruijia, et al.
Publicado: (2026)
por: Li, Ruijia, et al.
Publicado: (2026)
Contrastive Representation Distillation via Multi-Scale Feature Decoupling
por: Wang, Cuipeng, et al.
Publicado: (2025)
por: Wang, Cuipeng, et al.
Publicado: (2025)
Surformer v1: Transformer-Based Surface Classification Using Tactile and Vision Features
por: Kansana, Manish, et al.
Publicado: (2025)
por: Kansana, Manish, et al.
Publicado: (2025)
Proximal Vision Transformer: Enhancing Feature Representation through Two-Stage Manifold Geometry
por: Yun, Haoyu, et al.
Publicado: (2025)
por: Yun, Haoyu, et al.
Publicado: (2025)
Feature Identification for Hierarchical Contrastive Learning
por: Ott, Julius, et al.
Publicado: (2025)
por: Ott, Julius, et al.
Publicado: (2025)
FasterViT: Fast Vision Transformers with Hierarchical Attention
por: Hatamizadeh, Ali, et al.
Publicado: (2023)
por: Hatamizadeh, Ali, et al.
Publicado: (2023)
Local-Global Attention: An Adaptive Mechanism for Multi-Scale Feature Integration
por: Shao, Yifan
Publicado: (2024)
por: Shao, Yifan
Publicado: (2024)
DST-Net: A Dual-Stream Transformer with Illumination-Independent Feature Guidance and Multi-Scale Spatial Convolution for Low-Light Image Enhancement
por: Shi, Yicui, et al.
Publicado: (2026)
por: Shi, Yicui, et al.
Publicado: (2026)
MGHFT: Multi-Granularity Hierarchical Fusion Transformer for Cross-Modal Sticker Emotion Recognition
por: Chen, Jian, et al.
Publicado: (2025)
por: Chen, Jian, et al.
Publicado: (2025)
NESTOR: A Nested MOE-based Neural Operator for Large-Scale PDE Pre-Training
por: Sun, Dengdi, et al.
Publicado: (2026)
por: Sun, Dengdi, et al.
Publicado: (2026)
Multi-Scale Temporal Difference Transformer for Video-Text Retrieval
por: Wang, Ni, et al.
Publicado: (2024)
por: Wang, Ni, et al.
Publicado: (2024)
MuST: Multi-Scale Transformers for Surgical Phase Recognition
por: Pérez, Alejandra, et al.
Publicado: (2024)
por: Pérez, Alejandra, et al.
Publicado: (2024)
MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval
por: Zhu, Fengbin, et al.
Publicado: (2026)
por: Zhu, Fengbin, et al.
Publicado: (2026)
Trusted Unified Feature-Neighborhood Dynamics for Multi-View Classification
por: Huang, Haojian, et al.
Publicado: (2024)
por: Huang, Haojian, et al.
Publicado: (2024)
AHPA: Adaptive Hierarchical Prior Alignment for Diffusion Transformers
por: Min, Ruibin, et al.
Publicado: (2026)
por: Min, Ruibin, et al.
Publicado: (2026)
GFE-Mamba: Mamba-based AD Multi-modal Progression Assessment via Generative Feature Extraction from MCI
por: Fang, Zhaojie, et al.
Publicado: (2024)
por: Fang, Zhaojie, et al.
Publicado: (2024)
From Histopathology Images to Cell Clouds: Learning Slide Representations with Hierarchical Cell Transformer
por: Yang, Zijiang, et al.
Publicado: (2024)
por: Yang, Zijiang, et al.
Publicado: (2024)
ScaleKD: Strong Vision Transformers Could Be Excellent Teachers
por: Fan, Jiawei, et al.
Publicado: (2024)
por: Fan, Jiawei, et al.
Publicado: (2024)
Image Forgery Localization via Guided Noise and Multi-Scale Feature Aggregation
por: Niu, Yakun, et al.
Publicado: (2024)
por: Niu, Yakun, et al.
Publicado: (2024)
The Progression of Transformers from Language to Vision to MOT: A Literature Review on Multi-Object Tracking with Transformers
por: Kamboj, Abhi
Publicado: (2024)
por: Kamboj, Abhi
Publicado: (2024)
HAMLET-FFD: Hierarchical Adaptive Multi-modal Learning Embeddings Transformation for Face Forgery Detection
por: Cui, Jialei, et al.
Publicado: (2025)
por: Cui, Jialei, et al.
Publicado: (2025)
Ejemplares similares
-
HSVLT: Hierarchical Scale-Aware Vision-Language Transformer for Multi-Label Image Classification
por: Ouyang, Shuyi, et al.
Publicado: (2024) -
Vision Bridge Transformer at Scale
por: Tan, Zhenxiong, et al.
Publicado: (2025) -
Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation
por: Yue, Junrong, et al.
Publicado: (2025) -
CTA-Net: A CNN-Transformer Aggregation Network for Improving Multi-Scale Feature Extraction
por: Meng, Chunlei, et al.
Publicado: (2024) -
Masked Generative Nested Transformers with Decode Time Scaling
por: Goyal, Sahil, et al.
Publicado: (2025)