Enregistré dans:
| Auteurs principaux: | Liu, Yuang, Qiu, Zhiheng, Qin, Xiaokai |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2404.13434 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HSVLT: Hierarchical Scale-Aware Vision-Language Transformer for Multi-Label Image Classification
par: Ouyang, Shuyi, et autres
Publié: (2024)
par: Ouyang, Shuyi, et autres
Publié: (2024)
Vision Bridge Transformer at Scale
par: Tan, Zhenxiong, et autres
Publié: (2025)
par: Tan, Zhenxiong, et autres
Publié: (2025)
Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation
par: Yue, Junrong, et autres
Publié: (2025)
par: Yue, Junrong, et autres
Publié: (2025)
Masked Generative Nested Transformers with Decode Time Scaling
par: Goyal, Sahil, et autres
Publié: (2025)
par: Goyal, Sahil, et autres
Publié: (2025)
CTA-Net: A CNN-Transformer Aggregation Network for Improving Multi-Scale Feature Extraction
par: Meng, Chunlei, et autres
Publié: (2024)
par: Meng, Chunlei, et autres
Publié: (2024)
Tighnari: Multi-modal Plant Species Prediction Based on Hierarchical Cross-Attention Using Graph-Based and Vision Backbone-Extracted Features
par: Liu, Haixu, et autres
Publié: (2025)
par: Liu, Haixu, et autres
Publié: (2025)
CornViT: A Multi-Stage Convolutional Vision Transformer Framework for Hierarchical Corn Kernel Analysis
par: Erukude, Sai Teja, et autres
Publié: (2025)
par: Erukude, Sai Teja, et autres
Publié: (2025)
Accelerating Vision Transformers on Brain Processing Unit
par: Tang, Jinchi, et autres
Publié: (2026)
par: Tang, Jinchi, et autres
Publié: (2026)
N2F2: Hierarchical Scene Understanding with Nested Neural Feature Fields
par: Bhalgat, Yash, et autres
Publié: (2024)
par: Bhalgat, Yash, et autres
Publié: (2024)
Hierarchical Vision Transformer Enhanced by Graph Convolutional Network for Image Classification
par: Jiao, Haibin
Publié: (2026)
par: Jiao, Haibin
Publié: (2026)
Hierarchical Multi-modal Transformer for Cross-modal Long Document Classification
par: Liu, Tengfei, et autres
Publié: (2024)
par: Liu, Tengfei, et autres
Publié: (2024)
Enhancing Feature Diversity Boosts Channel-Adaptive Vision Transformers
par: Pham, Chau, et autres
Publié: (2024)
par: Pham, Chau, et autres
Publié: (2024)
CAViT -- Channel-Aware Vision Transformer for Dynamic Feature Fusion
par: Safdar, Aon, et autres
Publié: (2026)
par: Safdar, Aon, et autres
Publié: (2026)
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders
par: Lee, Dohun, et autres
Publié: (2025)
par: Lee, Dohun, et autres
Publié: (2025)
Multi-Scale Correlation-Aware Transformer for Maritime Vessel Re-Identification
par: Liu, Yunhe
Publié: (2025)
par: Liu, Yunhe
Publié: (2025)
Edu-MMBias: A Three-Tier Multimodal Benchmark for Auditing Social Bias in Vision-Language Models under Educational Contexts
par: Li, Ruijia, et autres
Publié: (2026)
par: Li, Ruijia, et autres
Publié: (2026)
DMAGaze: Gaze Estimation Based on Feature Disentanglement and Multi-Scale Attention
par: Chen, Haohan, et autres
Publié: (2025)
par: Chen, Haohan, et autres
Publié: (2025)
Feature Learning with Multi-Stage Vision Transformers on Inter-Modality HER2 Status Scoring and Tumor Classification on Whole Slides
par: Oyelade, Olaide N., et autres
Publié: (2025)
par: Oyelade, Olaide N., et autres
Publié: (2025)
FasterViT: Fast Vision Transformers with Hierarchical Attention
par: Hatamizadeh, Ali, et autres
Publié: (2023)
par: Hatamizadeh, Ali, et autres
Publié: (2023)
HMGIE: Hierarchical and Multi-Grained Inconsistency Evaluation for Vision-Language Data Cleansing
par: Zhu, Zihao, et autres
Publié: (2024)
par: Zhu, Zihao, et autres
Publié: (2024)
An Innovative Framework for Breast Cancer Detection Using Pyramid Adaptive Atrous Convolution, Transformer Integration, and Multi-Scale Feature Fusion
par: Pour, Ehsan Sadeghi, et autres
Publié: (2026)
par: Pour, Ehsan Sadeghi, et autres
Publié: (2026)
Surformer v1: Transformer-Based Surface Classification Using Tactile and Vision Features
par: Kansana, Manish, et autres
Publié: (2025)
par: Kansana, Manish, et autres
Publié: (2025)
Proximal Vision Transformer: Enhancing Feature Representation through Two-Stage Manifold Geometry
par: Yun, Haoyu, et autres
Publié: (2025)
par: Yun, Haoyu, et autres
Publié: (2025)
Contrastive Representation Distillation via Multi-Scale Feature Decoupling
par: Wang, Cuipeng, et autres
Publié: (2025)
par: Wang, Cuipeng, et autres
Publié: (2025)
Feature Identification for Hierarchical Contrastive Learning
par: Ott, Julius, et autres
Publié: (2025)
par: Ott, Julius, et autres
Publié: (2025)
ScaleKD: Strong Vision Transformers Could Be Excellent Teachers
par: Fan, Jiawei, et autres
Publié: (2024)
par: Fan, Jiawei, et autres
Publié: (2024)
Mixture of Nested Experts: Adaptive Processing of Visual Tokens
par: Jain, Gagan, et autres
Publié: (2024)
par: Jain, Gagan, et autres
Publié: (2024)
GFE-Mamba: Mamba-based AD Multi-modal Progression Assessment via Generative Feature Extraction from MCI
par: Fang, Zhaojie, et autres
Publié: (2024)
par: Fang, Zhaojie, et autres
Publié: (2024)
NESTOR: A Nested MOE-based Neural Operator for Large-Scale PDE Pre-Training
par: Sun, Dengdi, et autres
Publié: (2026)
par: Sun, Dengdi, et autres
Publié: (2026)
Trusted Unified Feature-Neighborhood Dynamics for Multi-View Classification
par: Huang, Haojian, et autres
Publié: (2024)
par: Huang, Haojian, et autres
Publié: (2024)
Local-Global Attention: An Adaptive Mechanism for Multi-Scale Feature Integration
par: Shao, Yifan
Publié: (2024)
par: Shao, Yifan
Publié: (2024)
From Histopathology Images to Cell Clouds: Learning Slide Representations with Hierarchical Cell Transformer
par: Yang, Zijiang, et autres
Publié: (2024)
par: Yang, Zijiang, et autres
Publié: (2024)
Mechanisms of Non-Monotonic Scaling in Vision Transformers
par: Kumar, Anantha Padmanaban Krishna
Publié: (2025)
par: Kumar, Anantha Padmanaban Krishna
Publié: (2025)
DST-Net: A Dual-Stream Transformer with Illumination-Independent Feature Guidance and Multi-Scale Spatial Convolution for Low-Light Image Enhancement
par: Shi, Yicui, et autres
Publié: (2026)
par: Shi, Yicui, et autres
Publié: (2026)
MGHFT: Multi-Granularity Hierarchical Fusion Transformer for Cross-Modal Sticker Emotion Recognition
par: Chen, Jian, et autres
Publié: (2025)
par: Chen, Jian, et autres
Publié: (2025)
AHPA: Adaptive Hierarchical Prior Alignment for Diffusion Transformers
par: Min, Ruibin, et autres
Publié: (2026)
par: Min, Ruibin, et autres
Publié: (2026)
MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval
par: Zhu, Fengbin, et autres
Publié: (2026)
par: Zhu, Fengbin, et autres
Publié: (2026)
Multi-Scale Temporal Difference Transformer for Video-Text Retrieval
par: Wang, Ni, et autres
Publié: (2024)
par: Wang, Ni, et autres
Publié: (2024)
MuST: Multi-Scale Transformers for Surgical Phase Recognition
par: Pérez, Alejandra, et autres
Publié: (2024)
par: Pérez, Alejandra, et autres
Publié: (2024)
IFViT: Interpretable Fixed-Length Representation for Fingerprint Matching via Vision Transformer
par: Qiu, Yuhang, et autres
Publié: (2024)
par: Qiu, Yuhang, et autres
Publié: (2024)
Documents similaires
-
HSVLT: Hierarchical Scale-Aware Vision-Language Transformer for Multi-Label Image Classification
par: Ouyang, Shuyi, et autres
Publié: (2024) -
Vision Bridge Transformer at Scale
par: Tan, Zhenxiong, et autres
Publié: (2025) -
Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation
par: Yue, Junrong, et autres
Publié: (2025) -
Masked Generative Nested Transformers with Decode Time Scaling
par: Goyal, Sahil, et autres
Publié: (2025) -
CTA-Net: A CNN-Transformer Aggregation Network for Improving Multi-Scale Feature Extraction
par: Meng, Chunlei, et autres
Publié: (2024)