Hierarchical Multi-modal Transformer for Cross-modal Long Document Classification
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Tengfei, Hu, Yongli, Gao, Junbin, Sun, Yanfeng, Yin, Baocai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Awesome Multi-modal Object Tracking
di: Zhang, Chunhui, et al.
Pubblicazione: (2024)
di: Zhang, Chunhui, et al.
Pubblicazione: (2024)
HAMLET-FFD: Hierarchical Adaptive Multi-modal Learning Embeddings Transformation for Face Forgery Detection
di: Cui, Jialei, et al.
Pubblicazione: (2025)
di: Cui, Jialei, et al.
Pubblicazione: (2025)
Tighnari: Multi-modal Plant Species Prediction Based on Hierarchical Cross-Attention Using Graph-Based and Vision Backbone-Extracted Features
di: Liu, Haixu, et al.
Pubblicazione: (2025)
di: Liu, Haixu, et al.
Pubblicazione: (2025)
EMMA: Empowering Multi-modal Mamba with Structural and Hierarchical Alignment
di: Xing, Yifei, et al.
Pubblicazione: (2024)
di: Xing, Yifei, et al.
Pubblicazione: (2024)
Cross-modality Guidance-aided Multi-modal Learning with Dual Attention for MRI Brain Tumor Grading
di: Xu, Dunyuan, et al.
Pubblicazione: (2024)
di: Xu, Dunyuan, et al.
Pubblicazione: (2024)
e5-omni: Explicit Cross-modal Alignment for Omni-modal Embeddings
di: Chen, Haonan, et al.
Pubblicazione: (2026)
di: Chen, Haonan, et al.
Pubblicazione: (2026)
HC-LLM: Historical-Constrained Large Language Models for Radiology Report Generation
di: Liu, Tengfei, et al.
Pubblicazione: (2024)
di: Liu, Tengfei, et al.
Pubblicazione: (2024)
Multi-modal Deepfake Detection and Localization with FPN-Transformer
di: Zheng, Chende, et al.
Pubblicazione: (2025)
di: Zheng, Chende, et al.
Pubblicazione: (2025)
Multi-modality Anomaly Segmentation on the Road
di: Gao, Heng, et al.
Pubblicazione: (2025)
di: Gao, Heng, et al.
Pubblicazione: (2025)
Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification
di: Wang, Xin, et al.
Pubblicazione: (2024)
di: Wang, Xin, et al.
Pubblicazione: (2024)
TACFN: Transformer-based Adaptive Cross-modal Fusion Network for Multimodal Emotion Recognition
di: Liu, Feng, et al.
Pubblicazione: (2025)
di: Liu, Feng, et al.
Pubblicazione: (2025)
Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation
di: Yue, Junrong, et al.
Pubblicazione: (2025)
di: Yue, Junrong, et al.
Pubblicazione: (2025)
Fusion-Mamba for Cross-modality Object Detection
di: Dong, Wenhao, et al.
Pubblicazione: (2024)
di: Dong, Wenhao, et al.
Pubblicazione: (2024)
Simultaneous Long-tailed Recognition and Multi-modal Fusion for Highly Imbalanced Multi-modal Data
di: Yoon, Heegeon, et al.
Pubblicazione: (2026)
di: Yoon, Heegeon, et al.
Pubblicazione: (2026)
Bridging Modality Gap for Visual Grounding with Effecitve Cross-modal Distillation
di: Wang, Jiaxi, et al.
Pubblicazione: (2023)
di: Wang, Jiaxi, et al.
Pubblicazione: (2023)
Multi-granularity Contrastive Cross-modal Collaborative Generation for End-to-End Long-term Video Question Answering
di: Yu, Ting, et al.
Pubblicazione: (2024)
di: Yu, Ting, et al.
Pubblicazione: (2024)
A Multimodal-Multitask Framework with Cross-modal Relation and Hierarchical Interactive Attention for Semantic Comprehension
di: Rehman, Mohammad Zia Ur, et al.
Pubblicazione: (2025)
di: Rehman, Mohammad Zia Ur, et al.
Pubblicazione: (2025)
LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance
di: Li, Zhang, et al.
Pubblicazione: (2025)
di: Li, Zhang, et al.
Pubblicazione: (2025)
Variational Adapter for Cross-modal Similarity Representation
di: Wei, WenZhang, et al.
Pubblicazione: (2026)
di: Wei, WenZhang, et al.
Pubblicazione: (2026)
Cross-Fundus Transformer for Multi-modal Diabetic Retinopathy Grading with Cataract
di: Xiao, Fan, et al.
Pubblicazione: (2024)
di: Xiao, Fan, et al.
Pubblicazione: (2024)
Cross-domain Few-shot Object Detection with Multi-modal Textual Enrichment
di: Shangguan, Zeyu, et al.
Pubblicazione: (2025)
di: Shangguan, Zeyu, et al.
Pubblicazione: (2025)
Multi-modal Spatio-Temporal Transformer for High-resolution Land Subsidence Prediction
di: Yao, Wendong, et al.
Pubblicazione: (2025)
di: Yao, Wendong, et al.
Pubblicazione: (2025)
Spectral Discrepancy and Cross-modal Semantic Consistency Learning for Object Detection in Hyperspectral Image
di: He, Xiao, et al.
Pubblicazione: (2025)
di: He, Xiao, et al.
Pubblicazione: (2025)
Explainable, Multi-modal Wound Infection Classification from Images Augmented with Generated Captions
di: Busaranuvong, Palawat, et al.
Pubblicazione: (2025)
di: Busaranuvong, Palawat, et al.
Pubblicazione: (2025)
UniEmoX: Cross-modal Semantic-Guided Large-Scale Pretraining for Universal Scene Emotion Perception
di: Chen, Chuang, et al.
Pubblicazione: (2024)
di: Chen, Chuang, et al.
Pubblicazione: (2024)
MCAD: Multi-teacher Cross-modal Alignment Distillation for efficient image-text retrieval
di: Lei, Youbo, et al.
Pubblicazione: (2023)
di: Lei, Youbo, et al.
Pubblicazione: (2023)
ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking
di: Ge, Jiawei, et al.
Pubblicazione: (2026)
di: Ge, Jiawei, et al.
Pubblicazione: (2026)
Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
Benefit from Reference: Retrieval-Augmented Cross-modal Point Cloud Completion
di: Hou, Hongye, et al.
Pubblicazione: (2025)
di: Hou, Hongye, et al.
Pubblicazione: (2025)
ViT-Lens: Towards Omni-modal Representations
di: Lei, Weixian, et al.
Pubblicazione: (2023)
di: Lei, Weixian, et al.
Pubblicazione: (2023)
Diffexplainer: Towards Cross-modal Global Explanations with Diffusion Models
di: Pennisi, Matteo, et al.
Pubblicazione: (2024)
di: Pennisi, Matteo, et al.
Pubblicazione: (2024)
Energy-Latency Manipulation of Multi-modal Large Language Models via Verbose Samples
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
Integrating Text and Image Pre-training for Multi-modal Algorithmic Reasoning
di: Zhang, Zijian, et al.
Pubblicazione: (2024)
di: Zhang, Zijian, et al.
Pubblicazione: (2024)
AnomalyControl: Learning Cross-modal Semantic Features for Controllable Anomaly Synthesis
di: He, Shidan, et al.
Pubblicazione: (2024)
di: He, Shidan, et al.
Pubblicazione: (2024)
Multi-modal Co-learning for Earth Observation: Enhancing single-modality models via modality collaboration
di: Mena, Francisco, et al.
Pubblicazione: (2025)
di: Mena, Francisco, et al.
Pubblicazione: (2025)
VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents
di: Yu, Shi, et al.
Pubblicazione: (2024)
di: Yu, Shi, et al.
Pubblicazione: (2024)
MGHFT: Multi-Granularity Hierarchical Fusion Transformer for Cross-Modal Sticker Emotion Recognition
di: Chen, Jian, et al.
Pubblicazione: (2025)
di: Chen, Jian, et al.
Pubblicazione: (2025)
DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models
di: Zhang, Yudong, et al.
Pubblicazione: (2024)
di: Zhang, Yudong, et al.
Pubblicazione: (2024)
FreeEdit: Mask-free Reference-based Image Editing with Multi-modal Instruction
di: He, Runze, et al.
Pubblicazione: (2024)
di: He, Runze, et al.
Pubblicazione: (2024)
Multi-Modality Distillation via Learning the teacher's modality-level Gram Matrix
di: Liu, Peng
Pubblicazione: (2021)
di: Liu, Peng
Pubblicazione: (2021)
Documenti analoghi
-
Awesome Multi-modal Object Tracking
di: Zhang, Chunhui, et al.
Pubblicazione: (2024) -
HAMLET-FFD: Hierarchical Adaptive Multi-modal Learning Embeddings Transformation for Face Forgery Detection
di: Cui, Jialei, et al.
Pubblicazione: (2025) -
Tighnari: Multi-modal Plant Species Prediction Based on Hierarchical Cross-Attention Using Graph-Based and Vision Backbone-Extracted Features
di: Liu, Haixu, et al.
Pubblicazione: (2025) -
EMMA: Empowering Multi-modal Mamba with Structural and Hierarchical Alignment
di: Xing, Yifei, et al.
Pubblicazione: (2024) -
Cross-modality Guidance-aided Multi-modal Learning with Dual Attention for MRI Brain Tumor Grading
di: Xu, Dunyuan, et al.
Pubblicazione: (2024)