A Signer-Invariant Conformer and Multi-Scale Fusion Transformer for Continuous Sign Language Recognition
Fuente:
arXiv
Saved in:
| Main Authors: | Haque, Md Rezwanul, Islam, Md. Milon, Raju, S M Taslim Uddin, Karray, Fakhri |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
FusionEnsemble-Net: An Attention-Based Ensemble of Spatiotemporal Networks for Multimodal Sign Language Recognition
by: Islam, Md. Milon, et al.
Published: (2025)
by: Islam, Md. Milon, et al.
Published: (2025)
GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning
by: Raju, S M Taslim Uddin, et al.
Published: (2025)
by: Raju, S M Taslim Uddin, et al.
Published: (2025)
MMFformer: Multimodal Fusion Transformer Network for Depression Detection
by: Haque, Md Rezwanul, et al.
Published: (2025)
by: Haque, Md Rezwanul, et al.
Published: (2025)
MDD-Net: Multimodal Depression Detection through Mutual Transformer
by: Haque, Md Rezwanul, et al.
Published: (2025)
by: Haque, Md Rezwanul, et al.
Published: (2025)
CAST: Channel-Aware Spatial Transfer Learning with Pseudo-Image Radar for Sign Language Recognition
by: Shujon, Md. Shakhoyat Rahman, et al.
Published: (2026)
by: Shujon, Md. Shakhoyat Rahman, et al.
Published: (2026)
CNN-Based Framework for Pedestrian Age and Gender Classification Using Far-View Surveillance in Mixed-Traffic Intersections
by: Arif, Shisir Shahriar, et al.
Published: (2025)
by: Arif, Shisir Shahriar, et al.
Published: (2025)
iRAG: Advancing RAG for Videos with an Incremental Approach
by: Arefeen, Md Adnan, et al.
Published: (2024)
by: Arefeen, Md Adnan, et al.
Published: (2024)
Bridging Brain with Foundation Models through Self-Supervised Learning
by: Altaheri, Hamdi, et al.
Published: (2025)
by: Altaheri, Hamdi, et al.
Published: (2025)
CBM-RAG: Demonstrating Enhanced Interpretability in Radiology Report Generation with Multi-Agent RAG and Concept Bottleneck Models
by: Alam, Hasan Md Tusfiqur, et al.
Published: (2025)
by: Alam, Hasan Md Tusfiqur, et al.
Published: (2025)
Large Language Models Meet Extreme Multi-label Classification: Scaling and Multi-modal Framework
by: Ortego, Diego, et al.
Published: (2025)
by: Ortego, Diego, et al.
Published: (2025)
Improving Continuous Sign Language Recognition with Consistency Constraints and Signer Removal
by: Zuo, Ronglai, et al.
Published: (2022)
by: Zuo, Ronglai, et al.
Published: (2022)
Self-distilled Dynamic Fusion Network for Language-based Fashion Retrieval
by: Wu, Yiming, et al.
Published: (2024)
by: Wu, Yiming, et al.
Published: (2024)
SignRAG: A Retrieval-Augmented System for Scalable Zero-Shot Road Sign Recognition
by: Zhu, Minghao, et al.
Published: (2025)
by: Zhu, Minghao, et al.
Published: (2025)
MMMORRF: Multimodal Multilingual Modularized Reciprocal Rank Fusion
by: Samuel, Saron, et al.
Published: (2025)
by: Samuel, Saron, et al.
Published: (2025)
FilterLLM: Text-To-Distribution LLM for Billion-Scale Cold-Start Recommendation
by: Liu, Ruochen, et al.
Published: (2025)
by: Liu, Ruochen, et al.
Published: (2025)
CoTMR: Chain-of-Thought Multi-Scale Reasoning for Training-Free Zero-Shot Composed Image Retrieval
by: Sun, Zelong, et al.
Published: (2025)
by: Sun, Zelong, et al.
Published: (2025)
Music Recommendation Based on Facial Emotion Recognition
by: B, Rajesh, et al.
Published: (2024)
by: B, Rajesh, et al.
Published: (2024)
LLM-Enhanced Multimodal Fusion for Cross-Domain Sequential Recommendation
by: Wu, Wangyu, et al.
Published: (2025)
by: Wu, Wangyu, et al.
Published: (2025)
Any2Any: Incomplete Multimodal Retrieval with Conformal Prediction
by: Li, Po-han, et al.
Published: (2024)
by: Li, Po-han, et al.
Published: (2024)
E-Commerce Product Recommendation System based on ML Algorithms
by: Haque, Md. Zahurul
Published: (2024)
by: Haque, Md. Zahurul
Published: (2024)
Large Language Model Simulator for Cold-Start Recommendation
by: Huang, Feiran, et al.
Published: (2024)
by: Huang, Feiran, et al.
Published: (2024)
Rethinking Sparse Lexical Representations for Image Retrieval in the Age of Rising Multi-Modal Large Language Models
by: Nakata, Kengo, et al.
Published: (2024)
by: Nakata, Kengo, et al.
Published: (2024)
Rethinking Detection Based Table Structure Recognition for Visually Rich Document Images
by: Xiao, Bin, et al.
Published: (2023)
by: Xiao, Bin, et al.
Published: (2023)
Advancing Re-Ranking with Multimodal Fusion and Target-Oriented Auxiliary Tasks in E-Commerce Search
by: Xu, Enqiang, et al.
Published: (2024)
by: Xu, Enqiang, et al.
Published: (2024)
Embracing Language Inclusivity and Diversity in CLIP through Continual Language Learning
by: Yang, Bang, et al.
Published: (2024)
by: Yang, Bang, et al.
Published: (2024)
A Collaborative Jade Recognition System for Mobile Devices Based on Lightweight and Large Models
by: Wang, Zhenyu, et al.
Published: (2025)
by: Wang, Zhenyu, et al.
Published: (2025)
ADaFuSE: Adaptive Diffusion-generated Image and Text Fusion for Interactive Text-to-Image Retrieval
by: Zhang, Zhuocheng, et al.
Published: (2026)
by: Zhang, Zhuocheng, et al.
Published: (2026)
Multi-Label Plant Species Prediction with Metadata-Enhanced Multi-Head Vision Transformers
by: Herasimchyk, Hanna, et al.
Published: (2025)
by: Herasimchyk, Hanna, et al.
Published: (2025)
Towards Interpretable Radiology Report Generation via Concept Bottlenecks using a Multi-Agentic RAG
by: Alam, Hasan Md Tusfiqur, et al.
Published: (2024)
by: Alam, Hasan Md Tusfiqur, et al.
Published: (2024)
Open-SAT: LLM-Guided Query Embedding Refinement for Open-Vocabulary Object Retrieval in Satellite Imagery
by: Arefeen, Md Adnan, et al.
Published: (2026)
by: Arefeen, Md Adnan, et al.
Published: (2026)
InvDiff: Invariant Guidance for Bias Mitigation in Diffusion Models
by: Hou, Min, et al.
Published: (2024)
by: Hou, Min, et al.
Published: (2024)
DeepScribe: Localization and Classification of Elamite Cuneiform Signs Via Deep Learning
by: Williams, Edward C., et al.
Published: (2023)
by: Williams, Edward C., et al.
Published: (2023)
Automating Iconclass: LLMs and RAG for Large-Scale Classification of Religious Woodcuts
by: Thomas, Drew B.
Published: (2025)
by: Thomas, Drew B.
Published: (2025)
Multi-Label Plant Species Classification with Self-Supervised Vision Transformers
by: Gustineli, Murilo, et al.
Published: (2024)
by: Gustineli, Murilo, et al.
Published: (2024)
ChordFormer: A Conformer-Based Architecture for Large-Vocabulary Audio Chord Recognition
by: Akram, Muhammad Waseem, et al.
Published: (2025)
by: Akram, Muhammad Waseem, et al.
Published: (2025)
MTMD: A Multi-Task Multi-Domain Framework for Unified Ad Lightweight Ranking at Pinterest
by: Yang, Xiao, et al.
Published: (2025)
by: Yang, Xiao, et al.
Published: (2025)
Dynamic Multimodal Fusion via Meta-Learning Towards Micro-Video Recommendation
by: Liu, Han, et al.
Published: (2025)
by: Liu, Han, et al.
Published: (2025)
Fetch-A-Set: A Large-Scale OCR-Free Benchmark for Historical Document Retrieval
by: Molina, Adrià, et al.
Published: (2024)
by: Molina, Adrià, et al.
Published: (2024)
EvdCLIP: Improving Vision-Language Retrieval with Entity Visual Descriptions from Large Language Models
by: Meng, GuangHao, et al.
Published: (2025)
by: Meng, GuangHao, et al.
Published: (2025)
X-Reflect: Cross-Reflection Prompting for Multimodal Recommendation
by: Lyu, Hanjia, et al.
Published: (2024)
by: Lyu, Hanjia, et al.
Published: (2024)
Similar Items
-
FusionEnsemble-Net: An Attention-Based Ensemble of Spatiotemporal Networks for Multimodal Sign Language Recognition
by: Islam, Md. Milon, et al.
Published: (2025) -
GNN-ViTCap: GNN-Enhanced Multiple Instance Learning with Vision Transformers for Whole Slide Image Classification and Captioning
by: Raju, S M Taslim Uddin, et al.
Published: (2025) -
MMFformer: Multimodal Fusion Transformer Network for Depression Detection
by: Haque, Md Rezwanul, et al.
Published: (2025) -
MDD-Net: Multimodal Depression Detection through Mutual Transformer
by: Haque, Md Rezwanul, et al.
Published: (2025) -
CAST: Channel-Aware Spatial Transfer Learning with Pseudo-Image Radar for Sign Language Recognition
by: Shujon, Md. Shakhoyat Rahman, et al.
Published: (2026)