CMFN: Cross-Modal Fusion Network for Irregular Scene Text Recognition
Fuente:
arXiv
Guardado en:
| Autores principales: | Zheng, Jinzhi, Ji, Ruyi, Zhang, Libo, Wu, Yanjun, Zhao, Chen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Text Region Multiple Information Perception Network for Scene Text Detection
por: Zheng, Jinzhi, et al.
Publicado: (2024)
por: Zheng, Jinzhi, et al.
Publicado: (2024)
BPDO:Boundary Points Dynamic Optimization for Arbitrary Shape Scene Text Detection
por: Zheng, Jinzhi, et al.
Publicado: (2024)
por: Zheng, Jinzhi, et al.
Publicado: (2024)
Decoder Pre-Training with only Text for Scene Text Recognition
por: Zhao, Shuai, et al.
Publicado: (2024)
por: Zhao, Shuai, et al.
Publicado: (2024)
TEACH: Text Encoding as Curriculum Hints for Scene Text Recognition
por: Yang, Xiahan, et al.
Publicado: (2025)
por: Yang, Xiahan, et al.
Publicado: (2025)
Recognition-Synergistic Scene Text Editing
por: Fang, Zhengyao, et al.
Publicado: (2025)
por: Fang, Zhengyao, et al.
Publicado: (2025)
Instruction-Guided Scene Text Recognition
por: Du, Yongkun, et al.
Publicado: (2024)
por: Du, Yongkun, et al.
Publicado: (2024)
Relational Contrastive Learning and Masked Image Modeling for Scene Text Recognition
por: Lin, Tiancheng, et al.
Publicado: (2024)
por: Lin, Tiancheng, et al.
Publicado: (2024)
A Semantic-Aware and Multi-Guided Network for Infrared-Visible Image Fusion
por: Zhang, Xiaoli, et al.
Publicado: (2024)
por: Zhang, Xiaoli, et al.
Publicado: (2024)
TextSSR: Diffusion-based Data Synthesis for Scene Text Recognition
por: Ye, Xingsong, et al.
Publicado: (2024)
por: Ye, Xingsong, et al.
Publicado: (2024)
Linguistics-aware Masked Image Modeling for Self-supervised Scene Text Recognition
por: Zhang, Yifei, et al.
Publicado: (2025)
por: Zhang, Yifei, et al.
Publicado: (2025)
MDiff4STR: Mask Diffusion Model for Scene Text Recognition
por: Du, Yongkun, et al.
Publicado: (2025)
por: Du, Yongkun, et al.
Publicado: (2025)
IPAD: Iterative, Parallel, and Diffusion-based Network for Scene Text Recognition
por: Yang, Xiaomeng, et al.
Publicado: (2023)
por: Yang, Xiaomeng, et al.
Publicado: (2023)
Integrating MedCLIP and Cross-Modal Fusion for Automatic Radiology Report Generation
por: Han, Qianhao, et al.
Publicado: (2024)
por: Han, Qianhao, et al.
Publicado: (2024)
Explicit Relational Reasoning Network for Scene Text Detection
por: Su, Yuchen, et al.
Publicado: (2024)
por: Su, Yuchen, et al.
Publicado: (2024)
Aggregated Text Transformer for Scene Text Detection
por: Zhou, Zhao, et al.
Publicado: (2022)
por: Zhou, Zhao, et al.
Publicado: (2022)
A Pseudo Global Fusion Paradigm-Based Cross-View Network for LiDAR-Based Place Recognition
por: Cheng, Jintao, et al.
Publicado: (2025)
por: Cheng, Jintao, et al.
Publicado: (2025)
Masked Next-Scale Prediction for Self-supervised Scene Text Recognition
por: Chen, Zhuohao, et al.
Publicado: (2026)
por: Chen, Zhuohao, et al.
Publicado: (2026)
Cross-Modal Consistency Learning for Sign Language Recognition
por: Wu, Kepeng, et al.
Publicado: (2025)
por: Wu, Kepeng, et al.
Publicado: (2025)
Fine-Grained Scene Image Classification with Modality-Agnostic Adapter
por: Wang, Yiqun, et al.
Publicado: (2024)
por: Wang, Yiqun, et al.
Publicado: (2024)
G3PT: Unleash the power of Autoregressive Modeling in 3D Generation via Cross-scale Querying Transformer
por: Zhang, Jinzhi, et al.
Publicado: (2024)
por: Zhang, Jinzhi, et al.
Publicado: (2024)
CrossOver: 3D Scene Cross-Modal Alignment
por: Sarkar, Sayan Deb, et al.
Publicado: (2025)
por: Sarkar, Sayan Deb, et al.
Publicado: (2025)
Cross-Modal Scene Semantic Alignment for Image Complexity Assessment
por: Luo, Yuqing, et al.
Publicado: (2025)
por: Luo, Yuqing, et al.
Publicado: (2025)
SVIPTR: Fast and Efficient Scene Text Recognition with Vision Permutable Extractor
por: Cheng, Xianfu, et al.
Publicado: (2024)
por: Cheng, Xianfu, et al.
Publicado: (2024)
Bridging Text and Vision: A Multi-View Text-Vision Registration Approach for Cross-Modal Place Recognition
por: Shang, Tianyi, et al.
Publicado: (2025)
por: Shang, Tianyi, et al.
Publicado: (2025)
CPCL: Cross-Modal Prototypical Contrastive Learning for Weakly Supervised Text-based Person Retrieval
por: Zhao, Xinpeng, et al.
Publicado: (2024)
por: Zhao, Xinpeng, et al.
Publicado: (2024)
MGHFT: Multi-Granularity Hierarchical Fusion Transformer for Cross-Modal Sticker Emotion Recognition
por: Chen, Jian, et al.
Publicado: (2025)
por: Chen, Jian, et al.
Publicado: (2025)
CBNet: A Plug-and-Play Network for Segmentation-Based Scene Text Detection
por: Zhao, Xi, et al.
Publicado: (2022)
por: Zhao, Xi, et al.
Publicado: (2022)
TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval
por: Zhao, Zixu, et al.
Publicado: (2025)
por: Zhao, Zixu, et al.
Publicado: (2025)
Weakly Supervised Cross-Modal Learning for 4D Radar Scene Flow Estimation
por: Fu, Jingyun, et al.
Publicado: (2026)
por: Fu, Jingyun, et al.
Publicado: (2026)
Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency
por: Guo, Xiangyu, et al.
Publicado: (2025)
por: Guo, Xiangyu, et al.
Publicado: (2025)
ECMF: Enhanced Cross-Modal Fusion for Multimodal Emotion Recognition in MER-SEMI Challenge
por: Hu, Juewen, et al.
Publicado: (2025)
por: Hu, Juewen, et al.
Publicado: (2025)
Equivariant Multi-Modality Image Fusion
por: Zhao, Zixiang, et al.
Publicado: (2023)
por: Zhao, Zixiang, et al.
Publicado: (2023)
Part-Whole Relational Fusion Towards Multi-Modal Scene Understanding
por: Liu, Yi, et al.
Publicado: (2024)
por: Liu, Yi, et al.
Publicado: (2024)
Reading in the Dark: Low-light Scene Text Recognition
por: Fu, Xuanshuo, et al.
Publicado: (2026)
por: Fu, Xuanshuo, et al.
Publicado: (2026)
Efficient and Accurate Scene Text Recognition with Cascaded-Transformers
por: Ozkan, Savas, et al.
Publicado: (2025)
por: Ozkan, Savas, et al.
Publicado: (2025)
Cross-Modal Geometric Hierarchy Fusion: An Implicit-Submap Driven Framework for Resilient 3D Place Recognition
por: Jiang, Xiaohui, et al.
Publicado: (2025)
por: Jiang, Xiaohui, et al.
Publicado: (2025)
Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation
por: Qi, Zheng, et al.
Publicado: (2025)
por: Qi, Zheng, et al.
Publicado: (2025)
SKANet: A Cognitive Dual-Stream Framework with Adaptive Modality Fusion for Robust Compound GNSS Interference Classification
por: Zeng, Zhihan, et al.
Publicado: (2026)
por: Zeng, Zhihan, et al.
Publicado: (2026)
Boosting Semi-Supervised Scene Text Recognition via Viewing and Summarizing
por: Qu, Yadong, et al.
Publicado: (2024)
por: Qu, Yadong, et al.
Publicado: (2024)
Focus on the Whole Character: Discriminative Character Modeling for Scene Text Recognition
por: Zhou, Bangbang, et al.
Publicado: (2024)
por: Zhou, Bangbang, et al.
Publicado: (2024)
Ejemplares similares
-
Text Region Multiple Information Perception Network for Scene Text Detection
por: Zheng, Jinzhi, et al.
Publicado: (2024) -
BPDO:Boundary Points Dynamic Optimization for Arbitrary Shape Scene Text Detection
por: Zheng, Jinzhi, et al.
Publicado: (2024) -
Decoder Pre-Training with only Text for Scene Text Recognition
por: Zhao, Shuai, et al.
Publicado: (2024) -
TEACH: Text Encoding as Curriculum Hints for Scene Text Recognition
por: Yang, Xiahan, et al.
Publicado: (2025) -
Recognition-Synergistic Scene Text Editing
por: Fang, Zhengyao, et al.
Publicado: (2025)