Guardado en:
| Autores principales: | Lu, Qiang, Xiu, Waikit, Li, Xiying, Hu, Shenyu, Sun, Shengbo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2507.23331 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Traffic-MLLM: Curiosity-Regularized Supervised Learning for Traffic Scenario Case-Based Reasoning
por: Xiu, Waikit, et al.
Publicado: (2025)
por: Xiu, Waikit, et al.
Publicado: (2025)
Beyond Pixels: Introducing Geometric-Semantic World Priors for Video-based Embodied Models via Spatio-temporal Alignment
por: Tang, Jinzhou, et al.
Publicado: (2025)
por: Tang, Jinzhou, et al.
Publicado: (2025)
LASAR: Towards Spatio-temporal Reasoning with Latent Cognitive Map
por: Tang, Jinzhou, et al.
Publicado: (2026)
por: Tang, Jinzhou, et al.
Publicado: (2026)
SignVTCL: Multi-Modal Continuous Sign Language Recognition Enhanced by Visual-Textual Contrastive Learning
por: Chen, Hao, et al.
Publicado: (2024)
por: Chen, Hao, et al.
Publicado: (2024)
Vision-Driven 2D Supervised Fine-Tuning Framework for Bird's Eye View Perception
por: He, Lei, et al.
Publicado: (2024)
por: He, Lei, et al.
Publicado: (2024)
AWM-Fuse: Multi-Modality Image Fusion for Adverse Weather via Global and Local Text Perception
por: Li, Xilai, et al.
Publicado: (2025)
por: Li, Xilai, et al.
Publicado: (2025)
SignBind-LLM: Multi-Stage Modality Fusion for Sign Language Translation
por: Thomas, Marshall, et al.
Publicado: (2025)
por: Thomas, Marshall, et al.
Publicado: (2025)
Cross-Modal Consistency Learning for Sign Language Recognition
por: Wu, Kepeng, et al.
Publicado: (2025)
por: Wu, Kepeng, et al.
Publicado: (2025)
LuSeg: Efficient Negative and Positive Obstacles Segmentation via Contrast-Driven Multi-Modal Feature Fusion on the Lunar
por: Jiao, Shuaifeng, et al.
Publicado: (2025)
por: Jiao, Shuaifeng, et al.
Publicado: (2025)
DIFF-MF: A Difference-Driven Channel-Spatial State Space Model for Multi-Modal Image Fusion
por: Sun, Yiming, et al.
Publicado: (2026)
por: Sun, Yiming, et al.
Publicado: (2026)
SparseFusion: Efficient Sparse Multi-Modal Fusion Framework for Long-Range 3D Perception
por: Li, Yiheng, et al.
Publicado: (2024)
por: Li, Yiheng, et al.
Publicado: (2024)
Generative Sign-description Prompts with Multi-positive Contrastive Learning for Sign Language Recognition
por: Liang, Siyu, et al.
Publicado: (2025)
por: Liang, Siyu, et al.
Publicado: (2025)
Bridging Text and Vision: A Multi-View Text-Vision Registration Approach for Cross-Modal Place Recognition
por: Shang, Tianyi, et al.
Publicado: (2025)
por: Shang, Tianyi, et al.
Publicado: (2025)
Spatial-Frequency Enhanced Mamba for Multi-Modal Image Fusion
por: Sun, Hui, et al.
Publicado: (2025)
por: Sun, Hui, et al.
Publicado: (2025)
Revolutionizing Traffic Sign Recognition: Unveiling the Potential of Vision Transformers
por: Mingwin, Susano, et al.
Publicado: (2024)
por: Mingwin, Susano, et al.
Publicado: (2024)
Hierarchical and Decoupled BEV Perception Learning Framework for Autonomous Driving
por: Dai, Yuqi, et al.
Publicado: (2024)
por: Dai, Yuqi, et al.
Publicado: (2024)
Cocoon: Robust Multi-Modal Perception with Uncertainty-Aware Sensor Fusion
por: Cho, Minkyoung, et al.
Publicado: (2024)
por: Cho, Minkyoung, et al.
Publicado: (2024)
SignMouth: Leveraging Mouthing Cues for Sign Language Translation by Multimodal Contrastive Fusion
por: Wu, Wenfang, et al.
Publicado: (2025)
por: Wu, Wenfang, et al.
Publicado: (2025)
Deep Learning-Based Multi-Modal Fusion for Robust Robot Perception and Navigation
por: Lai, Delun, et al.
Publicado: (2025)
por: Lai, Delun, et al.
Publicado: (2025)
Interactive Spatial-Frequency Fusion Mamba for Multi-Modal Image Fusion
por: Zhu, Yixin, et al.
Publicado: (2026)
por: Zhu, Yixin, et al.
Publicado: (2026)
FusionFM: All-in-One Multi-Modal Image Fusion with Flow Matching
por: Zhu, Huayi, et al.
Publicado: (2025)
por: Zhu, Huayi, et al.
Publicado: (2025)
Text-Guided Channel Perturbation and Pretrained Knowledge Integration for Unified Multi-Modality Image Fusion
por: Li, Xilai, et al.
Publicado: (2025)
por: Li, Xilai, et al.
Publicado: (2025)
InterFusion: Text-Driven Generation of 3D Human-Object Interaction
por: Dai, Sisi, et al.
Publicado: (2024)
por: Dai, Sisi, et al.
Publicado: (2024)
Exploring a Unified Vision-Centric Contrastive Alternatives on Multi-Modal Web Documents
por: Lin, Yiqi, et al.
Publicado: (2025)
por: Lin, Yiqi, et al.
Publicado: (2025)
Learning Contrastive Multimodal Fusion with Improved Modality Dropout for Disease Detection and Prediction
por: Gu, Yi, et al.
Publicado: (2025)
por: Gu, Yi, et al.
Publicado: (2025)
Cross-Modal Prototype Allocation: Unsupervised Slide Representation Learning via Patch-Text Contrast in Computational Pathology
por: Chen, Yuxuan, et al.
Publicado: (2025)
por: Chen, Yuxuan, et al.
Publicado: (2025)
Ordinal Scale Traffic Congestion Classification with Multi-Modal Vision-Language and Motion Analysis
por: Lin, Yu-Hsuan
Publicado: (2025)
por: Lin, Yu-Hsuan
Publicado: (2025)
FusionSAM: Visual Multi-Modal Learning with Segment Anything
por: Li, Daixun, et al.
Publicado: (2024)
por: Li, Daixun, et al.
Publicado: (2024)
$β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment
por: Zohra, Fatimah, et al.
Publicado: (2025)
por: Zohra, Fatimah, et al.
Publicado: (2025)
EMDFNet: Efficient Multi-scale and Diverse Feature Network for Traffic Sign Detection
por: Li, Pengyu, et al.
Publicado: (2024)
por: Li, Pengyu, et al.
Publicado: (2024)
Text-Driven Diffusion Model for Sign Language Production
por: He, Jiayi, et al.
Publicado: (2025)
por: He, Jiayi, et al.
Publicado: (2025)
Multi-granular body modeling with Redundancy-Free Spatiotemporal Fusion for Text-Driven Motion Generation
por: Zhan, Xingzu, et al.
Publicado: (2025)
por: Zhan, Xingzu, et al.
Publicado: (2025)
Contrast-X: A Multi-Modal Contrast Image Synthesis Benchmark and Universal Modality Flow Matching
por: Chen, Yifan, et al.
Publicado: (2026)
por: Chen, Yifan, et al.
Publicado: (2026)
Multi-View Fusion Neural Network for Traffic Demand Prediction
por: Zhang, Dongran, et al.
Publicado: (2024)
por: Zhang, Dongran, et al.
Publicado: (2024)
UTA-Sign: Unsupervised Thermal Video Augmentation via Event-Assisted Traffic Signage Sketching
por: Han, Yuqi, et al.
Publicado: (2025)
por: Han, Yuqi, et al.
Publicado: (2025)
MGHFT: Multi-Granularity Hierarchical Fusion Transformer for Cross-Modal Sticker Emotion Recognition
por: Chen, Jian, et al.
Publicado: (2025)
por: Chen, Jian, et al.
Publicado: (2025)
CalFuse: Multi-Modal Continual Learning via Feature Calibration and Parameter Fusion
por: Guo, Juncen, et al.
Publicado: (2025)
por: Guo, Juncen, et al.
Publicado: (2025)
MaxFusion: Plug&Play Multi-Modal Generation in Text-to-Image Diffusion Models
por: Nair, Nithin Gopalakrishnan, et al.
Publicado: (2024)
por: Nair, Nithin Gopalakrishnan, et al.
Publicado: (2024)
Invisible Reflections: Leveraging Infrared Laser Reflections to Target Traffic Sign Perception
por: Sato, Takami, et al.
Publicado: (2024)
por: Sato, Takami, et al.
Publicado: (2024)
MDDFNet: Mamba-based Dynamic Dual Fusion Network for Traffic Sign Detection
por: Yu, TianYi
Publicado: (2025)
por: Yu, TianYi
Publicado: (2025)
Ejemplares similares
-
Traffic-MLLM: Curiosity-Regularized Supervised Learning for Traffic Scenario Case-Based Reasoning
por: Xiu, Waikit, et al.
Publicado: (2025) -
Beyond Pixels: Introducing Geometric-Semantic World Priors for Video-based Embodied Models via Spatio-temporal Alignment
por: Tang, Jinzhou, et al.
Publicado: (2025) -
LASAR: Towards Spatio-temporal Reasoning with Latent Cognitive Map
por: Tang, Jinzhou, et al.
Publicado: (2026) -
SignVTCL: Multi-Modal Continuous Sign Language Recognition Enhanced by Visual-Textual Contrastive Learning
por: Chen, Hao, et al.
Publicado: (2024) -
Vision-Driven 2D Supervised Fine-Tuning Framework for Bird's Eye View Perception
por: He, Lei, et al.
Publicado: (2024)