Gespeichert in:
| Hauptverfasser: | Lu, Qiang, Xiu, Waikit, Li, Xiying, Hu, Shenyu, Sun, Shengbo |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2507.23331 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Traffic-MLLM: Curiosity-Regularized Supervised Learning for Traffic Scenario Case-Based Reasoning
von: Xiu, Waikit, et al.
Veröffentlicht: (2025)
von: Xiu, Waikit, et al.
Veröffentlicht: (2025)
Beyond Pixels: Introducing Geometric-Semantic World Priors for Video-based Embodied Models via Spatio-temporal Alignment
von: Tang, Jinzhou, et al.
Veröffentlicht: (2025)
von: Tang, Jinzhou, et al.
Veröffentlicht: (2025)
LASAR: Towards Spatio-temporal Reasoning with Latent Cognitive Map
von: Tang, Jinzhou, et al.
Veröffentlicht: (2026)
von: Tang, Jinzhou, et al.
Veröffentlicht: (2026)
SignVTCL: Multi-Modal Continuous Sign Language Recognition Enhanced by Visual-Textual Contrastive Learning
von: Chen, Hao, et al.
Veröffentlicht: (2024)
von: Chen, Hao, et al.
Veröffentlicht: (2024)
Vision-Driven 2D Supervised Fine-Tuning Framework for Bird's Eye View Perception
von: He, Lei, et al.
Veröffentlicht: (2024)
von: He, Lei, et al.
Veröffentlicht: (2024)
AWM-Fuse: Multi-Modality Image Fusion for Adverse Weather via Global and Local Text Perception
von: Li, Xilai, et al.
Veröffentlicht: (2025)
von: Li, Xilai, et al.
Veröffentlicht: (2025)
SignBind-LLM: Multi-Stage Modality Fusion for Sign Language Translation
von: Thomas, Marshall, et al.
Veröffentlicht: (2025)
von: Thomas, Marshall, et al.
Veröffentlicht: (2025)
Cross-Modal Consistency Learning for Sign Language Recognition
von: Wu, Kepeng, et al.
Veröffentlicht: (2025)
von: Wu, Kepeng, et al.
Veröffentlicht: (2025)
LuSeg: Efficient Negative and Positive Obstacles Segmentation via Contrast-Driven Multi-Modal Feature Fusion on the Lunar
von: Jiao, Shuaifeng, et al.
Veröffentlicht: (2025)
von: Jiao, Shuaifeng, et al.
Veröffentlicht: (2025)
DIFF-MF: A Difference-Driven Channel-Spatial State Space Model for Multi-Modal Image Fusion
von: Sun, Yiming, et al.
Veröffentlicht: (2026)
von: Sun, Yiming, et al.
Veröffentlicht: (2026)
SparseFusion: Efficient Sparse Multi-Modal Fusion Framework for Long-Range 3D Perception
von: Li, Yiheng, et al.
Veröffentlicht: (2024)
von: Li, Yiheng, et al.
Veröffentlicht: (2024)
Generative Sign-description Prompts with Multi-positive Contrastive Learning for Sign Language Recognition
von: Liang, Siyu, et al.
Veröffentlicht: (2025)
von: Liang, Siyu, et al.
Veröffentlicht: (2025)
Bridging Text and Vision: A Multi-View Text-Vision Registration Approach for Cross-Modal Place Recognition
von: Shang, Tianyi, et al.
Veröffentlicht: (2025)
von: Shang, Tianyi, et al.
Veröffentlicht: (2025)
Spatial-Frequency Enhanced Mamba for Multi-Modal Image Fusion
von: Sun, Hui, et al.
Veröffentlicht: (2025)
von: Sun, Hui, et al.
Veröffentlicht: (2025)
Revolutionizing Traffic Sign Recognition: Unveiling the Potential of Vision Transformers
von: Mingwin, Susano, et al.
Veröffentlicht: (2024)
von: Mingwin, Susano, et al.
Veröffentlicht: (2024)
Hierarchical and Decoupled BEV Perception Learning Framework for Autonomous Driving
von: Dai, Yuqi, et al.
Veröffentlicht: (2024)
von: Dai, Yuqi, et al.
Veröffentlicht: (2024)
Cocoon: Robust Multi-Modal Perception with Uncertainty-Aware Sensor Fusion
von: Cho, Minkyoung, et al.
Veröffentlicht: (2024)
von: Cho, Minkyoung, et al.
Veröffentlicht: (2024)
SignMouth: Leveraging Mouthing Cues for Sign Language Translation by Multimodal Contrastive Fusion
von: Wu, Wenfang, et al.
Veröffentlicht: (2025)
von: Wu, Wenfang, et al.
Veröffentlicht: (2025)
Deep Learning-Based Multi-Modal Fusion for Robust Robot Perception and Navigation
von: Lai, Delun, et al.
Veröffentlicht: (2025)
von: Lai, Delun, et al.
Veröffentlicht: (2025)
Interactive Spatial-Frequency Fusion Mamba for Multi-Modal Image Fusion
von: Zhu, Yixin, et al.
Veröffentlicht: (2026)
von: Zhu, Yixin, et al.
Veröffentlicht: (2026)
FusionFM: All-in-One Multi-Modal Image Fusion with Flow Matching
von: Zhu, Huayi, et al.
Veröffentlicht: (2025)
von: Zhu, Huayi, et al.
Veröffentlicht: (2025)
Text-Guided Channel Perturbation and Pretrained Knowledge Integration for Unified Multi-Modality Image Fusion
von: Li, Xilai, et al.
Veröffentlicht: (2025)
von: Li, Xilai, et al.
Veröffentlicht: (2025)
InterFusion: Text-Driven Generation of 3D Human-Object Interaction
von: Dai, Sisi, et al.
Veröffentlicht: (2024)
von: Dai, Sisi, et al.
Veröffentlicht: (2024)
Exploring a Unified Vision-Centric Contrastive Alternatives on Multi-Modal Web Documents
von: Lin, Yiqi, et al.
Veröffentlicht: (2025)
von: Lin, Yiqi, et al.
Veröffentlicht: (2025)
Learning Contrastive Multimodal Fusion with Improved Modality Dropout for Disease Detection and Prediction
von: Gu, Yi, et al.
Veröffentlicht: (2025)
von: Gu, Yi, et al.
Veröffentlicht: (2025)
Cross-Modal Prototype Allocation: Unsupervised Slide Representation Learning via Patch-Text Contrast in Computational Pathology
von: Chen, Yuxuan, et al.
Veröffentlicht: (2025)
von: Chen, Yuxuan, et al.
Veröffentlicht: (2025)
Ordinal Scale Traffic Congestion Classification with Multi-Modal Vision-Language and Motion Analysis
von: Lin, Yu-Hsuan
Veröffentlicht: (2025)
von: Lin, Yu-Hsuan
Veröffentlicht: (2025)
FusionSAM: Visual Multi-Modal Learning with Segment Anything
von: Li, Daixun, et al.
Veröffentlicht: (2024)
von: Li, Daixun, et al.
Veröffentlicht: (2024)
$β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment
von: Zohra, Fatimah, et al.
Veröffentlicht: (2025)
von: Zohra, Fatimah, et al.
Veröffentlicht: (2025)
EMDFNet: Efficient Multi-scale and Diverse Feature Network for Traffic Sign Detection
von: Li, Pengyu, et al.
Veröffentlicht: (2024)
von: Li, Pengyu, et al.
Veröffentlicht: (2024)
Text-Driven Diffusion Model for Sign Language Production
von: He, Jiayi, et al.
Veröffentlicht: (2025)
von: He, Jiayi, et al.
Veröffentlicht: (2025)
Multi-granular body modeling with Redundancy-Free Spatiotemporal Fusion for Text-Driven Motion Generation
von: Zhan, Xingzu, et al.
Veröffentlicht: (2025)
von: Zhan, Xingzu, et al.
Veröffentlicht: (2025)
Contrast-X: A Multi-Modal Contrast Image Synthesis Benchmark and Universal Modality Flow Matching
von: Chen, Yifan, et al.
Veröffentlicht: (2026)
von: Chen, Yifan, et al.
Veröffentlicht: (2026)
Multi-View Fusion Neural Network for Traffic Demand Prediction
von: Zhang, Dongran, et al.
Veröffentlicht: (2024)
von: Zhang, Dongran, et al.
Veröffentlicht: (2024)
UTA-Sign: Unsupervised Thermal Video Augmentation via Event-Assisted Traffic Signage Sketching
von: Han, Yuqi, et al.
Veröffentlicht: (2025)
von: Han, Yuqi, et al.
Veröffentlicht: (2025)
MGHFT: Multi-Granularity Hierarchical Fusion Transformer for Cross-Modal Sticker Emotion Recognition
von: Chen, Jian, et al.
Veröffentlicht: (2025)
von: Chen, Jian, et al.
Veröffentlicht: (2025)
CalFuse: Multi-Modal Continual Learning via Feature Calibration and Parameter Fusion
von: Guo, Juncen, et al.
Veröffentlicht: (2025)
von: Guo, Juncen, et al.
Veröffentlicht: (2025)
MaxFusion: Plug&Play Multi-Modal Generation in Text-to-Image Diffusion Models
von: Nair, Nithin Gopalakrishnan, et al.
Veröffentlicht: (2024)
von: Nair, Nithin Gopalakrishnan, et al.
Veröffentlicht: (2024)
Invisible Reflections: Leveraging Infrared Laser Reflections to Target Traffic Sign Perception
von: Sato, Takami, et al.
Veröffentlicht: (2024)
von: Sato, Takami, et al.
Veröffentlicht: (2024)
MDDFNet: Mamba-based Dynamic Dual Fusion Network for Traffic Sign Detection
von: Yu, TianYi
Veröffentlicht: (2025)
von: Yu, TianYi
Veröffentlicht: (2025)
Ähnliche Einträge
-
Traffic-MLLM: Curiosity-Regularized Supervised Learning for Traffic Scenario Case-Based Reasoning
von: Xiu, Waikit, et al.
Veröffentlicht: (2025) -
Beyond Pixels: Introducing Geometric-Semantic World Priors for Video-based Embodied Models via Spatio-temporal Alignment
von: Tang, Jinzhou, et al.
Veröffentlicht: (2025) -
LASAR: Towards Spatio-temporal Reasoning with Latent Cognitive Map
von: Tang, Jinzhou, et al.
Veröffentlicht: (2026) -
SignVTCL: Multi-Modal Continuous Sign Language Recognition Enhanced by Visual-Textual Contrastive Learning
von: Chen, Hao, et al.
Veröffentlicht: (2024) -
Vision-Driven 2D Supervised Fine-Tuning Framework for Bird's Eye View Perception
von: He, Lei, et al.
Veröffentlicht: (2024)