Residual Cross-Modal Fusion Networks for Audio-Visual Navigation
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yi, Yu, Yinfeng, Ren, Bin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Dynamic Multi-Target Fusion for Efficient Audio-Visual Navigation
di: Yu, Yinfeng, et al.
Pubblicazione: (2025)
di: Yu, Yinfeng, et al.
Pubblicazione: (2025)
Audio-Guided Visual Perception for Audio-Visual Navigation
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
DualCross: Cross-Modality Cross-Domain Adaptation for Monocular BEV Perception
di: Man, Yunze, et al.
Pubblicazione: (2023)
di: Man, Yunze, et al.
Pubblicazione: (2023)
DOPE: Dual Object Perception-Enhancement Network for Vision-and-Language Navigation
di: Yu, Yinfeng, et al.
Pubblicazione: (2025)
di: Yu, Yinfeng, et al.
Pubblicazione: (2025)
Audio-3DVG: Unified Audio -- Point Cloud Fusion for 3D Visual Grounding
di: Cao-Dinh, Duc, et al.
Pubblicazione: (2025)
di: Cao-Dinh, Duc, et al.
Pubblicazione: (2025)
Language-Conditioned World Modeling for Visual Navigation
di: Dong, Yifei, et al.
Pubblicazione: (2026)
di: Dong, Yifei, et al.
Pubblicazione: (2026)
MemoNav: Working Memory Model for Visual Navigation
di: Li, Hongxin, et al.
Pubblicazione: (2024)
di: Li, Hongxin, et al.
Pubblicazione: (2024)
FloNa: Floor Plan Guided Embodied Visual Navigation
di: Li, Jiaxin, et al.
Pubblicazione: (2024)
di: Li, Jiaxin, et al.
Pubblicazione: (2024)
M2DA: Multi-Modal Fusion Transformer Incorporating Driver Attention for Autonomous Driving
di: Xu, Dongyang, et al.
Pubblicazione: (2024)
di: Xu, Dongyang, et al.
Pubblicazione: (2024)
Single-Frame Point-Pixel Registration via Supervised Cross-Modal Feature Matching
di: Han, Yu, et al.
Pubblicazione: (2025)
di: Han, Yu, et al.
Pubblicazione: (2025)
RVN-Bench: A Benchmark for Reactive Visual Navigation
di: Lee, Jaewon, et al.
Pubblicazione: (2026)
di: Lee, Jaewon, et al.
Pubblicazione: (2026)
Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation
di: Zhang, Pingrui, et al.
Pubblicazione: (2025)
di: Zhang, Pingrui, et al.
Pubblicazione: (2025)
ANAVI: Audio Noise Awareness using Visuals of Indoor environments for NAVIgation
di: Jain, Vidhi, et al.
Pubblicazione: (2024)
di: Jain, Vidhi, et al.
Pubblicazione: (2024)
ModaLink: Unifying Modalities for Efficient Image-to-PointCloud Place Recognition
di: Xie, Weidong, et al.
Pubblicazione: (2024)
di: Xie, Weidong, et al.
Pubblicazione: (2024)
REALM: An RGB and Event Aligned Latent Manifold for Cross-Modal Perception
di: Polizzi, Vincenzo, et al.
Pubblicazione: (2026)
di: Polizzi, Vincenzo, et al.
Pubblicazione: (2026)
MPVO: Motion-Prior based Visual Odometry for PointGoal Navigation
di: Paul, Sayan, et al.
Pubblicazione: (2024)
di: Paul, Sayan, et al.
Pubblicazione: (2024)
Schrödinger's Navigator: Imagining an Ensemble of Futures for Zero-Shot Object Navigation
di: He, Yu, et al.
Pubblicazione: (2025)
di: He, Yu, et al.
Pubblicazione: (2025)
SpatialAnt: Autonomous Zero-Shot Robot Navigation via Active Scene Reconstruction and Visual Anticipation
di: Zhang, Jiwen, et al.
Pubblicazione: (2026)
di: Zhang, Jiwen, et al.
Pubblicazione: (2026)
OREN: Octree Residual Network for Real-Time Euclidean Signed Distance Mapping
di: Dai, Zhirui, et al.
Pubblicazione: (2025)
di: Dai, Zhirui, et al.
Pubblicazione: (2025)
Learning Visual Feature-Based World Models via Residual Latent Action
di: Zhang, Xinyu, et al.
Pubblicazione: (2026)
di: Zhang, Xinyu, et al.
Pubblicazione: (2026)
ViTaS: Visual Tactile Soft Fusion Contrastive Learning for Visuomotor Learning
di: Tian, Yufeng, et al.
Pubblicazione: (2026)
di: Tian, Yufeng, et al.
Pubblicazione: (2026)
Towards Unified World Models for Visual Navigation via Memory-Augmented Planning and Foresight
di: Dong, Yifei, et al.
Pubblicazione: (2025)
di: Dong, Yifei, et al.
Pubblicazione: (2025)
Integrating Object Detection Modality into Visual Language Model for Enhanced Autonomous Driving Agent
di: He, Linfeng, et al.
Pubblicazione: (2024)
di: He, Linfeng, et al.
Pubblicazione: (2024)
A Survey on Occupancy Perception for Autonomous Driving: The Information Fusion Perspective
di: Xu, Huaiyuan, et al.
Pubblicazione: (2024)
di: Xu, Huaiyuan, et al.
Pubblicazione: (2024)
LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning
di: Hao, Haihong, et al.
Pubblicazione: (2026)
di: Hao, Haihong, et al.
Pubblicazione: (2026)
A Multi-Modal Neuro-Symbolic Approach for Spatial Reasoning-Based Visual Grounding in Robotics
di: Jahangard, Simindokht, et al.
Pubblicazione: (2025)
di: Jahangard, Simindokht, et al.
Pubblicazione: (2025)
Online,Target-Free LiDAR-Camera Extrinsic Calibration via Cross-Modal Mask Matching
di: Huang, Zhiwei, et al.
Pubblicazione: (2024)
di: Huang, Zhiwei, et al.
Pubblicazione: (2024)
MoMa-Kitchen: A 100K+ Benchmark for Affordance-Grounded Last-Mile Navigation in Mobile Manipulation
di: Zhang, Pingrui, et al.
Pubblicazione: (2025)
di: Zhang, Pingrui, et al.
Pubblicazione: (2025)
Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy
di: Mandil, Willow, et al.
Pubblicazione: (2023)
di: Mandil, Willow, et al.
Pubblicazione: (2023)
Exploring the Use of VLMs for Navigation Assistance for People with Blindness and Low Vision
di: Li, Yu, et al.
Pubblicazione: (2026)
di: Li, Yu, et al.
Pubblicazione: (2026)
Navigating Motion Agents in Dynamic and Cluttered Environments through LLM Reasoning
di: Zhao, Yubo, et al.
Pubblicazione: (2025)
di: Zhao, Yubo, et al.
Pubblicazione: (2025)
Seeing Through Uncertainty: A Free-Energy Approach for Real-Time Perceptual Adaptation in Robust Visual Navigation
di: Piriyajitakonkij, Maytus, et al.
Pubblicazione: (2024)
di: Piriyajitakonkij, Maytus, et al.
Pubblicazione: (2024)
Adaptive Diffusion Terrain Generator for Autonomous Uneven Terrain Navigation
di: Yu, Youwei, et al.
Pubblicazione: (2024)
di: Yu, Youwei, et al.
Pubblicazione: (2024)
HAVT-IVD: Heterogeneity-Aware Cross-Modal Network for Audio-Visual Surveillance: Idling Vehicles Detection With Multichannel Audio and Multiscale Visual Cues
di: Li, Xiwen, et al.
Pubblicazione: (2025)
di: Li, Xiwen, et al.
Pubblicazione: (2025)
Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities
di: Wang, Liuyi, et al.
Pubblicazione: (2025)
di: Wang, Liuyi, et al.
Pubblicazione: (2025)
Vision-Language Navigation with Embodied Intelligence: A Survey
di: Gao, Peng, et al.
Pubblicazione: (2024)
di: Gao, Peng, et al.
Pubblicazione: (2024)
Do Visual Imaginations Improve Vision-and-Language Navigation Agents?
di: Perincherry, Akhil, et al.
Pubblicazione: (2025)
di: Perincherry, Akhil, et al.
Pubblicazione: (2025)
Human-like Navigation in a World Built for Humans
di: Chandaka, Bhargav, et al.
Pubblicazione: (2025)
di: Chandaka, Bhargav, et al.
Pubblicazione: (2025)
NavMapFusion: Diffusion-based Fusion of Navigation Maps for Online Vectorized HD Map Construction
di: Monninger, Thomas, et al.
Pubblicazione: (2025)
di: Monninger, Thomas, et al.
Pubblicazione: (2025)
Towards Deviation-Robust Agent Navigation via Perturbation-Aware Contrastive Learning
di: Lin, Bingqian, et al.
Pubblicazione: (2024)
di: Lin, Bingqian, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Dynamic Multi-Target Fusion for Efficient Audio-Visual Navigation
di: Yu, Yinfeng, et al.
Pubblicazione: (2025) -
Audio-Guided Visual Perception for Audio-Visual Navigation
di: Wang, Yi, et al.
Pubblicazione: (2025) -
DualCross: Cross-Modality Cross-Domain Adaptation for Monocular BEV Perception
di: Man, Yunze, et al.
Pubblicazione: (2023) -
DOPE: Dual Object Perception-Enhancement Network for Vision-and-Language Navigation
di: Yu, Yinfeng, et al.
Pubblicazione: (2025) -
Audio-3DVG: Unified Audio -- Point Cloud Fusion for 3D Visual Grounding
di: Cao-Dinh, Duc, et al.
Pubblicazione: (2025)