Team Xiaomi EV-AD VLA: Caption-Guided Retrieval System for Cross-Modal Drone Navigation -- Technical Report for IROS 2025 RoboSense Challenge Track 4
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Lingfeng, Xiao, Erjia, Zhang, Yuchen, Fu, Haoxiang, Hu, Ruibin, Ma, Yanbiao, Ding, Wenbo, Chen, Long, Ye, Hangjun, Hao, Xiaoshuai |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The RoboSense Challenge: Sense Anything, Navigate Anywhere, Adapt Across Platforms
par: Kong, Lingdong, et autres
Publié: (2026)
par: Kong, Lingdong, et autres
Publié: (2026)
RoboAfford++: A Generative AI-Enhanced Dataset for Multimodal Affordance Learning in Robotic Manipulation and Navigation
par: Hao, Xiaoshuai, et autres
Publié: (2025)
par: Hao, Xiaoshuai, et autres
Publié: (2025)
SocialNav-Map: Dynamic Mapping with Human Trajectory Prediction for Zero-Shot Social Navigation
par: Zhang, Lingfeng, et autres
Publié: (2025)
par: Zhang, Lingfeng, et autres
Publié: (2025)
Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigation
par: Zhang, Lingfeng, et autres
Publié: (2025)
par: Zhang, Lingfeng, et autres
Publié: (2025)
Learning to Navigate Socially Through Proactive Risk Perception
par: Xiao, Erjia, et autres
Publié: (2025)
par: Xiao, Erjia, et autres
Publié: (2025)
RoboSense: Large-scale Dataset and Benchmark for Egocentric Robot Perception and Navigation in Crowded and Unstructured Environments
par: Su, Haisheng, et autres
Publié: (2024)
par: Su, Haisheng, et autres
Publié: (2024)
Team Samsung-RAL: Technical Report for 2024 RoboDrive Challenge-Robust Map Segmentation Track
par: Hao, Xiaoshuai, et autres
Publié: (2024)
par: Hao, Xiaoshuai, et autres
Publié: (2024)
$NavA^3$: Understanding Any Instruction, Navigating Anywhere, Finding Anything
par: Zhang, Lingfeng, et autres
Publié: (2025)
par: Zhang, Lingfeng, et autres
Publié: (2025)
Xiaomi MiMo-VL-Miloco Technical Report
par: Li, Jiaze, et autres
Publié: (2025)
par: Li, Jiaze, et autres
Publié: (2025)
Multi-Floor Zero-Shot Object Navigation Policy
par: Zhang, Lingfeng, et autres
Publié: (2024)
par: Zhang, Lingfeng, et autres
Publié: (2024)
Exploring Typographic Visual Prompts Injection Threats in Cross-Modality Generation Models
par: Cheng, Hao, et autres
Publié: (2025)
par: Cheng, Hao, et autres
Publié: (2025)
RaceVLA: VLA-based Racing Drone Navigation with Human-like Behaviour
par: Serpiva, Valerii, et autres
Publié: (2025)
par: Serpiva, Valerii, et autres
Publié: (2025)
IROS: A Dual-Process Architecture for Real-Time VLM-Based Indoor Navigation
par: Lee, Joonhee, et autres
Publié: (2026)
par: Lee, Joonhee, et autres
Publié: (2026)
Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation
par: Liu, Jinkun, et autres
Publié: (2026)
par: Liu, Jinkun, et autres
Publié: (2026)
TriHelper: Zero-Shot Object Navigation with Dynamic Assistance
par: Zhang, Lingfeng, et autres
Publié: (2024)
par: Zhang, Lingfeng, et autres
Publié: (2024)
SEF-MAP: Subspace-Decomposed Expert Fusion for Robust Multimodal HD Map Prediction
par: Fu, Haoxiang, et autres
Publié: (2026)
par: Fu, Haoxiang, et autres
Publié: (2026)
Walk With Me: Long-Horizon Social Navigation for Human-Centric Outdoor Assistance
par: Zhang, Lingfeng, et autres
Publié: (2026)
par: Zhang, Lingfeng, et autres
Publié: (2026)
RoboBrain 2.0 Technical Report
par: BAAI RoboBrain Team, et autres
Publié: (2025)
par: BAAI RoboBrain Team, et autres
Publié: (2025)
Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation
par: Lu, Jinghui, et autres
Publié: (2026)
par: Lu, Jinghui, et autres
Publié: (2026)
DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving
par: jia, Feiyang, et autres
Publié: (2026)
par: jia, Feiyang, et autres
Publié: (2026)
DroneVLA: VLA based Aerial Manipulation
par: Mehboob, Fawad, et autres
Publié: (2026)
par: Mehboob, Fawad, et autres
Publié: (2026)
AT-Drone: Benchmarking Adaptive Teaming in Multi-Drone Pursuit
par: Li, Yang, et autres
Publié: (2025)
par: Li, Yang, et autres
Publié: (2025)
Xiaomi-Robotics-0: An Open-Sourced Vision-Language-Action Model with Real-Time Execution
par: Cai, Rui, et autres
Publié: (2026)
par: Cai, Rui, et autres
Publié: (2026)
TrackVLA++: Unleashing Reasoning and Memory Capabilities in VLA Models for Embodied Visual Tracking
par: Liu, Jiahang, et autres
Publié: (2025)
par: Liu, Jiahang, et autres
Publié: (2025)
ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
par: Chu, Zedong, et autres
Publié: (2026)
par: Chu, Zedong, et autres
Publié: (2026)
Weather-Conditioned Branch Routing for Robust LiDAR-Radar 3D Object Detection
par: Li, Hongsheng, et autres
Publié: (2026)
par: Li, Hongsheng, et autres
Publié: (2026)
TrackVLA: Embodied Visual Tracking in the Wild
par: Wang, Shaoan, et autres
Publié: (2025)
par: Wang, Shaoan, et autres
Publié: (2025)
Xiaomi Auto World Model: A Joint World Model Integrating Reconstruction and Generation for Autonomous Driving
par: Zhou, Lijun, et autres
Publié: (2026)
par: Zhou, Lijun, et autres
Publié: (2026)
DevPiolt: Operation Recommendation for IoT Devices at Xiaomi Home
par: Wang, Yuxiang, et autres
Publié: (2025)
par: Wang, Yuxiang, et autres
Publié: (2025)
RRAM-Based Bio-Inspired Circuits for Mobile Epileptic Correlation Extraction and Seizure Prediction
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation
par: Zhang, Lingfeng, et autres
Publié: (2025)
par: Zhang, Lingfeng, et autres
Publié: (2025)
iFlyBot-VLA Technical Report
par: Zhang, Yuan, et autres
Publié: (2025)
par: Zhang, Yuan, et autres
Publié: (2025)
OmniVLA: An Omni-Modal Vision-Language-Action Model for Robot Navigation
par: Hirose, Noriaki, et autres
Publié: (2025)
par: Hirose, Noriaki, et autres
Publié: (2025)
RedVLA: Physical Red Teaming for Vision-Language-Action Models
par: Zhang, Yuhao, et autres
Publié: (2026)
par: Zhang, Yuhao, et autres
Publié: (2026)
Flight Dynamics to Sensing Modalities: Exploiting Drone Ground Effect for Accurate Edge Detection
par: Zhao, Chenyu, et autres
Publié: (2025)
par: Zhao, Chenyu, et autres
Publié: (2025)
UruBots RoboCup Work Team Description Paper
par: Sodre, Hiago, et autres
Publié: (2025)
par: Sodre, Hiago, et autres
Publié: (2025)
AlignCap: Aligning Speech Emotion Captioning to Human Preferences
par: Liang, Ziqi, et autres
Publié: (2024)
par: Liang, Ziqi, et autres
Publié: (2024)
Flow-Modulated Scoring for Semantic-Aware Knowledge Graph Completion
par: Li, Siyuan, et autres
Publié: (2025)
par: Li, Siyuan, et autres
Publié: (2025)
AsyncVLA: An Asynchronous VLA for Fast and Robust Navigation on the Edge
par: Hirose, Noriaki, et autres
Publié: (2026)
par: Hirose, Noriaki, et autres
Publié: (2026)
RoboECC: Multi-Factor-Aware Edge-Cloud Collaborative Deployment for VLA Models
par: Zheng, Zihao, et autres
Publié: (2026)
par: Zheng, Zihao, et autres
Publié: (2026)
Documents similaires
-
The RoboSense Challenge: Sense Anything, Navigate Anywhere, Adapt Across Platforms
par: Kong, Lingdong, et autres
Publié: (2026) -
RoboAfford++: A Generative AI-Enhanced Dataset for Multimodal Affordance Learning in Robotic Manipulation and Navigation
par: Hao, Xiaoshuai, et autres
Publié: (2025) -
SocialNav-Map: Dynamic Mapping with Human Trajectory Prediction for Zero-Shot Social Navigation
par: Zhang, Lingfeng, et autres
Publié: (2025) -
Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigation
par: Zhang, Lingfeng, et autres
Publié: (2025) -
Learning to Navigate Socially Through Proactive Risk Perception
par: Xiao, Erjia, et autres
Publié: (2025)