$NavA^3$: Understanding Any Instruction, Navigating Anywhere, Finding Anything
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Lingfeng, Hao, Xiaoshuai, Tang, Yingbo, Fu, Haoxiang, Zheng, Xinyu, Wang, Pengwei, Wang, Zhongyuan, Ding, Wenbo, Zhang, Shanghang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought
par: Zhang, Shuyi, et autres
Publié: (2025)
par: Zhang, Shuyi, et autres
Publié: (2025)
MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation
par: Zhang, Lingfeng, et autres
Publié: (2025)
par: Zhang, Lingfeng, et autres
Publié: (2025)
AffordGrasp: In-Context Affordance Reasoning for Open-Vocabulary Task-Oriented Grasping in Clutter
par: Tang, Yingbo, et autres
Publié: (2025)
par: Tang, Yingbo, et autres
Publié: (2025)
SocialNav-Map: Dynamic Mapping with Human Trajectory Prediction for Zero-Shot Social Navigation
par: Zhang, Lingfeng, et autres
Publié: (2025)
par: Zhang, Lingfeng, et autres
Publié: (2025)
Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigation
par: Zhang, Lingfeng, et autres
Publié: (2025)
par: Zhang, Lingfeng, et autres
Publié: (2025)
Describe Anything Anywhere At Any Moment
par: Gorlo, Nicolas, et autres
Publié: (2025)
par: Gorlo, Nicolas, et autres
Publié: (2025)
The RoboSense Challenge: Sense Anything, Navigate Anywhere, Adapt Across Platforms
par: Kong, Lingdong, et autres
Publié: (2026)
par: Kong, Lingdong, et autres
Publié: (2026)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
par: Tan, Huajie, et autres
Publié: (2025)
par: Tan, Huajie, et autres
Publié: (2025)
Learning to Navigate Socially Through Proactive Risk Perception
par: Xiao, Erjia, et autres
Publié: (2025)
par: Xiao, Erjia, et autres
Publié: (2025)
RoboAfford++: A Generative AI-Enhanced Dataset for Multimodal Affordance Learning in Robotic Manipulation and Navigation
par: Hao, Xiaoshuai, et autres
Publié: (2025)
par: Hao, Xiaoshuai, et autres
Publié: (2025)
Team Xiaomi EV-AD VLA: Caption-Guided Retrieval System for Cross-Modal Drone Navigation -- Technical Report for IROS 2025 RoboSense Challenge Track 4
par: Zhang, Lingfeng, et autres
Publié: (2025)
par: Zhang, Lingfeng, et autres
Publié: (2025)
Hearing Anything Anywhere
par: Wang, Mason, et autres
Publié: (2024)
par: Wang, Mason, et autres
Publié: (2024)
PIGEON: VLM-Driven Object Navigation via Points of Interest Selection
par: Peng, Cheng, et autres
Publié: (2025)
par: Peng, Cheng, et autres
Publié: (2025)
Walk With Me: Long-Horizon Social Navigation for Human-Centric Outdoor Assistance
par: Zhang, Lingfeng, et autres
Publié: (2026)
par: Zhang, Lingfeng, et autres
Publié: (2026)
The RoboDrive Challenge: Drive Anytime Anywhere in Any Condition
par: Kong, Lingdong, et autres
Publié: (2024)
par: Kong, Lingdong, et autres
Publié: (2024)
Tracking and Segmenting Anything in Any Modality
par: Zhang, Tianlu, et autres
Publié: (2025)
par: Zhang, Tianlu, et autres
Publié: (2025)
Hearing Anywhere in Any Environment
par: Liu, Xiulong, et autres
Publié: (2025)
par: Liu, Xiulong, et autres
Publié: (2025)
AnyNav: Visual Neuro-Symbolic Friction Learning for Off-road Navigation
par: Fu, Taimeng, et autres
Publié: (2025)
par: Fu, Taimeng, et autres
Publié: (2025)
Depth Anything with Any Prior
par: Wang, Zehan, et autres
Publié: (2025)
par: Wang, Zehan, et autres
Publié: (2025)
METIS: Multi-Source Egocentric Training for Integrated Dexterous Vision-Language-Action Model
par: Fu, Yankai, et autres
Publié: (2025)
par: Fu, Yankai, et autres
Publié: (2025)
Any2Point: Empowering Any-modality Large Models for Efficient 3D Understanding
par: Tang, Yiwen, et autres
Publié: (2024)
par: Tang, Yiwen, et autres
Publié: (2024)
Nav-R1: Reasoning and Navigation in Embodied Scenes
par: Liu, Qingxiang, et autres
Publié: (2025)
par: Liu, Qingxiang, et autres
Publié: (2025)
InstructNav: Zero-shot System for Generic Instruction Navigation in Unexplored Environment
par: Long, Yuxing, et autres
Publié: (2024)
par: Long, Yuxing, et autres
Publié: (2024)
NavSpace: How Navigation Agents Follow Spatial Intelligence Instructions
par: Yang, Haolin, et autres
Publié: (2025)
par: Yang, Haolin, et autres
Publié: (2025)
Say Anything with Any Style
par: Tan, Shuai, et autres
Publié: (2024)
par: Tan, Shuai, et autres
Publié: (2024)
Weather-Conditioned Branch Routing for Robust LiDAR-Radar 3D Object Detection
par: Li, Hongsheng, et autres
Publié: (2026)
par: Li, Hongsheng, et autres
Publié: (2026)
AnyImageNav: Any-View Geometry for Precise Last-Meter Image-Goal Navigation
par: Deng, Yijie, et autres
Publié: (2026)
par: Deng, Yijie, et autres
Publié: (2026)
VoroNav: Voronoi-based Zero-shot Object Navigation with Large Language Model
par: Wu, Pengying, et autres
Publié: (2024)
par: Wu, Pengying, et autres
Publié: (2024)
Place Anything into Any Video
par: Liu, Ziling, et autres
Publié: (2024)
par: Liu, Ziling, et autres
Publié: (2024)
Anything in Any Scene: Photorealistic Video Object Insertion
par: Bai, Chen, et autres
Publié: (2024)
par: Bai, Chen, et autres
Publié: (2024)
Structurally Prune Anything: Any Architecture, Any Framework, Any Time
par: Wang, Xun, et autres
Publié: (2024)
par: Wang, Xun, et autres
Publié: (2024)
X-SAM: From Segment Anything to Any Segmentation
par: Wang, Hao, et autres
Publié: (2025)
par: Wang, Hao, et autres
Publié: (2025)
Create Anything Anywhere: Layout-Controllable Personalized Diffusion Model for Multiple Subjects
par: Li, Wei, et autres
Publié: (2025)
par: Li, Wei, et autres
Publié: (2025)
Deep Instruction Tuning for Segment Anything Model
par: Huang, Xiaorui, et autres
Publié: (2024)
par: Huang, Xiaorui, et autres
Publié: (2024)
Segment Any Motion in Videos
par: Huang, Nan, et autres
Publié: (2025)
par: Huang, Nan, et autres
Publié: (2025)
SAM 2++: Tracking Anything at Any Granularity
par: Zhang, Jiaming, et autres
Publié: (2025)
par: Zhang, Jiaming, et autres
Publié: (2025)
TopoNav: Topological Graphs as a Key Enabler for Advanced Object Navigation
par: Liu, Peiran, et autres
Publié: (2025)
par: Liu, Peiran, et autres
Publié: (2025)
Motion Anything: Any to Motion Generation
par: Zhang, Zeyu, et autres
Publié: (2025)
par: Zhang, Zeyu, et autres
Publié: (2025)
NavBench: Probing Multimodal Large Language Models for Embodied Navigation
par: Qiao, Yanyuan, et autres
Publié: (2025)
par: Qiao, Yanyuan, et autres
Publié: (2025)
Compress Any Segment Anything Model (SAM)
par: Fan, Juntong, et autres
Publié: (2025)
par: Fan, Juntong, et autres
Publié: (2025)
Documents similaires
-
Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought
par: Zhang, Shuyi, et autres
Publié: (2025) -
MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation
par: Zhang, Lingfeng, et autres
Publié: (2025) -
AffordGrasp: In-Context Affordance Reasoning for Open-Vocabulary Task-Oriented Grasping in Clutter
par: Tang, Yingbo, et autres
Publié: (2025) -
SocialNav-Map: Dynamic Mapping with Human Trajectory Prediction for Zero-Shot Social Navigation
par: Zhang, Lingfeng, et autres
Publié: (2025) -
Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigation
par: Zhang, Lingfeng, et autres
Publié: (2025)