P2DNav: Panorama-to-Downview Reasoning for Zero-shot Vision-and-Language Navigation
Fuente:
arXiv
Guardado en:
| Autores principales: | Sheng, Kai, Wang, Liuyi, Dai, Haojie, Li, Jinlong, Qin, Yongrui, He, Zongtao, Liu, Chengju, Chen, Qijun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2024)
por: Wang, Liuyi, et al.
Publicado: (2024)
Vision-and-Language Navigation via Causal Learning
por: Wang, Liuyi, et al.
Publicado: (2024)
por: Wang, Liuyi, et al.
Publicado: (2024)
MAGIC: Meta-Ability Guided Interactive Chain-of-Distillation for Effective-and-Efficient Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2024)
por: Wang, Liuyi, et al.
Publicado: (2024)
MLANet: Multi-Level Attention Network with Sub-instruction for Continuous Vision-and-Language Navigation
por: He, Zongtao, et al.
Publicado: (2023)
por: He, Zongtao, et al.
Publicado: (2023)
PASTS: Progress-Aware Spatio-Temporal Transformer Speaker For Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2023)
por: Wang, Liuyi, et al.
Publicado: (2023)
NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization
por: He, Zongtao, et al.
Publicado: (2025)
por: He, Zongtao, et al.
Publicado: (2025)
A Dual Semantic-Aware Recurrent Global-Adaptive Network For Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2023)
por: Wang, Liuyi, et al.
Publicado: (2023)
Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities
por: Wang, Liuyi, et al.
Publicado: (2025)
por: Wang, Liuyi, et al.
Publicado: (2025)
RATE-Nav: Region-Aware Termination Enhancement for Zero-shot Object Navigation with Vision-Language Models
por: Li, Junjie, et al.
Publicado: (2025)
por: Li, Junjie, et al.
Publicado: (2025)
Multi-Scale Gaussian-Language Map for Zero-shot Embodied Navigation and Reasoning
por: Zhang, Sixian, et al.
Publicado: (2026)
por: Zhang, Sixian, et al.
Publicado: (2026)
CleanPose: Category-Level Object Pose Estimation via Causal Learning and Knowledge Distillation
por: Lin, Xiao, et al.
Publicado: (2025)
por: Lin, Xiao, et al.
Publicado: (2025)
CLIPose: Category-Level Object Pose Estimation with Pre-trained Vision-Language Knowledge
por: Lin, Xiao, et al.
Publicado: (2024)
por: Lin, Xiao, et al.
Publicado: (2024)
SAM-LAD: Segment Anything Model Meets Zero-Shot Logic Anomaly Detection
por: Peng, Yun, et al.
Publicado: (2024)
por: Peng, Yun, et al.
Publicado: (2024)
Temporal-Guided Visual Foundation Models for Event-Based Vision
por: Xia, Ruihao, et al.
Publicado: (2025)
por: Xia, Ruihao, et al.
Publicado: (2025)
CLASH: Collaborative Large-Small Hierarchical Framework for Continuous Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2025)
por: Wang, Liuyi, et al.
Publicado: (2025)
MSNav: Zero-Shot Vision-and-Language Navigation with Dynamic Memory and LLM Spatial Reasoning
por: Liu, Chenghao, et al.
Publicado: (2025)
por: Liu, Chenghao, et al.
Publicado: (2025)
Fine-Grained Spatiotemporal Motion Alignment for Contrastive Video Representation Learning
por: Zhu, Minghao, et al.
Publicado: (2023)
por: Zhu, Minghao, et al.
Publicado: (2023)
TransPose: 6D Object Pose Estimation with Geometry-Aware Transformer
por: Lin, Xiao, et al.
Publicado: (2023)
por: Lin, Xiao, et al.
Publicado: (2023)
PathoHR: Hierarchical Reasoning for Vision-Language Models in Pathology
por: Huang, Yating, et al.
Publicado: (2025)
por: Huang, Yating, et al.
Publicado: (2025)
Attribute Distribution Modeling and Semantic-Visual Alignment for Generative Zero-shot Learning
por: Pu, Haojie, et al.
Publicado: (2026)
por: Pu, Haojie, et al.
Publicado: (2026)
View-on-Graph: Zero-shot 3D Visual Grounding via Vision-Language Reasoning on Scene Graphs
por: Liu, Yuanyuan, et al.
Publicado: (2025)
por: Liu, Yuanyuan, et al.
Publicado: (2025)
Prioritized Semantic Learning for Zero-shot Instance Navigation
por: Sun, Xinyu, et al.
Publicado: (2024)
por: Sun, Xinyu, et al.
Publicado: (2024)
Zero-shot Generalizable Incremental Learning for Vision-Language Object Detection
por: Deng, Jieren, et al.
Publicado: (2024)
por: Deng, Jieren, et al.
Publicado: (2024)
AnchorHOI: Zero-shot Generation of 4D Human-Object Interaction via Anchor-based Prior Distillation
por: Dai, Sisi, et al.
Publicado: (2025)
por: Dai, Sisi, et al.
Publicado: (2025)
Zero-shot Action Localization via the Confidence of Large Vision-Language Models
por: Aklilu, Josiah, et al.
Publicado: (2024)
por: Aklilu, Josiah, et al.
Publicado: (2024)
Enhancing Zero-shot Counting via Language-guided Exemplar Learning
por: Wang, Mingjie, et al.
Publicado: (2024)
por: Wang, Mingjie, et al.
Publicado: (2024)
Benchmarking Vision-Language and Multimodal Large Language Models in Zero-shot and Few-shot Scenarios: A study on Christian Iconography
por: Spinaci, Gianmarco, et al.
Publicado: (2025)
por: Spinaci, Gianmarco, et al.
Publicado: (2025)
Balancing Performance and Efficiency in Zero-shot Robotic Navigation
por: Kuzmenko, Dmytro, et al.
Publicado: (2024)
por: Kuzmenko, Dmytro, et al.
Publicado: (2024)
MoTE: Reconciling Generalization with Specialization for Visual-Language to Video Knowledge Transfer
por: Zhu, Minghao, et al.
Publicado: (2024)
por: Zhu, Minghao, et al.
Publicado: (2024)
Hierarchical Spatial Proximity Reasoning for Vision-and-Language Navigation
por: Xu, Ming, et al.
Publicado: (2024)
por: Xu, Ming, et al.
Publicado: (2024)
VoroNav: Voronoi-based Zero-shot Object Navigation with Large Language Model
por: Wu, Pengying, et al.
Publicado: (2024)
por: Wu, Pengying, et al.
Publicado: (2024)
Learning by Correction: Efficient Tuning Task for Zero-Shot Generative Vision-Language Reasoning
por: Li, Rongjie, et al.
Publicado: (2024)
por: Li, Rongjie, et al.
Publicado: (2024)
Zero-shot Vision-Language Reranking for Cross-View Geolocalization
por: Erzurumlu, Yunus Talha, et al.
Publicado: (2026)
por: Erzurumlu, Yunus Talha, et al.
Publicado: (2026)
Label Propagation for Zero-shot Classification with Vision-Language Models
por: Stojnić, Vladan, et al.
Publicado: (2024)
por: Stojnić, Vladan, et al.
Publicado: (2024)
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding
por: Fan, Rong, et al.
Publicado: (2026)
por: Fan, Rong, et al.
Publicado: (2026)
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
por: Wang, Zhecan, et al.
Publicado: (2023)
por: Wang, Zhecan, et al.
Publicado: (2023)
Towards Zero-shot Human-Object Interaction Detection via Vision-Language Integration
por: Xue, Weiying, et al.
Publicado: (2024)
por: Xue, Weiying, et al.
Publicado: (2024)
Gate-and-Merge: Zero-shot Compositional Personalization of Vision Language Models
por: Ding, Guodong, et al.
Publicado: (2026)
por: Ding, Guodong, et al.
Publicado: (2026)
SR-Nav: Spatial Relationships Matter for Zero-shot Object Goal Navigation
por: Fang, Leyuan, et al.
Publicado: (2026)
por: Fang, Leyuan, et al.
Publicado: (2026)
MAKE: Multi-Aspect Knowledge-Enhanced Vision-Language Pretraining for Zero-shot Dermatological Assessment
por: Yan, Siyuan, et al.
Publicado: (2025)
por: Yan, Siyuan, et al.
Publicado: (2025)
Ejemplares similares
-
Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2024) -
Vision-and-Language Navigation via Causal Learning
por: Wang, Liuyi, et al.
Publicado: (2024) -
MAGIC: Meta-Ability Guided Interactive Chain-of-Distillation for Effective-and-Efficient Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2024) -
MLANet: Multi-Level Attention Network with Sub-instruction for Continuous Vision-and-Language Navigation
por: He, Zongtao, et al.
Publicado: (2023) -
PASTS: Progress-Aware Spatio-Temporal Transformer Speaker For Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2023)