PRET: Planning with Directed Fidelity Trajectory for Vision and Language Navigation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lu, Renjie, Meng, Jingke, Zheng, Wei-Shi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Loc4Plan: Locating Before Planning for Outdoor Vision and Language Navigation
par: Tian, Huilin, et autres
Publié: (2024)
par: Tian, Huilin, et autres
Publié: (2024)
Distilling LLM Prior to Flow Model for Generalizable Agent's Imagination in Object Goal Navigation
par: Li, Badi, et autres
Publié: (2025)
par: Li, Badi, et autres
Publié: (2025)
Towards Completeness: A Generalizable Action Proposal Generator for Zero-Shot Temporal Action Localization
par: Du, Jia-Run, et autres
Publié: (2024)
par: Du, Jia-Run, et autres
Publié: (2024)
Rethinking Few-shot Class-incremental Learning: Learning from Yourself
par: Tang, Yu-Ming, et autres
Publié: (2024)
par: Tang, Yu-Ming, et autres
Publié: (2024)
Trajectory-Diversity-Driven Robust Vision-and-Language Navigation
par: Li, Jiangyang, et autres
Publié: (2026)
par: Li, Jiangyang, et autres
Publié: (2026)
LLMDet: Learning Strong Open-Vocabulary Object Detectors under the Supervision of Large Language Models
par: Fu, Shenghao, et autres
Publié: (2025)
par: Fu, Shenghao, et autres
Publié: (2025)
LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation
par: Ning, Yuwei, et autres
Publié: (2026)
par: Ning, Yuwei, et autres
Publié: (2026)
ChainHOI: Joint-based Kinematic Chain Modeling for Human-Object Interaction Generation
par: Zeng, Ling-An, et autres
Publié: (2025)
par: Zeng, Ling-An, et autres
Publié: (2025)
Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning
par: Lu, Fan, et autres
Publié: (2024)
par: Lu, Fan, et autres
Publié: (2024)
ProEdit: Inversion-based Editing From Prompts Done Right
par: Ouyang, Zhi, et autres
Publié: (2025)
par: Ouyang, Zhi, et autres
Publié: (2025)
Egocentric Vision Language Planning
par: Fang, Zhirui, et autres
Publié: (2024)
par: Fang, Zhirui, et autres
Publié: (2024)
ESceme: Vision-and-Language Navigation with Episodic Scene Memory
par: Zheng, Qi, et autres
Publié: (2023)
par: Zheng, Qi, et autres
Publié: (2023)
ColonNeRF: High-Fidelity Neural Reconstruction of Long Colonoscopy
par: Shi, Yufei, et autres
Publié: (2023)
par: Shi, Yufei, et autres
Publié: (2023)
Structure-Guided Diffusion Models for High-Fidelity Portrait Shadow Removal
par: Yu, Wanchang, et autres
Publié: (2025)
par: Yu, Wanchang, et autres
Publié: (2025)
HeadsUp! High-Fidelity Portrait Image Super-Resolution
par: Li, Renjie, et autres
Publié: (2025)
par: Li, Renjie, et autres
Publié: (2025)
LCGNav: Local Candidate-Aware Geometric Enhancement for General Topological Planning in Vision-Language Navigation
par: Peng, Jiankun, et autres
Publié: (2026)
par: Peng, Jiankun, et autres
Publié: (2026)
Temporal-Spatial Object Relations Modeling for Vision-and-Language Navigation
par: Huang, Bowen, et autres
Publié: (2024)
par: Huang, Bowen, et autres
Publié: (2024)
Efficient-VLN: A Training-Efficient Vision-Language Navigation Model
par: Zheng, Duo, et autres
Publié: (2025)
par: Zheng, Duo, et autres
Publié: (2025)
DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation
par: Shi, Haoxiang, et autres
Publié: (2025)
par: Shi, Haoxiang, et autres
Publié: (2025)
CLAD: Constrained Latent Action Diffusion for Vision-Language Procedure Planning
par: Shi, Lei, et autres
Publié: (2025)
par: Shi, Lei, et autres
Publié: (2025)
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
par: Guo, Wenxuan, et autres
Publié: (2026)
par: Guo, Wenxuan, et autres
Publié: (2026)
ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments
par: An, Dong, et autres
Publié: (2023)
par: An, Dong, et autres
Publié: (2023)
TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding
par: Yang, Fan, et autres
Publié: (2026)
par: Yang, Fan, et autres
Publié: (2026)
NavOne: One-Step Global Planning for Vision-Language Navigation on Top-Down Maps
par: Zhan, Dijia, et autres
Publié: (2026)
par: Zhan, Dijia, et autres
Publié: (2026)
RD-ViT: Recurrent-Depth Vision Transformer for Semantic Segmentation with Reduced Data Dependence Extending the Recurrent-Depth Transformer Architecture to Dense Prediction
par: He, Renjie
Publié: (2026)
par: He, Renjie
Publié: (2026)
Decoupled Distillation to Erase: A General Unlearning Method for Any Class-centric Tasks
par: Zhou, Yu, et autres
Publié: (2025)
par: Zhou, Yu, et autres
Publié: (2025)
The Essence of Balance for Self-Improving Agents in Vision-and-Language Navigation
par: Liu, Zhen, et autres
Publié: (2026)
par: Liu, Zhen, et autres
Publié: (2026)
Text Promptable Surgical Instrument Segmentation with Vision-Language Models
par: Zhou, Zijian, et autres
Publié: (2023)
par: Zhou, Zijian, et autres
Publié: (2023)
FA: Forced Prompt Learning of Vision-Language Models for Out-of-Distribution Detection
par: Lu, Xinhua, et autres
Publié: (2025)
par: Lu, Xinhua, et autres
Publié: (2025)
GC-VLN: Instruction as Graph Constraints for Training-free Vision-and-Language Navigation
par: Yin, Hang, et autres
Publié: (2025)
par: Yin, Hang, et autres
Publié: (2025)
GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning
par: Ma, Guoqing, et autres
Publié: (2026)
par: Ma, Guoqing, et autres
Publié: (2026)
Hijacking Vision-and-Language Navigation Agents with Adversarial Environmental Attacks
par: Yang, Zijiao, et autres
Publié: (2024)
par: Yang, Zijiao, et autres
Publié: (2024)
\textit{4DSurf}: High-Fidelity Dynamic Scene Surface Reconstruction
par: Wu, Renjie, et autres
Publié: (2026)
par: Wu, Renjie, et autres
Publié: (2026)
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
par: Zhang, Jiazhao, et autres
Publié: (2024)
par: Zhang, Jiazhao, et autres
Publié: (2024)
Learning to Reason and Navigate: Parameter Efficient Action Planning with Large Language Models
par: Mohammadi, Bahram, et autres
Publié: (2025)
par: Mohammadi, Bahram, et autres
Publié: (2025)
Volumetric Environment Representation for Vision-Language Navigation
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Vision-Language Navigation with Energy-Based Policy
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Scaling Vision-and-Language Navigation With Offline RL
par: Bundele, Valay, et autres
Publié: (2024)
par: Bundele, Valay, et autres
Publié: (2024)
Towards Physically Realizable Adversarial Attacks in Embodied Vision Navigation
par: Chen, Meng, et autres
Publié: (2024)
par: Chen, Meng, et autres
Publié: (2024)
REVISION: Rendering Tools Enable Spatial Fidelity in Vision-Language Models
par: Chatterjee, Agneet, et autres
Publié: (2024)
par: Chatterjee, Agneet, et autres
Publié: (2024)
Documents similaires
-
Loc4Plan: Locating Before Planning for Outdoor Vision and Language Navigation
par: Tian, Huilin, et autres
Publié: (2024) -
Distilling LLM Prior to Flow Model for Generalizable Agent's Imagination in Object Goal Navigation
par: Li, Badi, et autres
Publié: (2025) -
Towards Completeness: A Generalizable Action Proposal Generator for Zero-Shot Temporal Action Localization
par: Du, Jia-Run, et autres
Publié: (2024) -
Rethinking Few-shot Class-incremental Learning: Learning from Yourself
par: Tang, Yu-Ming, et autres
Publié: (2024) -
Trajectory-Diversity-Driven Robust Vision-and-Language Navigation
par: Li, Jiangyang, et autres
Publié: (2026)