PRET: Planning with Directed Fidelity Trajectory for Vision and Language Navigation
Fuente:
arXiv
Guardado en:
| Autores principales: | Lu, Renjie, Meng, Jingke, Zheng, Wei-Shi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Loc4Plan: Locating Before Planning for Outdoor Vision and Language Navigation
por: Tian, Huilin, et al.
Publicado: (2024)
por: Tian, Huilin, et al.
Publicado: (2024)
Distilling LLM Prior to Flow Model for Generalizable Agent's Imagination in Object Goal Navigation
por: Li, Badi, et al.
Publicado: (2025)
por: Li, Badi, et al.
Publicado: (2025)
Towards Completeness: A Generalizable Action Proposal Generator for Zero-Shot Temporal Action Localization
por: Du, Jia-Run, et al.
Publicado: (2024)
por: Du, Jia-Run, et al.
Publicado: (2024)
Rethinking Few-shot Class-incremental Learning: Learning from Yourself
por: Tang, Yu-Ming, et al.
Publicado: (2024)
por: Tang, Yu-Ming, et al.
Publicado: (2024)
Trajectory-Diversity-Driven Robust Vision-and-Language Navigation
por: Li, Jiangyang, et al.
Publicado: (2026)
por: Li, Jiangyang, et al.
Publicado: (2026)
LLMDet: Learning Strong Open-Vocabulary Object Detectors under the Supervision of Large Language Models
por: Fu, Shenghao, et al.
Publicado: (2025)
por: Fu, Shenghao, et al.
Publicado: (2025)
LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation
por: Ning, Yuwei, et al.
Publicado: (2026)
por: Ning, Yuwei, et al.
Publicado: (2026)
ChainHOI: Joint-based Kinematic Chain Modeling for Human-Object Interaction Generation
por: Zeng, Ling-An, et al.
Publicado: (2025)
por: Zeng, Ling-An, et al.
Publicado: (2025)
Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning
por: Lu, Fan, et al.
Publicado: (2024)
por: Lu, Fan, et al.
Publicado: (2024)
ProEdit: Inversion-based Editing From Prompts Done Right
por: Ouyang, Zhi, et al.
Publicado: (2025)
por: Ouyang, Zhi, et al.
Publicado: (2025)
Egocentric Vision Language Planning
por: Fang, Zhirui, et al.
Publicado: (2024)
por: Fang, Zhirui, et al.
Publicado: (2024)
ESceme: Vision-and-Language Navigation with Episodic Scene Memory
por: Zheng, Qi, et al.
Publicado: (2023)
por: Zheng, Qi, et al.
Publicado: (2023)
ColonNeRF: High-Fidelity Neural Reconstruction of Long Colonoscopy
por: Shi, Yufei, et al.
Publicado: (2023)
por: Shi, Yufei, et al.
Publicado: (2023)
Structure-Guided Diffusion Models for High-Fidelity Portrait Shadow Removal
por: Yu, Wanchang, et al.
Publicado: (2025)
por: Yu, Wanchang, et al.
Publicado: (2025)
HeadsUp! High-Fidelity Portrait Image Super-Resolution
por: Li, Renjie, et al.
Publicado: (2025)
por: Li, Renjie, et al.
Publicado: (2025)
LCGNav: Local Candidate-Aware Geometric Enhancement for General Topological Planning in Vision-Language Navigation
por: Peng, Jiankun, et al.
Publicado: (2026)
por: Peng, Jiankun, et al.
Publicado: (2026)
Temporal-Spatial Object Relations Modeling for Vision-and-Language Navigation
por: Huang, Bowen, et al.
Publicado: (2024)
por: Huang, Bowen, et al.
Publicado: (2024)
Efficient-VLN: A Training-Efficient Vision-Language Navigation Model
por: Zheng, Duo, et al.
Publicado: (2025)
por: Zheng, Duo, et al.
Publicado: (2025)
DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation
por: Shi, Haoxiang, et al.
Publicado: (2025)
por: Shi, Haoxiang, et al.
Publicado: (2025)
CLAD: Constrained Latent Action Diffusion for Vision-Language Procedure Planning
por: Shi, Lei, et al.
Publicado: (2025)
por: Shi, Lei, et al.
Publicado: (2025)
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
por: Guo, Wenxuan, et al.
Publicado: (2026)
por: Guo, Wenxuan, et al.
Publicado: (2026)
ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments
por: An, Dong, et al.
Publicado: (2023)
por: An, Dong, et al.
Publicado: (2023)
TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding
por: Yang, Fan, et al.
Publicado: (2026)
por: Yang, Fan, et al.
Publicado: (2026)
NavOne: One-Step Global Planning for Vision-Language Navigation on Top-Down Maps
por: Zhan, Dijia, et al.
Publicado: (2026)
por: Zhan, Dijia, et al.
Publicado: (2026)
RD-ViT: Recurrent-Depth Vision Transformer for Semantic Segmentation with Reduced Data Dependence Extending the Recurrent-Depth Transformer Architecture to Dense Prediction
por: He, Renjie
Publicado: (2026)
por: He, Renjie
Publicado: (2026)
Decoupled Distillation to Erase: A General Unlearning Method for Any Class-centric Tasks
por: Zhou, Yu, et al.
Publicado: (2025)
por: Zhou, Yu, et al.
Publicado: (2025)
The Essence of Balance for Self-Improving Agents in Vision-and-Language Navigation
por: Liu, Zhen, et al.
Publicado: (2026)
por: Liu, Zhen, et al.
Publicado: (2026)
Text Promptable Surgical Instrument Segmentation with Vision-Language Models
por: Zhou, Zijian, et al.
Publicado: (2023)
por: Zhou, Zijian, et al.
Publicado: (2023)
FA: Forced Prompt Learning of Vision-Language Models for Out-of-Distribution Detection
por: Lu, Xinhua, et al.
Publicado: (2025)
por: Lu, Xinhua, et al.
Publicado: (2025)
GC-VLN: Instruction as Graph Constraints for Training-free Vision-and-Language Navigation
por: Yin, Hang, et al.
Publicado: (2025)
por: Yin, Hang, et al.
Publicado: (2025)
GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning
por: Ma, Guoqing, et al.
Publicado: (2026)
por: Ma, Guoqing, et al.
Publicado: (2026)
Hijacking Vision-and-Language Navigation Agents with Adversarial Environmental Attacks
por: Yang, Zijiao, et al.
Publicado: (2024)
por: Yang, Zijiao, et al.
Publicado: (2024)
\textit{4DSurf}: High-Fidelity Dynamic Scene Surface Reconstruction
por: Wu, Renjie, et al.
Publicado: (2026)
por: Wu, Renjie, et al.
Publicado: (2026)
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
por: Zhang, Jiazhao, et al.
Publicado: (2024)
por: Zhang, Jiazhao, et al.
Publicado: (2024)
Learning to Reason and Navigate: Parameter Efficient Action Planning with Large Language Models
por: Mohammadi, Bahram, et al.
Publicado: (2025)
por: Mohammadi, Bahram, et al.
Publicado: (2025)
Volumetric Environment Representation for Vision-Language Navigation
por: Liu, Rui, et al.
Publicado: (2024)
por: Liu, Rui, et al.
Publicado: (2024)
Vision-Language Navigation with Energy-Based Policy
por: Liu, Rui, et al.
Publicado: (2024)
por: Liu, Rui, et al.
Publicado: (2024)
Scaling Vision-and-Language Navigation With Offline RL
por: Bundele, Valay, et al.
Publicado: (2024)
por: Bundele, Valay, et al.
Publicado: (2024)
Towards Physically Realizable Adversarial Attacks in Embodied Vision Navigation
por: Chen, Meng, et al.
Publicado: (2024)
por: Chen, Meng, et al.
Publicado: (2024)
REVISION: Rendering Tools Enable Spatial Fidelity in Vision-Language Models
por: Chatterjee, Agneet, et al.
Publicado: (2024)
por: Chatterjee, Agneet, et al.
Publicado: (2024)
Ejemplares similares
-
Loc4Plan: Locating Before Planning for Outdoor Vision and Language Navigation
por: Tian, Huilin, et al.
Publicado: (2024) -
Distilling LLM Prior to Flow Model for Generalizable Agent's Imagination in Object Goal Navigation
por: Li, Badi, et al.
Publicado: (2025) -
Towards Completeness: A Generalizable Action Proposal Generator for Zero-Shot Temporal Action Localization
por: Du, Jia-Run, et al.
Publicado: (2024) -
Rethinking Few-shot Class-incremental Learning: Learning from Yourself
por: Tang, Yu-Ming, et al.
Publicado: (2024) -
Trajectory-Diversity-Driven Robust Vision-and-Language Navigation
por: Li, Jiangyang, et al.
Publicado: (2026)