Loc4Plan: Locating Before Planning for Outdoor Vision and Language Navigation
Fuente:
arXiv
Salvato in:
| Autori principali: | Tian, Huilin, Meng, Jingke, Zheng, Wei-Shi, Li, Yuan-Ming, Yan, Junkai, Zhang, Yunong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PRET: Planning with Directed Fidelity Trajectory for Vision and Language Navigation
di: Lu, Renjie, et al.
Pubblicazione: (2024)
di: Lu, Renjie, et al.
Pubblicazione: (2024)
Augment Before Copy-Paste: Data and Memory Efficiency-Oriented Instance Segmentation Framework for Sport-scenes
di: Hsu, Chih-Chung, et al.
Pubblicazione: (2024)
di: Hsu, Chih-Chung, et al.
Pubblicazione: (2024)
PlanMoGPT: Flow-Enhanced Progressive Planning for Text to Motion Synthesis
di: Jin, Chuhao, et al.
Pubblicazione: (2025)
di: Jin, Chuhao, et al.
Pubblicazione: (2025)
PanoGen++: Domain-Adapted Text-Guided Panoramic Environment Generation for Vision-and-Language Navigation
di: Wang, Sen, et al.
Pubblicazione: (2025)
di: Wang, Sen, et al.
Pubblicazione: (2025)
Agent Journey Beyond RGB: Hierarchical Semantic-Spatial Representation Enrichment for Vision-and-Language Navigation
di: Zhang, Xuesong, et al.
Pubblicazione: (2024)
di: Zhang, Xuesong, et al.
Pubblicazione: (2024)
TimeLoc: A Unified End-to-End Framework for Precise Timestamp Localization in Long Videos
di: Zhang, Chen-Lin, et al.
Pubblicazione: (2025)
di: Zhang, Chen-Lin, et al.
Pubblicazione: (2025)
POINTS1.5: Building a Vision-Language Model towards Real World Applications
di: Liu, Yuan, et al.
Pubblicazione: (2024)
di: Liu, Yuan, et al.
Pubblicazione: (2024)
VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting
di: Ilaslan, Muhammet Furkan, et al.
Pubblicazione: (2024)
di: Ilaslan, Muhammet Furkan, et al.
Pubblicazione: (2024)
MLANet: Multi-Level Attention Network with Sub-instruction for Continuous Vision-and-Language Navigation
di: He, Zongtao, et al.
Pubblicazione: (2023)
di: He, Zongtao, et al.
Pubblicazione: (2023)
Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
ROI-Guided Point Cloud Geometry Compression Towards Human and Machine Vision
di: Liang, Xie, et al.
Pubblicazione: (2025)
di: Liang, Xie, et al.
Pubblicazione: (2025)
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
di: Chu, Meng, et al.
Pubblicazione: (2023)
di: Chu, Meng, et al.
Pubblicazione: (2023)
DPC: Dual-Prompt Collaboration for Tuning Vision-Language Models
di: Li, Haoyang, et al.
Pubblicazione: (2025)
di: Li, Haoyang, et al.
Pubblicazione: (2025)
Cross-modal Proxy Evolving for OOD Detection with Vision-Language Models
di: Tang, Hao, et al.
Pubblicazione: (2026)
di: Tang, Hao, et al.
Pubblicazione: (2026)
STEAR: Layer-Aware Spatiotemporal Evidence Intervention for Hallucination Mitigation in Video Large Language Models
di: Fan, Linfeng, et al.
Pubblicazione: (2026)
di: Fan, Linfeng, et al.
Pubblicazione: (2026)
Efficient Vision Language Model Fine-tuning for Text-based Person Anomaly Search
di: He, Jiayi, et al.
Pubblicazione: (2025)
di: He, Jiayi, et al.
Pubblicazione: (2025)
Bernini: Latent Semantic Planning for Video Diffusion
di: Bernini Team, et al.
Pubblicazione: (2026)
di: Bernini Team, et al.
Pubblicazione: (2026)
Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models
di: He, Xin, et al.
Pubblicazione: (2024)
di: He, Xin, et al.
Pubblicazione: (2024)
PlanLLM: Video Procedure Planning with Refinable Large Language Models
di: Yang, Dejie, et al.
Pubblicazione: (2024)
di: Yang, Dejie, et al.
Pubblicazione: (2024)
Unveiling Encoder-Free Vision-Language Models
di: Diao, Haiwen, et al.
Pubblicazione: (2024)
di: Diao, Haiwen, et al.
Pubblicazione: (2024)
DuoTeach: Dual Role Self-Teaching for Coarse-to-Fine Decision Coordination in Vision--Language Models
di: Yang, Wei, et al.
Pubblicazione: (2025)
di: Yang, Wei, et al.
Pubblicazione: (2025)
Mitigating Image Captioning Hallucinations in Vision-Language Models
di: Zhao, Fei, et al.
Pubblicazione: (2025)
di: Zhao, Fei, et al.
Pubblicazione: (2025)
ComAlign: Compositional Alignment in Vision-Language Models
di: Abdollah, Ali, et al.
Pubblicazione: (2024)
di: Abdollah, Ali, et al.
Pubblicazione: (2024)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
Selective Vision-Language Subspace Projection for Few-shot CLIP
di: Zhu, Xingyu, et al.
Pubblicazione: (2024)
di: Zhu, Xingyu, et al.
Pubblicazione: (2024)
Linguistics-Vision Monotonic Consistent Network for Sign Language Production
di: Wang, Xu, et al.
Pubblicazione: (2024)
di: Wang, Xu, et al.
Pubblicazione: (2024)
Logic Unseen: Revealing the Logical Blindspots of Vision-Language Models
di: Zhou, Yuchen, et al.
Pubblicazione: (2025)
di: Zhou, Yuchen, et al.
Pubblicazione: (2025)
Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2026)
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2026)
Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding
di: Huang, Dawei, et al.
Pubblicazione: (2025)
di: Huang, Dawei, et al.
Pubblicazione: (2025)
Noise-Tolerant Learning for Audio-Visual Action Recognition
di: Han, Haochen, et al.
Pubblicazione: (2022)
di: Han, Haochen, et al.
Pubblicazione: (2022)
Exploring the Distinctiveness and Fidelity of the Descriptions Generated by Large Vision-Language Models
di: Huang, Yuhang, et al.
Pubblicazione: (2024)
di: Huang, Yuhang, et al.
Pubblicazione: (2024)
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models
di: Zhu, Hongyi, et al.
Pubblicazione: (2024)
di: Zhu, Hongyi, et al.
Pubblicazione: (2024)
Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues
di: Feng, X., et al.
Pubblicazione: (2024)
di: Feng, X., et al.
Pubblicazione: (2024)
MAO: Efficient Model-Agnostic Optimization of Prompt Tuning for Vision-Language Models
di: Li, Haoyang, et al.
Pubblicazione: (2025)
di: Li, Haoyang, et al.
Pubblicazione: (2025)
Spatio-Temporal Data Enhanced Vision-Language Model for Traffic Scene Understanding
di: Ma, Jingtian, et al.
Pubblicazione: (2025)
di: Ma, Jingtian, et al.
Pubblicazione: (2025)
Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models
di: Jin, Hyundong, et al.
Pubblicazione: (2025)
di: Jin, Hyundong, et al.
Pubblicazione: (2025)
Improving Multi-modal Large Language Model through Boosting Vision Capabilities
di: Sun, Yanpeng, et al.
Pubblicazione: (2024)
di: Sun, Yanpeng, et al.
Pubblicazione: (2024)
DIRECT: Video Mashup Creation via Hierarchical Multi-Agent Planning and Intent-Guided Editing
di: Li, Ke, et al.
Pubblicazione: (2026)
di: Li, Ke, et al.
Pubblicazione: (2026)
Serial Low-rank Adaptation of Vision Transformer
di: Zhong, Houqiang, et al.
Pubblicazione: (2025)
di: Zhong, Houqiang, et al.
Pubblicazione: (2025)
Vision-Language Models Learn Super Images for Efficient Partially Relevant Video Retrieval
di: Nishimura, Taichi, et al.
Pubblicazione: (2023)
di: Nishimura, Taichi, et al.
Pubblicazione: (2023)
Documenti analoghi
-
PRET: Planning with Directed Fidelity Trajectory for Vision and Language Navigation
di: Lu, Renjie, et al.
Pubblicazione: (2024) -
Augment Before Copy-Paste: Data and Memory Efficiency-Oriented Instance Segmentation Framework for Sport-scenes
di: Hsu, Chih-Chung, et al.
Pubblicazione: (2024) -
PlanMoGPT: Flow-Enhanced Progressive Planning for Text to Motion Synthesis
di: Jin, Chuhao, et al.
Pubblicazione: (2025) -
PanoGen++: Domain-Adapted Text-Guided Panoramic Environment Generation for Vision-and-Language Navigation
di: Wang, Sen, et al.
Pubblicazione: (2025) -
Agent Journey Beyond RGB: Hierarchical Semantic-Spatial Representation Enrichment for Vision-and-Language Navigation
di: Zhang, Xuesong, et al.
Pubblicazione: (2024)