Navigation with VLM framework: Towards Going to Any Language
Fuente:
arXiv
Guardado en:
| Autores principales: | Yin, Zecheng, Cheng, Chonghao, Guo, and Yao, Li, Zhen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SleepVLM: Explainable and Rule-Grounded Sleep Staging via a Vision-Language Model
por: Deng, Guifeng, et al.
Publicado: (2026)
por: Deng, Guifeng, et al.
Publicado: (2026)
CultureVLM: Characterizing and Improving Cultural Understanding of Vision-Language Models for over 100 Countries
por: Liu, Shudong, et al.
Publicado: (2025)
por: Liu, Shudong, et al.
Publicado: (2025)
PatientVLM Meets DocVLM: Pre-Consultation Dialogue Between Vision-Language Models for Efficient Diagnosis
por: Lokesh, K, et al.
Publicado: (2026)
por: Lokesh, K, et al.
Publicado: (2026)
Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs
por: Wang, Haochen, et al.
Publicado: (2025)
por: Wang, Haochen, et al.
Publicado: (2025)
TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions
por: Chen, Ce, et al.
Publicado: (2026)
por: Chen, Ce, et al.
Publicado: (2026)
NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching
por: Luo, Run, et al.
Publicado: (2025)
por: Luo, Run, et al.
Publicado: (2025)
Towards Predicting Any Human Trajectory In Context
por: Fujii, Ryo, et al.
Publicado: (2025)
por: Fujii, Ryo, et al.
Publicado: (2025)
StreamingVLM: Real-Time Understanding for Infinite Video Streams
por: Xu, Ruyi, et al.
Publicado: (2025)
por: Xu, Ruyi, et al.
Publicado: (2025)
AnyTraverse: An off-road traversability framework with VLM and human operator in the loop
por: Sahu, Sattwik, et al.
Publicado: (2025)
por: Sahu, Sattwik, et al.
Publicado: (2025)
Nüwa: Mending the Spatial Integrity Torn by VLM Token Pruning
por: Huang, Yihong, et al.
Publicado: (2026)
por: Huang, Yihong, et al.
Publicado: (2026)
Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models
por: Qu, Kevin, et al.
Publicado: (2026)
por: Qu, Kevin, et al.
Publicado: (2026)
VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks
por: Jiang, Ziyan, et al.
Publicado: (2024)
por: Jiang, Ziyan, et al.
Publicado: (2024)
SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes
por: Liu, Tianhui, et al.
Publicado: (2026)
por: Liu, Tianhui, et al.
Publicado: (2026)
SAM2Point: Segment Any 3D as Videos in Zero-shot and Promptable Manners
por: Guo, Ziyu, et al.
Publicado: (2024)
por: Guo, Ziyu, et al.
Publicado: (2024)
Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
por: Wang, Peng, et al.
Publicado: (2024)
por: Wang, Peng, et al.
Publicado: (2024)
HPE-CogVLM: Advancing Vision Language Models with a Head Pose Grounding Task
por: Tian, Yu, et al.
Publicado: (2024)
por: Tian, Yu, et al.
Publicado: (2024)
Navigating the Nuances: A Fine-grained Evaluation of Vision-Language Navigation
por: Wang, Zehao, et al.
Publicado: (2024)
por: Wang, Zehao, et al.
Publicado: (2024)
Bootstrapping Language-Guided Navigation Learning with Self-Refining Data Flywheel
por: Wang, Zun, et al.
Publicado: (2024)
por: Wang, Zun, et al.
Publicado: (2024)
VLURes: Benchmarking VLM Visual and Linguistic Understanding in Low-Resource Languages
por: Atuhurra, Jesse, et al.
Publicado: (2025)
por: Atuhurra, Jesse, et al.
Publicado: (2025)
VLN-Video: Utilizing Driving Videos for Outdoor Vision-and-Language Navigation
por: Li, Jialu, et al.
Publicado: (2024)
por: Li, Jialu, et al.
Publicado: (2024)
G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
por: Hu, Wenbo, et al.
Publicado: (2025)
por: Hu, Wenbo, et al.
Publicado: (2025)
General Scene Adaptation for Vision-and-Language Navigation
por: Hong, Haodong, et al.
Publicado: (2025)
por: Hong, Haodong, et al.
Publicado: (2025)
CorNav: Autonomous Agent with Self-Corrected Planning for Zero-Shot Vision-and-Language Navigation
por: Liang, Xiwen, et al.
Publicado: (2023)
por: Liang, Xiwen, et al.
Publicado: (2023)
See, Point, Fly: A Learning-Free VLM Framework for Universal Unmanned Aerial Navigation
por: Hu, Chih Yao, et al.
Publicado: (2025)
por: Hu, Chih Yao, et al.
Publicado: (2025)
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
por: Ji, Yicheng, et al.
Publicado: (2025)
por: Ji, Yicheng, et al.
Publicado: (2025)
What Limits Vision-and-Language Navigation ?
por: Wang, Yunheng, et al.
Publicado: (2026)
por: Wang, Yunheng, et al.
Publicado: (2026)
BabyVLM: Data-Efficient Pretraining of VLMs Inspired by Infant Learning
por: Wang, Shengao, et al.
Publicado: (2025)
por: Wang, Shengao, et al.
Publicado: (2025)
ReVision: A Dataset and Baseline VLM for Privacy-Preserving Task-Oriented Visual Instruction Rewriting
por: Mishra, Abhijit, et al.
Publicado: (2025)
por: Mishra, Abhijit, et al.
Publicado: (2025)
AlignGPT: Multi-modal Large Language Models with Adaptive Alignment Capability
por: Zhao, Fei, et al.
Publicado: (2024)
por: Zhao, Fei, et al.
Publicado: (2024)
Towards Understanding Camera Motions in Any Video
por: Lin, Zhiqiu, et al.
Publicado: (2025)
por: Lin, Zhiqiu, et al.
Publicado: (2025)
Beyond Captioning: Task-Specific Prompting for Improved VLM Performance in Mathematical Reasoning
por: Singh, Ayush, et al.
Publicado: (2024)
por: Singh, Ayush, et al.
Publicado: (2024)
GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning
por: Ebouky, Brown, et al.
Publicado: (2026)
por: Ebouky, Brown, et al.
Publicado: (2026)
Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation
por: Yu, Seonghoon, et al.
Publicado: (2026)
por: Yu, Seonghoon, et al.
Publicado: (2026)
Arrow-Guided VLM: Enhancing Flowchart Understanding via Arrow Direction Encoding
por: Omasa, Takamitsu, et al.
Publicado: (2025)
por: Omasa, Takamitsu, et al.
Publicado: (2025)
Bridging vision language model (VLM) evaluation gaps with a framework for scalable and cost-effective benchmark generation
por: Rädsch, Tim, et al.
Publicado: (2025)
por: Rädsch, Tim, et al.
Publicado: (2025)
Correctable Landmark Discovery via Large Models for Vision-Language Navigation
por: Lin, Bingqian, et al.
Publicado: (2024)
por: Lin, Bingqian, et al.
Publicado: (2024)
OmniBench: Towards The Future of Universal Omni-Language Models
por: Li, Yizhi, et al.
Publicado: (2024)
por: Li, Yizhi, et al.
Publicado: (2024)
AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
por: Suglia, Alessandro, et al.
Publicado: (2024)
por: Suglia, Alessandro, et al.
Publicado: (2024)
CropVLM: Learning to Zoom for Fine-Grained Vision-Language Perception
por: Carvalho, Miguel, et al.
Publicado: (2025)
por: Carvalho, Miguel, et al.
Publicado: (2025)
Why Only Text: Empowering Vision-and-Language Navigation with Multi-modal Prompts
por: Hong, Haodong, et al.
Publicado: (2024)
por: Hong, Haodong, et al.
Publicado: (2024)
Ejemplares similares
-
SleepVLM: Explainable and Rule-Grounded Sleep Staging via a Vision-Language Model
por: Deng, Guifeng, et al.
Publicado: (2026) -
CultureVLM: Characterizing and Improving Cultural Understanding of Vision-Language Models for over 100 Countries
por: Liu, Shudong, et al.
Publicado: (2025) -
PatientVLM Meets DocVLM: Pre-Consultation Dialogue Between Vision-Language Models for Efficient Diagnosis
por: Lokesh, K, et al.
Publicado: (2026) -
Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs
por: Wang, Haochen, et al.
Publicado: (2025) -
TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions
por: Chen, Ce, et al.
Publicado: (2026)