Dynamic Topology Awareness: Breaking the Granularity Rigidity in Vision-Language Navigation
Fuente:
arXiv
Guardado en:
| Autores principales: | Peng, Jiankun, Guo, Jianyuan, Xu, Ying, Liu, Yue, Yan, Jiashuang, Ye, Xuanwei, Li, Houhua, Wang, Xiaoming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LCGNav: Local Candidate-Aware Geometric Enhancement for General Topological Planning in Vision-Language Navigation
por: Peng, Jiankun, et al.
Publicado: (2026)
por: Peng, Jiankun, et al.
Publicado: (2026)
Uncertainty-Aware Gaussian Map for Vision-Language Navigation
por: Gao, Jianzhe, et al.
Publicado: (2026)
por: Gao, Jianzhe, et al.
Publicado: (2026)
TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation
por: Liu, Jiaxing, et al.
Publicado: (2026)
por: Liu, Jiaxing, et al.
Publicado: (2026)
Semantic Granularity Navigation in Image Editing
por: Lu, Liangsi, et al.
Publicado: (2026)
por: Lu, Liangsi, et al.
Publicado: (2026)
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
por: Guo, Wenxuan, et al.
Publicado: (2026)
por: Guo, Wenxuan, et al.
Publicado: (2026)
Constraint-Aware Zero-Shot Vision-Language Navigation in Continuous Environments
por: Chen, Kehan, et al.
Publicado: (2024)
por: Chen, Kehan, et al.
Publicado: (2024)
World-Consistent Data Generation for Vision-and-Language Navigation
por: Zhong, Yu, et al.
Publicado: (2024)
por: Zhong, Yu, et al.
Publicado: (2024)
GAGS: Granularity-Aware Feature Distillation for Language Gaussian Splatting
por: Peng, Yuning, et al.
Publicado: (2024)
por: Peng, Yuning, et al.
Publicado: (2024)
Vision Superalignment: Weak-to-Strong Generalization for Vision Foundation Models
por: Guo, Jianyuan, et al.
Publicado: (2024)
por: Guo, Jianyuan, et al.
Publicado: (2024)
Bridging Sign and Spoken Languages: Pseudo Gloss Generation for Sign Language Translation
por: Guo, Jianyuan, et al.
Publicado: (2025)
por: Guo, Jianyuan, et al.
Publicado: (2025)
PASTS: Progress-Aware Spatio-Temporal Transformer Speaker For Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2023)
por: Wang, Liuyi, et al.
Publicado: (2023)
ADEM-VL: Adaptive and Embedded Fusion for Efficient Vision-Language Tuning
por: Hao, Zhiwei, et al.
Publicado: (2024)
por: Hao, Zhiwei, et al.
Publicado: (2024)
Omegance: A Single Parameter for Various Granularities in Diffusion-Based Synthesis
por: Hou, Xinyu, et al.
Publicado: (2024)
por: Hou, Xinyu, et al.
Publicado: (2024)
DAP: Domain-aware Prompt Learning for Vision-and-Language Navigation
por: Liu, Ting, et al.
Publicado: (2023)
por: Liu, Ting, et al.
Publicado: (2023)
Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents
por: Ma, Tianyi, et al.
Publicado: (2025)
por: Ma, Tianyi, et al.
Publicado: (2025)
PA-Attack: Guiding Gray-Box Attacks on LVLM Vision Encoders with Prototypes and Attention
por: Mei, Hefei, et al.
Publicado: (2026)
por: Mei, Hefei, et al.
Publicado: (2026)
LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation
por: Ning, Yuwei, et al.
Publicado: (2026)
por: Ning, Yuwei, et al.
Publicado: (2026)
Rethinking Vision-Language Model in Face Forensics: Multi-Modal Interpretable Forged Face Detector
por: Guo, Xiao, et al.
Publicado: (2025)
por: Guo, Xiao, et al.
Publicado: (2025)
Dynamic Granularity Matters: Rethinking Vision Transformers Beyond Fixed Patch Splitting
por: Yu, Qiyang, et al.
Publicado: (2025)
por: Yu, Qiyang, et al.
Publicado: (2025)
Human-Aware Vision-and-Language Navigation: Bridging Simulation to Reality with Dynamic Human Interactions
por: Li, Heng, et al.
Publicado: (2024)
por: Li, Heng, et al.
Publicado: (2024)
ETPNav: Evolving Topological Planning for Vision-Language Navigation in Continuous Environments
por: An, Dong, et al.
Publicado: (2023)
por: An, Dong, et al.
Publicado: (2023)
Topology-Aware Layer Pruning for Large Vision-Language Models
por: Zheng, Pengcheng, et al.
Publicado: (2026)
por: Zheng, Pengcheng, et al.
Publicado: (2026)
Cluster-Aware Neural Collapse Prompt Tuning for Long-Tailed Generalization of Vision-Language Models
por: Guo, Boyang, et al.
Publicado: (2026)
por: Guo, Boyang, et al.
Publicado: (2026)
Granular Privacy Control for Geolocation with Vision Language Models
por: Mendes, Ethan, et al.
Publicado: (2024)
por: Mendes, Ethan, et al.
Publicado: (2024)
Hierarchical Spatial Proximity Reasoning for Vision-and-Language Navigation
por: Xu, Ming, et al.
Publicado: (2024)
por: Xu, Ming, et al.
Publicado: (2024)
Structured Observation Language for Efficient and Generalizable Vision-Language Navigation
por: Peng, Daojie, et al.
Publicado: (2026)
por: Peng, Daojie, et al.
Publicado: (2026)
Multi-Granularity Class Prototype Topology Distillation for Class-Incremental Source-Free Unsupervised Domain Adaptation
por: Deng, Peihua, et al.
Publicado: (2024)
por: Deng, Peihua, et al.
Publicado: (2024)
Breaking the Rigid Prior: Towards Articulated 3D Anomaly Detection
por: Gan, Jinye, et al.
Publicado: (2026)
por: Gan, Jinye, et al.
Publicado: (2026)
PanoGen++: Domain-Adapted Text-Guided Panoramic Environment Generation for Vision-and-Language Navigation
por: Wang, Sen, et al.
Publicado: (2025)
por: Wang, Sen, et al.
Publicado: (2025)
GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation
por: Yang, Jiahao, et al.
Publicado: (2026)
por: Yang, Jiahao, et al.
Publicado: (2026)
Breaking the Encoder Barrier for Seamless Video-Language Understanding
por: Li, Handong, et al.
Publicado: (2025)
por: Li, Handong, et al.
Publicado: (2025)
GeminiFusion: Efficient Pixel-wise Multimodal Fusion for Vision Transformer
por: Jia, Ding, et al.
Publicado: (2024)
por: Jia, Ding, et al.
Publicado: (2024)
RSUniVLM: A Unified Vision Language Model for Remote Sensing via Granularity-oriented Mixture of Experts
por: Liu, Xu, et al.
Publicado: (2024)
por: Liu, Xu, et al.
Publicado: (2024)
From Static to Dynamic: a Survey of Topology-Aware Perception in Autonomous Driving
por: Chen, Yixiao, et al.
Publicado: (2025)
por: Chen, Yixiao, et al.
Publicado: (2025)
\textsc{NaVIDA}: Vision-Language Navigation with Inverse Dynamics Augmentation
por: Zhu, Weiye, et al.
Publicado: (2026)
por: Zhu, Weiye, et al.
Publicado: (2026)
GC-VLN: Instruction as Graph Constraints for Training-free Vision-and-Language Navigation
por: Yin, Hang, et al.
Publicado: (2025)
por: Yin, Hang, et al.
Publicado: (2025)
Data-efficient Large Vision Models through Sequential Autoregression
por: Guo, Jianyuan, et al.
Publicado: (2024)
por: Guo, Jianyuan, et al.
Publicado: (2024)
Fast-Slow Test-Time Adaptation for Online Vision-and-Language Navigation
por: Gao, Junyu, et al.
Publicado: (2023)
por: Gao, Junyu, et al.
Publicado: (2023)
TagSplat: Topology-Aware Gaussian Splatting for Dynamic Mesh Modeling and Tracking
por: Guo, Hanzhi, et al.
Publicado: (2025)
por: Guo, Hanzhi, et al.
Publicado: (2025)
MSNav: Zero-Shot Vision-and-Language Navigation with Dynamic Memory and LLM Spatial Reasoning
por: Liu, Chenghao, et al.
Publicado: (2025)
por: Liu, Chenghao, et al.
Publicado: (2025)
Ejemplares similares
-
LCGNav: Local Candidate-Aware Geometric Enhancement for General Topological Planning in Vision-Language Navigation
por: Peng, Jiankun, et al.
Publicado: (2026) -
Uncertainty-Aware Gaussian Map for Vision-Language Navigation
por: Gao, Jianzhe, et al.
Publicado: (2026) -
TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation
por: Liu, Jiaxing, et al.
Publicado: (2026) -
Semantic Granularity Navigation in Image Editing
por: Lu, Liangsi, et al.
Publicado: (2026) -
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
por: Guo, Wenxuan, et al.
Publicado: (2026)