Malicious Path Manipulations via Exploitation of Representation Vulnerabilities of Vision-Language Navigation Systems
Fuente:
arXiv
Guardado en:
| Autores principales: | Islam, Chashi Mahiul, Salman, Shaeke, Shams, Montasir, Liu, Xiuwen, Kumar, Piyush |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Are Vision Transformer Representations Semantically Meaningful? A Case Study in Medical Imaging
por: Shams, Montasir, et al.
Publicado: (2025)
por: Shams, Montasir, et al.
Publicado: (2025)
Intriguing Equivalence Structures of the Embedding Space of Vision Transformers
por: Salman, Shaeke, et al.
Publicado: (2024)
por: Salman, Shaeke, et al.
Publicado: (2024)
Mechanistic Understandings of Representation Vulnerabilities and Engineering Robust Vision Transformers
por: Islam, Chashi Mahiul, et al.
Publicado: (2025)
por: Islam, Chashi Mahiul, et al.
Publicado: (2025)
Intriguing Differences Between Zero-Shot and Systematic Evaluations of Vision-Language Transformer Models
por: Salman, Shaeke, et al.
Publicado: (2024)
por: Salman, Shaeke, et al.
Publicado: (2024)
DeepSeek on a Trip: Inducing Targeted Visual Hallucinations via Representation Vulnerabilities
por: Islam, Chashi Mahiul, et al.
Publicado: (2025)
por: Islam, Chashi Mahiul, et al.
Publicado: (2025)
Unaligning Everything: Or Aligning Any Text to Any Image in Multimodal Models
por: Salman, Shaeke, et al.
Publicado: (2024)
por: Salman, Shaeke, et al.
Publicado: (2024)
Numerical Instability and Chaos: Quantifying the Unpredictability of Large Language Models
por: Islam, Chashi Mahiul, et al.
Publicado: (2026)
por: Islam, Chashi Mahiul, et al.
Publicado: (2026)
Spatial-ViLT: Enhancing Visual Spatial Reasoning through Multi-Task Learning
por: Islam, Chashi Mahiul, et al.
Publicado: (2025)
por: Islam, Chashi Mahiul, et al.
Publicado: (2025)
Lookahead Exploration with Neural Radiance Representation for Continuous Vision-Language Navigation
por: Wang, Zihan, et al.
Publicado: (2024)
por: Wang, Zihan, et al.
Publicado: (2024)
Implicit Geometry Representations for Vision-and-Language Navigation from Web Videos
por: Han, Mingfei, et al.
Publicado: (2026)
por: Han, Mingfei, et al.
Publicado: (2026)
See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation
por: Dai, Tingjun, et al.
Publicado: (2026)
por: Dai, Tingjun, et al.
Publicado: (2026)
Instance-aware Exploration-Verification-Exploitation for Instance ImageGoal Navigation
por: Lei, Xiaohan, et al.
Publicado: (2024)
por: Lei, Xiaohan, et al.
Publicado: (2024)
Stop Wandering: Efficient Vision-Language Navigation via Metacognitive Reasoning
por: Li, Xueying, et al.
Publicado: (2026)
por: Li, Xueying, et al.
Publicado: (2026)
MapGPT: Map-Guided Prompting with Adaptive Path Planning for Vision-and-Language Navigation
por: Chen, Jiaqi, et al.
Publicado: (2024)
por: Chen, Jiaqi, et al.
Publicado: (2024)
DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation
por: Shi, Haoxiang, et al.
Publicado: (2025)
por: Shi, Haoxiang, et al.
Publicado: (2025)
Structured Observation Language for Efficient and Generalizable Vision-Language Navigation
por: Peng, Daojie, et al.
Publicado: (2026)
por: Peng, Daojie, et al.
Publicado: (2026)
StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling
por: Wei, Meng, et al.
Publicado: (2025)
por: Wei, Meng, et al.
Publicado: (2025)
Sim-to-Real Transfer via 3D Feature Fields for Vision-and-Language Navigation
por: Wang, Zihan, et al.
Publicado: (2024)
por: Wang, Zihan, et al.
Publicado: (2024)
SEBVS: Synthetic Event-based Visual Servoing for Robot Navigation and Manipulation
por: Vinod, Krishna, et al.
Publicado: (2025)
por: Vinod, Krishna, et al.
Publicado: (2025)
A Vision-Based Navigation System for Arable Fields
por: de Silva, Rajitha, et al.
Publicado: (2023)
por: de Silva, Rajitha, et al.
Publicado: (2023)
Does Peer Observation Help? Vision-Sharing Collaboration for Vision-Language Navigation
por: Jin, Qunchao, et al.
Publicado: (2026)
por: Jin, Qunchao, et al.
Publicado: (2026)
Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
por: Fang, Xiang, et al.
Publicado: (2026)
por: Fang, Xiang, et al.
Publicado: (2026)
RoboGround: Robotic Manipulation with Grounded Vision-Language Priors
por: Huang, Haifeng, et al.
Publicado: (2025)
por: Huang, Haifeng, et al.
Publicado: (2025)
Hijacking Vision-and-Language Navigation Agents with Adversarial Environmental Attacks
por: Yang, Zijiao, et al.
Publicado: (2024)
por: Yang, Zijiao, et al.
Publicado: (2024)
MonoDream: Monocular Vision-Language Navigation with Panoramic Dreaming
por: Wang, Shuo, et al.
Publicado: (2025)
por: Wang, Shuo, et al.
Publicado: (2025)
VISTAv2: World Imagination for Indoor Vision-and-Language Navigation
por: Huang, Yanjia, et al.
Publicado: (2025)
por: Huang, Yanjia, et al.
Publicado: (2025)
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
por: Guo, Wenxuan, et al.
Publicado: (2026)
por: Guo, Wenxuan, et al.
Publicado: (2026)
SPOC: Imitating Shortest Paths in Simulation Enables Effective Navigation and Manipulation in the Real World
por: Ehsani, Kiana, et al.
Publicado: (2023)
por: Ehsani, Kiana, et al.
Publicado: (2023)
CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling
por: Li, Hao, et al.
Publicado: (2025)
por: Li, Hao, et al.
Publicado: (2025)
Exploring the Limits of Vision-Language-Action Manipulations in Cross-task Generalization
por: Zhou, Jiaming, et al.
Publicado: (2025)
por: Zhou, Jiaming, et al.
Publicado: (2025)
UniHM: Unified Dexterous Hand Manipulation with Vision Language Model
por: Zhang, Zhenhao, et al.
Publicado: (2026)
por: Zhang, Zhenhao, et al.
Publicado: (2026)
Vision Language Action Models in Robotic Manipulation: A Systematic Review
por: Din, Muhayy Ud, et al.
Publicado: (2025)
por: Din, Muhayy Ud, et al.
Publicado: (2025)
History-Enhanced Two-Stage Transformer for Aerial Vision-and-Language Navigation
por: Ding, Xichen, et al.
Publicado: (2025)
por: Ding, Xichen, et al.
Publicado: (2025)
FlexVLN: Flexible Adaptation for Diverse Vision-and-Language Navigation Tasks
por: Zhang, Siqi, et al.
Publicado: (2025)
por: Zhang, Siqi, et al.
Publicado: (2025)
Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation
por: Bao, Muyi, et al.
Publicado: (2026)
por: Bao, Muyi, et al.
Publicado: (2026)
Constraint-Aware Zero-Shot Vision-Language Navigation in Continuous Environments
por: Chen, Kehan, et al.
Publicado: (2024)
por: Chen, Kehan, et al.
Publicado: (2024)
NaVILA: Legged Robot Vision-Language-Action Model for Navigation
por: Cheng, An-Chieh, et al.
Publicado: (2024)
por: Cheng, An-Chieh, et al.
Publicado: (2024)
Recursive Visual Imagination and Adaptive Linguistic Grounding for Vision Language Navigation
por: Chen, Bolei, et al.
Publicado: (2025)
por: Chen, Bolei, et al.
Publicado: (2025)
Towards Realistic UAV Vision-Language Navigation: Platform, Benchmark, and Methodology
por: Wang, Xiangyu, et al.
Publicado: (2024)
por: Wang, Xiangyu, et al.
Publicado: (2024)
COSMO: Combination of Selective Memorization for Low-cost Vision-and-Language Navigation
por: Zhang, Siqi, et al.
Publicado: (2025)
por: Zhang, Siqi, et al.
Publicado: (2025)
Ejemplares similares
-
Are Vision Transformer Representations Semantically Meaningful? A Case Study in Medical Imaging
por: Shams, Montasir, et al.
Publicado: (2025) -
Intriguing Equivalence Structures of the Embedding Space of Vision Transformers
por: Salman, Shaeke, et al.
Publicado: (2024) -
Mechanistic Understandings of Representation Vulnerabilities and Engineering Robust Vision Transformers
por: Islam, Chashi Mahiul, et al.
Publicado: (2025) -
Intriguing Differences Between Zero-Shot and Systematic Evaluations of Vision-Language Transformer Models
por: Salman, Shaeke, et al.
Publicado: (2024) -
DeepSeek on a Trip: Inducing Targeted Visual Hallucinations via Representation Vulnerabilities
por: Islam, Chashi Mahiul, et al.
Publicado: (2025)