Actional Atomic-Concept Learning for Demystifying Vision-Language Navigation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lin, Bingqian, Zhu, Yi, Liang, Xiaodan, Lin, Liang, Liu, Jianzhuang |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Correctable Landmark Discovery via Large Models for Vision-Language Navigation
par: Lin, Bingqian, et autres
Publié: (2024)
par: Lin, Bingqian, et autres
Publié: (2024)
Towards Deviation-Robust Agent Navigation via Perturbation-Aware Contrastive Learning
par: Lin, Bingqian, et autres
Publié: (2024)
par: Lin, Bingqian, et autres
Publié: (2024)
MapGPT: Map-Guided Prompting with Adaptive Path Planning for Vision-and-Language Navigation
par: Chen, Jiaqi, et autres
Publié: (2024)
par: Chen, Jiaqi, et autres
Publié: (2024)
Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
par: Wei, Ziming, et autres
Publié: (2025)
par: Wei, Ziming, et autres
Publié: (2025)
NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning
par: Lin, Bingqian, et autres
Publié: (2024)
par: Lin, Bingqian, et autres
Publié: (2024)
Structured Preference Optimization for Vision-Language Long-Horizon Task Planning
par: Liang, Xiwen, et autres
Publié: (2025)
par: Liang, Xiwen, et autres
Publié: (2025)
EvolveNav: Empowering LLM-Based Vision-Language Navigation via Self-Improving Embodied Reasoning
par: Lin, Bingqian, et autres
Publié: (2025)
par: Lin, Bingqian, et autres
Publié: (2025)
Language-Driven Visual Consensus for Zero-Shot Semantic Segmentation
par: Zhang, Zicheng, et autres
Publié: (2024)
par: Zhang, Zicheng, et autres
Publié: (2024)
CorNav: Autonomous Agent with Self-Corrected Planning for Zero-Shot Vision-and-Language Navigation
par: Liang, Xiwen, et autres
Publié: (2023)
par: Liang, Xiwen, et autres
Publié: (2023)
AtomicVLA: Unlocking the Potential of Atomic Skill Learning in Robots
par: Zhang, Likui, et autres
Publié: (2026)
par: Zhang, Likui, et autres
Publié: (2026)
Efficient Training of Large Vision Models via Advanced Automated Progressive Learning
par: Li, Changlin, et autres
Publié: (2024)
par: Li, Changlin, et autres
Publié: (2024)
PIVOT-R: Primitive-Driven Waypoint-Aware World Model for Robotic Manipulation
par: Zhang, Kaidong, et autres
Publié: (2024)
par: Zhang, Kaidong, et autres
Publié: (2024)
Dual-Anchoring: Addressing State Drift in Vision-Language Navigation
par: Wu, Kangyi, et autres
Publié: (2026)
par: Wu, Kangyi, et autres
Publié: (2026)
Vision-and-Language Navigation via Causal Learning
par: Wang, Liuyi, et autres
Publié: (2024)
par: Wang, Liuyi, et autres
Publié: (2024)
TINA: Think, Interaction, and Action Framework for Zero-Shot Vision Language Navigation
par: Li, Dingbang, et autres
Publié: (2024)
par: Li, Dingbang, et autres
Publié: (2024)
Learning to Retrieve Navigable Candidates for Efficient Vision-and-Language Navigation
par: Gu, Shutian, et autres
Publié: (2026)
par: Gu, Shutian, et autres
Publié: (2026)
PhyBlock: A Progressive Benchmark for Physical Understanding and Planning via 3D Block Assembly
par: Ma, Liang, et autres
Publié: (2025)
par: Ma, Liang, et autres
Publié: (2025)
Large Vision-Language Models Get Lost in Attention
par: Xi, Gongli, et autres
Publié: (2026)
par: Xi, Gongli, et autres
Publié: (2026)
Demystifying Video Reasoning
par: Wang, Ruisi, et autres
Publié: (2026)
par: Wang, Ruisi, et autres
Publié: (2026)
RoBridge: A Hierarchical Architecture Bridging Cognition and Execution for General Robotic Manipulation
par: Zhang, Kaidong, et autres
Publié: (2025)
par: Zhang, Kaidong, et autres
Publié: (2025)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
par: An, Ruichuan, et autres
Publié: (2025)
par: An, Ruichuan, et autres
Publié: (2025)
RADAR: Revealing Asymmetric Development of Abilities in MLLM Pre-training
par: Nie, Yunshuang, et autres
Publié: (2026)
par: Nie, Yunshuang, et autres
Publié: (2026)
Demystifying KAN for Vision Tasks: The RepKAN Approach
par: Cheon, Minjong
Publié: (2026)
par: Cheon, Minjong
Publié: (2026)
MVEB: Self-Supervised Learning with Multi-View Entropy Bottleneck
par: Wen, Liangjian, et autres
Publié: (2024)
par: Wen, Liangjian, et autres
Publié: (2024)
SpatialFly: Geometry-Guided Representation Alignment for UAV Vision-and-Language Navigation in Urban Environments
par: Jiang, Wen, et autres
Publié: (2026)
par: Jiang, Wen, et autres
Publié: (2026)
A Retrospect to Multi-prompt Learning across Vision and Language
par: Chen, Ziliang, et autres
Publié: (2025)
par: Chen, Ziliang, et autres
Publié: (2025)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
par: An, Ruichuan, et autres
Publié: (2024)
par: An, Ruichuan, et autres
Publié: (2024)
Continual Vision-and-Language Navigation
par: Jeong, Seongjun, et autres
Publié: (2024)
par: Jeong, Seongjun, et autres
Publié: (2024)
Tiny-Engram: Trigger-Indexed Concept Tables for Generative Vision
par: Cai, Runyuan, et autres
Publié: (2026)
par: Cai, Runyuan, et autres
Publié: (2026)
RoomTour3D: Geometry-Aware Video-Instruction Tuning for Embodied Navigation
par: Han, Mingfei, et autres
Publié: (2024)
par: Han, Mingfei, et autres
Publié: (2024)
SAUCE: Selective Concept Unlearning in Vision-Language Models with Sparse Autoencoders
par: Li, Qing, et autres
Publié: (2025)
par: Li, Qing, et autres
Publié: (2025)
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
par: Liu, Hanqing, et autres
Publié: (2026)
par: Liu, Hanqing, et autres
Publié: (2026)
Demystifying the Potential of ChatGPT-4 Vision for Construction Progress Monitoring
par: Ersoz, Ahmet Bahaddin
Publié: (2024)
par: Ersoz, Ahmet Bahaddin
Publié: (2024)
\textsc{NaVIDA}: Vision-Language Navigation with Inverse Dynamics Augmentation
par: Zhu, Weiye, et autres
Publié: (2026)
par: Zhu, Weiye, et autres
Publié: (2026)
Quantifying In-Context Reasoning Effects and Memorization Effects in LLMs
par: Lou, Siyu, et autres
Publié: (2024)
par: Lou, Siyu, et autres
Publié: (2024)
Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models
par: Liang, Shuang, et autres
Publié: (2025)
par: Liang, Shuang, et autres
Publié: (2025)
Assessing Privacy Preservation and Utility in Online Vision-Language Models
par: Chaudhari, Karmesh Siddharam, et autres
Publié: (2026)
par: Chaudhari, Karmesh Siddharam, et autres
Publié: (2026)
PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment
par: Liu, Zhendong, et autres
Publié: (2024)
par: Liu, Zhendong, et autres
Publié: (2024)
PROSPECT: Unified Streaming Vision-Language Navigation via Semantic--Spatial Fusion and Latent Predictive Representation
par: Fan, Zehua, et autres
Publié: (2026)
par: Fan, Zehua, et autres
Publié: (2026)
ViSA-Enhanced Aerial VLN: A Visual-Spatial Reasoning Enhanced Framework for Aerial Vision-Language Navigation
par: Tong, Haoyu, et autres
Publié: (2026)
par: Tong, Haoyu, et autres
Publié: (2026)
Documents similaires
-
Correctable Landmark Discovery via Large Models for Vision-Language Navigation
par: Lin, Bingqian, et autres
Publié: (2024) -
Towards Deviation-Robust Agent Navigation via Perturbation-Aware Contrastive Learning
par: Lin, Bingqian, et autres
Publié: (2024) -
MapGPT: Map-Guided Prompting with Adaptive Path Planning for Vision-and-Language Navigation
par: Chen, Jiaqi, et autres
Publié: (2024) -
Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
par: Wei, Ziming, et autres
Publié: (2025) -
NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning
par: Lin, Bingqian, et autres
Publié: (2024)