MLANet: Multi-Level Attention Network with Sub-instruction for Continuous Vision-and-Language Navigation
Fuente:
arXiv
Guardado en:
| Autores principales: | He, Zongtao, Wang, Liuyi, Li, Shu, Yan, Qingqing, Liu, Chengju, Chen, Qijun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Dual Semantic-Aware Recurrent Global-Adaptive Network For Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2023)
por: Wang, Liuyi, et al.
Publicado: (2023)
PASTS: Progress-Aware Spatio-Temporal Transformer Speaker For Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2023)
por: Wang, Liuyi, et al.
Publicado: (2023)
NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization
por: He, Zongtao, et al.
Publicado: (2025)
por: He, Zongtao, et al.
Publicado: (2025)
Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2024)
por: Wang, Liuyi, et al.
Publicado: (2024)
Vision-and-Language Navigation via Causal Learning
por: Wang, Liuyi, et al.
Publicado: (2024)
por: Wang, Liuyi, et al.
Publicado: (2024)
MAGIC: Meta-Ability Guided Interactive Chain-of-Distillation for Effective-and-Efficient Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2024)
por: Wang, Liuyi, et al.
Publicado: (2024)
Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration
por: Fazli, Mehrdad, et al.
Publicado: (2025)
por: Fazli, Mehrdad, et al.
Publicado: (2025)
P2DNav: Panorama-to-Downview Reasoning for Zero-shot Vision-and-Language Navigation
por: Sheng, Kai, et al.
Publicado: (2026)
por: Sheng, Kai, et al.
Publicado: (2026)
Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding
por: Luo, Chuwei, et al.
Publicado: (2022)
por: Luo, Chuwei, et al.
Publicado: (2022)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
por: Jiang, Chaoya, et al.
Publicado: (2024)
por: Jiang, Chaoya, et al.
Publicado: (2024)
COM Kitchens: An Unedited Overhead-view Video Dataset as a Vision-Language Benchmark
por: Maeda, Koki, et al.
Publicado: (2024)
por: Maeda, Koki, et al.
Publicado: (2024)
Enhancing the Learning Experience: Using Vision-Language Models to Generate Questions for Educational Videos
por: Stamatakis, Markos, et al.
Publicado: (2025)
por: Stamatakis, Markos, et al.
Publicado: (2025)
BioVL-QR: Egocentric Biochemical Vision-and-Language Dataset Using Micro QR Codes
por: Nishimoto, Tomohiro, et al.
Publicado: (2024)
por: Nishimoto, Tomohiro, et al.
Publicado: (2024)
Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models
por: Wu, Jiaying, et al.
Publicado: (2025)
por: Wu, Jiaying, et al.
Publicado: (2025)
VGA: Vision and Graph Fused Attention Network for Rumor Detection
por: Bai, Lin, et al.
Publicado: (2024)
por: Bai, Lin, et al.
Publicado: (2024)
Loc4Plan: Locating Before Planning for Outdoor Vision and Language Navigation
por: Tian, Huilin, et al.
Publicado: (2024)
por: Tian, Huilin, et al.
Publicado: (2024)
Hierarchical Sub-action Tree for Continuous Sign Language Recognition
por: Yang, Dejie, et al.
Publicado: (2025)
por: Yang, Dejie, et al.
Publicado: (2025)
Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities
por: Wang, Liuyi, et al.
Publicado: (2025)
por: Wang, Liuyi, et al.
Publicado: (2025)
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
por: Wang, Xiao, et al.
Publicado: (2025)
por: Wang, Xiao, et al.
Publicado: (2025)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
por: Ye, Weihao, et al.
Publicado: (2024)
por: Ye, Weihao, et al.
Publicado: (2024)
WordArt Designer API: User-Driven Artistic Typography Synthesis with Large Language Models on ModelScope
por: He, Jun-Yan, et al.
Publicado: (2024)
por: He, Jun-Yan, et al.
Publicado: (2024)
MuLTI: Efficient Video-and-Language Understanding with Text-Guided MultiWay-Sampler and Multiple Choice Modeling
por: Xu, Jiaqi, et al.
Publicado: (2023)
por: Xu, Jiaqi, et al.
Publicado: (2023)
EasyAnimate: High-Performance Video Generation Framework with Hybrid Windows Attention and Reward Backpropagation
por: Xu, Jiaqi, et al.
Publicado: (2024)
por: Xu, Jiaqi, et al.
Publicado: (2024)
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
por: An, Wenbin, et al.
Publicado: (2024)
por: An, Wenbin, et al.
Publicado: (2024)
Language Models as Black-Box Optimizers for Vision-Language Models
por: Liu, Shihong, et al.
Publicado: (2023)
por: Liu, Shihong, et al.
Publicado: (2023)
Hyperbolic Safety-Aware Vision-Language Models
por: Poppi, Tobia, et al.
Publicado: (2025)
por: Poppi, Tobia, et al.
Publicado: (2025)
Causal Graphical Models for Vision-Language Compositional Understanding
por: Parascandolo, Fiorenzo, et al.
Publicado: (2024)
por: Parascandolo, Fiorenzo, et al.
Publicado: (2024)
Agent Journey Beyond RGB: Hierarchical Semantic-Spatial Representation Enrichment for Vision-and-Language Navigation
por: Zhang, Xuesong, et al.
Publicado: (2024)
por: Zhang, Xuesong, et al.
Publicado: (2024)
Cross-modal Proxy Evolving for OOD Detection with Vision-Language Models
por: Tang, Hao, et al.
Publicado: (2026)
por: Tang, Hao, et al.
Publicado: (2026)
RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing
por: Zhang, Zilun, et al.
Publicado: (2023)
por: Zhang, Zilun, et al.
Publicado: (2023)
Multi-Modal Semantic Parsing for the Interpretation of Tombstone Inscriptions
por: Zhang, Xiao, et al.
Publicado: (2025)
por: Zhang, Xiao, et al.
Publicado: (2025)
PanoGen++: Domain-Adapted Text-Guided Panoramic Environment Generation for Vision-and-Language Navigation
por: Wang, Sen, et al.
Publicado: (2025)
por: Wang, Sen, et al.
Publicado: (2025)
MERIT: Multilingual Semantic Retrieval with Interleaved Multi-Condition Query
por: Chow, Wei, et al.
Publicado: (2025)
por: Chow, Wei, et al.
Publicado: (2025)
Positive-Augmented Contrastive Learning for Vision-and-Language Evaluation and Training
por: Sarto, Sara, et al.
Publicado: (2024)
por: Sarto, Sara, et al.
Publicado: (2024)
Multi-task Prompt Words Learning for Social Media Content Generation
por: Xue, Haochen, et al.
Publicado: (2024)
por: Xue, Haochen, et al.
Publicado: (2024)
LocoMotion: Learning Motion-Focused Video-Language Representations
por: Doughty, Hazel, et al.
Publicado: (2024)
por: Doughty, Hazel, et al.
Publicado: (2024)
Analyzing Images of Legal Documents: Toward Multi-Modal LLMs for Access to Justice
por: Westermann, Hannes, et al.
Publicado: (2024)
por: Westermann, Hannes, et al.
Publicado: (2024)
ChronusOmni: Improving Time Awareness of Omni Large Language Models
por: Chen, Yijing, et al.
Publicado: (2025)
por: Chen, Yijing, et al.
Publicado: (2025)
Teach Me Sign: Stepwise Prompting LLM for Sign Language Production
por: An, Zhaoyi, et al.
Publicado: (2025)
por: An, Zhaoyi, et al.
Publicado: (2025)
Improving Gloss-free Sign Language Translation by Reducing Representation Density
por: Ye, Jinhui, et al.
Publicado: (2024)
por: Ye, Jinhui, et al.
Publicado: (2024)
Ejemplares similares
-
A Dual Semantic-Aware Recurrent Global-Adaptive Network For Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2023) -
PASTS: Progress-Aware Spatio-Temporal Transformer Speaker For Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2023) -
NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization
por: He, Zongtao, et al.
Publicado: (2025) -
Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation
por: Wang, Liuyi, et al.
Publicado: (2024) -
Vision-and-Language Navigation via Causal Learning
por: Wang, Liuyi, et al.
Publicado: (2024)