MLANet: Multi-Level Attention Network with Sub-instruction for Continuous Vision-and-Language Navigation
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Zongtao, Wang, Liuyi, Li, Shu, Yan, Qingqing, Liu, Chengju, Chen, Qijun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Dual Semantic-Aware Recurrent Global-Adaptive Network For Vision-and-Language Navigation
di: Wang, Liuyi, et al.
Pubblicazione: (2023)
di: Wang, Liuyi, et al.
Pubblicazione: (2023)
PASTS: Progress-Aware Spatio-Temporal Transformer Speaker For Vision-and-Language Navigation
di: Wang, Liuyi, et al.
Pubblicazione: (2023)
di: Wang, Liuyi, et al.
Pubblicazione: (2023)
NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization
di: He, Zongtao, et al.
Pubblicazione: (2025)
di: He, Zongtao, et al.
Pubblicazione: (2025)
Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation
di: Wang, Liuyi, et al.
Pubblicazione: (2024)
di: Wang, Liuyi, et al.
Pubblicazione: (2024)
Vision-and-Language Navigation via Causal Learning
di: Wang, Liuyi, et al.
Pubblicazione: (2024)
di: Wang, Liuyi, et al.
Pubblicazione: (2024)
MAGIC: Meta-Ability Guided Interactive Chain-of-Distillation for Effective-and-Efficient Vision-and-Language Navigation
di: Wang, Liuyi, et al.
Pubblicazione: (2024)
di: Wang, Liuyi, et al.
Pubblicazione: (2024)
Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration
di: Fazli, Mehrdad, et al.
Pubblicazione: (2025)
di: Fazli, Mehrdad, et al.
Pubblicazione: (2025)
P2DNav: Panorama-to-Downview Reasoning for Zero-shot Vision-and-Language Navigation
di: Sheng, Kai, et al.
Pubblicazione: (2026)
di: Sheng, Kai, et al.
Pubblicazione: (2026)
Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding
di: Luo, Chuwei, et al.
Pubblicazione: (2022)
di: Luo, Chuwei, et al.
Pubblicazione: (2022)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
di: Jiang, Chaoya, et al.
Pubblicazione: (2024)
COM Kitchens: An Unedited Overhead-view Video Dataset as a Vision-Language Benchmark
di: Maeda, Koki, et al.
Pubblicazione: (2024)
di: Maeda, Koki, et al.
Pubblicazione: (2024)
Enhancing the Learning Experience: Using Vision-Language Models to Generate Questions for Educational Videos
di: Stamatakis, Markos, et al.
Pubblicazione: (2025)
di: Stamatakis, Markos, et al.
Pubblicazione: (2025)
BioVL-QR: Egocentric Biochemical Vision-and-Language Dataset Using Micro QR Codes
di: Nishimoto, Tomohiro, et al.
Pubblicazione: (2024)
di: Nishimoto, Tomohiro, et al.
Pubblicazione: (2024)
Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models
di: Wu, Jiaying, et al.
Pubblicazione: (2025)
di: Wu, Jiaying, et al.
Pubblicazione: (2025)
VGA: Vision and Graph Fused Attention Network for Rumor Detection
di: Bai, Lin, et al.
Pubblicazione: (2024)
di: Bai, Lin, et al.
Pubblicazione: (2024)
Loc4Plan: Locating Before Planning for Outdoor Vision and Language Navigation
di: Tian, Huilin, et al.
Pubblicazione: (2024)
di: Tian, Huilin, et al.
Pubblicazione: (2024)
Hierarchical Sub-action Tree for Continuous Sign Language Recognition
di: Yang, Dejie, et al.
Pubblicazione: (2025)
di: Yang, Dejie, et al.
Pubblicazione: (2025)
Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities
di: Wang, Liuyi, et al.
Pubblicazione: (2025)
di: Wang, Liuyi, et al.
Pubblicazione: (2025)
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
di: Ye, Weihao, et al.
Pubblicazione: (2024)
di: Ye, Weihao, et al.
Pubblicazione: (2024)
WordArt Designer API: User-Driven Artistic Typography Synthesis with Large Language Models on ModelScope
di: He, Jun-Yan, et al.
Pubblicazione: (2024)
di: He, Jun-Yan, et al.
Pubblicazione: (2024)
MuLTI: Efficient Video-and-Language Understanding with Text-Guided MultiWay-Sampler and Multiple Choice Modeling
di: Xu, Jiaqi, et al.
Pubblicazione: (2023)
di: Xu, Jiaqi, et al.
Pubblicazione: (2023)
EasyAnimate: High-Performance Video Generation Framework with Hybrid Windows Attention and Reward Backpropagation
di: Xu, Jiaqi, et al.
Pubblicazione: (2024)
di: Xu, Jiaqi, et al.
Pubblicazione: (2024)
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
di: An, Wenbin, et al.
Pubblicazione: (2024)
di: An, Wenbin, et al.
Pubblicazione: (2024)
Language Models as Black-Box Optimizers for Vision-Language Models
di: Liu, Shihong, et al.
Pubblicazione: (2023)
di: Liu, Shihong, et al.
Pubblicazione: (2023)
Hyperbolic Safety-Aware Vision-Language Models
di: Poppi, Tobia, et al.
Pubblicazione: (2025)
di: Poppi, Tobia, et al.
Pubblicazione: (2025)
Causal Graphical Models for Vision-Language Compositional Understanding
di: Parascandolo, Fiorenzo, et al.
Pubblicazione: (2024)
di: Parascandolo, Fiorenzo, et al.
Pubblicazione: (2024)
Agent Journey Beyond RGB: Hierarchical Semantic-Spatial Representation Enrichment for Vision-and-Language Navigation
di: Zhang, Xuesong, et al.
Pubblicazione: (2024)
di: Zhang, Xuesong, et al.
Pubblicazione: (2024)
Cross-modal Proxy Evolving for OOD Detection with Vision-Language Models
di: Tang, Hao, et al.
Pubblicazione: (2026)
di: Tang, Hao, et al.
Pubblicazione: (2026)
RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing
di: Zhang, Zilun, et al.
Pubblicazione: (2023)
di: Zhang, Zilun, et al.
Pubblicazione: (2023)
Multi-Modal Semantic Parsing for the Interpretation of Tombstone Inscriptions
di: Zhang, Xiao, et al.
Pubblicazione: (2025)
di: Zhang, Xiao, et al.
Pubblicazione: (2025)
PanoGen++: Domain-Adapted Text-Guided Panoramic Environment Generation for Vision-and-Language Navigation
di: Wang, Sen, et al.
Pubblicazione: (2025)
di: Wang, Sen, et al.
Pubblicazione: (2025)
MERIT: Multilingual Semantic Retrieval with Interleaved Multi-Condition Query
di: Chow, Wei, et al.
Pubblicazione: (2025)
di: Chow, Wei, et al.
Pubblicazione: (2025)
Positive-Augmented Contrastive Learning for Vision-and-Language Evaluation and Training
di: Sarto, Sara, et al.
Pubblicazione: (2024)
di: Sarto, Sara, et al.
Pubblicazione: (2024)
Multi-task Prompt Words Learning for Social Media Content Generation
di: Xue, Haochen, et al.
Pubblicazione: (2024)
di: Xue, Haochen, et al.
Pubblicazione: (2024)
LocoMotion: Learning Motion-Focused Video-Language Representations
di: Doughty, Hazel, et al.
Pubblicazione: (2024)
di: Doughty, Hazel, et al.
Pubblicazione: (2024)
Analyzing Images of Legal Documents: Toward Multi-Modal LLMs for Access to Justice
di: Westermann, Hannes, et al.
Pubblicazione: (2024)
di: Westermann, Hannes, et al.
Pubblicazione: (2024)
ChronusOmni: Improving Time Awareness of Omni Large Language Models
di: Chen, Yijing, et al.
Pubblicazione: (2025)
di: Chen, Yijing, et al.
Pubblicazione: (2025)
Teach Me Sign: Stepwise Prompting LLM for Sign Language Production
di: An, Zhaoyi, et al.
Pubblicazione: (2025)
di: An, Zhaoyi, et al.
Pubblicazione: (2025)
Improving Gloss-free Sign Language Translation by Reducing Representation Density
di: Ye, Jinhui, et al.
Pubblicazione: (2024)
di: Ye, Jinhui, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Dual Semantic-Aware Recurrent Global-Adaptive Network For Vision-and-Language Navigation
di: Wang, Liuyi, et al.
Pubblicazione: (2023) -
PASTS: Progress-Aware Spatio-Temporal Transformer Speaker For Vision-and-Language Navigation
di: Wang, Liuyi, et al.
Pubblicazione: (2023) -
NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization
di: He, Zongtao, et al.
Pubblicazione: (2025) -
Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation
di: Wang, Liuyi, et al.
Pubblicazione: (2024) -
Vision-and-Language Navigation via Causal Learning
di: Wang, Liuyi, et al.
Pubblicazione: (2024)