Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Liuyi, He, Zongtao, Dang, Ronghao, Chen, Huiyi, Liu, Chengju, Chen, Qijun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Vision-and-Language Navigation via Causal Learning
di: Wang, Liuyi, et al.
Pubblicazione: (2024)
di: Wang, Liuyi, et al.
Pubblicazione: (2024)
A Dual Semantic-Aware Recurrent Global-Adaptive Network For Vision-and-Language Navigation
di: Wang, Liuyi, et al.
Pubblicazione: (2023)
di: Wang, Liuyi, et al.
Pubblicazione: (2023)
PASTS: Progress-Aware Spatio-Temporal Transformer Speaker For Vision-and-Language Navigation
di: Wang, Liuyi, et al.
Pubblicazione: (2023)
di: Wang, Liuyi, et al.
Pubblicazione: (2023)
NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization
di: He, Zongtao, et al.
Pubblicazione: (2025)
di: He, Zongtao, et al.
Pubblicazione: (2025)
MLANet: Multi-Level Attention Network with Sub-instruction for Continuous Vision-and-Language Navigation
di: He, Zongtao, et al.
Pubblicazione: (2023)
di: He, Zongtao, et al.
Pubblicazione: (2023)
MAGIC: Meta-Ability Guided Interactive Chain-of-Distillation for Effective-and-Efficient Vision-and-Language Navigation
di: Wang, Liuyi, et al.
Pubblicazione: (2024)
di: Wang, Liuyi, et al.
Pubblicazione: (2024)
P2DNav: Panorama-to-Downview Reasoning for Zero-shot Vision-and-Language Navigation
di: Sheng, Kai, et al.
Pubblicazione: (2026)
di: Sheng, Kai, et al.
Pubblicazione: (2026)
Fine-Grained Spatiotemporal Motion Alignment for Contrastive Video Representation Learning
di: Zhu, Minghao, et al.
Pubblicazione: (2023)
di: Zhu, Minghao, et al.
Pubblicazione: (2023)
CLIPose: Category-Level Object Pose Estimation with Pre-trained Vision-Language Knowledge
di: Lin, Xiao, et al.
Pubblicazione: (2024)
di: Lin, Xiao, et al.
Pubblicazione: (2024)
Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities
di: Wang, Liuyi, et al.
Pubblicazione: (2025)
di: Wang, Liuyi, et al.
Pubblicazione: (2025)
MoTE: Reconciling Generalization with Specialization for Visual-Language to Video Knowledge Transfer
di: Zhu, Minghao, et al.
Pubblicazione: (2024)
di: Zhu, Minghao, et al.
Pubblicazione: (2024)
CleanPose: Category-Level Object Pose Estimation via Causal Learning and Knowledge Distillation
di: Lin, Xiao, et al.
Pubblicazione: (2025)
di: Lin, Xiao, et al.
Pubblicazione: (2025)
FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding
di: Liu, Zheng, et al.
Pubblicazione: (2025)
di: Liu, Zheng, et al.
Pubblicazione: (2025)
TransPose: 6D Object Pose Estimation with Geometry-Aware Transformer
di: Lin, Xiao, et al.
Pubblicazione: (2023)
di: Lin, Xiao, et al.
Pubblicazione: (2023)
Temporal-Guided Visual Foundation Models for Event-Based Vision
di: Xia, Ruihao, et al.
Pubblicazione: (2025)
di: Xia, Ruihao, et al.
Pubblicazione: (2025)
InstructDET: Diversifying Referring Object Detection with Generalized Instructions
di: Dang, Ronghao, et al.
Pubblicazione: (2023)
di: Dang, Ronghao, et al.
Pubblicazione: (2023)
Volumetric Environment Representation for Vision-Language Navigation
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
Collaborative Representation Learning for Alignment of Tactile, Language, and Vision Modalities
di: Zhou, Yiyun, et al.
Pubblicazione: (2025)
di: Zhou, Yiyun, et al.
Pubblicazione: (2025)
Cross-Modal Causal Intervention for Medical Report Generation
di: Chen, Weixing, et al.
Pubblicazione: (2023)
di: Chen, Weixing, et al.
Pubblicazione: (2023)
SAM-LAD: Segment Anything Model Meets Zero-Shot Logic Anomaly Detection
di: Peng, Yun, et al.
Pubblicazione: (2024)
di: Peng, Yun, et al.
Pubblicazione: (2024)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
di: Zhu, Tinghui, et al.
Pubblicazione: (2024)
di: Zhu, Tinghui, et al.
Pubblicazione: (2024)
GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding
di: Liu, Jiaqi, et al.
Pubblicazione: (2025)
di: Liu, Jiaqi, et al.
Pubblicazione: (2025)
Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM
di: Li, Shen, et al.
Pubblicazione: (2025)
di: Li, Shen, et al.
Pubblicazione: (2025)
RoadFormer+: Delivering RGB-X Scene Parsing through Scale-Aware Information Decoupling and Advanced Heterogeneous Feature Fusion
di: Huang, Jianxin, et al.
Pubblicazione: (2024)
di: Huang, Jianxin, et al.
Pubblicazione: (2024)
VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language Models
di: Wang, Chenyu, et al.
Pubblicazione: (2026)
di: Wang, Chenyu, et al.
Pubblicazione: (2026)
DELAN: Dual-Level Alignment for Vision-and-Language Navigation by Cross-Modal Contrastive Learning
di: Du, Mengfei, et al.
Pubblicazione: (2024)
di: Du, Mengfei, et al.
Pubblicazione: (2024)
Vision-Language Meets the Skeleton: Progressively Distillation with Cross-Modal Knowledge for 3D Action Representation Learning
di: Chen, Yang, et al.
Pubblicazione: (2024)
di: Chen, Yang, et al.
Pubblicazione: (2024)
AeroDuo: Aerial Duo for UAV-based Vision and Language Navigation
di: Wu, Ruipu, et al.
Pubblicazione: (2025)
di: Wu, Ruipu, et al.
Pubblicazione: (2025)
Vision-Language Models Create Cross-Modal Task Representations
di: Luo, Grace, et al.
Pubblicazione: (2024)
di: Luo, Grace, et al.
Pubblicazione: (2024)
Causal Disentanglement and Cross-Modal Alignment for Enhanced Few-Shot Learning
di: Jiang, Tianjiao, et al.
Pubblicazione: (2025)
di: Jiang, Tianjiao, et al.
Pubblicazione: (2025)
Efficient Text-driven Motion Generation via Latent Consistency Training
di: Hu, Mengxian, et al.
Pubblicazione: (2024)
di: Hu, Mengxian, et al.
Pubblicazione: (2024)
BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion
di: Xiang, Sike, et al.
Pubblicazione: (2025)
di: Xiang, Sike, et al.
Pubblicazione: (2025)
Improving Medical Visual Representation Learning with Pathological-level Cross-Modal Alignment and Correlation Exploration
di: Wang, Jun, et al.
Pubblicazione: (2025)
di: Wang, Jun, et al.
Pubblicazione: (2025)
VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving
di: Wang, Jie, et al.
Pubblicazione: (2026)
di: Wang, Jie, et al.
Pubblicazione: (2026)
Lookahead Exploration with Neural Radiance Representation for Continuous Vision-Language Navigation
di: Wang, Zihan, et al.
Pubblicazione: (2024)
di: Wang, Zihan, et al.
Pubblicazione: (2024)
Cross-Modal Prototype Allocation: Unsupervised Slide Representation Learning via Patch-Text Contrast in Computational Pathology
di: Chen, Yuxuan, et al.
Pubblicazione: (2025)
di: Chen, Yuxuan, et al.
Pubblicazione: (2025)
Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
di: Liu, Jiaqi, et al.
Pubblicazione: (2025)
di: Liu, Jiaqi, et al.
Pubblicazione: (2025)
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
di: Yan, Hanqi, et al.
Pubblicazione: (2025)
di: Yan, Hanqi, et al.
Pubblicazione: (2025)
VLNVerse: A Benchmark for Vision-Language Navigation with Versatile, Embodied, Realistic Simulation and Evaluation
di: Lin, Sihao, et al.
Pubblicazione: (2025)
di: Lin, Sihao, et al.
Pubblicazione: (2025)
OVER-NAV: Elevating Iterative Vision-and-Language Navigation with Open-Vocabulary Detection and StructurEd Representation
di: Zhao, Ganlong, et al.
Pubblicazione: (2024)
di: Zhao, Ganlong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Vision-and-Language Navigation via Causal Learning
di: Wang, Liuyi, et al.
Pubblicazione: (2024) -
A Dual Semantic-Aware Recurrent Global-Adaptive Network For Vision-and-Language Navigation
di: Wang, Liuyi, et al.
Pubblicazione: (2023) -
PASTS: Progress-Aware Spatio-Temporal Transformer Speaker For Vision-and-Language Navigation
di: Wang, Liuyi, et al.
Pubblicazione: (2023) -
NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization
di: He, Zongtao, et al.
Pubblicazione: (2025) -
MLANet: Multi-Level Attention Network with Sub-instruction for Continuous Vision-and-Language Navigation
di: He, Zongtao, et al.
Pubblicazione: (2023)