Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Liuyi, He, Zongtao, Dang, Ronghao, Chen, Huiyi, Liu, Chengju, Chen, Qijun |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Vision-and-Language Navigation via Causal Learning
par: Wang, Liuyi, et autres
Publié: (2024)
par: Wang, Liuyi, et autres
Publié: (2024)
A Dual Semantic-Aware Recurrent Global-Adaptive Network For Vision-and-Language Navigation
par: Wang, Liuyi, et autres
Publié: (2023)
par: Wang, Liuyi, et autres
Publié: (2023)
PASTS: Progress-Aware Spatio-Temporal Transformer Speaker For Vision-and-Language Navigation
par: Wang, Liuyi, et autres
Publié: (2023)
par: Wang, Liuyi, et autres
Publié: (2023)
NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization
par: He, Zongtao, et autres
Publié: (2025)
par: He, Zongtao, et autres
Publié: (2025)
MLANet: Multi-Level Attention Network with Sub-instruction for Continuous Vision-and-Language Navigation
par: He, Zongtao, et autres
Publié: (2023)
par: He, Zongtao, et autres
Publié: (2023)
MAGIC: Meta-Ability Guided Interactive Chain-of-Distillation for Effective-and-Efficient Vision-and-Language Navigation
par: Wang, Liuyi, et autres
Publié: (2024)
par: Wang, Liuyi, et autres
Publié: (2024)
P2DNav: Panorama-to-Downview Reasoning for Zero-shot Vision-and-Language Navigation
par: Sheng, Kai, et autres
Publié: (2026)
par: Sheng, Kai, et autres
Publié: (2026)
Fine-Grained Spatiotemporal Motion Alignment for Contrastive Video Representation Learning
par: Zhu, Minghao, et autres
Publié: (2023)
par: Zhu, Minghao, et autres
Publié: (2023)
CLIPose: Category-Level Object Pose Estimation with Pre-trained Vision-Language Knowledge
par: Lin, Xiao, et autres
Publié: (2024)
par: Lin, Xiao, et autres
Publié: (2024)
Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities
par: Wang, Liuyi, et autres
Publié: (2025)
par: Wang, Liuyi, et autres
Publié: (2025)
MoTE: Reconciling Generalization with Specialization for Visual-Language to Video Knowledge Transfer
par: Zhu, Minghao, et autres
Publié: (2024)
par: Zhu, Minghao, et autres
Publié: (2024)
CleanPose: Category-Level Object Pose Estimation via Causal Learning and Knowledge Distillation
par: Lin, Xiao, et autres
Publié: (2025)
par: Lin, Xiao, et autres
Publié: (2025)
FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding
par: Liu, Zheng, et autres
Publié: (2025)
par: Liu, Zheng, et autres
Publié: (2025)
TransPose: 6D Object Pose Estimation with Geometry-Aware Transformer
par: Lin, Xiao, et autres
Publié: (2023)
par: Lin, Xiao, et autres
Publié: (2023)
Temporal-Guided Visual Foundation Models for Event-Based Vision
par: Xia, Ruihao, et autres
Publié: (2025)
par: Xia, Ruihao, et autres
Publié: (2025)
InstructDET: Diversifying Referring Object Detection with Generalized Instructions
par: Dang, Ronghao, et autres
Publié: (2023)
par: Dang, Ronghao, et autres
Publié: (2023)
Volumetric Environment Representation for Vision-Language Navigation
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Collaborative Representation Learning for Alignment of Tactile, Language, and Vision Modalities
par: Zhou, Yiyun, et autres
Publié: (2025)
par: Zhou, Yiyun, et autres
Publié: (2025)
Cross-Modal Causal Intervention for Medical Report Generation
par: Chen, Weixing, et autres
Publié: (2023)
par: Chen, Weixing, et autres
Publié: (2023)
SAM-LAD: Segment Anything Model Meets Zero-Shot Logic Anomaly Detection
par: Peng, Yun, et autres
Publié: (2024)
par: Peng, Yun, et autres
Publié: (2024)
Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models
par: Zhu, Tinghui, et autres
Publié: (2024)
par: Zhu, Tinghui, et autres
Publié: (2024)
GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding
par: Liu, Jiaqi, et autres
Publié: (2025)
par: Liu, Jiaqi, et autres
Publié: (2025)
Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM
par: Li, Shen, et autres
Publié: (2025)
par: Li, Shen, et autres
Publié: (2025)
RoadFormer+: Delivering RGB-X Scene Parsing through Scale-Aware Information Decoupling and Advanced Heterogeneous Feature Fusion
par: Huang, Jianxin, et autres
Publié: (2024)
par: Huang, Jianxin, et autres
Publié: (2024)
VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language Models
par: Wang, Chenyu, et autres
Publié: (2026)
par: Wang, Chenyu, et autres
Publié: (2026)
DELAN: Dual-Level Alignment for Vision-and-Language Navigation by Cross-Modal Contrastive Learning
par: Du, Mengfei, et autres
Publié: (2024)
par: Du, Mengfei, et autres
Publié: (2024)
Vision-Language Meets the Skeleton: Progressively Distillation with Cross-Modal Knowledge for 3D Action Representation Learning
par: Chen, Yang, et autres
Publié: (2024)
par: Chen, Yang, et autres
Publié: (2024)
AeroDuo: Aerial Duo for UAV-based Vision and Language Navigation
par: Wu, Ruipu, et autres
Publié: (2025)
par: Wu, Ruipu, et autres
Publié: (2025)
Vision-Language Models Create Cross-Modal Task Representations
par: Luo, Grace, et autres
Publié: (2024)
par: Luo, Grace, et autres
Publié: (2024)
Causal Disentanglement and Cross-Modal Alignment for Enhanced Few-Shot Learning
par: Jiang, Tianjiao, et autres
Publié: (2025)
par: Jiang, Tianjiao, et autres
Publié: (2025)
Efficient Text-driven Motion Generation via Latent Consistency Training
par: Hu, Mengxian, et autres
Publié: (2024)
par: Hu, Mengxian, et autres
Publié: (2024)
BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion
par: Xiang, Sike, et autres
Publié: (2025)
par: Xiang, Sike, et autres
Publié: (2025)
Improving Medical Visual Representation Learning with Pathological-level Cross-Modal Alignment and Correlation Exploration
par: Wang, Jun, et autres
Publié: (2025)
par: Wang, Jun, et autres
Publié: (2025)
VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving
par: Wang, Jie, et autres
Publié: (2026)
par: Wang, Jie, et autres
Publié: (2026)
Lookahead Exploration with Neural Radiance Representation for Continuous Vision-Language Navigation
par: Wang, Zihan, et autres
Publié: (2024)
par: Wang, Zihan, et autres
Publié: (2024)
Cross-Modal Prototype Allocation: Unsupervised Slide Representation Learning via Patch-Text Contrast in Computational Pathology
par: Chen, Yuxuan, et autres
Publié: (2025)
par: Chen, Yuxuan, et autres
Publié: (2025)
Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
par: Liu, Jiaqi, et autres
Publié: (2025)
par: Liu, Jiaqi, et autres
Publié: (2025)
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
par: Yan, Hanqi, et autres
Publié: (2025)
par: Yan, Hanqi, et autres
Publié: (2025)
VLNVerse: A Benchmark for Vision-Language Navigation with Versatile, Embodied, Realistic Simulation and Evaluation
par: Lin, Sihao, et autres
Publié: (2025)
par: Lin, Sihao, et autres
Publié: (2025)
OVER-NAV: Elevating Iterative Vision-and-Language Navigation with Open-Vocabulary Detection and StructurEd Representation
par: Zhao, Ganlong, et autres
Publié: (2024)
par: Zhao, Ganlong, et autres
Publié: (2024)
Documents similaires
-
Vision-and-Language Navigation via Causal Learning
par: Wang, Liuyi, et autres
Publié: (2024) -
A Dual Semantic-Aware Recurrent Global-Adaptive Network For Vision-and-Language Navigation
par: Wang, Liuyi, et autres
Publié: (2023) -
PASTS: Progress-Aware Spatio-Temporal Transformer Speaker For Vision-and-Language Navigation
par: Wang, Liuyi, et autres
Publié: (2023) -
NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization
par: He, Zongtao, et autres
Publié: (2025) -
MLANet: Multi-Level Attention Network with Sub-instruction for Continuous Vision-and-Language Navigation
par: He, Zongtao, et autres
Publié: (2023)