DELAN: Dual-Level Alignment for Vision-and-Language Navigation by Cross-Modal Contrastive Learning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Du, Mengfei, Wu, Binhao, Zhang, Jiwen, Fan, Zhihao, Li, Zejun, Luo, Ruipu, Huang, Xuanjing, Wei, Zhongyu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
von: Du, Mengfei, et al.
Veröffentlicht: (2024)
von: Du, Mengfei, et al.
Veröffentlicht: (2024)
VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
von: Li, Zejun, et al.
Veröffentlicht: (2024)
von: Li, Zejun, et al.
Veröffentlicht: (2024)
Activating Distributed Visual Region within LLMs for Efficient and Effective Vision-Language Training and Inference
von: Wang, Siyuan, et al.
Veröffentlicht: (2024)
von: Wang, Siyuan, et al.
Veröffentlicht: (2024)
SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation
von: Zhang, Jiwen, et al.
Veröffentlicht: (2026)
von: Zhang, Jiwen, et al.
Veröffentlicht: (2026)
MoIIE: Mixture of Intra- and Inter-Modality Experts for Large Vision Language Models
von: Wang, Dianyi, et al.
Veröffentlicht: (2025)
von: Wang, Dianyi, et al.
Veröffentlicht: (2025)
Benchmark Self-Evolving: A Multi-Agent Framework for Dynamic LLM Evaluation
von: Wang, Siyuan, et al.
Veröffentlicht: (2024)
von: Wang, Siyuan, et al.
Veröffentlicht: (2024)
Dual-Level Cross-Modal Contrastive Clustering
von: Zhang, Haixin, et al.
Veröffentlicht: (2024)
von: Zhang, Haixin, et al.
Veröffentlicht: (2024)
Unveiling the Truth and Facilitating Change: Towards Agent-based Large-scale Social Movement Simulation
von: Mou, Xinyi, et al.
Veröffentlicht: (2024)
von: Mou, Xinyi, et al.
Veröffentlicht: (2024)
LifeSim: Long-Horizon User Life Simulator for Personalized Assistant Evaluation
von: Duan, Feiyu, et al.
Veröffentlicht: (2026)
von: Duan, Feiyu, et al.
Veröffentlicht: (2026)
EcoLANG: Efficient and Effective Agent Communication Language Induction for Social Simulation
von: Mou, Xinyi, et al.
Veröffentlicht: (2025)
von: Mou, Xinyi, et al.
Veröffentlicht: (2025)
AeroDuo: Aerial Duo for UAV-based Vision and Language Navigation
von: Wu, Ruipu, et al.
Veröffentlicht: (2025)
von: Wu, Ruipu, et al.
Veröffentlicht: (2025)
AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs
von: Ding, Xuanwen, et al.
Veröffentlicht: (2025)
von: Ding, Xuanwen, et al.
Veröffentlicht: (2025)
OViP: Online Vision-Language Preference Learning for VLM Hallucination
von: Liu, Shujun, et al.
Veröffentlicht: (2025)
von: Liu, Shujun, et al.
Veröffentlicht: (2025)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
von: Huang, Qidong, et al.
Veröffentlicht: (2024)
von: Huang, Qidong, et al.
Veröffentlicht: (2024)
SoMeLVLM: A Large Vision Language Model for Social Media Processing
von: Zhang, Xinnong, et al.
Veröffentlicht: (2024)
von: Zhang, Xinnong, et al.
Veröffentlicht: (2024)
CommunityBench: Benchmarking Community-Level Alignment across Diverse Groups and Tasks
von: Lin, Jiayu, et al.
Veröffentlicht: (2026)
von: Lin, Jiayu, et al.
Veröffentlicht: (2026)
Valley: Video Assistant with Large Language model Enhanced abilitY
von: Luo, Ruipu, et al.
Veröffentlicht: (2023)
von: Luo, Ruipu, et al.
Veröffentlicht: (2023)
HAF-RM: A Hybrid Alignment Framework for Reward Model Training
von: Liu, Shujun, et al.
Veröffentlicht: (2024)
von: Liu, Shujun, et al.
Veröffentlicht: (2024)
Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments
von: Li, Haoyuan, et al.
Veröffentlicht: (2026)
von: Li, Haoyuan, et al.
Veröffentlicht: (2026)
Cross-Modal Urban Sensing: Evaluating Sound-Vision Alignment Across Street-Level and Aerial Imagery
von: Chen, Pengyu, et al.
Veröffentlicht: (2025)
von: Chen, Pengyu, et al.
Veröffentlicht: (2025)
ALaRM: Align Language Models via Hierarchical Rewards Modeling
von: Lai, Yuhang, et al.
Veröffentlicht: (2024)
von: Lai, Yuhang, et al.
Veröffentlicht: (2024)
Cross-Modal Adapter for Vision-Language Retrieval
von: Jiang, Haojun, et al.
Veröffentlicht: (2022)
von: Jiang, Haojun, et al.
Veröffentlicht: (2022)
Synergistic Multi-Agent Framework with Trajectory Learning for Knowledge-Intensive Tasks
von: Yue, Shengbin, et al.
Veröffentlicht: (2024)
von: Yue, Shengbin, et al.
Veröffentlicht: (2024)
SpatialAnt: Autonomous Zero-Shot Robot Navigation via Active Scene Reconstruction and Visual Anticipation
von: Zhang, Jiwen, et al.
Veröffentlicht: (2026)
von: Zhang, Jiwen, et al.
Veröffentlicht: (2026)
Simple o3: Towards Interleaved Vision-Language Reasoning
von: Wang, Ye, et al.
Veröffentlicht: (2025)
von: Wang, Ye, et al.
Veröffentlicht: (2025)
Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model
von: Wang, Siyin, et al.
Veröffentlicht: (2024)
von: Wang, Siyin, et al.
Veröffentlicht: (2024)
CMCRD: Cross-Modal Contrastive Representation Distillation for Emotion Recognition
von: Kan, Siyuan, et al.
Veröffentlicht: (2025)
von: Kan, Siyuan, et al.
Veröffentlicht: (2025)
Causality-based Cross-Modal Representation Learning for Vision-and-Language Navigation
von: Wang, Liuyi, et al.
Veröffentlicht: (2024)
von: Wang, Liuyi, et al.
Veröffentlicht: (2024)
X-VILA: Cross-Modality Alignment for Large Language Model
von: Ye, Hanrong, et al.
Veröffentlicht: (2024)
von: Ye, Hanrong, et al.
Veröffentlicht: (2024)
Vision-Language Models Create Cross-Modal Task Representations
von: Luo, Grace, et al.
Veröffentlicht: (2024)
von: Luo, Grace, et al.
Veröffentlicht: (2024)
CURP: Codebook-based Continuous User Representation for Personalized Generation with LLMs
von: Wang, Liang, et al.
Veröffentlicht: (2026)
von: Wang, Liang, et al.
Veröffentlicht: (2026)
Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models
von: Yan, Hanqi, et al.
Veröffentlicht: (2025)
von: Yan, Hanqi, et al.
Veröffentlicht: (2025)
GC-VLN: Instruction as Graph Constraints for Training-free Vision-and-Language Navigation
von: Yin, Hang, et al.
Veröffentlicht: (2025)
von: Yin, Hang, et al.
Veröffentlicht: (2025)
BBA: Bi-Modal Behavioral Alignment for Reasoning with Large Vision-Language Models
von: Zhao, Xueliang, et al.
Veröffentlicht: (2024)
von: Zhao, Xueliang, et al.
Veröffentlicht: (2024)
From LLMs to MLLMs: Exploring the Landscape of Multimodal Jailbreaking
von: Wang, Siyuan, et al.
Veröffentlicht: (2024)
von: Wang, Siyuan, et al.
Veröffentlicht: (2024)
Unveiling Linguistic Regions in Large Language Models
von: Zhang, Zhihao, et al.
Veröffentlicht: (2024)
von: Zhang, Zhihao, et al.
Veröffentlicht: (2024)
Navigating Beyond Instructions: Vision-and-Language Navigation in Obstructed Environments
von: Hong, Haodong, et al.
Veröffentlicht: (2024)
von: Hong, Haodong, et al.
Veröffentlicht: (2024)
Valley2: Exploring Multimodal Models with Scalable Vision-Language Design
von: Wu, Ziheng, et al.
Veröffentlicht: (2025)
von: Wu, Ziheng, et al.
Veröffentlicht: (2025)
AI Hospital: Benchmarking Large Language Models in a Multi-agent Medical Interaction Simulator
von: Fan, Zhihao, et al.
Veröffentlicht: (2024)
von: Fan, Zhihao, et al.
Veröffentlicht: (2024)
Visible-Infrared Person Re-Identification via Patch-Mixed Cross-Modality Learning
von: Qian, Zhihao, et al.
Veröffentlicht: (2023)
von: Qian, Zhihao, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
von: Du, Mengfei, et al.
Veröffentlicht: (2024) -
VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
von: Li, Zejun, et al.
Veröffentlicht: (2024) -
Activating Distributed Visual Region within LLMs for Efficient and Effective Vision-Language Training and Inference
von: Wang, Siyuan, et al.
Veröffentlicht: (2024) -
SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation
von: Zhang, Jiwen, et al.
Veröffentlicht: (2026) -
MoIIE: Mixture of Intra- and Inter-Modality Experts for Large Vision Language Models
von: Wang, Dianyi, et al.
Veröffentlicht: (2025)