CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation
Fuente:
arXiv
Salvato in:
| Autori principali: | Hao, Haihong, Han, Mingfei, Li, Changlin, Li, Zhihui, Chang, Xiaojun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CoNav: A Benchmark for Human-Centered Collaborative Navigation
di: Li, Changhao, et al.
Pubblicazione: (2024)
di: Li, Changhao, et al.
Pubblicazione: (2024)
LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning
di: Hao, Haihong, et al.
Pubblicazione: (2026)
di: Hao, Haihong, et al.
Pubblicazione: (2026)
GeoSense: Internalizing Geometric Necessity Perception for Multimodal Reasoning
di: Liu, Ruiheng, et al.
Pubblicazione: (2026)
di: Liu, Ruiheng, et al.
Pubblicazione: (2026)
CL2CM: Improving Cross-Lingual Cross-Modal Retrieval via Cross-Lingual Knowledge Transfer
di: Wang, Yabing, et al.
Pubblicazione: (2023)
di: Wang, Yabing, et al.
Pubblicazione: (2023)
Med-Banana-50K: A Cross-modality Large-Scale Dataset for Text-guided Medical Image Editing
di: Chen, Zhihui, et al.
Pubblicazione: (2025)
di: Chen, Zhihui, et al.
Pubblicazione: (2025)
MSCT: Differential Cross-Modal Attention for Deepfake Detection
di: Wei, Fangda, et al.
Pubblicazione: (2026)
di: Wei, Fangda, et al.
Pubblicazione: (2026)
HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
di: Chen, Liyang, et al.
Pubblicazione: (2025)
di: Chen, Liyang, et al.
Pubblicazione: (2025)
Cross-Modal and Uni-Modal Soft-Label Alignment for Image-Text Retrieval
di: Huang, Hailang, et al.
Pubblicazione: (2024)
di: Huang, Hailang, et al.
Pubblicazione: (2024)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
di: Chen, Yaru, et al.
Pubblicazione: (2025)
di: Chen, Yaru, et al.
Pubblicazione: (2025)
Gradient-Guided Modality Decoupling for Missing-Modality Robustness
di: Wang, Hao, et al.
Pubblicazione: (2024)
di: Wang, Hao, et al.
Pubblicazione: (2024)
Anisotropic Modality Align
di: Yu, Xiaomin, et al.
Pubblicazione: (2026)
di: Yu, Xiaomin, et al.
Pubblicazione: (2026)
CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation
di: Lu, Zhenyu, et al.
Pubblicazione: (2025)
di: Lu, Zhenyu, et al.
Pubblicazione: (2025)
Robust Modality-incomplete Anomaly Detection: A Modality-instructive Framework with Benchmark
di: Miao, Bingchen, et al.
Pubblicazione: (2024)
di: Miao, Bingchen, et al.
Pubblicazione: (2024)
Robust Self-Paced Hashing for Cross-Modal Retrieval with Noisy Labels
di: Pu, Ruitao, et al.
Pubblicazione: (2025)
di: Pu, Ruitao, et al.
Pubblicazione: (2025)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation
di: Roy, Prasun, et al.
Pubblicazione: (2025)
di: Roy, Prasun, et al.
Pubblicazione: (2025)
Towards Unbiased Cross-Modal Representation Learning for Food Image-to-Recipe Retrieval
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation
di: Zhou, Jinxing, et al.
Pubblicazione: (2025)
di: Zhou, Jinxing, et al.
Pubblicazione: (2025)
Cross Modal Fine-Grained Alignment via Granularity-Aware and Region-Uncertain Modeling
di: Liu, Jiale, et al.
Pubblicazione: (2025)
di: Liu, Jiale, et al.
Pubblicazione: (2025)
Joint Explicit and Implicit Cross-Modal Interaction Network for Anterior Chamber Inflammation Diagnosis
di: Shao, Qian, et al.
Pubblicazione: (2023)
di: Shao, Qian, et al.
Pubblicazione: (2023)
SkeFi: Cross-Modal Knowledge Transfer for Wireless Skeleton-Based Action Recognition
di: Huang, Shunyu, et al.
Pubblicazione: (2026)
di: Huang, Shunyu, et al.
Pubblicazione: (2026)
Progressive Online Video Understanding with Evidence-Aligned Timing and Transparent Decisions
di: Zhang, Kecheng, et al.
Pubblicazione: (2026)
di: Zhang, Kecheng, et al.
Pubblicazione: (2026)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
di: Han, ZhaoYang, et al.
Pubblicazione: (2025)
di: Han, ZhaoYang, et al.
Pubblicazione: (2025)
DS-NeRV: Implicit Neural Video Representation with Decomposed Static and Dynamic Codes
di: Yan, Hao, et al.
Pubblicazione: (2024)
di: Yan, Hao, et al.
Pubblicazione: (2024)
Learning to Rematch Mismatched Pairs for Robust Cross-Modal Retrieval
di: Han, Haochen, et al.
Pubblicazione: (2024)
di: Han, Haochen, et al.
Pubblicazione: (2024)
Towards Universal Modal Tracking with Online Dense Temporal Token Learning
di: Zheng, Yaozong, et al.
Pubblicazione: (2025)
di: Zheng, Yaozong, et al.
Pubblicazione: (2025)
SM3Det: A Unified Model for Multi-Modal Remote Sensing Object Detection
di: Li, Yuxuan, et al.
Pubblicazione: (2024)
di: Li, Yuxuan, et al.
Pubblicazione: (2024)
Modality-Aware Shot Relating and Comparing for Video Scene Detection
di: Tan, Jiawei, et al.
Pubblicazione: (2024)
di: Tan, Jiawei, et al.
Pubblicazione: (2024)
A Unified Optimal Transport Framework for Cross-Modal Retrieval with Noisy Labels
di: Han, Haochen, et al.
Pubblicazione: (2024)
di: Han, Haochen, et al.
Pubblicazione: (2024)
VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering
di: Meng, Yiran, et al.
Pubblicazione: (2025)
di: Meng, Yiran, et al.
Pubblicazione: (2025)
SpikeMba: Multi-Modal Spiking Saliency Mamba for Temporal Video Grounding
di: Li, Wenrui, et al.
Pubblicazione: (2024)
di: Li, Wenrui, et al.
Pubblicazione: (2024)
Riemann-based Multi-scale Attention Reasoning Network for Text-3D Retrieval
di: Li, Wenrui, et al.
Pubblicazione: (2024)
di: Li, Wenrui, et al.
Pubblicazione: (2024)
MST-Distill: Mixture of Specialized Teachers for Cross-Modal Knowledge Distillation
di: Li, Hui, et al.
Pubblicazione: (2025)
di: Li, Hui, et al.
Pubblicazione: (2025)
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
di: Araujo, Edson, et al.
Pubblicazione: (2026)
di: Araujo, Edson, et al.
Pubblicazione: (2026)
DPC: Dual-Prompt Collaboration for Tuning Vision-Language Models
di: Li, Haoyang, et al.
Pubblicazione: (2025)
di: Li, Haoyang, et al.
Pubblicazione: (2025)
Dual-Granularity Cross-Modal Identity Association for Weakly-Supervised Text-to-Person Image Matching
di: Zhang, Yafei, et al.
Pubblicazione: (2025)
di: Zhang, Yafei, et al.
Pubblicazione: (2025)
Cross-Modal Coordination Across a Diverse Set of Input Modalities
di: Sánchez, Jorge, et al.
Pubblicazione: (2024)
di: Sánchez, Jorge, et al.
Pubblicazione: (2024)
Adaptive 3D Gaussian Splatting Video Streaming
di: Gong, Han, et al.
Pubblicazione: (2025)
di: Gong, Han, et al.
Pubblicazione: (2025)
Truth in the Few: High-Value Data Selection for Efficient Multi-Modal Reasoning
di: Li, Shenshen, et al.
Pubblicazione: (2025)
di: Li, Shenshen, et al.
Pubblicazione: (2025)
WoW: Towards a World omniscient World model Through Embodied Interaction
di: Chi, Xiaowei, et al.
Pubblicazione: (2025)
di: Chi, Xiaowei, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CoNav: A Benchmark for Human-Centered Collaborative Navigation
di: Li, Changhao, et al.
Pubblicazione: (2024) -
LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning
di: Hao, Haihong, et al.
Pubblicazione: (2026) -
GeoSense: Internalizing Geometric Necessity Perception for Multimodal Reasoning
di: Liu, Ruiheng, et al.
Pubblicazione: (2026) -
CL2CM: Improving Cross-Lingual Cross-Modal Retrieval via Cross-Lingual Knowledge Transfer
di: Wang, Yabing, et al.
Pubblicazione: (2023) -
Med-Banana-50K: A Cross-modality Large-Scale Dataset for Text-guided Medical Image Editing
di: Chen, Zhihui, et al.
Pubblicazione: (2025)