Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision
Fuente:
arXiv
Salvato in:
| Autori principali: | Han, Xiaofeng, Chen, Shunpeng, Fu, Zenghuang, Feng, Zhe, Fan, Lue, An, Dong, Wang, Changwei, Guo, Li, Meng, Weiliang, Zhang, Xiaopeng, Xu, Rongtao, Xu, Shibiao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HMR-1: Hierarchical Massage Robot with Vision-Language-Model for Embodied Healthcare
di: Xu, Rongtao, et al.
Pubblicazione: (2026)
di: Xu, Rongtao, et al.
Pubblicazione: (2026)
Local Feature Matching Using Deep Learning: A Survey
di: Xu, Shibiao, et al.
Pubblicazione: (2024)
di: Xu, Shibiao, et al.
Pubblicazione: (2024)
SkinFormer: Learning Statistical Texture Representation with Transformer for Skin Lesion Segmentation
di: Xu, Rongtao, et al.
Pubblicazione: (2024)
di: Xu, Rongtao, et al.
Pubblicazione: (2024)
InstruGen: Automatic Instruction Generation for Vision-and-Language Navigation Via Large Multimodal Models
di: Yan, Yu, et al.
Pubblicazione: (2024)
di: Yan, Yu, et al.
Pubblicazione: (2024)
GLaD: Geometric Latent Distillation for Vision-Language-Action Models
di: Guo, Minghao, et al.
Pubblicazione: (2025)
di: Guo, Minghao, et al.
Pubblicazione: (2025)
3D-MoRe: Unified Modal-Contextual Reasoning for Embodied Question Answering
di: Xu, Rongtao, et al.
Pubblicazione: (2025)
di: Xu, Rongtao, et al.
Pubblicazione: (2025)
DeliCIR: Deliberative Test-Time Evolutionary Hierarchical Multi-Agents for Composed Image Retrieval
di: Pei, Xingtian, et al.
Pubblicazione: (2026)
di: Pei, Xingtian, et al.
Pubblicazione: (2026)
DMTrack: Deformable State-Space Modeling for UAV Multi-Object Tracking with Kalman Fusion and Uncertainty-Aware Association
di: Fu, Zenghuang, et al.
Pubblicazione: (2025)
di: Fu, Zenghuang, et al.
Pubblicazione: (2025)
CurriFlow: Curriculum-Guided Depth Fusion with Optical Flow-Based Temporal Alignment for 3D Semantic Scene Completion
di: Lin, Jinzhou, et al.
Pubblicazione: (2025)
di: Lin, Jinzhou, et al.
Pubblicazione: (2025)
Advances in Embodied Navigation Using Large Language Models: A Survey
di: Lin, Jinzhou, et al.
Pubblicazione: (2023)
di: Lin, Jinzhou, et al.
Pubblicazione: (2023)
Constraint-Aware Zero-Shot Vision-Language Navigation in Continuous Environments
di: Chen, Kehan, et al.
Pubblicazione: (2024)
di: Chen, Kehan, et al.
Pubblicazione: (2024)
Region Matters: Efficient and Reliable Region-Aware Visual Place Recognition
di: Chen, Shunpeng, et al.
Pubblicazione: (2026)
di: Chen, Shunpeng, et al.
Pubblicazione: (2026)
FDBPL: Faster Distillation-Based Prompt Learning for Region-Aware Vision-Language Models Adaptation
di: Zhang, Zherui, et al.
Pubblicazione: (2025)
di: Zhang, Zherui, et al.
Pubblicazione: (2025)
Image Recognition with Online Lightweight Vision Transformer: A Survey
di: Zhang, Zherui, et al.
Pubblicazione: (2025)
di: Zhang, Zherui, et al.
Pubblicazione: (2025)
Cyclic Fusion of Measuring Information in Curved Elastomer Contact via Vision-Based Tactile Sensing
di: Li, Zilan, et al.
Pubblicazione: (2023)
di: Li, Zilan, et al.
Pubblicazione: (2023)
SAMamba: Adaptive State Space Modeling with Hierarchical Vision for Infrared Small Target Detection
di: Xu, Wenhao, et al.
Pubblicazione: (2025)
di: Xu, Wenhao, et al.
Pubblicazione: (2025)
A Vision-Based Tactile Sensing System for Multimodal Contact Information Perception via Neural Network
di: Xu, Weiliang, et al.
Pubblicazione: (2023)
di: Xu, Weiliang, et al.
Pubblicazione: (2023)
Spectral Prompt Tuning:Unveiling Unseen Classes for Zero-Shot Semantic Segmentation
di: Xu, Wenhao, et al.
Pubblicazione: (2023)
di: Xu, Wenhao, et al.
Pubblicazione: (2023)
AnySlot: Goal-Conditioned Vision-Language-Action Policies for Zero-Shot Slot-Level Placement
di: Hu, Zhaofeng, et al.
Pubblicazione: (2026)
di: Hu, Zhaofeng, et al.
Pubblicazione: (2026)
ActiveVLN: Towards Active Exploration via Multi-Turn RL in Vision-and-Language Navigation
di: Zhang, Zekai, et al.
Pubblicazione: (2025)
di: Zhang, Zekai, et al.
Pubblicazione: (2025)
HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models
di: Wang, Kun, et al.
Pubblicazione: (2026)
di: Wang, Kun, et al.
Pubblicazione: (2026)
ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model
di: Zhou, Zhongyi, et al.
Pubblicazione: (2025)
di: Zhou, Zhongyi, et al.
Pubblicazione: (2025)
AnchorVLA4D: an Anchor-Based Spatial-Temporal Vision-Language-Action Model for Robotic Manipulation
di: Zhu, Juan, et al.
Pubblicazione: (2026)
di: Zhu, Juan, et al.
Pubblicazione: (2026)
LaplacianFormer:Rethinking Linear Attention with Laplacian Kernel
di: Feng, Zhe, et al.
Pubblicazione: (2026)
di: Feng, Zhe, et al.
Pubblicazione: (2026)
Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms
di: Cao, Zhixiang, et al.
Pubblicazione: (2026)
di: Cao, Zhixiang, et al.
Pubblicazione: (2026)
Being-0: A Humanoid Robotic Agent with Vision-Language Models and Modular Skills
di: Yuan, Haoqi, et al.
Pubblicazione: (2025)
di: Yuan, Haoqi, et al.
Pubblicazione: (2025)
CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation
di: Li, Xiaoqi, et al.
Pubblicazione: (2025)
di: Li, Xiaoqi, et al.
Pubblicazione: (2025)
Touch100k: A Large-Scale Touch-Language-Vision Dataset for Touch-Centric Multimodal Representation
di: Cheng, Ning, et al.
Pubblicazione: (2024)
di: Cheng, Ning, et al.
Pubblicazione: (2024)
TacVLA: Contact-Aware Tactile Fusion for Robust Vision-Language-Action Manipulation
di: Zhang, Kaidi, et al.
Pubblicazione: (2026)
di: Zhang, Kaidi, et al.
Pubblicazione: (2026)
LaViRA: Language-Vision-Robot Actions Translation for Zero-Shot Vision Language Navigation in Continuous Environments
di: Ding, Hongyu, et al.
Pubblicazione: (2025)
di: Ding, Hongyu, et al.
Pubblicazione: (2025)
VLMPC: Vision-Language Model Predictive Control for Robotic Manipulation
di: Zhao, Wentao, et al.
Pubblicazione: (2024)
di: Zhao, Wentao, et al.
Pubblicazione: (2024)
PSTNet: Enhanced Polyp Segmentation with Multi-scale Alignment and Frequency Domain Integration
di: Xu, Wenhao, et al.
Pubblicazione: (2024)
di: Xu, Wenhao, et al.
Pubblicazione: (2024)
A0: An Affordance-Aware Hierarchical Model for General Robotic Manipulation
di: Xu, Rongtao, et al.
Pubblicazione: (2025)
di: Xu, Rongtao, et al.
Pubblicazione: (2025)
SAGE: Spatial-visual Adaptive Graph Exploration for Efficient Visual Place Recognition
di: Chen, Shunpeng, et al.
Pubblicazione: (2025)
di: Chen, Shunpeng, et al.
Pubblicazione: (2025)
NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
di: Zhang, Jiazhao, et al.
Pubblicazione: (2024)
Towards Comprehensive Multimodal Perception: Introducing the Touch-Language-Vision Dataset
di: Cheng, Ning, et al.
Pubblicazione: (2024)
di: Cheng, Ning, et al.
Pubblicazione: (2024)
Bridging Language, Vision and Action: Multimodal VAEs in Robotic Manipulation Tasks
di: Sejnova, Gabriela, et al.
Pubblicazione: (2024)
di: Sejnova, Gabriela, et al.
Pubblicazione: (2024)
ExploreVLM: Closed-Loop Robot Exploration Task Planning with Vision-Language Models
di: Lou, Zhichen, et al.
Pubblicazione: (2025)
di: Lou, Zhichen, et al.
Pubblicazione: (2025)
FlyAware: Inertia-Aware Aerial Manipulation via Vision-Based Estimation and Post-Grasp Adaptation
di: Ye, Biyu, et al.
Pubblicazione: (2026)
di: Ye, Biyu, et al.
Pubblicazione: (2026)
A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model
di: Zhang, Kaidong, et al.
Pubblicazione: (2026)
di: Zhang, Kaidong, et al.
Pubblicazione: (2026)
Documenti analoghi
-
HMR-1: Hierarchical Massage Robot with Vision-Language-Model for Embodied Healthcare
di: Xu, Rongtao, et al.
Pubblicazione: (2026) -
Local Feature Matching Using Deep Learning: A Survey
di: Xu, Shibiao, et al.
Pubblicazione: (2024) -
SkinFormer: Learning Statistical Texture Representation with Transformer for Skin Lesion Segmentation
di: Xu, Rongtao, et al.
Pubblicazione: (2024) -
InstruGen: Automatic Instruction Generation for Vision-and-Language Navigation Via Large Multimodal Models
di: Yan, Yu, et al.
Pubblicazione: (2024) -
GLaD: Geometric Latent Distillation for Vision-Language-Action Models
di: Guo, Minghao, et al.
Pubblicazione: (2025)