FM-Fusion: Instance-aware Semantic Mapping Boosted by Vision-Language Foundation Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Chuhao, Wang, Ke, Shi, Jieqi, Qiao, Zhijian, Shen, Shaojie |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SG-Reg: Generalizable and Efficient Scene Graph Registration
von: Liu, Chuhao, et al.
Veröffentlicht: (2025)
von: Liu, Chuhao, et al.
Veröffentlicht: (2025)
CSMapping: Scalable Crowdsourced Semantic Mapping and Topology Inference for Autonomous Driving
von: Qiao, Zhijian, et al.
Veröffentlicht: (2025)
von: Qiao, Zhijian, et al.
Veröffentlicht: (2025)
SEPT: Standard-Definition Map Enhanced Scene Perception and Topology Reasoning for Autonomous Driving
von: Pei, Muleilan, et al.
Veröffentlicht: (2025)
von: Pei, Muleilan, et al.
Veröffentlicht: (2025)
G3Reg: Pyramid Graph-based Global Registration using Gaussian Ellipsoid Model
von: Qiao, Zhijian, et al.
Veröffentlicht: (2023)
von: Qiao, Zhijian, et al.
Veröffentlicht: (2023)
ST-GS: Vision-Based 3D Semantic Occupancy Prediction with Spatial-Temporal Gaussian Splatting
von: Yan, Xiaoyang, et al.
Veröffentlicht: (2025)
von: Yan, Xiaoyang, et al.
Veröffentlicht: (2025)
Open-Set 3D Semantic Instance Maps for Vision Language Navigation -- O3D-SIM
von: Nanwani, Laksh, et al.
Veröffentlicht: (2024)
von: Nanwani, Laksh, et al.
Veröffentlicht: (2024)
IRIS-SLAM: Unified Geo-Instance Representations for Robust Semantic Localization and Mapping
von: Xiao, Tingyang, et al.
Veröffentlicht: (2026)
von: Xiao, Tingyang, et al.
Veröffentlicht: (2026)
UFO: Uncertainty-aware LiDAR-image Fusion for Off-road Semantic Terrain Map Estimation
von: Kim, Ohn, et al.
Veröffentlicht: (2024)
von: Kim, Ohn, et al.
Veröffentlicht: (2024)
VG3S: Visual Geometry Grounded Gaussian Splatting for Semantic Occupancy Prediction
von: Yan, Xiaoyang, et al.
Veröffentlicht: (2026)
von: Yan, Xiaoyang, et al.
Veröffentlicht: (2026)
Instance-aware Exploration-Verification-Exploitation for Instance ImageGoal Navigation
von: Lei, Xiaohan, et al.
Veröffentlicht: (2024)
von: Lei, Xiaohan, et al.
Veröffentlicht: (2024)
DiffSemanticFusion: Semantic Raster BEV Fusion for Autonomous Driving via Online HD Map Diffusion
von: Sun, Zhigang, et al.
Veröffentlicht: (2025)
von: Sun, Zhigang, et al.
Veröffentlicht: (2025)
UAOR: Uncertainty-aware Observation Reinjection for Vision-Language-Action Models
von: Yang, Jiabing, et al.
Veröffentlicht: (2026)
von: Yang, Jiabing, et al.
Veröffentlicht: (2026)
ZISVFM: Zero-Shot Object Instance Segmentation in Indoor Robotic Environments with Vision Foundation Models
von: Zhang, Ying, et al.
Veröffentlicht: (2025)
von: Zhang, Ying, et al.
Veröffentlicht: (2025)
Advancing Multi-agent Traffic Simulation via R1-Style Reinforcement Fine-Tuning
von: Pei, Muleilan, et al.
Veröffentlicht: (2025)
von: Pei, Muleilan, et al.
Veröffentlicht: (2025)
Leveraging Vision-Language Models for Open-Vocabulary Instance Segmentation and Tracking
von: Pätzold, Bastian, et al.
Veröffentlicht: (2025)
von: Pätzold, Bastian, et al.
Veröffentlicht: (2025)
Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision
von: Han, Xiaofeng, et al.
Veröffentlicht: (2025)
von: Han, Xiaofeng, et al.
Veröffentlicht: (2025)
DeFM: Learning Foundation Representations from Depth for Robotics
von: Patel, Manthan, et al.
Veröffentlicht: (2026)
von: Patel, Manthan, et al.
Veröffentlicht: (2026)
DAgger Diffusion Navigation: DAgger Boosted Diffusion Policy for Vision-Language Navigation
von: Shi, Haoxiang, et al.
Veröffentlicht: (2025)
von: Shi, Haoxiang, et al.
Veröffentlicht: (2025)
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model
von: Sun, Jingwen, et al.
Veröffentlicht: (2026)
von: Sun, Jingwen, et al.
Veröffentlicht: (2026)
3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding
von: Xia, Zhongyu, et al.
Veröffentlicht: (2026)
von: Xia, Zhongyu, et al.
Veröffentlicht: (2026)
FineCog-Nav: Integrating Fine-grained Cognitive Modules for Zero-shot Multimodal UAV Navigation
von: Shao, Dian, et al.
Veröffentlicht: (2026)
von: Shao, Dian, et al.
Veröffentlicht: (2026)
Foresight in Motion: Reinforcing Trajectory Prediction with Reward Heuristics
von: Pei, Muleilan, et al.
Veröffentlicht: (2025)
von: Pei, Muleilan, et al.
Veröffentlicht: (2025)
Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models
von: Yang, Yurou, et al.
Veröffentlicht: (2026)
von: Yang, Yurou, et al.
Veröffentlicht: (2026)
Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation
von: Ding, Hongyu, et al.
Veröffentlicht: (2026)
von: Ding, Hongyu, et al.
Veröffentlicht: (2026)
UniHM: Unified Dexterous Hand Manipulation with Vision Language Model
von: Zhang, Zhenhao, et al.
Veröffentlicht: (2026)
von: Zhang, Zhenhao, et al.
Veröffentlicht: (2026)
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
von: Guo, Wenxuan, et al.
Veröffentlicht: (2026)
von: Guo, Wenxuan, et al.
Veröffentlicht: (2026)
Uncertainty-aware Semantic Mapping in Off-road Environments with Dempster-Shafer Theory of Evidence
von: Kim, Junyoung, et al.
Veröffentlicht: (2024)
von: Kim, Junyoung, et al.
Veröffentlicht: (2024)
Evidential Semantic Mapping in Off-road Environments with Uncertainty-aware Bayesian Kernel Inference
von: Kim, Junyoung, et al.
Veröffentlicht: (2024)
von: Kim, Junyoung, et al.
Veröffentlicht: (2024)
Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment
von: Lin, Tao, et al.
Veröffentlicht: (2025)
von: Lin, Tao, et al.
Veröffentlicht: (2025)
GS-LIVO: Real-Time LiDAR, Inertial, and Visual Multi-sensor Fused Odometry with Gaussian Mapping
von: Hong, Sheng, et al.
Veröffentlicht: (2025)
von: Hong, Sheng, et al.
Veröffentlicht: (2025)
Fast-SmartWay: Panoramic-Free End-to-End Zero-Shot Vision-and-Language Navigation
von: Shi, Xiangyu, et al.
Veröffentlicht: (2025)
von: Shi, Xiangyu, et al.
Veröffentlicht: (2025)
Adapting Pre-Trained Vision Models for Novel Instance Detection and Segmentation
von: Lu, Yangxiao, et al.
Veröffentlicht: (2024)
von: Lu, Yangxiao, et al.
Veröffentlicht: (2024)
Lift, Splat, Map: Lifting Foundation Masks for Label-Free Semantic Scene Completion
von: Zhang, Arthur, et al.
Veröffentlicht: (2024)
von: Zhang, Arthur, et al.
Veröffentlicht: (2024)
OPAL: Visibility-aware LiDAR-to-OpenStreetMap Place Recognition via Adaptive Radial Fusion
von: Kang, Shuhao, et al.
Veröffentlicht: (2025)
von: Kang, Shuhao, et al.
Veröffentlicht: (2025)
GoIRL: Graph-Oriented Inverse Reinforcement Learning for Multimodal Trajectory Prediction
von: Pei, Muleilan, et al.
Veröffentlicht: (2025)
von: Pei, Muleilan, et al.
Veröffentlicht: (2025)
Mobile Robot Navigation Using Hand-Drawn Maps: A Vision Language Model Approach
von: Tan, Aaron Hao, et al.
Veröffentlicht: (2025)
von: Tan, Aaron Hao, et al.
Veröffentlicht: (2025)
FlexVLN: Flexible Adaptation for Diverse Vision-and-Language Navigation Tasks
von: Zhang, Siqi, et al.
Veröffentlicht: (2025)
von: Zhang, Siqi, et al.
Veröffentlicht: (2025)
Multimodal Signal Processing For Thermo-Visible-Lidar Fusion In Real-time 3D Semantic Mapping
von: Sun, Jiajun, et al.
Veröffentlicht: (2026)
von: Sun, Jiajun, et al.
Veröffentlicht: (2026)
MacFormer: Map-Agent Coupled Transformer for Real-time and Robust Trajectory Prediction
von: Feng, Chen, et al.
Veröffentlicht: (2023)
von: Feng, Chen, et al.
Veröffentlicht: (2023)
COSMO: Combination of Selective Memorization for Low-cost Vision-and-Language Navigation
von: Zhang, Siqi, et al.
Veröffentlicht: (2025)
von: Zhang, Siqi, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
SG-Reg: Generalizable and Efficient Scene Graph Registration
von: Liu, Chuhao, et al.
Veröffentlicht: (2025) -
CSMapping: Scalable Crowdsourced Semantic Mapping and Topology Inference for Autonomous Driving
von: Qiao, Zhijian, et al.
Veröffentlicht: (2025) -
SEPT: Standard-Definition Map Enhanced Scene Perception and Topology Reasoning for Autonomous Driving
von: Pei, Muleilan, et al.
Veröffentlicht: (2025) -
G3Reg: Pyramid Graph-based Global Registration using Gaussian Ellipsoid Model
von: Qiao, Zhijian, et al.
Veröffentlicht: (2023) -
ST-GS: Vision-Based 3D Semantic Occupancy Prediction with Spatial-Temporal Gaussian Splatting
von: Yan, Xiaoyang, et al.
Veröffentlicht: (2025)