Multimodal Fusion SLAM with Fourier Attention
Fuente:
arXiv
Saved in:
| Main Authors: | Zhou, Youjie, Mei, Guofeng, Wang, Yiming, Wan, Yi, Poiesi, Fabio |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Efficient Encoder-Free Fourier-based 3D Large Multimodal Model
by: Mei, Guofeng, et al.
Published: (2026)
by: Mei, Guofeng, et al.
Published: (2026)
Vocabulary-Free 3D Instance Segmentation with Vision and Language Assistant
by: Mei, Guofeng, et al.
Published: (2024)
by: Mei, Guofeng, et al.
Published: (2024)
Free-form language-based robotic reasoning and grasping
by: Jiao, Runyu, et al.
Published: (2025)
by: Jiao, Runyu, et al.
Published: (2025)
Obstruction reasoning for robotic grasping
by: Jiao, Runyu, et al.
Published: (2025)
by: Jiao, Runyu, et al.
Published: (2025)
Geometrically-driven Aggregation for Zero-shot 3D Point Cloud Understanding
by: Mei, Guofeng, et al.
Published: (2023)
by: Mei, Guofeng, et al.
Published: (2023)
FGS-SLAM: Fourier-based Gaussian Splatting for Real-time SLAM with Sparse and Dense Map Fusion
by: Xu, Yansong, et al.
Published: (2025)
by: Xu, Yansong, et al.
Published: (2025)
Fully-Geometric Cross-Attention for Point Cloud Registration
by: Wang, Weijie, et al.
Published: (2025)
by: Wang, Weijie, et al.
Published: (2025)
Light-weight Retinal Layer Segmentation with Global Reasoning
by: He, Xiang, et al.
Published: (2024)
by: He, Xiang, et al.
Published: (2024)
Trifuse: Enhancing Attention-Based GUI Grounding via Multimodal Fusion
by: Ma, Longhui, et al.
Published: (2026)
by: Ma, Longhui, et al.
Published: (2026)
PerLA: Perceptive 3D Language Assistant
by: Mei, Guofeng, et al.
Published: (2024)
by: Mei, Guofeng, et al.
Published: (2024)
OpenGS-SLAM: Open-Set Dense Semantic SLAM with 3D Gaussian Splatting for Object-Level Scene Understanding
by: Yang, Dianyi, et al.
Published: (2025)
by: Yang, Dianyi, et al.
Published: (2025)
SGS-SLAM: Semantic Gaussian Splatting For Neural Dense SLAM
by: Li, Mingrui, et al.
Published: (2024)
by: Li, Mingrui, et al.
Published: (2024)
Do MLLMs Really See It: Reinforcing Visual Attention in Multimodal LLMs
by: Ou, Siqu, et al.
Published: (2026)
by: Ou, Siqu, et al.
Published: (2026)
LVD-GS: Gaussian Splatting SLAM for Dynamic Scenes via Hierarchical Explicit-Implicit Representation Collaboration Rendering
by: Zhu, Wenkai, et al.
Published: (2025)
by: Zhu, Wenkai, et al.
Published: (2025)
GPT-4 Enhanced Multimodal Grounding for Autonomous Driving: Leveraging Cross-Modal Attention with Large Language Models
by: Liao, Haicheng, et al.
Published: (2023)
by: Liao, Haicheng, et al.
Published: (2023)
MCOO-SLAM: A Multi-Camera Omnidirectional Object SLAM System
by: Pan, Miaoxin, et al.
Published: (2025)
by: Pan, Miaoxin, et al.
Published: (2025)
Edge-Enhanced Dilated Residual Attention Network for Multimodal Medical Image Fusion
by: Zhou, Meng, et al.
Published: (2024)
by: Zhou, Meng, et al.
Published: (2024)
Fourier-Guided Attention Upsampling for Image Super-Resolution
by: Choi, Daejune, et al.
Published: (2025)
by: Choi, Daejune, et al.
Published: (2025)
VLM-E2E: Enhancing End-to-End Autonomous Driving with Multimodal Driver Attention Fusion
by: Liu, Pei, et al.
Published: (2025)
by: Liu, Pei, et al.
Published: (2025)
Multimodal Connectome Fusion via Cross-Attention for Autism Spectrum Disorder Classification Using Graph Learning
by: Rahman, Ansar, et al.
Published: (2026)
by: Rahman, Ansar, et al.
Published: (2026)
SimInsert: Seamless Video Object Insertion via Regional Sparse Attention Fusion
by: Chen, Xinyu, et al.
Published: (2026)
by: Chen, Xinyu, et al.
Published: (2026)
Hierarchical Modeling for Medical Visual Question Answering with Cross-Attention Fusion
by: Zhang, Junkai, et al.
Published: (2025)
by: Zhang, Junkai, et al.
Published: (2025)
Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs
by: Wang, Wei-Yao, et al.
Published: (2025)
by: Wang, Wei-Yao, et al.
Published: (2025)
Local and Global Feature Attention Fusion Network for Face Recognition
by: Yu, Wang, et al.
Published: (2024)
by: Yu, Wang, et al.
Published: (2024)
Application of Multimodal Fusion Deep Learning Model in Disease Recognition
by: Liu, Xiaoyi, et al.
Published: (2024)
by: Liu, Xiaoyi, et al.
Published: (2024)
MSVIT: Improving Spiking Vision Transformer Using Multi-scale Attention Fusion
by: Hua, Wei, et al.
Published: (2025)
by: Hua, Wei, et al.
Published: (2025)
Collaborative Attention and Consistent-Guided Fusion of MRI and PET for Alzheimer's Disease Diagnosis
by: Ma, Delin, et al.
Published: (2025)
by: Ma, Delin, et al.
Published: (2025)
Towards Cross-Scale Attention and Surface Supervision for Fractured Bone Segmentation in CT
by: Zhou, Yu, et al.
Published: (2024)
by: Zhou, Yu, et al.
Published: (2024)
Multi-view Image Diffusion via Coordinate Noise and Fourier Attention
by: Theiss, Justin, et al.
Published: (2024)
by: Theiss, Justin, et al.
Published: (2024)
Multimodal Feature Fusion Network with Text Difference Enhancement for Remote Sensing Change Detection
by: Zhou, Yijun, et al.
Published: (2025)
by: Zhou, Yijun, et al.
Published: (2025)
CASA: Cross-Attention over Self-Attention for Efficient Vision-Language Fusion
by: Böhle, Moritz, et al.
Published: (2025)
by: Böhle, Moritz, et al.
Published: (2025)
Fusion to Enhance: Fusion Visual Encoder to Enhance Multimodal Language Model
by: She, Yifei, et al.
Published: (2025)
by: She, Yifei, et al.
Published: (2025)
Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion
by: Chen, Zhuokun, et al.
Published: (2024)
by: Chen, Zhuokun, et al.
Published: (2024)
Text-Guided Layer Fusion Mitigates Hallucination in Multimodal LLMs
by: Lin, Chenchen, et al.
Published: (2026)
by: Lin, Chenchen, et al.
Published: (2026)
Rethinking Normalization Strategies and Convolutional Kernels for Multimodal Image Fusion
by: He, Dan, et al.
Published: (2024)
by: He, Dan, et al.
Published: (2024)
HIMOSA: Efficient Remote Sensing Image Super-Resolution with Hierarchical Mixture of Sparse Attention
by: Liu, Yi, et al.
Published: (2025)
by: Liu, Yi, et al.
Published: (2025)
DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception
by: Li, Xiaotong, et al.
Published: (2024)
by: Li, Xiaotong, et al.
Published: (2024)
Famba-V: Fast Vision Mamba with Cross-Layer Token Fusion
by: Shen, Hui, et al.
Published: (2024)
by: Shen, Hui, et al.
Published: (2024)
Sparse Shortcuts: Facilitating Efficient Fusion in Multimodal Large Language Models
by: Zhang, Jingrui, et al.
Published: (2026)
by: Zhang, Jingrui, et al.
Published: (2026)
QCaption: Video Captioning and Q&A through Fusion of Large Multimodal Models
by: Wang, Jiale, et al.
Published: (2026)
by: Wang, Jiale, et al.
Published: (2026)
Similar Items
-
Efficient Encoder-Free Fourier-based 3D Large Multimodal Model
by: Mei, Guofeng, et al.
Published: (2026) -
Vocabulary-Free 3D Instance Segmentation with Vision and Language Assistant
by: Mei, Guofeng, et al.
Published: (2024) -
Free-form language-based robotic reasoning and grasping
by: Jiao, Runyu, et al.
Published: (2025) -
Obstruction reasoning for robotic grasping
by: Jiao, Runyu, et al.
Published: (2025) -
Geometrically-driven Aggregation for Zero-shot 3D Point Cloud Understanding
by: Mei, Guofeng, et al.
Published: (2023)