3D-MoE: A Mixture-of-Experts Multi-modal LLM for 3D Vision and Pose Diffusion via Rectified Flow
Fuente:
arXiv
Salvato in:
| Autori principali: | Ma, Yueen, Zhuang, Yuzheng, Hao, Jianye, King, Irwin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Survey on Vision-Language-Action Models for Embodied AI
di: Ma, Yueen, et al.
Pubblicazione: (2024)
di: Ma, Yueen, et al.
Pubblicazione: (2024)
Astra: Efficient Transformer Architecture and Contrastive Dynamics Learning for Embodied Instruction Following
di: Ma, Yueen, et al.
Pubblicazione: (2024)
di: Ma, Yueen, et al.
Pubblicazione: (2024)
VOLTA: Improving Generative Diversity by Variational Mutual Information Maximizing Autoencoder
di: Ma, Yueen, et al.
Pubblicazione: (2023)
di: Ma, Yueen, et al.
Pubblicazione: (2023)
MoE3D: Mixture of Experts meets Multi-Modal 3D Understanding
di: Li, Yu, et al.
Pubblicazione: (2025)
di: Li, Yu, et al.
Pubblicazione: (2025)
SocialNav-MoE: A Mixture-of-Experts Vision Language Model for Socially Compliant Navigation with Reinforcement Fine-Tuning
di: Kawabata, Tomohito, et al.
Pubblicazione: (2025)
di: Kawabata, Tomohito, et al.
Pubblicazione: (2025)
3D-AffordanceLLM: Harnessing Large Language Models for Open-Vocabulary Affordance Detection in 3D Worlds
di: Chu, Hengshuo, et al.
Pubblicazione: (2025)
di: Chu, Hengshuo, et al.
Pubblicazione: (2025)
OmniEVA: Embodied Versatile Planner via Task-Adaptive 3D-Grounded and Embodiment-aware Reasoning
di: Liu, Yuecheng, et al.
Pubblicazione: (2025)
di: Liu, Yuecheng, et al.
Pubblicazione: (2025)
MoE3D: A Mixture-of-Experts Module for 3D Reconstruction
di: Wang, Zichen, et al.
Pubblicazione: (2026)
di: Wang, Zichen, et al.
Pubblicazione: (2026)
MH-MoE: Multi-Head Mixture-of-Experts
di: Huang, Shaohan, et al.
Pubblicazione: (2024)
di: Huang, Shaohan, et al.
Pubblicazione: (2024)
Uni3D-MoE: Scalable Multimodal 3D Scene Understanding via Mixture of Experts
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
Multi-modal Situated Reasoning in 3D Scenes
di: Linghu, Xiongkun, et al.
Pubblicazione: (2024)
di: Linghu, Xiongkun, et al.
Pubblicazione: (2024)
Rectified Point Flow: Generic Point Cloud Pose Estimation
di: Sun, Tao, et al.
Pubblicazione: (2025)
di: Sun, Tao, et al.
Pubblicazione: (2025)
SE(3)-PoseFlow: Estimating 6D Pose Distributions for Uncertainty-Aware Robotic Manipulation
di: Jin, Yufeng, et al.
Pubblicazione: (2025)
di: Jin, Yufeng, et al.
Pubblicazione: (2025)
Multi-view Pose Fusion for Occlusion-Aware 3D Human Pose Estimation
di: Bragagnolo, Laura, et al.
Pubblicazione: (2024)
di: Bragagnolo, Laura, et al.
Pubblicazione: (2024)
MoE-Loco: Mixture of Experts for Multitask Locomotion
di: Huang, Runhan, et al.
Pubblicazione: (2025)
di: Huang, Runhan, et al.
Pubblicazione: (2025)
Vision6D: 3D-to-2D Interactive Visualization and Annotation Tool for 6D Pose Estimation
di: Zhang, Yike, et al.
Pubblicazione: (2025)
di: Zhang, Yike, et al.
Pubblicazione: (2025)
AutoLayout: Closed-Loop Layout Synthesis via Slow-Fast Collaborative Reasoning
di: Chen, Weixing, et al.
Pubblicazione: (2025)
di: Chen, Weixing, et al.
Pubblicazione: (2025)
When LLMs step into the 3D World: A Survey and Meta-Analysis of 3D Tasks via Multi-modal Large Language Models
di: Ma, Xianzheng, et al.
Pubblicazione: (2024)
di: Ma, Xianzheng, et al.
Pubblicazione: (2024)
ReSeFlow: Rectifying SE(3)-Equivariant Policy Learning Flows
di: Wang, Zhitao, et al.
Pubblicazione: (2025)
di: Wang, Zhitao, et al.
Pubblicazione: (2025)
LM-MCVT: A Lightweight Multi-modal Multi-view Convolutional-Vision Transformer Approach for 3D Object Recognition
di: Xiong, Songsong, et al.
Pubblicazione: (2025)
di: Xiong, Songsong, et al.
Pubblicazione: (2025)
MoE-ACT: Scaling Multi-Task Bimanual Manipulation with Sparse Language-Conditioned Mixture-of-Experts Transformers
di: Guo, Kangjun, et al.
Pubblicazione: (2026)
di: Guo, Kangjun, et al.
Pubblicazione: (2026)
REHEARSE-3D: A Multi-modal Emulated Rain Dataset for 3D Point Cloud De-raining
di: Raisuddin, Abu Mohammed, et al.
Pubblicazione: (2025)
di: Raisuddin, Abu Mohammed, et al.
Pubblicazione: (2025)
SAM-Med3D-MoE: Towards a Non-Forgetting Segment Anything Model via Mixture of Experts for 3D Medical Image Segmentation
di: Wang, Guoan, et al.
Pubblicazione: (2024)
di: Wang, Guoan, et al.
Pubblicazione: (2024)
Point-MoE: Large-Scale Multi-Dataset Training with Mixture-of-Experts for 3D Semantic Segmentation
di: Chen, Xuweiyi, et al.
Pubblicazione: (2025)
di: Chen, Xuweiyi, et al.
Pubblicazione: (2025)
Multi-modal panoramic 3D outdoor datasets for place categorization
di: Jung, Hojung, et al.
Pubblicazione: (2026)
di: Jung, Hojung, et al.
Pubblicazione: (2026)
ECo-MoE: Embodiment-Conditioned Mixture of Experts Increases the Evolvability of Robots
di: Wang, Yibin, et al.
Pubblicazione: (2026)
di: Wang, Yibin, et al.
Pubblicazione: (2026)
MM3DGS SLAM: Multi-modal 3D Gaussian Splatting for SLAM Using Vision, Depth, and Inertial Measurements
di: Sun, Lisong C., et al.
Pubblicazione: (2024)
di: Sun, Lisong C., et al.
Pubblicazione: (2024)
DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving
di: Yang, Zhenjie, et al.
Pubblicazione: (2025)
di: Yang, Zhenjie, et al.
Pubblicazione: (2025)
AW-MoE: All-Weather Mixture of Experts for Robust Multi-Modal 3D Object Detection
di: Lin, Hongwei, et al.
Pubblicazione: (2026)
di: Lin, Hongwei, et al.
Pubblicazione: (2026)
G3Flow: Generative 3D Semantic Flow for Pose-aware and Generalizable Object Manipulation
di: Chen, Tianxing, et al.
Pubblicazione: (2024)
di: Chen, Tianxing, et al.
Pubblicazione: (2024)
PoseMoE: Mixture-of-Experts Network for Monocular 3D Human Pose Estimation
di: Liu, Mengyuan, et al.
Pubblicazione: (2025)
di: Liu, Mengyuan, et al.
Pubblicazione: (2025)
DeProPose: Deficiency-Proof 3D Human Pose Estimation via Adaptive Multi-View Fusion
di: Jiao, Jianbin, et al.
Pubblicazione: (2025)
di: Jiao, Jianbin, et al.
Pubblicazione: (2025)
MV-SSM: Multi-View State Space Modeling for 3D Human Pose Estimation
di: Chharia, Aviral, et al.
Pubblicazione: (2025)
di: Chharia, Aviral, et al.
Pubblicazione: (2025)
MonoDiff9D: Monocular Category-Level 9D Object Pose Estimation via Diffusion Model
di: Liu, Jian, et al.
Pubblicazione: (2025)
di: Liu, Jian, et al.
Pubblicazione: (2025)
RFM-Pose:Reinforcement-Guided Flow Matching for Fast Category-Level 6D Pose Estimation
di: He, Diya, et al.
Pubblicazione: (2026)
di: He, Diya, et al.
Pubblicazione: (2026)
LAR-MoE: Latent-Aligned Routing for Mixture of Experts in Robotic Imitation Learning
di: Rodriguez, Ariel, et al.
Pubblicazione: (2026)
di: Rodriguez, Ariel, et al.
Pubblicazione: (2026)
Long-Tailed 3D Detection via Multi-Modal Fusion
di: Ma, Yechi, et al.
Pubblicazione: (2023)
di: Ma, Yechi, et al.
Pubblicazione: (2023)
Point2Pose: Occlusion-Recovering 6D Pose Tracking and 3D Reconstruction for Multiple Unknown Objects Via 2D Point Trackers
di: Lin, Tzu-Yuan, et al.
Pubblicazione: (2026)
di: Lin, Tzu-Yuan, et al.
Pubblicazione: (2026)
ZING-3D: Zero-shot Incremental 3D Scene Graphs via Vision-Language Models
di: Saxena, Pranav, et al.
Pubblicazione: (2025)
di: Saxena, Pranav, et al.
Pubblicazione: (2025)
Towards Precise 3D Human Pose Estimation with Multi-Perspective Spatial-Temporal Relational Transformers
di: Jiao, Jianbin, et al.
Pubblicazione: (2024)
di: Jiao, Jianbin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Survey on Vision-Language-Action Models for Embodied AI
di: Ma, Yueen, et al.
Pubblicazione: (2024) -
Astra: Efficient Transformer Architecture and Contrastive Dynamics Learning for Embodied Instruction Following
di: Ma, Yueen, et al.
Pubblicazione: (2024) -
VOLTA: Improving Generative Diversity by Variational Mutual Information Maximizing Autoencoder
di: Ma, Yueen, et al.
Pubblicazione: (2023) -
MoE3D: Mixture of Experts meets Multi-Modal 3D Understanding
di: Li, Yu, et al.
Pubblicazione: (2025) -
SocialNav-MoE: A Mixture-of-Experts Vision Language Model for Socially Compliant Navigation with Reinforcement Fine-Tuning
di: Kawabata, Tomohito, et al.
Pubblicazione: (2025)