3D-MoRe: Unified Modal-Contextual Reasoning for Embodied Question Answering
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Rongtao, Gao, Han, Yu, Mingming, An, Dong, Chen, Shunpeng, Wang, Changwei, Guo, Li, Liang, Xiaodan, Xu, Shibiao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Local Feature Matching Using Deep Learning: A Survey
by: Xu, Shibiao, et al.
Published: (2024)
by: Xu, Shibiao, et al.
Published: (2024)
DeliCIR: Deliberative Test-Time Evolutionary Hierarchical Multi-Agents for Composed Image Retrieval
by: Pei, Xingtian, et al.
Published: (2026)
by: Pei, Xingtian, et al.
Published: (2026)
Advances in Embodied Navigation Using Large Language Models: A Survey
by: Lin, Jinzhou, et al.
Published: (2023)
by: Lin, Jinzhou, et al.
Published: (2023)
CurriFlow: Curriculum-Guided Depth Fusion with Optical Flow-Based Temporal Alignment for 3D Semantic Scene Completion
by: Lin, Jinzhou, et al.
Published: (2025)
by: Lin, Jinzhou, et al.
Published: (2025)
Region Matters: Efficient and Reliable Region-Aware Visual Place Recognition
by: Chen, Shunpeng, et al.
Published: (2026)
by: Chen, Shunpeng, et al.
Published: (2026)
Complementary Information Guided Occupancy Prediction via Multi-Level Representation Fusion
by: Xu, Rongtao, et al.
Published: (2025)
by: Xu, Rongtao, et al.
Published: (2025)
PSTNet: Enhanced Polyp Segmentation with Multi-scale Alignment and Frequency Domain Integration
by: Xu, Wenhao, et al.
Published: (2024)
by: Xu, Wenhao, et al.
Published: (2024)
SAGE: Spatial-visual Adaptive Graph Exploration for Efficient Visual Place Recognition
by: Chen, Shunpeng, et al.
Published: (2025)
by: Chen, Shunpeng, et al.
Published: (2025)
Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision
by: Han, Xiaofeng, et al.
Published: (2025)
by: Han, Xiaofeng, et al.
Published: (2025)
CAE-DFKD: Bridging the Transferability Gap in Data-Free Knowledge Distillation
by: Zhang, Zherui, et al.
Published: (2025)
by: Zhang, Zherui, et al.
Published: (2025)
Spectral Prompt Tuning:Unveiling Unseen Classes for Zero-Shot Semantic Segmentation
by: Xu, Wenhao, et al.
Published: (2023)
by: Xu, Wenhao, et al.
Published: (2023)
SkinFormer: Learning Statistical Texture Representation with Transformer for Skin Lesion Segmentation
by: Xu, Rongtao, et al.
Published: (2024)
by: Xu, Rongtao, et al.
Published: (2024)
MoRe Fine-Tuning with 10x Fewer Parameters
by: Tan, Wenxuan, et al.
Published: (2024)
by: Tan, Wenxuan, et al.
Published: (2024)
MoRe: Motion-aware Feed-forward 4D Reconstruction Transformer
by: Fang, Juntong, et al.
Published: (2026)
by: Fang, Juntong, et al.
Published: (2026)
SAMamba: Adaptive State Space Modeling with Hierarchical Vision for Infrared Small Target Detection
by: Xu, Wenhao, et al.
Published: (2025)
by: Xu, Wenhao, et al.
Published: (2025)
Focus on Local: Finding Reliable Discriminative Regions for Visual Place Recognition
by: Wang, Changwei, et al.
Published: (2025)
by: Wang, Changwei, et al.
Published: (2025)
Generalization Boosted Adapter for Open-Vocabulary Segmentation
by: Xu, Wenhao, et al.
Published: (2024)
by: Xu, Wenhao, et al.
Published: (2024)
HMR-1: Hierarchical Massage Robot with Vision-Language-Model for Embodied Healthcare
by: Xu, Rongtao, et al.
Published: (2026)
by: Xu, Rongtao, et al.
Published: (2026)
H-MoRe: Learning Human-centric Motion Representation for Action Analysis
by: Huang, Zhanbo, et al.
Published: (2025)
by: Huang, Zhanbo, et al.
Published: (2025)
Segment Anything Model is a Good Teacher for Local Feature Learning
by: Wu, Jingqian, et al.
Published: (2023)
by: Wu, Jingqian, et al.
Published: (2023)
Multi-Step Reasoning for Embodied Question Answering via Tool Augmentation
by: Zhai, Mingliang, et al.
Published: (2025)
by: Zhai, Mingliang, et al.
Published: (2025)
FDBPL: Faster Distillation-Based Prompt Learning for Region-Aware Vision-Language Models Adaptation
by: Zhang, Zherui, et al.
Published: (2025)
by: Zhang, Zherui, et al.
Published: (2025)
MoRe-ERL: Learning Motion Residuals using Episodic Reinforcement Learning
by: Huang, Xi, et al.
Published: (2025)
by: Huang, Xi, et al.
Published: (2025)
HCF-Net: Hierarchical Context Fusion Network for Infrared Small Object Detection
by: Xu, Shibiao, et al.
Published: (2024)
by: Xu, Shibiao, et al.
Published: (2024)
Open-Ended Multi-Modal Relational Reasoning for Video Question Answering
by: Luo, Haozheng, et al.
Published: (2020)
by: Luo, Haozheng, et al.
Published: (2020)
Image Recognition with Online Lightweight Vision Transformer: A Survey
by: Zhang, Zherui, et al.
Published: (2025)
by: Zhang, Zherui, et al.
Published: (2025)
MoRe: Monocular Geometry Refinement via Graph Optimization for Cross-View Consistency
by: Jung, Dongki, et al.
Published: (2025)
by: Jung, Dongki, et al.
Published: (2025)
MoRe: Class Patch Attention Needs Regularization for Weakly Supervised Semantic Segmentation
by: Yang, Zhiwei, et al.
Published: (2024)
by: Yang, Zhiwei, et al.
Published: (2024)
MoReVQA: Exploring Modular Reasoning Models for Video Question Answering
by: Min, Juhong, et al.
Published: (2024)
by: Min, Juhong, et al.
Published: (2024)
MoRe-3DGSMR: Motion-resolved reconstruction framework for free-breathing pulmonary MRI based on 3D Gaussian representation
by: Peng, Tengya, et al.
Published: (2025)
by: Peng, Tengya, et al.
Published: (2025)
Nonequilibrium Quasiparticle Dynamics in a MoRe-Based Superconducting Resonator under IR Excitation
by: Kalenyuk, O. A., et al.
Published: (2025)
by: Kalenyuk, O. A., et al.
Published: (2025)
Memory-Centric Embodied Question Answering
by: Zhai, Mingliang, et al.
Published: (2025)
by: Zhai, Mingliang, et al.
Published: (2025)
EvolveNav: Empowering LLM-Based Vision-Language Navigation via Self-Improving Embodied Reasoning
by: Lin, Bingqian, et al.
Published: (2025)
by: Lin, Bingqian, et al.
Published: (2025)
Extending Embodied Question Answering from Perception to Decision
by: Gong, Xicheng, et al.
Published: (2026)
by: Gong, Xicheng, et al.
Published: (2026)
ChartReasoner: Code-Driven Modality Bridging for Long-Chain Reasoning in Chart Question Answering
by: Jia, Caijun, et al.
Published: (2025)
by: Jia, Caijun, et al.
Published: (2025)
Embodied Intelligence for 3D Understanding: A Survey on 3D Scene Question Answering
by: Li, Zechuan, et al.
Published: (2025)
by: Li, Zechuan, et al.
Published: (2025)
Enter the Mind Palace: Reasoning and Planning for Long-term Active Embodied Question Answering
by: Ginting, Muhammad Fadhil, et al.
Published: (2025)
by: Ginting, Muhammad Fadhil, et al.
Published: (2025)
$\mathcal{P}^3$: Toward Versatile Embodied Agents
by: Zhou, Shengli, et al.
Published: (2025)
by: Zhou, Shengli, et al.
Published: (2025)
InstruGen: Automatic Instruction Generation for Vision-and-Language Navigation Via Large Multimodal Models
by: Yan, Yu, et al.
Published: (2024)
by: Yan, Yu, et al.
Published: (2024)
DARA: Decomposition-Alignment-Reasoning Autonomous Language Agent for Question Answering over Knowledge Graphs
by: Fang, Haishuo, et al.
Published: (2024)
by: Fang, Haishuo, et al.
Published: (2024)
Similar Items
-
Local Feature Matching Using Deep Learning: A Survey
by: Xu, Shibiao, et al.
Published: (2024) -
DeliCIR: Deliberative Test-Time Evolutionary Hierarchical Multi-Agents for Composed Image Retrieval
by: Pei, Xingtian, et al.
Published: (2026) -
Advances in Embodied Navigation Using Large Language Models: A Survey
by: Lin, Jinzhou, et al.
Published: (2023) -
CurriFlow: Curriculum-Guided Depth Fusion with Optical Flow-Based Temporal Alignment for 3D Semantic Scene Completion
by: Lin, Jinzhou, et al.
Published: (2025) -
Region Matters: Efficient and Reliable Region-Aware Visual Place Recognition
by: Chen, Shunpeng, et al.
Published: (2026)