MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence
Fuente:
arXiv
Saved in:
| Main Authors: | Yin, Xingyilang, Li, Chengzhengxu, Chang, Jiahao, Pun, Chi-Man, Cun, Xiaodong |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
GSFixer: Improving 3D Gaussian Splatting with Reference-Guided Video Diffusion Priors
by: Yin, Xingyilang, et al.
Published: (2025)
by: Yin, Xingyilang, et al.
Published: (2025)
High-Resolution Document Shadow Removal via A Large-Scale Real-World Dataset and A Frequency-Aware Shadow Erasing Net
by: Li, Zinuo, et al.
Published: (2023)
by: Li, Zinuo, et al.
Published: (2023)
ForgeryTTT: Zero-Shot Image Manipulation Localization with Test-Time Training
by: Liu, Weihuang, et al.
Published: (2024)
by: Liu, Weihuang, et al.
Published: (2024)
PersonaLive! Expressive Portrait Image Animation for Live Streaming
by: Li, Zhiyuan, et al.
Published: (2025)
by: Li, Zhiyuan, et al.
Published: (2025)
A Unified Spatial Alignment Framework for Highly Transferable Transformation-Based Attacks on Spatially Structured Tasks
by: Liang, Jiaming, et al.
Published: (2026)
by: Liang, Jiaming, et al.
Published: (2026)
EmoCAST: Emotional Talking Portrait via Emotive Text Description
by: Jiang, Yiguo, et al.
Published: (2025)
by: Jiang, Yiguo, et al.
Published: (2025)
Depth-aware Test-Time Training for Zero-shot Video Object Segmentation
by: Liu, Weihuang, et al.
Published: (2024)
by: Liu, Weihuang, et al.
Published: (2024)
Mobius: Text to Seamless Looping Video Generation via Latent Shift
by: Bi, Xiuli, et al.
Published: (2025)
by: Bi, Xiuli, et al.
Published: (2025)
SA3DIP: Segment Any 3D Instance with Potential 3D Priors
by: Yang, Xi, et al.
Published: (2024)
by: Yang, Xi, et al.
Published: (2024)
Spatial-Aware Conformal Prediction for Trustworthy Hyperspectral Image Classification
by: Liu, Kangdao, et al.
Published: (2024)
by: Liu, Kangdao, et al.
Published: (2024)
Efficient Preemptive Robustification with Image Sharpening
by: Liang, Jiaming, et al.
Published: (2026)
by: Liang, Jiaming, et al.
Published: (2026)
OTI: A Model-free and Visually Interpretable Measure of Image Attackability
by: Liang, Jiaming, et al.
Published: (2026)
by: Liang, Jiaming, et al.
Published: (2026)
Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence
by: Wu, Diankun, et al.
Published: (2025)
by: Wu, Diankun, et al.
Published: (2025)
Efficient Prototype Consistency Learning in Medical Image Segmentation via Joint Uncertainty and Data Augmentation
by: Li, Lijian, et al.
Published: (2025)
by: Li, Lijian, et al.
Published: (2025)
Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence
by: Zheng, Yufei, et al.
Published: (2026)
by: Zheng, Yufei, et al.
Published: (2026)
Dynamic Parameter Optimization for Highly Transferable Transformation-Based Attacks
by: Liang, Jiaming, et al.
Published: (2025)
by: Liang, Jiaming, et al.
Published: (2025)
SAMPro3D: Locating SAM Prompts in 3D for Zero-Shot Instance Segmentation
by: Xu, Mutian, et al.
Published: (2023)
by: Xu, Mutian, et al.
Published: (2023)
MPerS: Dynamic MLLM MixExperts Perception-Guided Remote Sensing Scene Segmentation
by: Wang, Ziyi, et al.
Published: (2026)
by: Wang, Ziyi, et al.
Published: (2026)
RS3Mamba: Visual State Space Model for Remote Sensing Images Semantic Segmentation
by: Ma, Xianping, et al.
Published: (2024)
by: Ma, Xianping, et al.
Published: (2024)
Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution
by: Liu, Zuyan, et al.
Published: (2024)
by: Liu, Zuyan, et al.
Published: (2024)
4DVD: Cascaded Dense-view Video Diffusion Model for High-quality 4D Content Generation
by: Yang, Shuzhou, et al.
Published: (2025)
by: Yang, Shuzhou, et al.
Published: (2025)
Reconstructing 4D Spatial Intelligence: A Survey
by: Cao, Yukang, et al.
Published: (2025)
by: Cao, Yukang, et al.
Published: (2025)
Unleashing the Multi-View Fusion Potential: Noise Correction in VLM for Open-Vocabulary 3D Scene Understanding
by: Yin, Xingyilang, et al.
Published: (2025)
by: Yin, Xingyilang, et al.
Published: (2025)
Generalized Uncertainty-Based Evidential Fusion with Hybrid Multi-Head Attention for Weak-Supervised Temporal Action Localization
by: He, Yuanpeng, et al.
Published: (2024)
by: He, Yuanpeng, et al.
Published: (2024)
InstructX: Towards Unified Visual Editing with MLLM Guidance
by: Mou, Chong, et al.
Published: (2025)
by: Mou, Chong, et al.
Published: (2025)
FS-RWKV: Leveraging Frequency Spatial-Aware RWKV for 3T-to-7T MRI Translation
by: Lei, Yingtie, et al.
Published: (2025)
by: Lei, Yingtie, et al.
Published: (2025)
Underwater Image Restoration Through a Prior Guided Hybrid Sense Approach and Extensive Benchmark Analysis
by: Guo, Xiaojiao, et al.
Published: (2025)
by: Guo, Xiaojiao, et al.
Published: (2025)
Visual Position Prompt for MLLM based Visual Grounding
by: Tang, Wei, et al.
Published: (2025)
by: Tang, Wei, et al.
Published: (2025)
Spatial-TTT: Streaming Visual-based Spatial Intelligence with Test-Time Training
by: Liu, Fangfu, et al.
Published: (2026)
by: Liu, Fangfu, et al.
Published: (2026)
EarthGPT-X: A Spatial MLLM for Multi-level Multi-Source Remote Sensing Imagery Understanding with Visual Prompting
by: Zhang, Wei, et al.
Published: (2025)
by: Zhang, Wei, et al.
Published: (2025)
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models
by: Xu, Runsen, et al.
Published: (2025)
by: Xu, Runsen, et al.
Published: (2025)
Splat4D: Diffusion-Enhanced 4D Gaussian Splatting for Temporally and Spatially Consistent Content Creation
by: Yin, Minghao, et al.
Published: (2025)
by: Yin, Minghao, et al.
Published: (2025)
DF4LCZ: A SAM-Empowered Data Fusion Framework for Scene-Level Local Climate Zone Classification
by: Wu, Qianqian, et al.
Published: (2024)
by: Wu, Qianqian, et al.
Published: (2024)
S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance
by: Xu, Beining, et al.
Published: (2025)
by: Xu, Beining, et al.
Published: (2025)
AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs
by: Chang, Boyu, et al.
Published: (2026)
by: Chang, Boyu, et al.
Published: (2026)
Spatial4D-Bench: A Versatile 4D Spatial Intelligence Benchmark
by: Wang, Pan, et al.
Published: (2025)
by: Wang, Pan, et al.
Published: (2025)
Spatial-Temporal State Propagation Autoregressive Model for 4D Object Generation
by: Yang, Liying, et al.
Published: (2026)
by: Yang, Liying, et al.
Published: (2026)
RGA-Net: A Vision Enhancement Framework for Robotic Surgical Systems Using Reciprocal Attention Mechanisms
by: Li, Quanjun, et al.
Published: (2026)
by: Li, Quanjun, et al.
Published: (2026)
InfoGeo: Information-Theoretic Object-Centric Learning for Cross-View Generalizable UAV Geo-Localization
by: Zhang, Hongyang, et al.
Published: (2026)
by: Zhang, Hongyang, et al.
Published: (2026)
Kolmogorov-Arnold Network for Remote Sensing Image Semantic Segmentation
by: Ma, Xianping, et al.
Published: (2025)
by: Ma, Xianping, et al.
Published: (2025)
Similar Items
-
GSFixer: Improving 3D Gaussian Splatting with Reference-Guided Video Diffusion Priors
by: Yin, Xingyilang, et al.
Published: (2025) -
High-Resolution Document Shadow Removal via A Large-Scale Real-World Dataset and A Frequency-Aware Shadow Erasing Net
by: Li, Zinuo, et al.
Published: (2023) -
ForgeryTTT: Zero-Shot Image Manipulation Localization with Test-Time Training
by: Liu, Weihuang, et al.
Published: (2024) -
PersonaLive! Expressive Portrait Image Animation for Live Streaming
by: Li, Zhiyuan, et al.
Published: (2025) -
A Unified Spatial Alignment Framework for Highly Transferable Transformation-Based Attacks on Spatially Structured Tasks
by: Liang, Jiaming, et al.
Published: (2026)