Spatiotemporal Decoupling for Efficient Vision-Based Occupancy Forecasting
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Jingyi, Chen, Xieyuanli, Ma, Junyi, Huang, Jiawei, Xu, Jintao, Wang, Yue, Pei, Ling |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Cam4DOcc: Benchmark for Camera-Only 4D Occupancy Forecasting in Autonomous Driving Applications
by: Ma, Junyi, et al.
Published: (2023)
by: Ma, Junyi, et al.
Published: (2023)
Diff-IP2D: Diffusion-Based Hand-Object Interaction Prediction on Egocentric Videos
by: Ma, Junyi, et al.
Published: (2024)
by: Ma, Junyi, et al.
Published: (2024)
Explicit Interaction for Fusion-Based Place Recognition
by: Xu, Jingyi, et al.
Published: (2024)
by: Xu, Jingyi, et al.
Published: (2024)
MADiff: Motion-Aware Mamba Diffusion Models for Hand Trajectory Prediction on Egocentric Videos
by: Ma, Junyi, et al.
Published: (2024)
by: Ma, Junyi, et al.
Published: (2024)
Uni-Hand: Universal Hand Motion Forecasting in Egocentric Views
by: Ma, Junyi, et al.
Published: (2025)
by: Ma, Junyi, et al.
Published: (2025)
Novel Diffusion Models for Multimodal 3D Hand Trajectory Prediction
by: Ma, Junyi, et al.
Published: (2025)
by: Ma, Junyi, et al.
Published: (2025)
Occupancy Learning with Spatiotemporal Memory
by: Leng, Ziyang, et al.
Published: (2025)
by: Leng, Ziyang, et al.
Published: (2025)
EDmamba: Rethinking Efficient Event Denoising with Spatiotemporal Decoupled SSMs
by: Ruan, Ciyu, et al.
Published: (2025)
by: Ruan, Ciyu, et al.
Published: (2025)
VGGT-MPR: VGGT-Enhanced Multimodal Place Recognition in Autonomous Driving Environments
by: Xu, Jingyi, et al.
Published: (2026)
by: Xu, Jingyi, et al.
Published: (2026)
Driving in the Occupancy World: Vision-Centric 4D Occupancy Forecasting and Planning via World Models for Autonomous Driving
by: Yang, Yu, et al.
Published: (2024)
by: Yang, Yu, et al.
Published: (2024)
Deep Height Decoupling for Precise Vision-based 3D Occupancy Prediction
by: Wu, Yuan, et al.
Published: (2024)
by: Wu, Yuan, et al.
Published: (2024)
An Efficient Occupancy World Model via Decoupled Dynamic Flow and Image-assisted Training
by: Zhang, Haiming, et al.
Published: (2024)
by: Zhang, Haiming, et al.
Published: (2024)
LCPR: A Multi-Scale Attention-Based LiDAR-Camera Fusion Network for Place Recognition
by: Zhou, Zijie, et al.
Published: (2023)
by: Zhou, Zijie, et al.
Published: (2023)
VMRNN: Integrating Vision Mamba and LSTM for Efficient and Accurate Spatiotemporal Forecasting
by: Tang, Yujin, et al.
Published: (2024)
by: Tang, Yujin, et al.
Published: (2024)
GEM: Gaussian Evolution Model for Occupancy Forecasting and Motion Planning
by: Chen, Cheng, et al.
Published: (2026)
by: Chen, Cheng, et al.
Published: (2026)
COTR: Compact Occupancy TRansformer for Vision-based 3D Occupancy Prediction
by: Ma, Qihang, et al.
Published: (2023)
by: Ma, Qihang, et al.
Published: (2023)
Deflickering Vision-Based Occupancy Networks through Lightweight Spatio-Temporal Correlation
by: Yu, Fengcheng, et al.
Published: (2025)
by: Yu, Fengcheng, et al.
Published: (2025)
A Pseudo Global Fusion Paradigm-Based Cross-View Network for LiDAR-Based Place Recognition
by: Cheng, Jintao, et al.
Published: (2025)
by: Cheng, Jintao, et al.
Published: (2025)
OccProphet: Pushing Efficiency Frontier of Camera-Only 4D Occupancy Forecasting with Observer-Forecaster-Refiner Framework
by: Chen, Junliang, et al.
Published: (2025)
by: Chen, Junliang, et al.
Published: (2025)
SparseOcc: Rethinking Sparse Latent Representation for Vision-Based Semantic Occupancy Prediction
by: Tang, Pin, et al.
Published: (2024)
by: Tang, Pin, et al.
Published: (2024)
CV-MOS: A Cross-View Model for Motion Segmentation
by: Tang, Xiaoyu, et al.
Published: (2024)
by: Tang, Xiaoyu, et al.
Published: (2024)
VGGT-Occ: Geometry-Grounded and Density-Aware Gated Fusion for 3D Occupancy Prediction
by: Chen, Xun, et al.
Published: (2026)
by: Chen, Xun, et al.
Published: (2026)
EasyVFX: Frequency-Driven Decoupling for Resource-Efficient VFX Generation
by: Ma, Yue, et al.
Published: (2026)
by: Ma, Yue, et al.
Published: (2026)
ST-GS: Vision-Based 3D Semantic Occupancy Prediction with Spatial-Temporal Gaussian Splatting
by: Yan, Xiaoyang, et al.
Published: (2025)
by: Yan, Xiaoyang, et al.
Published: (2025)
VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models
by: Cheng, Jintao, et al.
Published: (2026)
by: Cheng, Jintao, et al.
Published: (2026)
FSF-Net: Enhance 4D Occupancy Forecasting with Coarse BEV Scene Flow for Autonomous Driving
by: Guo, Erxin, et al.
Published: (2024)
by: Guo, Erxin, et al.
Published: (2024)
DecoupledGaussian: Object-Scene Decoupling for Physics-Based Interaction
by: Wang, Miaowei, et al.
Published: (2025)
by: Wang, Miaowei, et al.
Published: (2025)
Libra: Building Decoupled Vision System on Large Language Models
by: Xu, Yifan, et al.
Published: (2024)
by: Xu, Yifan, et al.
Published: (2024)
TSCM: A Teacher-Student Model for Vision Place Recognition Using Cross-Metric Knowledge Distillation
by: Shen, Yehui, et al.
Published: (2024)
by: Shen, Yehui, et al.
Published: (2024)
Vision-Only Gaussian Splatting for Collaborative Semantic Occupancy Prediction
by: Chen, Cheng, et al.
Published: (2025)
by: Chen, Cheng, et al.
Published: (2025)
Cross-Self KV Cache Pruning for Efficient Vision-Language Inference
by: Pei, Xiaohuan, et al.
Published: (2024)
by: Pei, Xiaohuan, et al.
Published: (2024)
ForecastOcc: Vision-based Semantic Occupancy Forecasting
by: Mohan, Riya, et al.
Published: (2026)
by: Mohan, Riya, et al.
Published: (2026)
Vision-Centric 4D Occupancy Forecasting and Planning via Implicit Residual World Models
by: Mei, Jianbiao, et al.
Published: (2025)
by: Mei, Jianbiao, et al.
Published: (2025)
4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration
by: Zhang, Jiahui, et al.
Published: (2025)
by: Zhang, Jiahui, et al.
Published: (2025)
SuperFusion: Multilevel LiDAR-Camera Fusion for Long-Range HD Map Generation
by: Dong, Hao, et al.
Published: (2022)
by: Dong, Hao, et al.
Published: (2022)
Co-Occ: Coupling Explicit Feature Fusion with Volume Rendering Regularization for Multi-Modal 3D Semantic Occupancy Prediction
by: Pan, Jingyi, et al.
Published: (2024)
by: Pan, Jingyi, et al.
Published: (2024)
WE-GS: An In-the-wild Efficient 3D Gaussian Representation for Unconstrained Photo Collections
by: Wang, Yuze, et al.
Published: (2024)
by: Wang, Yuze, et al.
Published: (2024)
MF-MOS: A Motion-Focused Model for Moving Object Segmentation
by: Cheng, Jintao, et al.
Published: (2024)
by: Cheng, Jintao, et al.
Published: (2024)
GSPR: Multimodal Place Recognition Using 3D Gaussian Splatting for Autonomous Driving
by: Qi, Zhangshuo, et al.
Published: (2024)
by: Qi, Zhangshuo, et al.
Published: (2024)
Importance-Based Token Merging for Efficient Image and Video Generation
by: Wu, Haoyu, et al.
Published: (2024)
by: Wu, Haoyu, et al.
Published: (2024)
Similar Items
-
Cam4DOcc: Benchmark for Camera-Only 4D Occupancy Forecasting in Autonomous Driving Applications
by: Ma, Junyi, et al.
Published: (2023) -
Diff-IP2D: Diffusion-Based Hand-Object Interaction Prediction on Egocentric Videos
by: Ma, Junyi, et al.
Published: (2024) -
Explicit Interaction for Fusion-Based Place Recognition
by: Xu, Jingyi, et al.
Published: (2024) -
MADiff: Motion-Aware Mamba Diffusion Models for Hand Trajectory Prediction on Egocentric Videos
by: Ma, Junyi, et al.
Published: (2024) -
Uni-Hand: Universal Hand Motion Forecasting in Egocentric Views
by: Ma, Junyi, et al.
Published: (2025)