Exploring Recurrent Long-term Temporal Fusion for Multi-view 3D Perception
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Chunrui, Yang, Jinrong, Sun, Jianjian, Ge, Zheng, Dong, Runpei, Zhou, Hongyu, Mao, Weixin, Peng, Yuang, Zhang, Xiangyu |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DreamLLM: Synergistic Multimodal Comprehension and Creation
par: Dong, Runpei, et autres
Publié: (2023)
par: Dong, Runpei, et autres
Publié: (2023)
Perception in Reflection
par: Wei, Yana, et autres
Publié: (2025)
par: Wei, Yana, et autres
Publié: (2025)
DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation
par: Peng, Yuang, et autres
Publié: (2024)
par: Peng, Yuang, et autres
Publié: (2024)
Perception-R1: Pioneering Perception Policy with Reinforcement Learning
par: Yu, En, et autres
Publié: (2025)
par: Yu, En, et autres
Publié: (2025)
ShapeLLM: Universal 3D Object Understanding for Embodied Interaction
par: Qi, Zekun, et autres
Publié: (2024)
par: Qi, Zekun, et autres
Publié: (2024)
Thinking by Doing: Building Efficient World Model Reasoning in LLMs via Multi-turn Interaction
par: Shu, Bao, et autres
Publié: (2025)
par: Shu, Bao, et autres
Publié: (2025)
General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
par: Wei, Haoran, et autres
Publié: (2024)
par: Wei, Haoran, et autres
Publié: (2024)
Focus Anywhere for Fine-grained Multi-page Document Understanding
par: Liu, Chenglong, et autres
Publié: (2024)
par: Liu, Chenglong, et autres
Publié: (2024)
Small Language Model Meets with Reinforced Vision Vocabulary
par: Wei, Haoran, et autres
Publié: (2024)
par: Wei, Haoran, et autres
Publié: (2024)
OneChart: Purify the Chart Structural Extraction via One Auxiliary Token
par: Chen, Jinyue, et autres
Publié: (2024)
par: Chen, Jinyue, et autres
Publié: (2024)
Taming Teacher Forcing for Masked Autoregressive Video Generation
par: Zhou, Deyu, et autres
Publié: (2025)
par: Zhou, Deyu, et autres
Publié: (2025)
OnlineBEV: Recurrent Temporal Fusion in Bird's Eye View Representations for Multi-Camera 3D Perception
par: Koh, Junho, et autres
Publié: (2025)
par: Koh, Junho, et autres
Publié: (2025)
DGAE: Diffusion-Guided Autoencoder for Efficient Latent Representation Learning
par: Liu, Dongxu, et autres
Publié: (2025)
par: Liu, Dongxu, et autres
Publié: (2025)
Slow Perception: Let's Perceive Geometric Figures Step-by-step
par: Wei, Haoran, et autres
Publié: (2024)
par: Wei, Haoran, et autres
Publié: (2024)
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
par: Wei, Yana, et autres
Publié: (2025)
par: Wei, Yana, et autres
Publié: (2025)
Unhackable Temporal Rewarding for Scalable Video MLLMs
par: Yu, En, et autres
Publié: (2025)
par: Yu, En, et autres
Publié: (2025)
VSFormer: Mining Correlations in Flexible View Set for Multi-view 3D Shape Understanding
par: Sun, Hongyu, et autres
Publié: (2024)
par: Sun, Hongyu, et autres
Publié: (2024)
RAG-KT: Cross-platform Explainable Knowledge Tracing with Multi-view Fusion Retrieval Generation
par: Duan, Zhiyi, et autres
Publié: (2026)
par: Duan, Zhiyi, et autres
Publié: (2026)
Positional Prompt Tuning for Efficient 3D Representation Learning
par: Zhang, Shaochen, et autres
Publié: (2024)
par: Zhang, Shaochen, et autres
Publié: (2024)
SparseFusion: Efficient Sparse Multi-Modal Fusion Framework for Long-Range 3D Perception
par: Li, Yiheng, et autres
Publié: (2024)
par: Li, Yiheng, et autres
Publié: (2024)
Exploring Modality-Aware Fusion and Decoupled Temporal Propagation for Multi-Modal Object Tracking
par: Wang, Shilei, et autres
Publié: (2026)
par: Wang, Shilei, et autres
Publié: (2026)
Learning Getting-Up Policies for Real-World Humanoid Robots
par: He, Xialin, et autres
Publié: (2025)
par: He, Xialin, et autres
Publié: (2025)
Learning Humanoid End-Effector Control for Open-Vocabulary Visual Loco-Manipulation
par: Dong, Runpei, et autres
Publié: (2026)
par: Dong, Runpei, et autres
Publié: (2026)
PE-MVCNet: Multi-view and Cross-modal Fusion Network for Pulmonary Embolism Prediction
par: Guo, Zhaoxin, et autres
Publié: (2024)
par: Guo, Zhaoxin, et autres
Publié: (2024)
BFA: Best-Feature-Aware Fusion for Multi-View Fine-grained Manipulation
par: Lan, Zihan, et autres
Publié: (2025)
par: Lan, Zihan, et autres
Publié: (2025)
SmartCooper: Vehicular Collaborative Perception with Adaptive Fusion and Judger Mechanism
par: Zhang, Yuang, et autres
Publié: (2024)
par: Zhang, Yuang, et autres
Publié: (2024)
Multimodal Long Video Modeling Based on Temporal Dynamic Context
par: Hao, Haoran, et autres
Publié: (2025)
par: Hao, Haoran, et autres
Publié: (2025)
Multi-Grained Compositional Visual Clue Learning for Image Intent Recognition
par: Tang, Yin, et autres
Publié: (2025)
par: Tang, Yin, et autres
Publié: (2025)
MVD-Fusion: Single-view 3D via Depth-consistent Multi-view Generation
par: Hu, Hanzhe, et autres
Publié: (2024)
par: Hu, Hanzhe, et autres
Publié: (2024)
JRN-Geo: A Joint Perception Network based on RGB and Normal images for Cross-view Geo-localization
par: Zhou, Hongyu, et autres
Publié: (2025)
par: Zhou, Hongyu, et autres
Publié: (2025)
Cocoon: Robust Multi-Modal Perception with Uncertainty-Aware Sensor Fusion
par: Cho, Minkyoung, et autres
Publié: (2024)
par: Cho, Minkyoung, et autres
Publié: (2024)
ReWiTe: Realistic Wide-angle and Telephoto Dual Camera Fusion Dataset via Beam Splitter Camera Rig
par: Peng, Chunli, et autres
Publié: (2024)
par: Peng, Chunli, et autres
Publié: (2024)
Insight-LLM: LLM-enhanced Multi-view Fusion in Insider Threat Detection
par: Song, Chengyu, et autres
Publié: (2025)
par: Song, Chengyu, et autres
Publié: (2025)
Contrastive Continual Multi-view Clustering with Filtered Structural Fusion
par: Wan, Xinhang, et autres
Publié: (2023)
par: Wan, Xinhang, et autres
Publié: (2023)
HENet: Hybrid Encoding for End-to-end Multi-task 3D Perception from Multi-view Cameras
par: Xia, Zhongyu, et autres
Publié: (2024)
par: Xia, Zhongyu, et autres
Publié: (2024)
Multi-view Image Prompted Multi-view Diffusion for Improved 3D Generation
par: Kim, Seungwook, et autres
Publié: (2024)
par: Kim, Seungwook, et autres
Publié: (2024)
Improved fractional‐order active disturbance rejection control for photoelectric tracking system with internal uncertainty and external disturbance
par: Jianjian Zhao, et autres
Publié: (2025)
par: Jianjian Zhao, et autres
Publié: (2025)
V2XPnP: Vehicle-to-Everything Spatio-Temporal Fusion for Multi-Agent Perception and Prediction
par: Zhou, Zewei, et autres
Publié: (2024)
par: Zhou, Zewei, et autres
Publié: (2024)
Fusion-Poly: A Polyhedral Framework Based on Spatial-Temporal Fusion for 3D Multi-Object Tracking
par: Wu, Xian, et autres
Publié: (2026)
par: Wu, Xian, et autres
Publié: (2026)
Reinforced Collaboration in Multi-Agent Flow Networks
par: Wang, Zheng, et autres
Publié: (2026)
par: Wang, Zheng, et autres
Publié: (2026)
Documents similaires
-
DreamLLM: Synergistic Multimodal Comprehension and Creation
par: Dong, Runpei, et autres
Publié: (2023) -
Perception in Reflection
par: Wei, Yana, et autres
Publié: (2025) -
DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation
par: Peng, Yuang, et autres
Publié: (2024) -
Perception-R1: Pioneering Perception Policy with Reinforcement Learning
par: Yu, En, et autres
Publié: (2025) -
ShapeLLM: Universal 3D Object Understanding for Embodied Interaction
par: Qi, Zekun, et autres
Publié: (2024)