DiVE: Efficient Multi-View Driving Scenes Generation Based on Video Diffusion Transformer
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Junpeng, Hong, Gangyi, Zhang, Miao, Hu, Hengtong, Zhan, Kun, Shao, Rui, Nie, Liqiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DiVE: DiT-based Video Generation with Enhanced Control
di: Jiang, Junpeng, et al.
Pubblicazione: (2024)
di: Jiang, Junpeng, et al.
Pubblicazione: (2024)
DiVE-k: Differential Visual Reasoning for Fine-grained Image Recognition
di: Kumar, Raja, et al.
Pubblicazione: (2025)
di: Kumar, Raja, et al.
Pubblicazione: (2025)
A Direct Variance Estimation (DiVE) for Meta-Analysis of Median Differences
di: Okuda, Tadahisa, et al.
Pubblicazione: (2026)
di: Okuda, Tadahisa, et al.
Pubblicazione: (2026)
DriveLiDAR4D: Sequential and Controllable LiDAR Scene Generation for Autonomous Driving
di: Cai, Kaiwen, et al.
Pubblicazione: (2025)
di: Cai, Kaiwen, et al.
Pubblicazione: (2025)
MoVieDrive: Urban Scene Synthesis with Multi-Modal Multi-View Video Diffusion Transformer
di: Wu, Guile, et al.
Pubblicazione: (2025)
di: Wu, Guile, et al.
Pubblicazione: (2025)
Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation
di: Qi, Tianhao, et al.
Pubblicazione: (2025)
di: Qi, Tianhao, et al.
Pubblicazione: (2025)
LION-FS: Fast & Slow Video-Language Thinker as Online Video Assistant
di: Li, Wei, et al.
Pubblicazione: (2025)
di: Li, Wei, et al.
Pubblicazione: (2025)
Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention
di: Lu, Hannan, et al.
Pubblicazione: (2024)
di: Lu, Hannan, et al.
Pubblicazione: (2024)
DreamForge: Motion-Aware Autoregressive Video Generation for Multi-View Driving Scenes
di: Mei, Jianbiao, et al.
Pubblicazione: (2024)
di: Mei, Jianbiao, et al.
Pubblicazione: (2024)
FullDiT2: Efficient In-Context Conditioning for Video Diffusion Transformers
di: He, Xuanhua, et al.
Pubblicazione: (2025)
di: He, Xuanhua, et al.
Pubblicazione: (2025)
FrameDiT: Diffusion Transformer with Matrix Attention for Efficient Video Generation
di: Le, Minh Khoa, et al.
Pubblicazione: (2026)
di: Le, Minh Khoa, et al.
Pubblicazione: (2026)
ViDiT-Q: Efficient and Accurate Quantization of Diffusion Transformers for Image and Video Generation
di: Zhao, Tianchen, et al.
Pubblicazione: (2024)
di: Zhao, Tianchen, et al.
Pubblicazione: (2024)
ScenDi: 3D-to-2D Scene Diffusion Cascades for Urban Generation
di: Guo, Hanlei, et al.
Pubblicazione: (2026)
di: Guo, Hanlei, et al.
Pubblicazione: (2026)
Unleashing Generalization of End-to-End Autonomous Driving with Controllable Long Video Generation
di: Ma, Enhui, et al.
Pubblicazione: (2024)
di: Ma, Enhui, et al.
Pubblicazione: (2024)
DiTPainter: Efficient Video Inpainting with Diffusion Transformers
di: Wu, Xian, et al.
Pubblicazione: (2025)
di: Wu, Xian, et al.
Pubblicazione: (2025)
Unveil Benign Overfitting for Transformer in Vision: Training Dynamics, Convergence, and Generalization
di: Jiang, Jiarui, et al.
Pubblicazione: (2024)
di: Jiang, Jiarui, et al.
Pubblicazione: (2024)
Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile
di: Ding, Hangliang, et al.
Pubblicazione: (2025)
di: Ding, Hangliang, et al.
Pubblicazione: (2025)
DASH: Fast Differentiable Architecture Search for Hybrid Attention in Minutes on a Single GPU
di: Chen, Weizhe, et al.
Pubblicazione: (2026)
di: Chen, Weizhe, et al.
Pubblicazione: (2026)
Cortical Policy: A Dual-Stream View Transformer for Robotic Manipulation
di: Zhang, Xuening, et al.
Pubblicazione: (2026)
di: Zhang, Xuening, et al.
Pubblicazione: (2026)
SceneCrafter: Controllable Multi-View Driving Scene Editing
di: Zhu, Zehao, et al.
Pubblicazione: (2025)
di: Zhu, Zehao, et al.
Pubblicazione: (2025)
PixelDiT: Pixel Diffusion Transformers for Image Generation
di: Yu, Yongsheng, et al.
Pubblicazione: (2025)
di: Yu, Yongsheng, et al.
Pubblicazione: (2025)
DiT-IC: Aligned Diffusion Transformer for Efficient Image Compression
di: Shi, Junqi, et al.
Pubblicazione: (2026)
di: Shi, Junqi, et al.
Pubblicazione: (2026)
GalaxyDiT: Efficient Video Generation with Guidance Alignment and Adaptive Proxy in Diffusion Transformers
di: Song, Zhiye, et al.
Pubblicazione: (2025)
di: Song, Zhiye, et al.
Pubblicazione: (2025)
AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
di: Wang, Kai, et al.
Pubblicazione: (2024)
di: Wang, Kai, et al.
Pubblicazione: (2024)
DriveGen3D: Boosting Feed-Forward Driving Scene Generation with Efficient Video Diffusion
di: Wang, Weijie, et al.
Pubblicazione: (2025)
di: Wang, Weijie, et al.
Pubblicazione: (2025)
Human4DiT: 360-degree Human Video Generation with 4D Diffusion Transformer
di: Shao, Ruizhi, et al.
Pubblicazione: (2024)
di: Shao, Ruizhi, et al.
Pubblicazione: (2024)
S2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation
di: Zhao, Lin, et al.
Pubblicazione: (2026)
di: Zhao, Lin, et al.
Pubblicazione: (2026)
Mixture of Distributions Matters: Dynamic Sparse Attention for Efficient Video Diffusion Transformers
di: Liu, Yuxi, et al.
Pubblicazione: (2026)
di: Liu, Yuxi, et al.
Pubblicazione: (2026)
Driving factors of auditory category learning success
di: Wang, Nan, et al.
Pubblicazione: (2025)
di: Wang, Nan, et al.
Pubblicazione: (2025)
DriveDiTFit: Fine-tuning Diffusion Transformers for Autonomous Driving
di: Tu, Jiahang, et al.
Pubblicazione: (2024)
di: Tu, Jiahang, et al.
Pubblicazione: (2024)
PosePilot: Steering Camera Pose for Generative World Models with Self-supervised Depth
di: Jin, Bu, et al.
Pubblicazione: (2025)
di: Jin, Bu, et al.
Pubblicazione: (2025)
PMQ-VE: Progressive Multi-Frame Quantization for Video Enhancement
di: Feng, ZhanFeng, et al.
Pubblicazione: (2025)
di: Feng, ZhanFeng, et al.
Pubblicazione: (2025)
Inf-DiT: Upsampling Any-Resolution Image with Memory-Efficient Diffusion Transformer
di: Yang, Zhuoyi, et al.
Pubblicazione: (2024)
di: Yang, Zhuoyi, et al.
Pubblicazione: (2024)
ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation
di: Sun, Jiahui, et al.
Pubblicazione: (2025)
di: Sun, Jiahui, et al.
Pubblicazione: (2025)
TINA: Text-Free Inversion Attack for Unlearned Text-to-Image Diffusion Models
di: Xiang, Qianlong, et al.
Pubblicazione: (2026)
di: Xiang, Qianlong, et al.
Pubblicazione: (2026)
SceneDiffuser: Efficient and Controllable Driving Simulation Initialization and Rollout
di: Jiang, Chiyu Max, et al.
Pubblicazione: (2024)
di: Jiang, Chiyu Max, et al.
Pubblicazione: (2024)
Enhancing Emotional Generation Capability of Large Language Models via Emotional Chain-of-Thought
di: Li, Zaijing, et al.
Pubblicazione: (2024)
di: Li, Zaijing, et al.
Pubblicazione: (2024)
Towards Unified Semantic and Controllable Image Fusion: A Diffusion Transformer Approach
di: Li, Jiayang, et al.
Pubblicazione: (2025)
di: Li, Jiayang, et al.
Pubblicazione: (2025)
DiST-4D: Disentangled Spatiotemporal Diffusion with Metric Depth for 4D Driving Scene Generation
di: Guo, Jiazhe, et al.
Pubblicazione: (2025)
di: Guo, Jiazhe, et al.
Pubblicazione: (2025)
LuxDiT: Lighting Estimation with Video Diffusion Transformer
di: Liang, Ruofan, et al.
Pubblicazione: (2025)
di: Liang, Ruofan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DiVE: DiT-based Video Generation with Enhanced Control
di: Jiang, Junpeng, et al.
Pubblicazione: (2024) -
DiVE-k: Differential Visual Reasoning for Fine-grained Image Recognition
di: Kumar, Raja, et al.
Pubblicazione: (2025) -
A Direct Variance Estimation (DiVE) for Meta-Analysis of Median Differences
di: Okuda, Tadahisa, et al.
Pubblicazione: (2026) -
DriveLiDAR4D: Sequential and Controllable LiDAR Scene Generation for Autonomous Driving
di: Cai, Kaiwen, et al.
Pubblicazione: (2025) -
MoVieDrive: Urban Scene Synthesis with Multi-Modal Multi-View Video Diffusion Transformer
di: Wu, Guile, et al.
Pubblicazione: (2025)