Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xiao, Zeqi, Zhao, Yiwei, Li, Lingxiao, Lan, Yushi, Yu, Ning, Garg, Rahul, Cooper, Roshni, Taghavi, Mohammad H., Pan, Xingang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Video Diffusion Models are Training-free Motion Interpreter and Controller
par: Xiao, Zeqi, et autres
Publié: (2024)
par: Xiao, Zeqi, et autres
Publié: (2024)
Dense Semantic Matching with VGGT Prior
par: Yang, Songlin, et autres
Publié: (2025)
par: Yang, Songlin, et autres
Publié: (2025)
WorldMem: Long-term Consistent World Simulation with Memory
par: Xiao, Zeqi, et autres
Publié: (2025)
par: Xiao, Zeqi, et autres
Publié: (2025)
TokensGen: Harnessing Condensed Tokens for Long Video Generation
par: Ouyang, Wenqi, et autres
Publié: (2025)
par: Ouyang, Wenqi, et autres
Publié: (2025)
ArtiLatent: Realistic Articulated 3D Object Generation via Structured Latents
par: Chen, Honghua, et autres
Publié: (2025)
par: Chen, Honghua, et autres
Publié: (2025)
Trajectory Attention for Fine-grained Video Motion Control
par: Xiao, Zeqi, et autres
Publié: (2024)
par: Xiao, Zeqi, et autres
Publié: (2024)
Textured 3D Regenerative Morphing with 3D Diffusion Prior
par: Yang, Songlin, et autres
Publié: (2025)
par: Yang, Songlin, et autres
Publié: (2025)
Alias-Free Latent Diffusion Models: Improving Fractional Shift Equivariance of Diffusion Latent Space
par: Zhou, Yifan, et autres
Publié: (2025)
par: Zhou, Yifan, et autres
Publié: (2025)
FastMesh: Efficient Artistic Mesh Generation via Component Decoupling
par: Kim, Jeonghwan, et autres
Publié: (2025)
par: Kim, Jeonghwan, et autres
Publié: (2025)
4RC: 4D Reconstruction via Conditional Querying Anytime and Anywhere
par: Luo, Yihang, et autres
Publié: (2026)
par: Luo, Yihang, et autres
Publié: (2026)
SAR3D: Autoregressive 3D Object Generation and Understanding via Multi-scale 3D VQVAE
par: Chen, Yongwei, et autres
Publié: (2024)
par: Chen, Yongwei, et autres
Publié: (2024)
MvDrag3D: Drag-based Creative 3D Editing via Multi-view Generation-Reconstruction Priors
par: Chen, Honghua, et autres
Publié: (2024)
par: Chen, Honghua, et autres
Publié: (2024)
I2VEdit: First-Frame-Guided Video Editing via Image-to-Video Diffusion Models
par: Ouyang, Wenqi, et autres
Publié: (2024)
par: Ouyang, Wenqi, et autres
Publié: (2024)
Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers
par: Zhou, Yifan, et autres
Publié: (2025)
par: Zhou, Yifan, et autres
Publié: (2025)
Moiré Video Authentication: A Physical Signature Against AI Video Generation
par: Qing, Yuan, et autres
Publié: (2026)
par: Qing, Yuan, et autres
Publié: (2026)
3DEnhancer: Consistent Multi-View Diffusion for 3D Enhancement
par: Luo, Yihang, et autres
Publié: (2024)
par: Luo, Yihang, et autres
Publié: (2024)
Correctness-Guaranteed Code Generation via Constrained Decoding
par: Li, Lingxiao, et autres
Publié: (2025)
par: Li, Lingxiao, et autres
Publié: (2025)
PnP-U3D: Plug-and-Play 3D Framework Bridging Autoregression and Diffusion for Unified Understanding and Generation
par: Chen, Yongwei, et autres
Publié: (2026)
par: Chen, Yongwei, et autres
Publié: (2026)
Toward Rich Video Human-Motion2D Generation
par: Xi, Ruihao, et autres
Publié: (2025)
par: Xi, Ruihao, et autres
Publié: (2025)
EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation
par: Wang, Xiaofeng, et autres
Publié: (2024)
par: Wang, Xiaofeng, et autres
Publié: (2024)
The Role of Diversity in In-Context Learning for Large Language Models
par: Xiao, Wenyang, et autres
Publié: (2025)
par: Xiao, Wenyang, et autres
Publié: (2025)
Visuospatial Cognitive Assistant
par: Feng, Qi
Publié: (2025)
par: Feng, Qi
Publié: (2025)
GaussianAnything: Interactive Point Cloud Flow Matching For 3D Object Generation
par: Lan, Yushi, et autres
Publié: (2024)
par: Lan, Yushi, et autres
Publié: (2024)
Towards Visuospatial Cognition via Hierarchical Fusion of Visual Experts
par: Feng, Qi
Publié: (2025)
par: Feng, Qi
Publié: (2025)
GigaVideo-1: Advancing Video Generation via Automatic Feedback with 4 GPU-Hours Fine-Tuning
par: Bao, Xiaoyi, et autres
Publié: (2025)
par: Bao, Xiaoyi, et autres
Publié: (2025)
VideoAuteur: Towards Long Narrative Video Generation
par: Xiao, Junfei, et autres
Publié: (2025)
par: Xiao, Junfei, et autres
Publié: (2025)
LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation
par: Huang, Yushi, et autres
Publié: (2025)
par: Huang, Yushi, et autres
Publié: (2025)
Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models
par: Shen, Haozhan, et autres
Publié: (2026)
par: Shen, Haozhan, et autres
Publié: (2026)
RexBERT: Context Specialized Bidirectional Encoders for E-commerce
par: Bajaj, Rahul, et autres
Publié: (2026)
par: Bajaj, Rahul, et autres
Publié: (2026)
Mixture of Contexts for Long Video Generation
par: Cai, Shengqu, et autres
Publié: (2025)
par: Cai, Shengqu, et autres
Publié: (2025)
AMG: Avatar Motion Guided Video Generation
par: Yang, Zhangsihao, et autres
Publié: (2024)
par: Yang, Zhangsihao, et autres
Publié: (2024)
Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence
par: Gao, Yuanyuan, et autres
Publié: (2026)
par: Gao, Yuanyuan, et autres
Publié: (2026)
Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction
par: Zhao, Yuan, et autres
Publié: (2024)
par: Zhao, Yuan, et autres
Publié: (2024)
MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence
par: Lin, Jingli, et autres
Publié: (2025)
par: Lin, Jingli, et autres
Publié: (2025)
Virtually Being: Customizing Camera-Controllable Video Diffusion Models with Multi-View Performance Captures
par: Xu, Yuancheng, et autres
Publié: (2025)
par: Xu, Yuancheng, et autres
Publié: (2025)
Cambrian-S: Towards Spatial Supersensing in Video
par: Yang, Shusheng, et autres
Publié: (2025)
par: Yang, Shusheng, et autres
Publié: (2025)
Filter-Guided Diffusion for Controllable Image Generation
par: Gu, Zeqi, et autres
Publié: (2023)
par: Gu, Zeqi, et autres
Publié: (2023)
Superstars or Super-Villains? Productivity Spillovers and Firm Dynamics in Indonesia
par: Yasin, Mohammad Zeqi
Publié: (2025)
par: Yasin, Mohammad Zeqi
Publié: (2025)
VideoGPA: Distilling Geometry Priors for 3D-Consistent Video Generation
par: Du, Hongyang, et autres
Publié: (2026)
par: Du, Hongyang, et autres
Publié: (2026)
Context-Guided Spatio-Temporal Video Grounding
par: Gu, Xin, et autres
Publié: (2024)
par: Gu, Xin, et autres
Publié: (2024)
Documents similaires
-
Video Diffusion Models are Training-free Motion Interpreter and Controller
par: Xiao, Zeqi, et autres
Publié: (2024) -
Dense Semantic Matching with VGGT Prior
par: Yang, Songlin, et autres
Publié: (2025) -
WorldMem: Long-term Consistent World Simulation with Memory
par: Xiao, Zeqi, et autres
Publié: (2025) -
TokensGen: Harnessing Condensed Tokens for Long Video Generation
par: Ouyang, Wenqi, et autres
Publié: (2025) -
ArtiLatent: Realistic Articulated 3D Object Generation via Structured Latents
par: Chen, Honghua, et autres
Publié: (2025)