Salvato in:
| Autori principali: | Xiao, Junfei, Yang, Ceyuan, Zhang, Lvmin, Cai, Shengqu, Zhao, Yang, Guo, Yuwei, Wetzstein, Gordon, Agrawala, Maneesh, Yuille, Alan, Jiang, Lu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2507.18634 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mixture of Contexts for Long Video Generation
di: Cai, Shengqu, et al.
Pubblicazione: (2025)
di: Cai, Shengqu, et al.
Pubblicazione: (2025)
Frame Context Packing and Drift Prevention in Next-Frame-Prediction Video Diffusion Models
di: Zhang, Lvmin, et al.
Pubblicazione: (2025)
di: Zhang, Lvmin, et al.
Pubblicazione: (2025)
Pretraining Frame Preservation for Lightweight Autoregressive Video History Embedding
di: Zhang, Lvmin, et al.
Pubblicazione: (2025)
di: Zhang, Lvmin, et al.
Pubblicazione: (2025)
Taming Flow-based I2V Models for Creative Video Editing
di: Kong, Xianghao, et al.
Pubblicazione: (2025)
di: Kong, Xianghao, et al.
Pubblicazione: (2025)
Transparent Image Layer Diffusion using Latent Transparency
di: Zhang, Lvmin, et al.
Pubblicazione: (2024)
di: Zhang, Lvmin, et al.
Pubblicazione: (2024)
Mode Seeking meets Mean Seeking for Fast Long Video Generation
di: Cai, Shengqu, et al.
Pubblicazione: (2026)
di: Cai, Shengqu, et al.
Pubblicazione: (2026)
View-oriented Conversation Compiler for Agent Trace Analysis
di: Zhang, Lvmin, et al.
Pubblicazione: (2026)
di: Zhang, Lvmin, et al.
Pubblicazione: (2026)
Instance Segmentation of Scene Sketches Using Natural Image Priors
di: Tang, Mia, et al.
Pubblicazione: (2025)
di: Tang, Mia, et al.
Pubblicazione: (2025)
CameraCtrl: Enabling Camera Control for Text-to-Video Generation
di: He, Hao, et al.
Pubblicazione: (2024)
di: He, Hao, et al.
Pubblicazione: (2024)
Captain Safari: A World Engine with Pose-Aligned 3D Memory
di: Chou, Yu-Cheng, et al.
Pubblicazione: (2025)
di: Chou, Yu-Cheng, et al.
Pubblicazione: (2025)
ScriptViz: A Visualization Tool to Aid Scriptwriting based on a Large Movie Database
di: Rao, Anyi, et al.
Pubblicazione: (2024)
di: Rao, Anyi, et al.
Pubblicazione: (2024)
AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning
di: Guo, Yuwei, et al.
Pubblicazione: (2023)
di: Guo, Yuwei, et al.
Pubblicazione: (2023)
GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation
di: Ackermann, Jan, et al.
Pubblicazione: (2026)
di: Ackermann, Jan, et al.
Pubblicazione: (2026)
Generated Reality: Human-centric World Simulation using Interactive Video Generation with Hand and Camera Control
di: Xie, Linxi, et al.
Pubblicazione: (2026)
di: Xie, Linxi, et al.
Pubblicazione: (2026)
Diffusion Self-Distillation for Zero-Shot Customized Image Generation
di: Cai, Shengqu, et al.
Pubblicazione: (2024)
di: Cai, Shengqu, et al.
Pubblicazione: (2024)
MoVer: Motion Verification for Motion Graphics Animations
di: Ma, Jiaju, et al.
Pubblicazione: (2025)
di: Ma, Jiaju, et al.
Pubblicazione: (2025)
VideoAuteur: Towards Long Narrative Video Generation
di: Xiao, Junfei, et al.
Pubblicazione: (2025)
di: Xiao, Junfei, et al.
Pubblicazione: (2025)
ReStyle3D: Scene-Level Appearance Transfer with Semantic Correspondences
di: Zhu, Liyuan, et al.
Pubblicazione: (2025)
di: Zhu, Liyuan, et al.
Pubblicazione: (2025)
Collaborative Video Diffusion: Consistent Multi-video Generation with Camera Control
di: Kuang, Zhengfei, et al.
Pubblicazione: (2024)
di: Kuang, Zhengfei, et al.
Pubblicazione: (2024)
Robust Symmetry Detection via Riemannian Langevin Dynamics
di: Je, Jihyeon, et al.
Pubblicazione: (2024)
di: Je, Jihyeon, et al.
Pubblicazione: (2024)
Interspatial Attention for Efficient 4D Human Video Generation
di: Shao, Ruizhi, et al.
Pubblicazione: (2025)
di: Shao, Ruizhi, et al.
Pubblicazione: (2025)
Long Context Tuning for Video Generation
di: Guo, Yuwei, et al.
Pubblicazione: (2025)
di: Guo, Yuwei, et al.
Pubblicazione: (2025)
Block and Detail: Scaffolding Sketch-to-Image Generation
di: Sarukkai, Vishnu, et al.
Pubblicazione: (2024)
di: Sarukkai, Vishnu, et al.
Pubblicazione: (2024)
BulletTime: Decoupled Control of Time and Camera Pose for Video Generation
di: Wang, Yiming, et al.
Pubblicazione: (2025)
di: Wang, Yiming, et al.
Pubblicazione: (2025)
VTok: A Unified Video Tokenizer with Decoupled Spatial-Temporal Latents
di: Wang, Feng, et al.
Pubblicazione: (2026)
di: Wang, Feng, et al.
Pubblicazione: (2026)
GRM: Large Gaussian Reconstruction Model for Efficient 3D Reconstruction and Generation
di: Xu, Yinghao, et al.
Pubblicazione: (2024)
di: Xu, Yinghao, et al.
Pubblicazione: (2024)
Self-Consistency for LLM-Based Motion Trajectory Generation and Verification
di: Ma, Jiaju, et al.
Pubblicazione: (2026)
di: Ma, Jiaju, et al.
Pubblicazione: (2026)
CameraCtrl II: Dynamic Scene Exploration via Camera-controlled Video Diffusion Models
di: He, Hao, et al.
Pubblicazione: (2025)
di: He, Hao, et al.
Pubblicazione: (2025)
Radial Attention: $O(n\log n)$ Sparse Attention with Energy Decay for Long Video Generation
di: Li, Xingyang, et al.
Pubblicazione: (2025)
di: Li, Xingyang, et al.
Pubblicazione: (2025)
CL-Splats: Continual Learning of Gaussian Splatting with Local Optimization
di: Ackermann, Jan, et al.
Pubblicazione: (2025)
di: Ackermann, Jan, et al.
Pubblicazione: (2025)
PaLM2-VAdapter: Progressively Aligned Language Model Makes a Strong Vision-language Adapter
di: Xiao, Junfei, et al.
Pubblicazione: (2024)
di: Xiao, Junfei, et al.
Pubblicazione: (2024)
Play to Generalize: Learning to Reason Through Game Play
di: Xie, Yunfei, et al.
Pubblicazione: (2025)
di: Xie, Yunfei, et al.
Pubblicazione: (2025)
SeedVR: Seeding Infinity in Diffusion Transformer Towards Generic Video Restoration
di: Wang, Jianyi, et al.
Pubblicazione: (2025)
di: Wang, Jianyi, et al.
Pubblicazione: (2025)
Uncovering Conceptual Blindspots in Generative Image Models Using Sparse Autoencoders
di: Bohacek, Matyas, et al.
Pubblicazione: (2025)
di: Bohacek, Matyas, et al.
Pubblicazione: (2025)
3DitScene: Editing Any Scene via Language-guided Disentangled Gaussian Splatting
di: Zhang, Qihang, et al.
Pubblicazione: (2024)
di: Zhang, Qihang, et al.
Pubblicazione: (2024)
StreamDiffusionV2: A Streaming System for Dynamic and Interactive Video Generation
di: Feng, Tianrui, et al.
Pubblicazione: (2025)
di: Feng, Tianrui, et al.
Pubblicazione: (2025)
Towards Vision-Language-Garment Models for Web Knowledge Garment Understanding and Generation
di: Ackermann, Jan, et al.
Pubblicazione: (2025)
di: Ackermann, Jan, et al.
Pubblicazione: (2025)
Rejuvenating image-GPT as Strong Visual Representation Learners
di: Ren, Sucheng, et al.
Pubblicazione: (2023)
di: Ren, Sucheng, et al.
Pubblicazione: (2023)
End-to-End Training for Autoregressive Video Diffusion via Self-Resampling
di: Guo, Yuwei, et al.
Pubblicazione: (2025)
di: Guo, Yuwei, et al.
Pubblicazione: (2025)
ByteMorph: Benchmarking Instruction-Guided Image Editing with Non-Rigid Motions
di: Chang, Di, et al.
Pubblicazione: (2025)
di: Chang, Di, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Mixture of Contexts for Long Video Generation
di: Cai, Shengqu, et al.
Pubblicazione: (2025) -
Frame Context Packing and Drift Prevention in Next-Frame-Prediction Video Diffusion Models
di: Zhang, Lvmin, et al.
Pubblicazione: (2025) -
Pretraining Frame Preservation for Lightweight Autoregressive Video History Embedding
di: Zhang, Lvmin, et al.
Pubblicazione: (2025) -
Taming Flow-based I2V Models for Creative Video Editing
di: Kong, Xianghao, et al.
Pubblicazione: (2025) -
Transparent Image Layer Diffusion using Latent Transparency
di: Zhang, Lvmin, et al.
Pubblicazione: (2024)