AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Girish, Sharath, Ivanov, Viacheslav, Chen, Tsai-Shien, Chen, Hao, Siarohin, Aliaksandr, Tulyakov, Sergey |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VIMI: Grounding Video Generation through Multi-modal Instruction
por: Fang, Yuwei, et al.
Publicado: (2024)
por: Fang, Yuwei, et al.
Publicado: (2024)
Hierarchical Patch Diffusion Models for High-Resolution Video Generation
por: Skorokhodov, Ivan, et al.
Publicado: (2024)
por: Skorokhodov, Ivan, et al.
Publicado: (2024)
Mind the Time: Temporally-Controlled Multi-Event Video Generation
por: Wu, Ziyi, et al.
Publicado: (2024)
por: Wu, Ziyi, et al.
Publicado: (2024)
Multi-subject Open-set Personalization in Video Generation
por: Chen, Tsai-Shien, et al.
Publicado: (2025)
por: Chen, Tsai-Shien, et al.
Publicado: (2025)
DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models
por: Wu, Ziyi, et al.
Publicado: (2025)
por: Wu, Ziyi, et al.
Publicado: (2025)
H3AE: High Compression, High Speed, and High Quality AutoEncoder for Video Diffusion Models
por: Wu, Yushu, et al.
Publicado: (2025)
por: Wu, Yushu, et al.
Publicado: (2025)
Video Motion Transfer with Diffusion Transformers
por: Pondaven, Alexander, et al.
Publicado: (2024)
por: Pondaven, Alexander, et al.
Publicado: (2024)
Improving the Diffusability of Autoencoders
por: Skorokhodov, Ivan, et al.
Publicado: (2025)
por: Skorokhodov, Ivan, et al.
Publicado: (2025)
Snap Video: Scaled Spatiotemporal Transformers for Text-to-Video Synthesis
por: Menapace, Willi, et al.
Publicado: (2024)
por: Menapace, Willi, et al.
Publicado: (2024)
ActionParty: Multi-Subject Action Binding in Generative Video Games
por: Pondaven, Alexander, et al.
Publicado: (2026)
por: Pondaven, Alexander, et al.
Publicado: (2026)
OmniView: An All-Seeing Diffusion Model for 3D and 4D View Synthesis
por: Fan, Xiang, et al.
Publicado: (2025)
por: Fan, Xiang, et al.
Publicado: (2025)
AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation
por: Haji-Ali, Moayed, et al.
Publicado: (2024)
por: Haji-Ali, Moayed, et al.
Publicado: (2024)
Panda-70M: Captioning 70M Videos with Multiple Cross-Modality Teachers
por: Chen, Tsai-Shien, et al.
Publicado: (2024)
por: Chen, Tsai-Shien, et al.
Publicado: (2024)
AC3D: Analyzing and Improving 3D Camera Control in Video Diffusion Transformers
por: Bahmani, Sherwin, et al.
Publicado: (2024)
por: Bahmani, Sherwin, et al.
Publicado: (2024)
Diffusion Priors for Dynamic View Synthesis from Monocular Videos
por: Wang, Chaoyang, et al.
Publicado: (2024)
por: Wang, Chaoyang, et al.
Publicado: (2024)
Dynamic Concepts Personalization from Single Videos
por: Abdal, Rameen, et al.
Publicado: (2025)
por: Abdal, Rameen, et al.
Publicado: (2025)
Zero-Shot Dynamic Concept Personalization with Grid-Based LoRA
por: Abdal, Rameen, et al.
Publicado: (2025)
por: Abdal, Rameen, et al.
Publicado: (2025)
AsCAN: Asymmetric Convolution-Attention Networks for Efficient Recognition and Generation
por: Kag, Anil, et al.
Publicado: (2024)
por: Kag, Anil, et al.
Publicado: (2024)
Pixel-Aligned Multi-View Generation with Depth Guided Decoder
por: Tang, Zhenggang, et al.
Publicado: (2024)
por: Tang, Zhenggang, et al.
Publicado: (2024)
Improving Progressive Generation with Decomposable Flow Matching
por: Haji-Ali, Moayed, et al.
Publicado: (2025)
por: Haji-Ali, Moayed, et al.
Publicado: (2025)
4Real: Towards Photorealistic 4D Scene Generation via Video Diffusion Models
por: Yu, Heng, et al.
Publicado: (2024)
por: Yu, Heng, et al.
Publicado: (2024)
AlphaFlow: Understanding and Improving MeanFlow Models
por: Zhang, Huijie, et al.
Publicado: (2025)
por: Zhang, Huijie, et al.
Publicado: (2025)
Promptable Game Models: Text-Guided Game Simulation via Masked Diffusion Models
por: Menapace, Willi, et al.
Publicado: (2023)
por: Menapace, Willi, et al.
Publicado: (2023)
HyperHuman: Hyper-Realistic Human Generation with Latent Structural Diffusion
por: Liu, Xian, et al.
Publicado: (2023)
por: Liu, Xian, et al.
Publicado: (2023)
S2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation
por: Zhao, Lin, et al.
Publicado: (2026)
por: Zhao, Lin, et al.
Publicado: (2026)
Canvas-to-Image: Compositional Image Generation with Multimodal Controls
por: Dalva, Yusuf, et al.
Publicado: (2025)
por: Dalva, Yusuf, et al.
Publicado: (2025)
4Real-Video-V2: Fused View-Time Attention and Feedforward Reconstruction for 4D Scene Generation
por: Wang, Chaoyang, et al.
Publicado: (2025)
por: Wang, Chaoyang, et al.
Publicado: (2025)
4Real-Video: Learning Generalizable Photo-Realistic 4D Video Diffusion
por: Wang, Chaoyang, et al.
Publicado: (2024)
por: Wang, Chaoyang, et al.
Publicado: (2024)
SF-V: Single Forward Video Generation Model
por: Zhang, Zhixing, et al.
Publicado: (2024)
por: Zhang, Zhixing, et al.
Publicado: (2024)
Taming Diffusion Transformer for Efficient Mobile Video Generation in Seconds
por: Wu, Yushu, et al.
Publicado: (2025)
por: Wu, Yushu, et al.
Publicado: (2025)
Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalization
por: Chen, Tsai-Shien, et al.
Publicado: (2025)
por: Chen, Tsai-Shien, et al.
Publicado: (2025)
VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control
por: Bahmani, Sherwin, et al.
Publicado: (2024)
por: Bahmani, Sherwin, et al.
Publicado: (2024)
Sprint: Sparse-Dense Residual Fusion for Efficient Diffusion Transformers
por: Park, Dogyun, et al.
Publicado: (2025)
por: Park, Dogyun, et al.
Publicado: (2025)
One Model, Many Budgets: Elastic Latent Interfaces for Diffusion Transformers
por: Haji-Ali, Moayed, et al.
Publicado: (2026)
por: Haji-Ali, Moayed, et al.
Publicado: (2026)
Training and Tuning Generative Neural Radiance Fields for Attribute-Conditional 3D-Aware Face Generation
por: Zhang, Jichao, et al.
Publicado: (2022)
por: Zhang, Jichao, et al.
Publicado: (2022)
GTR: Improving Large 3D Reconstruction Models through Geometry and Texture Refinement
por: Zhuang, Peiye, et al.
Publicado: (2024)
por: Zhuang, Peiye, et al.
Publicado: (2024)
Multi-modal Reference Learning for Fine-grained Text-to-Image Retrieval
por: Ma, Zehong, et al.
Publicado: (2025)
por: Ma, Zehong, et al.
Publicado: (2025)
EgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editing
por: Li, Runjia, et al.
Publicado: (2025)
por: Li, Runjia, et al.
Publicado: (2025)
SPAD : Spatially Aware Multiview Diffusers
por: Kant, Yash, et al.
Publicado: (2024)
por: Kant, Yash, et al.
Publicado: (2024)
Multi-Context Temporal Consistent Modeling for Referring Video Object Segmentation
por: Choi, Sun-Hyuk, et al.
Publicado: (2025)
por: Choi, Sun-Hyuk, et al.
Publicado: (2025)
Ejemplares similares
-
VIMI: Grounding Video Generation through Multi-modal Instruction
por: Fang, Yuwei, et al.
Publicado: (2024) -
Hierarchical Patch Diffusion Models for High-Resolution Video Generation
por: Skorokhodov, Ivan, et al.
Publicado: (2024) -
Mind the Time: Temporally-Controlled Multi-Event Video Generation
por: Wu, Ziyi, et al.
Publicado: (2024) -
Multi-subject Open-set Personalization in Video Generation
por: Chen, Tsai-Shien, et al.
Publicado: (2025) -
DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models
por: Wu, Ziyi, et al.
Publicado: (2025)