SkyReels-A2: Compose Anything in Video Diffusion Transformers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fei, Zhengcong, Li, Debang, Qiu, Di, Wang, Jiahua, Dou, Yikun, Wang, Rui, Xu, Jingtao, Fan, Mingyuan, Chen, Guibin, Li, Yang, Zhou, Yahui |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers
par: Fei, Zhengcong, et autres
Publié: (2025)
par: Fei, Zhengcong, et autres
Publié: (2025)
SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers
par: Qiu, Di, et autres
Publié: (2025)
par: Qiu, Di, et autres
Publié: (2025)
SkyReels-V3 Technique Report
par: Li, Debang, et autres
Publié: (2026)
par: Li, Debang, et autres
Publié: (2026)
SkyReels-V2: Infinite-length Film Generative Model
par: Chen, Guibin, et autres
Publié: (2025)
par: Chen, Guibin, et autres
Publié: (2025)
Video Diffusion Transformers are In-Context Learners
par: Fei, Zhengcong, et autres
Publié: (2024)
par: Fei, Zhengcong, et autres
Publié: (2024)
Ingredients: Blending Custom Photos with Video Diffusion Transformers
par: Fei, Zhengcong, et autres
Publié: (2025)
par: Fei, Zhengcong, et autres
Publié: (2025)
SkyReels-V4: Multi-modal Video-Audio Generation, Inpainting and Editing model
par: Chen, Guibin, et autres
Publié: (2026)
par: Chen, Guibin, et autres
Publié: (2026)
Scaling Diffusion Transformers to 16 Billion Parameters
par: Fei, Zhengcong, et autres
Publié: (2024)
par: Fei, Zhengcong, et autres
Publié: (2024)
Dimba: Transformer-Mamba Diffusion Models
par: Fei, Zhengcong, et autres
Publié: (2024)
par: Fei, Zhengcong, et autres
Publié: (2024)
Diffusion-RWKV: Scaling RWKV-Like Architectures for Diffusion Models
par: Fei, Zhengcong, et autres
Publié: (2024)
par: Fei, Zhengcong, et autres
Publié: (2024)
SkyReels-Text: Fine-Grained Font-Controllable Text Editing for Poster Design
par: Yu, Yunjie, et autres
Publié: (2025)
par: Yu, Yunjie, et autres
Publié: (2025)
Scalable Diffusion Models with State Space Backbone
par: Fei, Zhengcong, et autres
Publié: (2024)
par: Fei, Zhengcong, et autres
Publié: (2024)
A-JEPA: Joint-Embedding Predictive Architecture Can Listen
par: Fei, Zhengcong, et autres
Publié: (2023)
par: Fei, Zhengcong, et autres
Publié: (2023)
Music Consistency Models
par: Fei, Zhengcong, et autres
Publié: (2024)
par: Fei, Zhengcong, et autres
Publié: (2024)
FLUX that Plays Music
par: Fei, Zhengcong, et autres
Publié: (2024)
par: Fei, Zhengcong, et autres
Publié: (2024)
PodReels: Human-AI Co-Creation of Video Podcast Teasers
par: Wang, Sitong, et autres
Publié: (2023)
par: Wang, Sitong, et autres
Publié: (2023)
MovieCharacter: A Tuning-Free Framework for Controllable Character Video Synthesis
par: Qiu, Di, et autres
Publié: (2024)
par: Qiu, Di, et autres
Publié: (2024)
Personalize Anything for Free with Diffusion Transformer
par: Feng, Haoran, et autres
Publié: (2025)
par: Feng, Haoran, et autres
Publié: (2025)
ReelFramer: Human-AI Co-Creation for News-to-Video Translation
par: Wang, Sitong, et autres
Publié: (2023)
par: Wang, Sitong, et autres
Publié: (2023)
A Sanity Check on Composed Image Retrieval
par: Liu, Yikun, et autres
Publié: (2026)
par: Liu, Yikun, et autres
Publié: (2026)
CubeComposer: Spatio-Temporal Autoregressive 4K 360° Video Generation from Perspective Video
par: Li, Lingen, et autres
Publié: (2026)
par: Li, Lingen, et autres
Publié: (2026)
Systematic Evaluation and Guidelines for Segment Anything Model in Surgical Video Analysis
par: Yuan, Cheng, et autres
Publié: (2024)
par: Yuan, Cheng, et autres
Publié: (2024)
Zero-shot Composed Text-Image Retrieval
par: Liu, Yikun, et autres
Publié: (2023)
par: Liu, Yikun, et autres
Publié: (2023)
SayAnything: Audio-Driven Lip Synchronization with Conditional Video Diffusion
par: Ma, Junxian, et autres
Publié: (2025)
par: Ma, Junxian, et autres
Publié: (2025)
Anything in Any Scene: Photorealistic Video Object Insertion
par: Bai, Chen, et autres
Publié: (2024)
par: Bai, Chen, et autres
Publié: (2024)
Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion
par: Huang, Xun, et autres
Publié: (2025)
par: Huang, Xun, et autres
Publié: (2025)
Get In Video: Add Anything You Want to the Video
par: Zhuang, Shaobin, et autres
Publié: (2025)
par: Zhuang, Shaobin, et autres
Publié: (2025)
AnimateAnything: Consistent and Controllable Animation for Video Generation
par: Lei, Guojun, et autres
Publié: (2024)
par: Lei, Guojun, et autres
Publié: (2024)
Tora: Trajectory-oriented Diffusion Transformer for Video Generation
par: Zhang, Zhenghao, et autres
Publié: (2024)
par: Zhang, Zhenghao, et autres
Publié: (2024)
SAMEdge: An Edge-cloud Video Analytics Architecture for the Segment Anything Model
par: Lu, Rui, et autres
Publié: (2024)
par: Lu, Rui, et autres
Publié: (2024)
Growth Inhibitors for Suppressing Inappropriate Image Concepts in Diffusion Models
par: Chen, Die, et autres
Publié: (2024)
par: Chen, Die, et autres
Publié: (2024)
MoCapAnything: Unified 3D Motion Capture for Arbitrary Skeletons from Monocular Videos
par: Gong, Kehong, et autres
Publié: (2025)
par: Gong, Kehong, et autres
Publié: (2025)
ComposeAnything: Composite Object Priors for Text-to-Image Generation
par: Khan, Zeeshan, et autres
Publié: (2025)
par: Khan, Zeeshan, et autres
Publié: (2025)
DragAnything: Motion Control for Anything using Entity Representation
par: Wu, Weijia, et autres
Publié: (2024)
par: Wu, Weijia, et autres
Publié: (2024)
Responsible Diffusion Models via Constraining Text Embeddings within Safe Regions
par: Li, Zhiwen, et autres
Publié: (2025)
par: Li, Zhiwen, et autres
Publié: (2025)
Few-Step Diffusion via Score identity Distillation
par: Zhou, Mingyuan, et autres
Publié: (2025)
par: Zhou, Mingyuan, et autres
Publié: (2025)
Beyond Doping: Rare‐Earth Mediated Strategies for Rational Design of Multifunctional Electrocatalysts
par: Di Wang, et autres
Publié: (2026)
par: Di Wang, et autres
Publié: (2026)
Composable Effect Handling for Programming LLM-integrated Scripts
par: Wang, Di
Publié: (2025)
par: Wang, Di
Publié: (2025)
DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers
par: Wang, Lizhen, et autres
Publié: (2025)
par: Wang, Lizhen, et autres
Publié: (2025)
The Reel Deal: Designing and Evaluating LLM-Generated Short-Form Educational Videos
par: Stavrinou, Lazaros, et autres
Publié: (2025)
par: Stavrinou, Lazaros, et autres
Publié: (2025)
Documents similaires
-
SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers
par: Fei, Zhengcong, et autres
Publié: (2025) -
SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers
par: Qiu, Di, et autres
Publié: (2025) -
SkyReels-V3 Technique Report
par: Li, Debang, et autres
Publié: (2026) -
SkyReels-V2: Infinite-length Film Generative Model
par: Chen, Guibin, et autres
Publié: (2025) -
Video Diffusion Transformers are In-Context Learners
par: Fei, Zhengcong, et autres
Publié: (2024)