Video Diffusion Transformers are In-Context Learners
Fuente:
arXiv
Saved in:
| Main Authors: | Fei, Zhengcong, Qiu, Di, Li, Debang, Yu, Changqian, Fan, Mingyuan |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Ingredients: Blending Custom Photos with Video Diffusion Transformers
by: Fei, Zhengcong, et al.
Published: (2025)
by: Fei, Zhengcong, et al.
Published: (2025)
Scaling Diffusion Transformers to 16 Billion Parameters
by: Fei, Zhengcong, et al.
Published: (2024)
by: Fei, Zhengcong, et al.
Published: (2024)
Diffusion-RWKV: Scaling RWKV-Like Architectures for Diffusion Models
by: Fei, Zhengcong, et al.
Published: (2024)
by: Fei, Zhengcong, et al.
Published: (2024)
Dimba: Transformer-Mamba Diffusion Models
by: Fei, Zhengcong, et al.
Published: (2024)
by: Fei, Zhengcong, et al.
Published: (2024)
Scalable Diffusion Models with State Space Backbone
by: Fei, Zhengcong, et al.
Published: (2024)
by: Fei, Zhengcong, et al.
Published: (2024)
SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers
by: Qiu, Di, et al.
Published: (2025)
by: Qiu, Di, et al.
Published: (2025)
SkyReels-A2: Compose Anything in Video Diffusion Transformers
by: Fei, Zhengcong, et al.
Published: (2025)
by: Fei, Zhengcong, et al.
Published: (2025)
SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers
by: Fei, Zhengcong, et al.
Published: (2025)
by: Fei, Zhengcong, et al.
Published: (2025)
FLUX that Plays Music
by: Fei, Zhengcong, et al.
Published: (2024)
by: Fei, Zhengcong, et al.
Published: (2024)
MovieCharacter: A Tuning-Free Framework for Controllable Character Video Synthesis
by: Qiu, Di, et al.
Published: (2024)
by: Qiu, Di, et al.
Published: (2024)
A-JEPA: Joint-Embedding Predictive Architecture Can Listen
by: Fei, Zhengcong, et al.
Published: (2023)
by: Fei, Zhengcong, et al.
Published: (2023)
Group Diffusion Transformers are Unsupervised Multitask Learners
by: Huang, Lianghua, et al.
Published: (2024)
by: Huang, Lianghua, et al.
Published: (2024)
In-Context Audio Control of Video Diffusion Transformers
by: Liu, Wenze, et al.
Published: (2025)
by: Liu, Wenze, et al.
Published: (2025)
FullDiT2: Efficient In-Context Conditioning for Video Diffusion Transformers
by: He, Xuanhua, et al.
Published: (2025)
by: He, Xuanhua, et al.
Published: (2025)
Generative Multimodal Models are In-Context Learners
by: Sun, Quan, et al.
Published: (2023)
by: Sun, Quan, et al.
Published: (2023)
Color as the Impetus: Transforming Few-Shot Learner
by: Qi, Chaofei, et al.
Published: (2025)
by: Qi, Chaofei, et al.
Published: (2025)
SCTNet: Single-Branch CNN with Transformer Semantic Information for Real-Time Segmentation
by: Xu, Zhengze, et al.
Published: (2023)
by: Xu, Zhengze, et al.
Published: (2023)
SkyReels-V2: Infinite-length Film Generative Model
by: Chen, Guibin, et al.
Published: (2025)
by: Chen, Guibin, et al.
Published: (2025)
In-Context LoRA for Diffusion Transformers
by: Huang, Lianghua, et al.
Published: (2024)
by: Huang, Lianghua, et al.
Published: (2024)
Few-Shot Object Detection with Sparse Context Transformers
by: Mei, Jie, et al.
Published: (2024)
by: Mei, Jie, et al.
Published: (2024)
Tora: Trajectory-oriented Diffusion Transformer for Video Generation
by: Zhang, Zhenghao, et al.
Published: (2024)
by: Zhang, Zhenghao, et al.
Published: (2024)
OutDreamer: Video Outpainting with a Diffusion Transformer
by: Zhong, Linhao, et al.
Published: (2025)
by: Zhong, Linhao, et al.
Published: (2025)
SkyReels-V3 Technique Report
by: Li, Debang, et al.
Published: (2026)
by: Li, Debang, et al.
Published: (2026)
Latte: Latent Diffusion Transformer for Video Generation
by: Ma, Xin, et al.
Published: (2024)
by: Ma, Xin, et al.
Published: (2024)
Video Generation with Stable Transparency via Shiftable RGB-A Distribution Learner
by: Dong, Haotian, et al.
Published: (2025)
by: Dong, Haotian, et al.
Published: (2025)
Kronecker Mask and Interpretive Prompts are Language-Action Video Learners
by: Yang, Jingyi, et al.
Published: (2025)
by: Yang, Jingyi, et al.
Published: (2025)
Vision Transformers are Circulant Attention Learners
by: Han, Dongchen, et al.
Published: (2025)
by: Han, Dongchen, et al.
Published: (2025)
Steering Video Diffusion Transformers with Massive Activations
by: Cheng, Xianhang, et al.
Published: (2026)
by: Cheng, Xianhang, et al.
Published: (2026)
In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer
by: Zhang, Zechuan, et al.
Published: (2025)
by: Zhang, Zechuan, et al.
Published: (2025)
DreamVVT: Mastering Realistic Video Virtual Try-On in the Wild via a Stage-Wise Diffusion Transformer Framework
by: Zuo, Tongchun, et al.
Published: (2025)
by: Zuo, Tongchun, et al.
Published: (2025)
Adversarially Pretrained Transformers May Be Universally Robust In-Context Learners
by: Kumano, Soichiro, et al.
Published: (2025)
by: Kumano, Soichiro, et al.
Published: (2025)
VIRAL: Visual In-Context Reasoning via Analogy in Diffusion Transformers
by: Li, Zhiwen, et al.
Published: (2026)
by: Li, Zhiwen, et al.
Published: (2026)
Flow-Guided Diffusion for Video Inpainting
by: Gu, Bohai, et al.
Published: (2023)
by: Gu, Bohai, et al.
Published: (2023)
GenCompositor: Generative Video Compositing with Diffusion Transformer
by: Yang, Shuzhou, et al.
Published: (2025)
by: Yang, Shuzhou, et al.
Published: (2025)
Token Pruning for In-Context Generation in Diffusion Transformers
by: Lin, Junqing, et al.
Published: (2026)
by: Lin, Junqing, et al.
Published: (2026)
ViFeEdit: A Video-Free Tuner of Your Video Diffusion Transformer
by: Yu, Ruonan, et al.
Published: (2026)
by: Yu, Ruonan, et al.
Published: (2026)
Analysis of Attention in Video Diffusion Transformers
by: Wen, Yuxin, et al.
Published: (2025)
by: Wen, Yuxin, et al.
Published: (2025)
CaMML: Context-Aware Multimodal Learner for Large Models
by: Chen, Yixin, et al.
Published: (2024)
by: Chen, Yixin, et al.
Published: (2024)
Growth Inhibitors for Suppressing Inappropriate Image Concepts in Diffusion Models
by: Chen, Die, et al.
Published: (2024)
by: Chen, Die, et al.
Published: (2024)
SeedVR: Seeding Infinity in Diffusion Transformer Towards Generic Video Restoration
by: Wang, Jianyi, et al.
Published: (2025)
by: Wang, Jianyi, et al.
Published: (2025)
Similar Items
-
Ingredients: Blending Custom Photos with Video Diffusion Transformers
by: Fei, Zhengcong, et al.
Published: (2025) -
Scaling Diffusion Transformers to 16 Billion Parameters
by: Fei, Zhengcong, et al.
Published: (2024) -
Diffusion-RWKV: Scaling RWKV-Like Architectures for Diffusion Models
by: Fei, Zhengcong, et al.
Published: (2024) -
Dimba: Transformer-Mamba Diffusion Models
by: Fei, Zhengcong, et al.
Published: (2024) -
Scalable Diffusion Models with State Space Backbone
by: Fei, Zhengcong, et al.
Published: (2024)