FullDiT: Multi-Task Video Generative Foundation Model with Full Attention
Fuente:
arXiv
Salvato in:
| Autori principali: | Ju, Xuan, Ye, Weicai, Liu, Quande, Wang, Qiulin, Wang, Xintao, Wan, Pengfei, Zhang, Di, Gai, Kun, Xu, Qiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FullDiT2: Efficient In-Context Conditioning for Video Diffusion Transformers
di: He, Xuanhua, et al.
Pubblicazione: (2025)
di: He, Xuanhua, et al.
Pubblicazione: (2025)
UniVideo: Unified Understanding, Generation, and Editing for Videos
di: Wei, Cong, et al.
Pubblicazione: (2025)
di: Wei, Cong, et al.
Pubblicazione: (2025)
VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning
di: Cai, Minghong, et al.
Pubblicazione: (2025)
di: Cai, Minghong, et al.
Pubblicazione: (2025)
ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning
di: Huang, Yuzhou, et al.
Pubblicazione: (2025)
di: Huang, Yuzhou, et al.
Pubblicazione: (2025)
UNIC: Unified In-Context Video Editing
di: Ye, Zixuan, et al.
Pubblicazione: (2025)
di: Ye, Zixuan, et al.
Pubblicazione: (2025)
A Reason-then-Describe Instruction Interpreter for Controllable Video Generation
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
MultiShotMaster: A Controllable Multi-Shot Video Generation Framework
di: Wang, Qinghe, et al.
Pubblicazione: (2025)
di: Wang, Qinghe, et al.
Pubblicazione: (2025)
UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation
di: Xu, Yiyan, et al.
Pubblicazione: (2026)
di: Xu, Yiyan, et al.
Pubblicazione: (2026)
A Survey of Interactive Generative Video
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
In-Context Audio Control of Video Diffusion Transformers
di: Liu, Wenze, et al.
Pubblicazione: (2025)
di: Liu, Wenze, et al.
Pubblicazione: (2025)
SketchVideo: Sketch-based Video Generation and Editing
di: Liu, Feng-Lin, et al.
Pubblicazione: (2025)
di: Liu, Feng-Lin, et al.
Pubblicazione: (2025)
Visual-Aware CoT: Achieving High-Fidelity Visual Consistency in Unified Models
di: Ye, Zixuan, et al.
Pubblicazione: (2025)
di: Ye, Zixuan, et al.
Pubblicazione: (2025)
PhysFlow: Unleashing the Potential of Multi-modal Foundation Models and Video Diffusion for 4D Dynamic Physical Scene Simulation
di: Liu, Zhuoman, et al.
Pubblicazione: (2024)
di: Liu, Zhuoman, et al.
Pubblicazione: (2024)
Position: Interactive Generative Video as Next-Generation Game Engine
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
ShotStream: Streaming Multi-Shot Video Generation for Interactive Storytelling
di: Luo, Yawen, et al.
Pubblicazione: (2026)
di: Luo, Yawen, et al.
Pubblicazione: (2026)
Scaling Image and Video Generation via Test-Time Evolutionary Search
di: He, Haoran, et al.
Pubblicazione: (2025)
di: He, Haoran, et al.
Pubblicazione: (2025)
VINO: A Unified Visual Generator with Interleaved OmniModal Context
di: Chen, Junyi, et al.
Pubblicazione: (2026)
di: Chen, Junyi, et al.
Pubblicazione: (2026)
Context as Memory: Scene-Consistent Interactive Long Video Generation with Memory Retrieval
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
UniMMVSR: A Unified Multi-Modal Framework for Cascaded Video Super-Resolution
di: Du, Shian, et al.
Pubblicazione: (2025)
di: Du, Shian, et al.
Pubblicazione: (2025)
CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation
di: Wang, Qinghe, et al.
Pubblicazione: (2025)
di: Wang, Qinghe, et al.
Pubblicazione: (2025)
CamCloneMaster: Enabling Reference-based Camera Control for Video Generation
di: Luo, Yawen, et al.
Pubblicazione: (2025)
di: Luo, Yawen, et al.
Pubblicazione: (2025)
StyleMaster: Stylize Your Video with Artistic Generation and Translation
di: Ye, Zixuan, et al.
Pubblicazione: (2024)
di: Ye, Zixuan, et al.
Pubblicazione: (2024)
RelightMaster: Precise Video Relighting with Multi-plane Light Images
di: Bian, Weikang, et al.
Pubblicazione: (2025)
di: Bian, Weikang, et al.
Pubblicazione: (2025)
Native 3D Editing with Full Attention
di: Cai, Weiwei, et al.
Pubblicazione: (2025)
di: Cai, Weiwei, et al.
Pubblicazione: (2025)
Improving Video Generation with Human Feedback
di: Liu, Jie, et al.
Pubblicazione: (2025)
di: Liu, Jie, et al.
Pubblicazione: (2025)
FEAT: Full-Dimensional Efficient Attention Transformer for Medical Video Generation
di: Wang, Huihan, et al.
Pubblicazione: (2025)
di: Wang, Huihan, et al.
Pubblicazione: (2025)
GameFactory: Creating New Games with Generative Interactive Videos
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
di: Yu, Jiwen, et al.
Pubblicazione: (2025)
SemanticGen: Video Generation in Semantic Space
di: Bai, Jianhong, et al.
Pubblicazione: (2025)
di: Bai, Jianhong, et al.
Pubblicazione: (2025)
Geometry-Aware Implicit Memory for Video World Models
di: Wei, Zhengxuan, et al.
Pubblicazione: (2026)
di: Wei, Zhengxuan, et al.
Pubblicazione: (2026)
Learning Video Generation for Robotic Manipulation with Collaborative Trajectory Control
di: Fu, Xiao, et al.
Pubblicazione: (2025)
di: Fu, Xiao, et al.
Pubblicazione: (2025)
FullTransNet: Full Transformer with Local-Global Attention for Video Summarization
di: Lan, Libin, et al.
Pubblicazione: (2025)
di: Lan, Libin, et al.
Pubblicazione: (2025)
SynCamMaster: Synchronizing Multi-Camera Video Generation from Diverse Viewpoints
di: Bai, Jianhong, et al.
Pubblicazione: (2024)
di: Bai, Jianhong, et al.
Pubblicazione: (2024)
HumanAesExpert: Advancing a Multi-Modality Foundation Model for Human Image Aesthetic Assessment
di: Liao, Zhichao, et al.
Pubblicazione: (2025)
di: Liao, Zhichao, et al.
Pubblicazione: (2025)
DecMem: Towards Minute-Long Consistent World Generation with Decoupled Memory
di: Yang, Zhenhao, et al.
Pubblicazione: (2026)
di: Yang, Zhenhao, et al.
Pubblicazione: (2026)
PipeDiT: Accelerating Diffusion Transformers in Video Generation with Task Pipelining and Model Decoupling
di: Wang, Sijie, et al.
Pubblicazione: (2025)
di: Wang, Sijie, et al.
Pubblicazione: (2025)
High-Speed FHD Full-Color Video Computer-Generated Holography
di: Zhang, Haomiao, et al.
Pubblicazione: (2025)
di: Zhang, Haomiao, et al.
Pubblicazione: (2025)
VideoTetris: Towards Compositional Text-to-Video Generation
di: Tian, Ye, et al.
Pubblicazione: (2024)
di: Tian, Ye, et al.
Pubblicazione: (2024)
3DTrajMaster: Mastering 3D Trajectory for Multi-Entity Motion in Video Generation
di: Fu, Xiao, et al.
Pubblicazione: (2024)
di: Fu, Xiao, et al.
Pubblicazione: (2024)
PatchVSR: Breaking Video Diffusion Resolution Limits with Patch-wise Video Super-Resolution
di: Du, Shian, et al.
Pubblicazione: (2025)
di: Du, Shian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
FullDiT2: Efficient In-Context Conditioning for Video Diffusion Transformers
di: He, Xuanhua, et al.
Pubblicazione: (2025) -
UniVideo: Unified Understanding, Generation, and Editing for Videos
di: Wei, Cong, et al.
Pubblicazione: (2025) -
VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning
di: Cai, Minghong, et al.
Pubblicazione: (2025) -
ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning
di: Huang, Yuzhou, et al.
Pubblicazione: (2025) -
UNIC: Unified In-Context Video Editing
di: Ye, Zixuan, et al.
Pubblicazione: (2025)