UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Jiehui, Zhang, Yuechen, He, Xu, Gao, Yuan, Cen, Zhi, Xia, Bin, Zhou, Yan, Tao, Xin, Wan, Pengfei, Jia, Jiaya |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Training-Free Efficient Video Generation via Dynamic Token Carving
di: Zhang, Yuechen, et al.
Pubblicazione: (2025)
di: Zhang, Yuechen, et al.
Pubblicazione: (2025)
MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers
di: Zhang, Yuechen, et al.
Pubblicazione: (2025)
di: Zhang, Yuechen, et al.
Pubblicazione: (2025)
Prompt Highlighter: Interactive Control for Multi-Modal LLMs
di: Zhang, Yuechen, et al.
Pubblicazione: (2023)
di: Zhang, Yuechen, et al.
Pubblicazione: (2023)
DreamVE: Unified Instruction-based Image and Video Editing
di: Xia, Bin, et al.
Pubblicazione: (2025)
di: Xia, Bin, et al.
Pubblicazione: (2025)
GRADEO: Towards Human-Like Evaluation for Text-to-Video Generation via Multi-Step Reasoning
di: Mou, Zhun, et al.
Pubblicazione: (2025)
di: Mou, Zhun, et al.
Pubblicazione: (2025)
UniMMVSR: A Unified Multi-Modal Framework for Cascaded Video Super-Resolution
di: Du, Shian, et al.
Pubblicazione: (2025)
di: Du, Shian, et al.
Pubblicazione: (2025)
MTV-Inpaint: Multi-Task Long Video Inpainting
di: Yang, Shiyuan, et al.
Pubblicazione: (2025)
di: Yang, Shiyuan, et al.
Pubblicazione: (2025)
DreamOmni: Unified Image Generation and Editing
di: Xia, Bin, et al.
Pubblicazione: (2024)
di: Xia, Bin, et al.
Pubblicazione: (2024)
ControlNeXt: Powerful and Efficient Control for Image and Video Generation
di: Peng, Bohao, et al.
Pubblicazione: (2024)
di: Peng, Bohao, et al.
Pubblicazione: (2024)
MVPBench: A Multi-Video Perception Evaluation Benchmark for Multi-Modal Video Understanding
di: Bai, Purui, et al.
Pubblicazione: (2026)
di: Bai, Purui, et al.
Pubblicazione: (2026)
Owl-1: Omni World Model for Consistent Long Video Generation
di: Huang, Yuanhui, et al.
Pubblicazione: (2024)
di: Huang, Yuanhui, et al.
Pubblicazione: (2024)
Enhancing Lip Reading with Multi-Scale Video and Multi-Encoder
di: Wang, He, et al.
Pubblicazione: (2024)
di: Wang, He, et al.
Pubblicazione: (2024)
LayerT2V: A Unified Multi-Layer Video Generation Framework
di: Li, Guangzhao, et al.
Pubblicazione: (2025)
di: Li, Guangzhao, et al.
Pubblicazione: (2025)
Towards Multi-Task Multi-Modal Models: A Video Generative Perspective
di: Yu, Lijun
Pubblicazione: (2024)
di: Yu, Lijun
Pubblicazione: (2024)
VideoTetris: Towards Compositional Text-to-Video Generation
di: Tian, Ye, et al.
Pubblicazione: (2024)
di: Tian, Ye, et al.
Pubblicazione: (2024)
MoTCoder: Elevating Large Language Models with Modular of Thought for Challenging Programming Tasks
di: Li, Jingyao, et al.
Pubblicazione: (2023)
di: Li, Jingyao, et al.
Pubblicazione: (2023)
Apollo: Unified Multi-Task Audio-Video Joint Generation
di: Wang, Jun, et al.
Pubblicazione: (2026)
di: Wang, Jun, et al.
Pubblicazione: (2026)
MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation
di: Li, Liyang, et al.
Pubblicazione: (2026)
di: Li, Liyang, et al.
Pubblicazione: (2026)
Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models
di: Li, Yanwei, et al.
Pubblicazione: (2024)
di: Li, Yanwei, et al.
Pubblicazione: (2024)
FullDiT: Multi-Task Video Generative Foundation Model with Full Attention
di: Ju, Xuan, et al.
Pubblicazione: (2025)
di: Ju, Xuan, et al.
Pubblicazione: (2025)
UNIAA: A Unified Multi-modal Image Aesthetic Assessment Baseline and Benchmark
di: Zhou, Zhaokun, et al.
Pubblicazione: (2024)
di: Zhou, Zhaokun, et al.
Pubblicazione: (2024)
Motion-Aware Video Frame Interpolation
di: Han, Pengfei, et al.
Pubblicazione: (2024)
di: Han, Pengfei, et al.
Pubblicazione: (2024)
Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification
di: Wang, Xiao, et al.
Pubblicazione: (2026)
di: Wang, Xiao, et al.
Pubblicazione: (2026)
UniVideo: Unified Understanding, Generation, and Editing for Videos
di: Wei, Cong, et al.
Pubblicazione: (2025)
di: Wei, Cong, et al.
Pubblicazione: (2025)
Geometry-Aware Implicit Memory for Video World Models
di: Wei, Zhengxuan, et al.
Pubblicazione: (2026)
di: Wei, Zhengxuan, et al.
Pubblicazione: (2026)
MUVR: A Multi-Modal Untrimmed Video Retrieval Benchmark with Multi-Level Visual Correspondence
di: Feng, Yue, et al.
Pubblicazione: (2025)
di: Feng, Yue, et al.
Pubblicazione: (2025)
SynCamMaster: Synchronizing Multi-Camera Video Generation from Diverse Viewpoints
di: Bai, Jianhong, et al.
Pubblicazione: (2024)
di: Bai, Jianhong, et al.
Pubblicazione: (2024)
LLMGA: Multimodal Large Language Model based Generation Assistant
di: Xia, Bin, et al.
Pubblicazione: (2023)
di: Xia, Bin, et al.
Pubblicazione: (2023)
Analytic Score Optimization for Multi Dimension Video Quality Assessment
di: Lin, Boda, et al.
Pubblicazione: (2026)
di: Lin, Boda, et al.
Pubblicazione: (2026)
MultiShotMaster: A Controllable Multi-Shot Video Generation Framework
di: Wang, Qinghe, et al.
Pubblicazione: (2025)
di: Wang, Qinghe, et al.
Pubblicazione: (2025)
UNIC: Unified In-Context Video Editing
di: Ye, Zixuan, et al.
Pubblicazione: (2025)
di: Ye, Zixuan, et al.
Pubblicazione: (2025)
MultiCOIN: Multi-Modal COntrollable Video INbetweening
di: Tanveer, Maham, et al.
Pubblicazione: (2025)
di: Tanveer, Maham, et al.
Pubblicazione: (2025)
BadVideo: Stealthy Backdoor Attack against Text-to-Video Generation
di: Wang, Ruotong, et al.
Pubblicazione: (2025)
di: Wang, Ruotong, et al.
Pubblicazione: (2025)
IPFormer-VideoLLM: Enhancing Multi-modal Video Understanding for Multi-shot Scenes
di: Liang, Yujia, et al.
Pubblicazione: (2025)
di: Liang, Yujia, et al.
Pubblicazione: (2025)
FFAA: Multimodal Large Language Model based Explainable Open-World Face Forgery Analysis Assistant
di: Huang, Zhengchao, et al.
Pubblicazione: (2024)
di: Huang, Zhengchao, et al.
Pubblicazione: (2024)
Unified Open-World Segmentation with Multi-Modal Prompts
di: Liu, Yang, et al.
Pubblicazione: (2025)
di: Liu, Yang, et al.
Pubblicazione: (2025)
AMOSL: Adaptive Modality-wise Structure Learning in Multi-view Graph Neural Networks For Enhanced Unified Representation
di: Liang, Peiyu, et al.
Pubblicazione: (2024)
di: Liang, Peiyu, et al.
Pubblicazione: (2024)
Video-As-Prompt: Unified Semantic Control for Video Generation
di: Bian, Yuxuan, et al.
Pubblicazione: (2025)
di: Bian, Yuxuan, et al.
Pubblicazione: (2025)
3DTrajMaster: Mastering 3D Trajectory for Multi-Entity Motion in Video Generation
di: Fu, Xiao, et al.
Pubblicazione: (2024)
di: Fu, Xiao, et al.
Pubblicazione: (2024)
PhysMaster: Mastering Physical Representation for Video Generation via Reinforcement Learning
di: Ji, Sihui, et al.
Pubblicazione: (2025)
di: Ji, Sihui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Training-Free Efficient Video Generation via Dynamic Token Carving
di: Zhang, Yuechen, et al.
Pubblicazione: (2025) -
MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers
di: Zhang, Yuechen, et al.
Pubblicazione: (2025) -
Prompt Highlighter: Interactive Control for Multi-Modal LLMs
di: Zhang, Yuechen, et al.
Pubblicazione: (2023) -
DreamVE: Unified Instruction-based Image and Video Editing
di: Xia, Bin, et al.
Pubblicazione: (2025) -
GRADEO: Towards Human-Like Evaluation for Text-to-Video Generation via Multi-Step Reasoning
di: Mou, Zhun, et al.
Pubblicazione: (2025)