UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Jiehui, Zhang, Yuechen, He, Xu, Gao, Yuan, Cen, Zhi, Xia, Bin, Zhou, Yan, Tao, Xin, Wan, Pengfei, Jia, Jiaya |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Training-Free Efficient Video Generation via Dynamic Token Carving
par: Zhang, Yuechen, et autres
Publié: (2025)
par: Zhang, Yuechen, et autres
Publié: (2025)
MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers
par: Zhang, Yuechen, et autres
Publié: (2025)
par: Zhang, Yuechen, et autres
Publié: (2025)
Prompt Highlighter: Interactive Control for Multi-Modal LLMs
par: Zhang, Yuechen, et autres
Publié: (2023)
par: Zhang, Yuechen, et autres
Publié: (2023)
DreamVE: Unified Instruction-based Image and Video Editing
par: Xia, Bin, et autres
Publié: (2025)
par: Xia, Bin, et autres
Publié: (2025)
GRADEO: Towards Human-Like Evaluation for Text-to-Video Generation via Multi-Step Reasoning
par: Mou, Zhun, et autres
Publié: (2025)
par: Mou, Zhun, et autres
Publié: (2025)
UniMMVSR: A Unified Multi-Modal Framework for Cascaded Video Super-Resolution
par: Du, Shian, et autres
Publié: (2025)
par: Du, Shian, et autres
Publié: (2025)
MTV-Inpaint: Multi-Task Long Video Inpainting
par: Yang, Shiyuan, et autres
Publié: (2025)
par: Yang, Shiyuan, et autres
Publié: (2025)
DreamOmni: Unified Image Generation and Editing
par: Xia, Bin, et autres
Publié: (2024)
par: Xia, Bin, et autres
Publié: (2024)
ControlNeXt: Powerful and Efficient Control for Image and Video Generation
par: Peng, Bohao, et autres
Publié: (2024)
par: Peng, Bohao, et autres
Publié: (2024)
MVPBench: A Multi-Video Perception Evaluation Benchmark for Multi-Modal Video Understanding
par: Bai, Purui, et autres
Publié: (2026)
par: Bai, Purui, et autres
Publié: (2026)
Owl-1: Omni World Model for Consistent Long Video Generation
par: Huang, Yuanhui, et autres
Publié: (2024)
par: Huang, Yuanhui, et autres
Publié: (2024)
Enhancing Lip Reading with Multi-Scale Video and Multi-Encoder
par: Wang, He, et autres
Publié: (2024)
par: Wang, He, et autres
Publié: (2024)
LayerT2V: A Unified Multi-Layer Video Generation Framework
par: Li, Guangzhao, et autres
Publié: (2025)
par: Li, Guangzhao, et autres
Publié: (2025)
Towards Multi-Task Multi-Modal Models: A Video Generative Perspective
par: Yu, Lijun
Publié: (2024)
par: Yu, Lijun
Publié: (2024)
VideoTetris: Towards Compositional Text-to-Video Generation
par: Tian, Ye, et autres
Publié: (2024)
par: Tian, Ye, et autres
Publié: (2024)
MoTCoder: Elevating Large Language Models with Modular of Thought for Challenging Programming Tasks
par: Li, Jingyao, et autres
Publié: (2023)
par: Li, Jingyao, et autres
Publié: (2023)
Apollo: Unified Multi-Task Audio-Video Joint Generation
par: Wang, Jun, et autres
Publié: (2026)
par: Wang, Jun, et autres
Publié: (2026)
MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation
par: Li, Liyang, et autres
Publié: (2026)
par: Li, Liyang, et autres
Publié: (2026)
Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models
par: Li, Yanwei, et autres
Publié: (2024)
par: Li, Yanwei, et autres
Publié: (2024)
FullDiT: Multi-Task Video Generative Foundation Model with Full Attention
par: Ju, Xuan, et autres
Publié: (2025)
par: Ju, Xuan, et autres
Publié: (2025)
UNIAA: A Unified Multi-modal Image Aesthetic Assessment Baseline and Benchmark
par: Zhou, Zhaokun, et autres
Publié: (2024)
par: Zhou, Zhaokun, et autres
Publié: (2024)
Motion-Aware Video Frame Interpolation
par: Han, Pengfei, et autres
Publié: (2024)
par: Han, Pengfei, et autres
Publié: (2024)
Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification
par: Wang, Xiao, et autres
Publié: (2026)
par: Wang, Xiao, et autres
Publié: (2026)
UniVideo: Unified Understanding, Generation, and Editing for Videos
par: Wei, Cong, et autres
Publié: (2025)
par: Wei, Cong, et autres
Publié: (2025)
Geometry-Aware Implicit Memory for Video World Models
par: Wei, Zhengxuan, et autres
Publié: (2026)
par: Wei, Zhengxuan, et autres
Publié: (2026)
MUVR: A Multi-Modal Untrimmed Video Retrieval Benchmark with Multi-Level Visual Correspondence
par: Feng, Yue, et autres
Publié: (2025)
par: Feng, Yue, et autres
Publié: (2025)
SynCamMaster: Synchronizing Multi-Camera Video Generation from Diverse Viewpoints
par: Bai, Jianhong, et autres
Publié: (2024)
par: Bai, Jianhong, et autres
Publié: (2024)
LLMGA: Multimodal Large Language Model based Generation Assistant
par: Xia, Bin, et autres
Publié: (2023)
par: Xia, Bin, et autres
Publié: (2023)
Analytic Score Optimization for Multi Dimension Video Quality Assessment
par: Lin, Boda, et autres
Publié: (2026)
par: Lin, Boda, et autres
Publié: (2026)
MultiShotMaster: A Controllable Multi-Shot Video Generation Framework
par: Wang, Qinghe, et autres
Publié: (2025)
par: Wang, Qinghe, et autres
Publié: (2025)
UNIC: Unified In-Context Video Editing
par: Ye, Zixuan, et autres
Publié: (2025)
par: Ye, Zixuan, et autres
Publié: (2025)
MultiCOIN: Multi-Modal COntrollable Video INbetweening
par: Tanveer, Maham, et autres
Publié: (2025)
par: Tanveer, Maham, et autres
Publié: (2025)
BadVideo: Stealthy Backdoor Attack against Text-to-Video Generation
par: Wang, Ruotong, et autres
Publié: (2025)
par: Wang, Ruotong, et autres
Publié: (2025)
IPFormer-VideoLLM: Enhancing Multi-modal Video Understanding for Multi-shot Scenes
par: Liang, Yujia, et autres
Publié: (2025)
par: Liang, Yujia, et autres
Publié: (2025)
FFAA: Multimodal Large Language Model based Explainable Open-World Face Forgery Analysis Assistant
par: Huang, Zhengchao, et autres
Publié: (2024)
par: Huang, Zhengchao, et autres
Publié: (2024)
Unified Open-World Segmentation with Multi-Modal Prompts
par: Liu, Yang, et autres
Publié: (2025)
par: Liu, Yang, et autres
Publié: (2025)
AMOSL: Adaptive Modality-wise Structure Learning in Multi-view Graph Neural Networks For Enhanced Unified Representation
par: Liang, Peiyu, et autres
Publié: (2024)
par: Liang, Peiyu, et autres
Publié: (2024)
Video-As-Prompt: Unified Semantic Control for Video Generation
par: Bian, Yuxuan, et autres
Publié: (2025)
par: Bian, Yuxuan, et autres
Publié: (2025)
3DTrajMaster: Mastering 3D Trajectory for Multi-Entity Motion in Video Generation
par: Fu, Xiao, et autres
Publié: (2024)
par: Fu, Xiao, et autres
Publié: (2024)
PhysMaster: Mastering Physical Representation for Video Generation via Reinforcement Learning
par: Ji, Sihui, et autres
Publié: (2025)
par: Ji, Sihui, et autres
Publié: (2025)
Documents similaires
-
Training-Free Efficient Video Generation via Dynamic Token Carving
par: Zhang, Yuechen, et autres
Publié: (2025) -
MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers
par: Zhang, Yuechen, et autres
Publié: (2025) -
Prompt Highlighter: Interactive Control for Multi-Modal LLMs
par: Zhang, Yuechen, et autres
Publié: (2023) -
DreamVE: Unified Instruction-based Image and Video Editing
par: Xia, Bin, et autres
Publié: (2025) -
GRADEO: Towards Human-Like Evaluation for Text-to-Video Generation via Multi-Step Reasoning
par: Mou, Zhun, et autres
Publié: (2025)