Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Ruibin, Yang, Tao, Shi, Yangming, Feng, Weiguo, Wen, Shilei, Peng, Bingyue, Zhang, Lei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation
by: Li, Ruibin, et al.
Published: (2026)
by: Li, Ruibin, et al.
Published: (2026)
Factorized-Dreamer: Training A High-Quality Video Generator with Limited and Low-Quality Data
by: Yang, Tao, et al.
Published: (2024)
by: Yang, Tao, et al.
Published: (2024)
ManiVideo: Generating Hand-Object Manipulation Video with Dexterous and Generalizable Grasping
by: Pang, Youxin, et al.
Published: (2024)
by: Pang, Youxin, et al.
Published: (2024)
JoVA: Unified Multimodal Learning for Joint Video-Audio Generation
by: Huang, Xiaohu, et al.
Published: (2025)
by: Huang, Xiaohu, et al.
Published: (2025)
iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation
by: Fu, Zhoujie, et al.
Published: (2025)
by: Fu, Zhoujie, et al.
Published: (2025)
Many-Task Federated Fine-Tuning via Unified Task Vectors
by: Tsouvalas, Vasileios, et al.
Published: (2025)
by: Tsouvalas, Vasileios, et al.
Published: (2025)
RORem: Training a Robust Object Remover with Human-in-the-Loop
by: Li, Ruibin, et al.
Published: (2025)
by: Li, Ruibin, et al.
Published: (2025)
Mani-GS: Gaussian Splatting Manipulation with Triangular Mesh
by: Gao, Xiangjun, et al.
Published: (2024)
by: Gao, Xiangjun, et al.
Published: (2024)
ManiSkill-HAB: A Benchmark for Low-Level Manipulation in Home Rearrangement Tasks
by: Shukla, Arth, et al.
Published: (2024)
by: Shukla, Arth, et al.
Published: (2024)
Many-to-many Image Generation with Auto-regressive Diffusion Models
by: Shen, Ying, et al.
Published: (2024)
by: Shen, Ying, et al.
Published: (2024)
Text-to-Edit: Controllable End-to-End Video Ad Creation via Multimodal LLMs
by: Cheng, Dabing, et al.
Published: (2025)
by: Cheng, Dabing, et al.
Published: (2025)
Deploy DINO with Many-to-Many Association
by: Jiang, Haodong, et al.
Published: (2026)
by: Jiang, Haodong, et al.
Published: (2026)
Discriminator-Free Direct Preference Optimization for Video Diffusion
by: Cheng, Haoran, et al.
Published: (2025)
by: Cheng, Haoran, et al.
Published: (2025)
RelayFormer: A Unified Local-Global Attention Framework for Scalable Image and Video Manipulation Localization
by: Huang, Wen, et al.
Published: (2025)
by: Huang, Wen, et al.
Published: (2025)
ManiGaussian: Dynamic Gaussian Splatting for Multi-task Robotic Manipulation
by: Lu, Guanxing, et al.
Published: (2024)
by: Lu, Guanxing, et al.
Published: (2024)
ManiSoft: Towards Vision-Language Manipulation for Soft Continuum Robotics
by: Wei, Ziyu, et al.
Published: (2026)
by: Wei, Ziyu, et al.
Published: (2026)
Video Individual Counting With Implicit One-to-Many Matching
by: Zhu, Xuhui, et al.
Published: (2025)
by: Zhu, Xuhui, et al.
Published: (2025)
Bayesian Neural Networks for One-to-Many Mapping in Image Enhancement
by: Huang, Guoxi, et al.
Published: (2025)
by: Huang, Guoxi, et al.
Published: (2025)
From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion
by: Chen, Cheng, et al.
Published: (2026)
by: Chen, Cheng, et al.
Published: (2026)
TokenBinder: Text-Video Retrieval with One-to-Many Alignment Paradigm
by: Zhang, Bingqing, et al.
Published: (2024)
by: Zhang, Bingqing, et al.
Published: (2024)
ManiPose: A Comprehensive Benchmark for Pose-aware Object Manipulation in Robotics
by: Yu, Qiaojun, et al.
Published: (2024)
by: Yu, Qiaojun, et al.
Published: (2024)
Motion Guided Token Compression for Efficient Masked Video Modeling
by: Feng, Yukun, et al.
Published: (2024)
by: Feng, Yukun, et al.
Published: (2024)
In Pursuit of Many: A Review of Modern Multiple Object Tracking Systems
by: Bashar, Mk, et al.
Published: (2022)
by: Bashar, Mk, et al.
Published: (2022)
ManiDext: Hand-Object Manipulation Synthesis via Continuous Correspondence Embeddings and Residual-Guided Diffusion
by: Zhang, Jiajun, et al.
Published: (2024)
by: Zhang, Jiajun, et al.
Published: (2024)
Waver: Wave Your Way to Lifelike Video Generation
by: Zhang, Yifu, et al.
Published: (2025)
by: Zhang, Yifu, et al.
Published: (2025)
Improving Deep Generative Models on Many-To-One Image-to-Image Translation
by: Saxena, Sagar, et al.
Published: (2024)
by: Saxena, Sagar, et al.
Published: (2024)
Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation
by: Sun, Peize, et al.
Published: (2024)
by: Sun, Peize, et al.
Published: (2024)
LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision
by: Li, Chunyu, et al.
Published: (2024)
by: Li, Chunyu, et al.
Published: (2024)
FlashVideo: Flowing Fidelity to Detail for Efficient High-Resolution Video Generation
by: Zhang, Shilong, et al.
Published: (2025)
by: Zhang, Shilong, et al.
Published: (2025)
OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation
by: Zhou, Donghao, et al.
Published: (2026)
by: Zhou, Donghao, et al.
Published: (2026)
Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models
by: Ke, Junlong, et al.
Published: (2026)
by: Ke, Junlong, et al.
Published: (2026)
Many-Worlds Inverse Rendering
by: Zhang, Ziyi, et al.
Published: (2024)
by: Zhang, Ziyi, et al.
Published: (2024)
OpenSubject: Leveraging Video-Derived Identity and Diversity Priors for Subject-driven Image Generation and Manipulation
by: Liu, Yexin, et al.
Published: (2025)
by: Liu, Yexin, et al.
Published: (2025)
Beyond Subspace Isolation: Many-to-Many Transformer for Light Field Image Super-resolution
by: Hu, Zeke Zexi, et al.
Published: (2024)
by: Hu, Zeke Zexi, et al.
Published: (2024)
Learning Many-to-Many Mapping for Unpaired Real-World Image Super-resolution and Downscaling
by: Sun, Wanjie, et al.
Published: (2023)
by: Sun, Wanjie, et al.
Published: (2023)
UniTok: A Unified Tokenizer for Visual Generation and Understanding
by: Ma, Chuofan, et al.
Published: (2025)
by: Ma, Chuofan, et al.
Published: (2025)
Spider: Any-to-Many Multimodal LLM
by: Lai, Jinxiang, et al.
Published: (2024)
by: Lai, Jinxiang, et al.
Published: (2024)
Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction
by: Tian, Keyu, et al.
Published: (2024)
by: Tian, Keyu, et al.
Published: (2024)
UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation
by: Huang, Jiehui, et al.
Published: (2025)
by: Huang, Jiehui, et al.
Published: (2025)
Training-free Motion Factorization for Compositional Video Generation
by: Wang, Zixuan, et al.
Published: (2026)
by: Wang, Zixuan, et al.
Published: (2026)
Similar Items
-
Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation
by: Li, Ruibin, et al.
Published: (2026) -
Factorized-Dreamer: Training A High-Quality Video Generator with Limited and Low-Quality Data
by: Yang, Tao, et al.
Published: (2024) -
ManiVideo: Generating Hand-Object Manipulation Video with Dexterous and Generalizable Grasping
by: Pang, Youxin, et al.
Published: (2024) -
JoVA: Unified Multimodal Learning for Joint Video-Audio Generation
by: Huang, Xiaohu, et al.
Published: (2025) -
iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation
by: Fu, Zhoujie, et al.
Published: (2025)