DreamVE: Unified Instruction-based Image and Video Editing
Fuente:
arXiv
Saved in:
| Main Authors: | Xia, Bin, Liu, Jiyang, Zhang, Yuechen, Peng, Bohao, Chu, Ruihang, Wang, Yitong, Wu, Xinglong, Yu, Bei, Jia, Jiaya |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DreamOmni: Unified Image Generation and Editing
by: Xia, Bin, et al.
Published: (2024)
by: Xia, Bin, et al.
Published: (2024)
DreamOmni2: Multimodal Instruction-based Editing and Generation
by: Xia, Bin, et al.
Published: (2025)
by: Xia, Bin, et al.
Published: (2025)
DreamOmni3: Scribble-based Editing and Generation
by: Xia, Bin, et al.
Published: (2025)
by: Xia, Bin, et al.
Published: (2025)
RePlan: Reasoning-guided Region Planning for Complex Instruction-based Image Editing
by: Qu, Tianyuan, et al.
Published: (2025)
by: Qu, Tianyuan, et al.
Published: (2025)
MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers
by: Zhang, Yuechen, et al.
Published: (2025)
by: Zhang, Yuechen, et al.
Published: (2025)
ControlNeXt: Powerful and Efficient Control for Image and Video Generation
by: Peng, Bohao, et al.
Published: (2024)
by: Peng, Bohao, et al.
Published: (2024)
Prompt Highlighter: Interactive Control for Multi-Modal LLMs
by: Zhang, Yuechen, et al.
Published: (2023)
by: Zhang, Yuechen, et al.
Published: (2023)
Training-Free Efficient Video Generation via Dynamic Token Carving
by: Zhang, Yuechen, et al.
Published: (2025)
by: Zhang, Yuechen, et al.
Published: (2025)
Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?
by: Qu, Tianyuan, et al.
Published: (2025)
by: Qu, Tianyuan, et al.
Published: (2025)
VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning
by: Liu, Yuqi, et al.
Published: (2025)
by: Liu, Yuqi, et al.
Published: (2025)
DreamShot: Personalized Storyboard Synthesis with Video Diffusion Prior
by: Huang, Junjia, et al.
Published: (2026)
by: Huang, Junjia, et al.
Published: (2026)
LLMGA: Multimodal Large Language Model based Generation Assistant
by: Xia, Bin, et al.
Published: (2023)
by: Xia, Bin, et al.
Published: (2023)
DreamLayer: Simultaneous Multi-Layer Generation via Diffusion Mode
by: Huang, Junjia, et al.
Published: (2025)
by: Huang, Junjia, et al.
Published: (2025)
UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation
by: Huang, Jiehui, et al.
Published: (2025)
by: Huang, Jiehui, et al.
Published: (2025)
Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models
by: Li, Yanwei, et al.
Published: (2024)
by: Li, Yanwei, et al.
Published: (2024)
DreamFuse: Adaptive Image Fusion with Diffusion Transformer
by: Huang, Junjia, et al.
Published: (2025)
by: Huang, Junjia, et al.
Published: (2025)
DreamLight: Towards Harmonious and Consistent Image Relighting
by: Liu, Yong, et al.
Published: (2025)
by: Liu, Yong, et al.
Published: (2025)
O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing
by: Chen, Yuqing, et al.
Published: (2025)
by: Chen, Yuqing, et al.
Published: (2025)
DreamPoster: A Unified Framework for Image-Conditioned Generative Poster Design
by: Hu, Xiwei, et al.
Published: (2025)
by: Hu, Xiwei, et al.
Published: (2025)
Exploiting Discriminative Codebook Prior for Autoregressive Image Generation
by: Tang, Longxiang, et al.
Published: (2025)
by: Tang, Longxiang, et al.
Published: (2025)
MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech
by: Wang, Chengyao, et al.
Published: (2025)
by: Wang, Chengyao, et al.
Published: (2025)
DiVE: DiT-based Video Generation with Enhanced Control
by: Jiang, Junpeng, et al.
Published: (2024)
by: Jiang, Junpeng, et al.
Published: (2024)
DreamO: A Unified Framework for Image Customization
by: Mou, Chong, et al.
Published: (2025)
by: Mou, Chong, et al.
Published: (2025)
OneReward: Unified Mask-Guided Image Generation via Multi-Task Human Preference Learning
by: Gong, Yuan, et al.
Published: (2025)
by: Gong, Yuan, et al.
Published: (2025)
OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-Guided Video Editing
by: He, Haoyang, et al.
Published: (2025)
by: He, Haoyang, et al.
Published: (2025)
GRADEO: Towards Human-Like Evaluation for Text-to-Video Generation via Multi-Step Reasoning
by: Mou, Zhun, et al.
Published: (2025)
by: Mou, Zhun, et al.
Published: (2025)
OA-CNNs: Omni-Adaptive Sparse CNNs for 3D Semantic Segmentation
by: Peng, Bohao, et al.
Published: (2024)
by: Peng, Bohao, et al.
Published: (2024)
GroupContrast: Semantic-aware Self-supervised Representation Learning for 3D Understanding
by: Wang, Chengyao, et al.
Published: (2024)
by: Wang, Chengyao, et al.
Published: (2024)
High Quality Segmentation for Ultra High-resolution Images
by: Shen, Tiancheng, et al.
Published: (2021)
by: Shen, Tiancheng, et al.
Published: (2021)
DreamLite: A Lightweight On-Device Unified Model for Image Generation and Editing
by: Feng, Kailai, et al.
Published: (2026)
by: Feng, Kailai, et al.
Published: (2026)
LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing
by: Wang, Weicheng, et al.
Published: (2026)
by: Wang, Weicheng, et al.
Published: (2026)
Boosting Fidelity for Pre-Trained-Diffusion-Based Low-Light Image Enhancement via Condition Refinement
by: Xu, Xiaogang, et al.
Published: (2025)
by: Xu, Xiaogang, et al.
Published: (2025)
FluencyVE: Marrying Temporal-Aware Mamba with Bypass Attention for Video Editing
by: Cai, Mingshu, et al.
Published: (2025)
by: Cai, Mingshu, et al.
Published: (2025)
Uni-Neur2Img: Unified Neural Signal-Guided Image Generation, Editing, and Stylization via Diffusion Transformers
by: Bai, Xiyue, et al.
Published: (2025)
by: Bai, Xiyue, et al.
Published: (2025)
Empowering Visual Creativity: A Vision-Language Assistant to Image Editing Recommendations
by: Shen, Tiancheng, et al.
Published: (2024)
by: Shen, Tiancheng, et al.
Published: (2024)
LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model
by: Yang, Senqiao, et al.
Published: (2023)
by: Yang, Senqiao, et al.
Published: (2023)
VCoME: Verbal Video Composition with Multimodal Editing Effects
by: Gong, Weibo, et al.
Published: (2024)
by: Gong, Weibo, et al.
Published: (2024)
Unified Language-driven Zero-shot Domain Adaptation
by: Yang, Senqiao, et al.
Published: (2024)
by: Yang, Senqiao, et al.
Published: (2024)
FiVE: A Fine-grained Video Editing Benchmark for Evaluating Emerging Diffusion and Rectified Flow Models
by: Li, Minghan, et al.
Published: (2025)
by: Li, Minghan, et al.
Published: (2025)
DreamColour: Controllable Video Colour Editing without Training
by: Utintu, Chaitat, et al.
Published: (2024)
by: Utintu, Chaitat, et al.
Published: (2024)
Similar Items
-
DreamOmni: Unified Image Generation and Editing
by: Xia, Bin, et al.
Published: (2024) -
DreamOmni2: Multimodal Instruction-based Editing and Generation
by: Xia, Bin, et al.
Published: (2025) -
DreamOmni3: Scribble-based Editing and Generation
by: Xia, Bin, et al.
Published: (2025) -
RePlan: Reasoning-guided Region Planning for Complex Instruction-based Image Editing
by: Qu, Tianyuan, et al.
Published: (2025) -
MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers
by: Zhang, Yuechen, et al.
Published: (2025)