Guardado en:
| Autores principales: | Zhao, Shifang, Hu, Yihan, Shan, Ying, Wei, Yunchao, Cun, Xiaodong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2603.29664 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
EasyOmnimatte: Taming Pretrained Inpainting Diffusion Models for End-to-End Video Layered Decomposition
por: Hu, Yihan, et al.
Publicado: (2025)
por: Hu, Yihan, et al.
Publicado: (2025)
OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning
por: Zhao, Shifang, et al.
Publicado: (2025)
por: Zhao, Shifang, et al.
Publicado: (2025)
DCEdit: Dual-Level Controlled Image Editing via Precisely Localized Semantics
por: Hu, Yihan, et al.
Publicado: (2025)
por: Hu, Yihan, et al.
Publicado: (2025)
DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos
por: Hu, Wenbo, et al.
Publicado: (2024)
por: Hu, Wenbo, et al.
Publicado: (2024)
ZeroSmooth: Training-free Diffuser Adaptation for High Frame Rate Video Generation
por: Yang, Shaoshu, et al.
Publicado: (2024)
por: Yang, Shaoshu, et al.
Publicado: (2024)
MOFA-Video: Controllable Image Animation via Generative Motion Field Adaptions in Frozen Image-to-Video Diffusion Model
por: Niu, Muyao, et al.
Publicado: (2024)
por: Niu, Muyao, et al.
Publicado: (2024)
Learning Trimaps via Clicks for Image Matting
por: Zhang, Chenyi, et al.
Publicado: (2024)
por: Zhang, Chenyi, et al.
Publicado: (2024)
MagicStick: Controllable Video Editing via Control Handle Transformations
por: Ma, Yue, et al.
Publicado: (2023)
por: Ma, Yue, et al.
Publicado: (2023)
AlignGen: Boosting Personalized Image Generation with Cross-Modality Prior Alignment
por: Lin, Yiheng, et al.
Publicado: (2025)
por: Lin, Yiheng, et al.
Publicado: (2025)
VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models
por: Chen, Haoxin, et al.
Publicado: (2024)
por: Chen, Haoxin, et al.
Publicado: (2024)
GenCompositor: Generative Video Compositing with Diffusion Transformer
por: Yang, Shuzhou, et al.
Publicado: (2025)
por: Yang, Shuzhou, et al.
Publicado: (2025)
Diffusion for Natural Image Matting
por: Hu, Yihan, et al.
Publicado: (2023)
por: Hu, Yihan, et al.
Publicado: (2023)
Follow Your Pose: Pose-Guided Text-to-Video Generation using Pose-Free Videos
por: Ma, Yue, et al.
Publicado: (2023)
por: Ma, Yue, et al.
Publicado: (2023)
VideoMaker: Zero-shot Customized Video Generation with the Inherent Force of Video Diffusion Models
por: Wu, Tao, et al.
Publicado: (2024)
por: Wu, Tao, et al.
Publicado: (2024)
CV-VAE: A Compatible Video VAE for Latent Generative Video Models
por: Zhao, Sijie, et al.
Publicado: (2024)
por: Zhao, Sijie, et al.
Publicado: (2024)
VAU-R1: Advancing Video Anomaly Understanding via Reinforcement Fine-Tuning
por: Zhu, Liyun, et al.
Publicado: (2025)
por: Zhu, Liyun, et al.
Publicado: (2025)
FairyGen: Storied Cartoon Video from a Single Child-Drawn Character
por: Zheng, Jiayi, et al.
Publicado: (2025)
por: Zheng, Jiayi, et al.
Publicado: (2025)
EF-VI: Enhancing End-Frame Injection for Video Inbetweening
por: Chen, Liuhan, et al.
Publicado: (2025)
por: Chen, Liuhan, et al.
Publicado: (2025)
MV-Performer: Taming Video Diffusion Model for Faithful and Synchronized Multi-view Performer Synthesis
por: Zhi, Yihao, et al.
Publicado: (2025)
por: Zhi, Yihao, et al.
Publicado: (2025)
StereoCrafter: Diffusion-based Generation of Long and High-fidelity Stereoscopic 3D from Monocular Videos
por: Zhao, Sijie, et al.
Publicado: (2024)
por: Zhao, Sijie, et al.
Publicado: (2024)
LightCtrl: Training-free Controllable Video Relighting
por: Peng, Yizuo, et al.
Publicado: (2026)
por: Peng, Yizuo, et al.
Publicado: (2026)
DCI: Dual-Conditional Inversion for Boosting Diffusion-Based Image Editing
por: Li, Zixiang, et al.
Publicado: (2025)
por: Li, Zixiang, et al.
Publicado: (2025)
GenClaw: Code-Driven Agentic Image Generation
por: Ye, Junyan, et al.
Publicado: (2026)
por: Ye, Junyan, et al.
Publicado: (2026)
BlobCtrl: Taming Controllable Blob for Element-level Image Editing
por: Li, Yaowei, et al.
Publicado: (2025)
por: Li, Yaowei, et al.
Publicado: (2025)
EvalCrafter: Benchmarking and Evaluating Large Video Generation Models
por: Liu, Yaofang, et al.
Publicado: (2023)
por: Liu, Yaofang, et al.
Publicado: (2023)
Noise Calibration: Plug-and-play Content-Preserving Video Enhancement using Pre-trained Video Diffusion Models
por: Yang, Qinyu, et al.
Publicado: (2024)
por: Yang, Qinyu, et al.
Publicado: (2024)
DepthSync: Diffusion Guidance-Based Depth Synchronization for Scale- and Geometry-Consistent Video Depth Estimation
por: Dong, Yue-Jiang, et al.
Publicado: (2025)
por: Dong, Yue-Jiang, et al.
Publicado: (2025)
ARC-Chapter: Structuring Hour-Long Videos into Navigable Chapters and Hierarchical Summaries
por: Pu, Junfu, et al.
Publicado: (2025)
por: Pu, Junfu, et al.
Publicado: (2025)
Memory Efficient Matting with Adaptive Token Routing
por: Lin, Yiheng, et al.
Publicado: (2024)
por: Lin, Yiheng, et al.
Publicado: (2024)
Rolling Forcing: Autoregressive Long Video Diffusion in Real Time
por: Liu, Kunhao, et al.
Publicado: (2025)
por: Liu, Kunhao, et al.
Publicado: (2025)
Mobius: Text to Seamless Looping Video Generation via Latent Shift
por: Bi, Xiuli, et al.
Publicado: (2025)
por: Bi, Xiuli, et al.
Publicado: (2025)
CustomTTT: Motion and Appearance Customized Video Generation via Test-Time Training
por: Bi, Xiuli, et al.
Publicado: (2024)
por: Bi, Xiuli, et al.
Publicado: (2024)
4DVD: Cascaded Dense-view Video Diffusion Model for High-quality 4D Content Generation
por: Yang, Shuzhou, et al.
Publicado: (2025)
por: Yang, Shuzhou, et al.
Publicado: (2025)
DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation
por: Cai, Minghong, et al.
Publicado: (2024)
por: Cai, Minghong, et al.
Publicado: (2024)
VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding
por: He, Haichen, et al.
Publicado: (2026)
por: He, Haichen, et al.
Publicado: (2026)
On Exact Editing of Flow-Based Diffusion Models
por: Li, Zixiang, et al.
Publicado: (2025)
por: Li, Zixiang, et al.
Publicado: (2025)
Making Image Editing Easier via Adaptive Task Reformulation with Agentic Executions
por: Zhao, Bo, et al.
Publicado: (2026)
por: Zhao, Bo, et al.
Publicado: (2026)
Towards A Better Metric for Text-to-Video Generation
por: Wu, Jay Zhangjie, et al.
Publicado: (2024)
por: Wu, Jay Zhangjie, et al.
Publicado: (2024)
PAD-F: Prior-Aware Debiasing Framework for Long-Tailed X-ray Prohibited Item Detection
por: Wang, Haoyu, et al.
Publicado: (2024)
por: Wang, Haoyu, et al.
Publicado: (2024)
AnchorSync: Global Consistency Optimization for Long Video Editing
por: Liu, Zichi, et al.
Publicado: (2025)
por: Liu, Zichi, et al.
Publicado: (2025)
Ejemplares similares
-
EasyOmnimatte: Taming Pretrained Inpainting Diffusion Models for End-to-End Video Layered Decomposition
por: Hu, Yihan, et al.
Publicado: (2025) -
OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning
por: Zhao, Shifang, et al.
Publicado: (2025) -
DCEdit: Dual-Level Controlled Image Editing via Precisely Localized Semantics
por: Hu, Yihan, et al.
Publicado: (2025) -
DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos
por: Hu, Wenbo, et al.
Publicado: (2024) -
ZeroSmooth: Training-free Diffuser Adaptation for High Frame Rate Video Generation
por: Yang, Shaoshu, et al.
Publicado: (2024)