FFP-300K: Scaling First-Frame Propagation for Generalizable Video Editing
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Xijie, Xu, Chengming, Luo, Donghao, Hu, Xiaobin, Tang, Peng, Peng, Xu, Zhang, Jiangning, Wang, Chengjie, Fu, Yanwei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ArtWeaver: Advanced Dynamic Style Integration via Diffusion Model
por: Xu, Chengming, et al.
Publicado: (2024)
por: Xu, Chengming, et al.
Publicado: (2024)
What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing
por: Lin, Hangyu, et al.
Publicado: (2026)
por: Lin, Hangyu, et al.
Publicado: (2026)
FitDiT: Advancing the Authentic Garment Details for High-fidelity Virtual Try-on
por: Jiang, Boyuan, et al.
Publicado: (2024)
por: Jiang, Boyuan, et al.
Publicado: (2024)
VTBench: Comprehensive Benchmark Suite Towards Real-World Virtual Try-on Models
por: Xiaobin, Hu, et al.
Publicado: (2025)
por: Xiaobin, Hu, et al.
Publicado: (2025)
CrossVTON: Mimicking the Logic Reasoning on Cross-category Virtual Try-on guided by Tri-zone Priors
por: Luo, Donghao, et al.
Publicado: (2025)
por: Luo, Donghao, et al.
Publicado: (2025)
Towards One-step Causal Video Generation via Adversarial Self-Distillation
por: Yang, Yongqi, et al.
Publicado: (2025)
por: Yang, Yongqi, et al.
Publicado: (2025)
CustAny: Customizing Anything from A Single Example
por: Kong, Lingjie, et al.
Publicado: (2024)
por: Kong, Lingjie, et al.
Publicado: (2024)
SwiftVideo: A Unified Framework for Few-Step Video Generation through Trajectory-Distribution Alignment
por: Sun, Yanxiao, et al.
Publicado: (2025)
por: Sun, Yanxiao, et al.
Publicado: (2025)
StrandDesigner: Towards Practical Strand Generation with Sketch Guidance
por: Zhang, Na, et al.
Publicado: (2025)
por: Zhang, Na, et al.
Publicado: (2025)
Towards Generalized Multi-Image Editing for Unified Multimodal Models
por: Xu, Pengcheng, et al.
Publicado: (2026)
por: Xu, Pengcheng, et al.
Publicado: (2026)
Transform Trained Transformer: Accelerating Naive 4K Video Generation Over 10$\times$
por: Zhang, Jiangning, et al.
Publicado: (2025)
por: Zhang, Jiangning, et al.
Publicado: (2025)
Unveil Inversion and Invariance in Flow Transformer for Versatile Image Editing
por: Xu, Pengcheng, et al.
Publicado: (2024)
por: Xu, Pengcheng, et al.
Publicado: (2024)
When Preferences Diverge: Aligning Diffusion Models with Minority-Aware Adaptive DPO
por: Zhang, Lingfan, et al.
Publicado: (2025)
por: Zhang, Lingfan, et al.
Publicado: (2025)
DiffuMatting: Synthesizing Arbitrary Objects with Matting-level Annotation
por: Hu, Xiaobin, et al.
Publicado: (2024)
por: Hu, Xiaobin, et al.
Publicado: (2024)
DiffFAE: Advancing High-fidelity One-shot Facial Appearance Editing with Space-sensitive Customization and Semantic Preservation
por: Wang, Qilin, et al.
Publicado: (2024)
por: Wang, Qilin, et al.
Publicado: (2024)
VividPose: Advancing Stable Video Diffusion for Realistic Human Image Animation
por: Wang, Qilin, et al.
Publicado: (2024)
por: Wang, Qilin, et al.
Publicado: (2024)
SVFR: A Unified Framework for Generalized Video Face Restoration
por: Wang, Zhiyao, et al.
Publicado: (2025)
por: Wang, Zhiyao, et al.
Publicado: (2025)
Exploring Real&Synthetic Dataset and Linear Attention in Image Restoration
por: Du, Yuzhen, et al.
Publicado: (2024)
por: Du, Yuzhen, et al.
Publicado: (2024)
DynamicControl: Adaptive Condition Selection for Improved Text-to-Image Generation
por: He, Qingdong, et al.
Publicado: (2024)
por: He, Qingdong, et al.
Publicado: (2024)
Collaborative Face Experts Fusion in Video Generation: Boosting Identity Consistency Across Large Face Poses
por: Wang, Yuji, et al.
Publicado: (2025)
por: Wang, Yuji, et al.
Publicado: (2025)
The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection
por: He, Qingdong, et al.
Publicado: (2025)
por: He, Qingdong, et al.
Publicado: (2025)
Disentangle Identity, Cooperate Emotion: Correlation-Aware Emotional Talking Portrait Generation
por: Tan, Weipeng, et al.
Publicado: (2025)
por: Tan, Weipeng, et al.
Publicado: (2025)
IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment
por: Chen, Yinan, et al.
Publicado: (2025)
por: Chen, Yinan, et al.
Publicado: (2025)
Semantic Frame Interpolation
por: Hong, Yijia, et al.
Publicado: (2025)
por: Hong, Yijia, et al.
Publicado: (2025)
Robust Network Learning via Inverse Scale Variational Sparsification
por: Zhou, Zhiling, et al.
Publicado: (2024)
por: Zhou, Zhiling, et al.
Publicado: (2024)
Soul: Breathe Life into Digital Human for High-fidelity Long-term Multimodal Animation
por: Zhang, Jiangning, et al.
Publicado: (2025)
por: Zhang, Jiangning, et al.
Publicado: (2025)
DVHGNN: Multi-Scale Dilated Vision HGNN for Efficient Vision Recognition
por: Li, Caoshuo, et al.
Publicado: (2025)
por: Li, Caoshuo, et al.
Publicado: (2025)
Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
por: Liu, Yuansen, et al.
Publicado: (2025)
por: Liu, Yuansen, et al.
Publicado: (2025)
Visual Document Understanding and Reasoning: A Multi-Agent Collaboration Framework with Agent-Wise Adaptive Test-Time Scaling
por: Yu, Xinlei, et al.
Publicado: (2025)
por: Yu, Xinlei, et al.
Publicado: (2025)
Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning
por: He, Qingdong, et al.
Publicado: (2025)
por: He, Qingdong, et al.
Publicado: (2025)
TRACE: Object Motion Editing in Videos with First-Frame Trajectory Guidance
por: Phung, Quynh, et al.
Publicado: (2026)
por: Phung, Quynh, et al.
Publicado: (2026)
PointSeg: A Training-Free Paradigm for 3D Scene Segmentation via Foundation Models
por: He, Qingdong, et al.
Publicado: (2024)
por: He, Qingdong, et al.
Publicado: (2024)
SVP: Style-Enhanced Vivid Portrait Talking Head Diffusion Model
por: Tan, Weipeng, et al.
Publicado: (2024)
por: Tan, Weipeng, et al.
Publicado: (2024)
Sonic: Shifting Focus to Global Audio Perception in Portrait Animation
por: Ji, Xiaozhong, et al.
Publicado: (2024)
por: Ji, Xiaozhong, et al.
Publicado: (2024)
TokenAR: Multiple Subject Generation via Autoregressive Token-level enhancement
por: Sun, Haiyue, et al.
Publicado: (2025)
por: Sun, Haiyue, et al.
Publicado: (2025)
Towards Global Optimal Visual In-Context Learning Prompt Selection
por: Xu, Chengming, et al.
Publicado: (2024)
por: Xu, Chengming, et al.
Publicado: (2024)
EditCast3D: Single-Frame-Guided 3D Editing with Video Propagation and View Selection
por: Qu, Huaizhi, et al.
Publicado: (2025)
por: Qu, Huaizhi, et al.
Publicado: (2025)
VTON-HandFit: Virtual Try-on for Arbitrary Hand Pose Guided by Hand Priors Embedding
por: Liang, Yujie, et al.
Publicado: (2024)
por: Liang, Yujie, et al.
Publicado: (2024)
Enhancing Video Inpainting with Aligned Frame Interval Guidance
por: Xie, Ming, et al.
Publicado: (2025)
por: Xie, Ming, et al.
Publicado: (2025)
EDEN: Enhanced Diffusion for High-quality Large-motion Video Frame Interpolation
por: Zhang, Zihao, et al.
Publicado: (2025)
por: Zhang, Zihao, et al.
Publicado: (2025)
Ejemplares similares
-
ArtWeaver: Advanced Dynamic Style Integration via Diffusion Model
por: Xu, Chengming, et al.
Publicado: (2024) -
What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing
por: Lin, Hangyu, et al.
Publicado: (2026) -
FitDiT: Advancing the Authentic Garment Details for High-fidelity Virtual Try-on
por: Jiang, Boyuan, et al.
Publicado: (2024) -
VTBench: Comprehensive Benchmark Suite Towards Real-World Virtual Try-on Models
por: Xiaobin, Hu, et al.
Publicado: (2025) -
CrossVTON: Mimicking the Logic Reasoning on Cross-category Virtual Try-on guided by Tri-zone Priors
por: Luo, Donghao, et al.
Publicado: (2025)