The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | He, Qingdong, Chen, Xueqin, Pan, Yanjie, Tang, Peng, Xu, Pengcheng, Gan, Zhenye, Wang, Chengjie, Hu, Xiaobin, Zhang, Jiangning, Wang, Yabiao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning
par: He, Qingdong, et autres
Publié: (2025)
par: He, Qingdong, et autres
Publié: (2025)
FitDiT: Advancing the Authentic Garment Details for High-fidelity Virtual Try-on
par: Jiang, Boyuan, et autres
Publié: (2024)
par: Jiang, Boyuan, et autres
Publié: (2024)
Once Is Enough: Lightweight DiT-Based Video Virtual Try-On via One-Time Garment Appearance Injection
par: Pan, Yanjie, et autres
Publié: (2025)
par: Pan, Yanjie, et autres
Publié: (2025)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
par: Cai, Yuxuan, et autres
Publié: (2025)
par: Cai, Yuxuan, et autres
Publié: (2025)
PixelPonder: Dynamic Patch Adaptation for Enhanced Multi-Conditional Text-to-Image Generation
par: Pan, Yanjie, et autres
Publié: (2025)
par: Pan, Yanjie, et autres
Publié: (2025)
A Comprehensive Library for Benchmarking Multi-class Visual Anomaly Detection
par: Zhang, Jiangning, et autres
Publié: (2024)
par: Zhang, Jiangning, et autres
Publié: (2024)
Transform Trained Transformer: Accelerating Naive 4K Video Generation Over 10$\times$
par: Zhang, Jiangning, et autres
Publié: (2025)
par: Zhang, Jiangning, et autres
Publié: (2025)
PointRWKV: Efficient RWKV-Like Model for Hierarchical Point Cloud Learning
par: He, Qingdong, et autres
Publié: (2024)
par: He, Qingdong, et autres
Publié: (2024)
UniCombine: Unified Multi-Conditional Combination with Diffusion Transformer
par: Wang, Haoxuan, et autres
Publié: (2025)
par: Wang, Haoxuan, et autres
Publié: (2025)
MobileMamba: Lightweight Multi-Receptive Visual Mamba Network
par: He, Haoyang, et autres
Publié: (2024)
par: He, Haoyang, et autres
Publié: (2024)
DynamicControl: Adaptive Condition Selection for Improved Text-to-Image Generation
par: He, Qingdong, et autres
Publié: (2024)
par: He, Qingdong, et autres
Publié: (2024)
VTBench: Comprehensive Benchmark Suite Towards Real-World Virtual Try-on Models
par: Xiaobin, Hu, et autres
Publié: (2025)
par: Xiaobin, Hu, et autres
Publié: (2025)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
par: Chen, Yuheng, et autres
Publié: (2026)
par: Chen, Yuheng, et autres
Publié: (2026)
DMAD: Dual Memory Bank for Real-World Anomaly Detection
par: Hu, Jianlong, et autres
Publié: (2024)
par: Hu, Jianlong, et autres
Publié: (2024)
MARRS: Masked Autoregressive Unit-based Reaction Synthesis
par: Wang, Yabiao, et autres
Publié: (2025)
par: Wang, Yabiao, et autres
Publié: (2025)
MambaAD: Exploring State Space Models for Multi-class Unsupervised Anomaly Detection
par: He, Haoyang, et autres
Publié: (2024)
par: He, Haoyang, et autres
Publié: (2024)
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
par: Jin, Yizhang, et autres
Publié: (2024)
par: Jin, Yizhang, et autres
Publié: (2024)
PointSeg: A Training-Free Paradigm for 3D Scene Segmentation via Foundation Models
par: He, Qingdong, et autres
Publié: (2024)
par: He, Qingdong, et autres
Publié: (2024)
UniM-OV3D: Uni-Modality Open-Vocabulary 3D Scene Understanding with Fine-Grained Feature Representation
par: He, Qingdong, et autres
Publié: (2024)
par: He, Qingdong, et autres
Publié: (2024)
Unveil Inversion and Invariance in Flow Transformer for Versatile Image Editing
par: Xu, Pengcheng, et autres
Publié: (2024)
par: Xu, Pengcheng, et autres
Publié: (2024)
CLEAR: Context-Aware Learning with End-to-End Mask-Free Inference for Adaptive Video Subtitle Removal
par: He, Qingdong, et autres
Publié: (2026)
par: He, Qingdong, et autres
Publié: (2026)
Open-Vocabulary SAM3D: Towards Training-free Open-Vocabulary 3D Scene Understanding
par: Tai, Hanchen, et autres
Publié: (2024)
par: Tai, Hanchen, et autres
Publié: (2024)
Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
par: Liu, Yuansen, et autres
Publié: (2025)
par: Liu, Yuansen, et autres
Publié: (2025)
IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment
par: Chen, Yinan, et autres
Publié: (2025)
par: Chen, Yinan, et autres
Publié: (2025)
Collaborative Face Experts Fusion in Video Generation: Boosting Identity Consistency Across Large Face Poses
par: Wang, Yuji, et autres
Publié: (2025)
par: Wang, Yuji, et autres
Publié: (2025)
Identity-Preserving Text-to-Video Generation Guided by Simple yet Effective Spatial-Temporal Decoupled Representations
par: Wang, Yuji, et autres
Publié: (2025)
par: Wang, Yuji, et autres
Publié: (2025)
CrossVTON: Mimicking the Logic Reasoning on Cross-category Virtual Try-on guided by Tri-zone Priors
par: Luo, Donghao, et autres
Publié: (2025)
par: Luo, Donghao, et autres
Publié: (2025)
Towards Generalized Multi-Image Editing for Unified Multimodal Models
par: Xu, Pengcheng, et autres
Publié: (2026)
par: Xu, Pengcheng, et autres
Publié: (2026)
RoleRMBench & RoleRM: Towards Reward Modeling for Profile-Based Role Play in Dialogue Systems
par: Ding, Hang, et autres
Publié: (2025)
par: Ding, Hang, et autres
Publié: (2025)
PiT: Progressive Diffusion Transformer
par: Wu, Jiafu, et autres
Publié: (2025)
par: Wu, Jiafu, et autres
Publié: (2025)
FFP-300K: Scaling First-Frame Propagation for Generalizable Video Editing
par: Huang, Xijie, et autres
Publié: (2026)
par: Huang, Xijie, et autres
Publié: (2026)
Leveraging Fine-Grained Information and Noise Decoupling for Remote Sensing Change Detection
par: Du, Qiangang, et autres
Publié: (2024)
par: Du, Qiangang, et autres
Publié: (2024)
TokenAR: Multiple Subject Generation via Autoregressive Token-level enhancement
par: Sun, Haiyue, et autres
Publié: (2025)
par: Sun, Haiyue, et autres
Publié: (2025)
AdapNet: Adaptive Noise-Based Network for Low-Quality Image Retrieval
par: Zhang, Sihe, et autres
Publié: (2024)
par: Zhang, Sihe, et autres
Publié: (2024)
UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions
par: Xue, Zhucun, et autres
Publié: (2025)
par: Xue, Zhucun, et autres
Publié: (2025)
Mamba-YOLO-World: Marrying YOLO-World with Mamba for Open-Vocabulary Detection
par: Wang, Haoxuan, et autres
Publié: (2024)
par: Wang, Haoxuan, et autres
Publié: (2024)
Semantic Frame Interpolation
par: Hong, Yijia, et autres
Publié: (2025)
par: Hong, Yijia, et autres
Publié: (2025)
PSPU: Enhanced Positive and Unlabeled Learning by Leveraging Pseudo Supervision
par: Wang, Chengjie, et autres
Publié: (2024)
par: Wang, Chengjie, et autres
Publié: (2024)
Towards One-step Causal Video Generation via Adversarial Self-Distillation
par: Yang, Yongqi, et autres
Publié: (2025)
par: Yang, Yongqi, et autres
Publié: (2025)
PVG: Progressive Vision Graph for Vision Recognition
par: Wu, Jiafu, et autres
Publié: (2023)
par: Wu, Jiafu, et autres
Publié: (2023)
Documents similaires
-
Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning
par: He, Qingdong, et autres
Publié: (2025) -
FitDiT: Advancing the Authentic Garment Details for High-fidelity Virtual Try-on
par: Jiang, Boyuan, et autres
Publié: (2024) -
Once Is Enough: Lightweight DiT-Based Video Virtual Try-On via One-Time Garment Appearance Injection
par: Pan, Yanjie, et autres
Publié: (2025) -
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
par: Cai, Yuxuan, et autres
Publié: (2025) -
PixelPonder: Dynamic Patch Adaptation for Enhanced Multi-Conditional Text-to-Image Generation
par: Pan, Yanjie, et autres
Publié: (2025)