Enregistré dans:
| Auteurs principaux: | Du, Yuzhen, Hu, Teng, Zhang, Jiangning, Xu, Ran Yi Chengming, Hu, Xiaobin, Wu, Kai, Luo, Donghao, Wang, Yabiao, Ma, Lizhuang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2412.03814 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SaRA: High-Efficient Diffusion Model Fine-tuning with Progressive Sparse Low-Rank Adaptation
par: Hu, Teng, et autres
Publié: (2024)
par: Hu, Teng, et autres
Publié: (2024)
Collaborative Face Experts Fusion in Video Generation: Boosting Identity Consistency Across Large Face Poses
par: Wang, Yuji, et autres
Publié: (2025)
par: Wang, Yuji, et autres
Publié: (2025)
AnomalyDiffusion: Few-Shot Anomaly Image Generation with Diffusion Model
par: Hu, Teng, et autres
Publié: (2023)
par: Hu, Teng, et autres
Publié: (2023)
Improving Autoregressive Visual Generation with Cluster-Oriented Token Prediction
par: Hu, Teng, et autres
Publié: (2025)
par: Hu, Teng, et autres
Publié: (2025)
MotionMaster: Training-free Camera Motion Transfer For Video Generation
par: Hu, Teng, et autres
Publié: (2024)
par: Hu, Teng, et autres
Publié: (2024)
ArtWeaver: Advanced Dynamic Style Integration via Diffusion Model
par: Xu, Chengming, et autres
Publié: (2024)
par: Xu, Chengming, et autres
Publié: (2024)
IAR2: Improving Autoregressive Visual Generation with Semantic-Detail Associated Token Prediction
par: Yi, Ran, et autres
Publié: (2025)
par: Yi, Ran, et autres
Publié: (2025)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
par: Chen, Yuheng, et autres
Publié: (2026)
par: Chen, Yuheng, et autres
Publié: (2026)
Identity-Preserving Text-to-Video Generation Guided by Simple yet Effective Spatial-Temporal Decoupled Representations
par: Wang, Yuji, et autres
Publié: (2025)
par: Wang, Yuji, et autres
Publié: (2025)
Semantic Frame Interpolation
par: Hong, Yijia, et autres
Publié: (2025)
par: Hong, Yijia, et autres
Publié: (2025)
Transform Trained Transformer: Accelerating Naive 4K Video Generation Over 10$\times$
par: Zhang, Jiangning, et autres
Publié: (2025)
par: Zhang, Jiangning, et autres
Publié: (2025)
InstanceV: Instance-Level Video Generation
par: Chen, Yuheng, et autres
Publié: (2025)
par: Chen, Yuheng, et autres
Publié: (2025)
FFP-300K: Scaling First-Frame Propagation for Generalizable Video Editing
par: Huang, Xijie, et autres
Publié: (2026)
par: Huang, Xijie, et autres
Publié: (2026)
DynamicControl: Adaptive Condition Selection for Improved Text-to-Image Generation
par: He, Qingdong, et autres
Publié: (2024)
par: He, Qingdong, et autres
Publié: (2024)
UltraGen: High-Resolution Video Generation with Hierarchical Attention
par: Hu, Teng, et autres
Publié: (2025)
par: Hu, Teng, et autres
Publié: (2025)
Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations
par: Zhang, Tong, et autres
Publié: (2026)
par: Zhang, Tong, et autres
Publié: (2026)
CustAny: Customizing Anything from A Single Example
par: Kong, Lingjie, et autres
Publié: (2024)
par: Kong, Lingjie, et autres
Publié: (2024)
FitDiT: Advancing the Authentic Garment Details for High-fidelity Virtual Try-on
par: Jiang, Boyuan, et autres
Publié: (2024)
par: Jiang, Boyuan, et autres
Publié: (2024)
VTBench: Comprehensive Benchmark Suite Towards Real-World Virtual Try-on Models
par: Xiaobin, Hu, et autres
Publié: (2025)
par: Xiaobin, Hu, et autres
Publié: (2025)
A$^\text{T}$A: Adaptive Transformation Agent for Text-Guided Subject-Position Variable Background Inpainting
par: Tang, Yizhe, et autres
Publié: (2025)
par: Tang, Yizhe, et autres
Publié: (2025)
Textual Decomposition Then Sub-motion-space Scattering for Open-Vocabulary Motion Generation
par: Fan, Ke, et autres
Publié: (2024)
par: Fan, Ke, et autres
Publié: (2024)
SVFR: A Unified Framework for Generalized Video Face Restoration
par: Wang, Zhiyao, et autres
Publié: (2025)
par: Wang, Zhiyao, et autres
Publié: (2025)
UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy
par: Xu, Yicheng, et autres
Publié: (2026)
par: Xu, Yicheng, et autres
Publié: (2026)
Towards One-step Causal Video Generation via Adversarial Self-Distillation
par: Yang, Yongqi, et autres
Publié: (2025)
par: Yang, Yongqi, et autres
Publié: (2025)
Image Inversion: A Survey from GANs to Diffusion and Beyond
par: Chen, Yinan, et autres
Publié: (2025)
par: Chen, Yinan, et autres
Publié: (2025)
IRPO: Boosting Image Restoration via Post-training GRPO
par: Xu, Haoxuan, et autres
Publié: (2025)
par: Xu, Haoxuan, et autres
Publié: (2025)
Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation
par: Chen, Yuheng, et autres
Publié: (2026)
par: Chen, Yuheng, et autres
Publié: (2026)
Unveil Inversion and Invariance in Flow Transformer for Versatile Image Editing
par: Xu, Pengcheng, et autres
Publié: (2024)
par: Xu, Pengcheng, et autres
Publié: (2024)
From Physical Degradation Models to Task-Aware All-in-One Image Restoration
par: Gao, Hu, et autres
Publié: (2026)
par: Gao, Hu, et autres
Publié: (2026)
FreeMotion: A Unified Framework for Number-free Text-to-Motion Synthesis
par: Fan, Ke, et autres
Publié: (2024)
par: Fan, Ke, et autres
Publié: (2024)
Physically Interpretable Multi-Degradation Image Restoration via Deep Unfolding and Explainable Convolution
par: Gao, Hu, et autres
Publié: (2025)
par: Gao, Hu, et autres
Publié: (2025)
Towards Generalized Multi-Image Editing for Unified Multimodal Models
par: Xu, Pengcheng, et autres
Publié: (2026)
par: Xu, Pengcheng, et autres
Publié: (2026)
What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing
par: Lin, Hangyu, et autres
Publié: (2026)
par: Lin, Hangyu, et autres
Publié: (2026)
LLM-Oriented Token-Adaptive Knowledge Distillation
par: Xie, Xurong, et autres
Publié: (2025)
par: Xie, Xurong, et autres
Publié: (2025)
PoseAnything: Universal Pose-guided Video Generation with Part-aware Temporal Coherence
par: Wang, Ruiyan, et autres
Publié: (2025)
par: Wang, Ruiyan, et autres
Publié: (2025)
SwiftVideo: A Unified Framework for Few-Step Video Generation through Trajectory-Distribution Alignment
par: Sun, Yanxiao, et autres
Publié: (2025)
par: Sun, Yanxiao, et autres
Publié: (2025)
CrossVTON: Mimicking the Logic Reasoning on Cross-category Virtual Try-on guided by Tri-zone Priors
par: Luo, Donghao, et autres
Publié: (2025)
par: Luo, Donghao, et autres
Publié: (2025)
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
par: Jin, Yizhang, et autres
Publié: (2024)
par: Jin, Yizhang, et autres
Publié: (2024)
AttentionPainter: An Efficient and Adaptive Stroke Predictor for Scene Painting
par: Tang, Yizhe, et autres
Publié: (2024)
par: Tang, Yizhe, et autres
Publié: (2024)
Evolution of Video Generative Foundations
par: Hu, Teng, et autres
Publié: (2026)
par: Hu, Teng, et autres
Publié: (2026)
Documents similaires
-
SaRA: High-Efficient Diffusion Model Fine-tuning with Progressive Sparse Low-Rank Adaptation
par: Hu, Teng, et autres
Publié: (2024) -
Collaborative Face Experts Fusion in Video Generation: Boosting Identity Consistency Across Large Face Poses
par: Wang, Yuji, et autres
Publié: (2025) -
AnomalyDiffusion: Few-Shot Anomaly Image Generation with Diffusion Model
par: Hu, Teng, et autres
Publié: (2023) -
Improving Autoregressive Visual Generation with Cluster-Oriented Token Prediction
par: Hu, Teng, et autres
Publié: (2025) -
MotionMaster: Training-free Camera Motion Transfer For Video Generation
par: Hu, Teng, et autres
Publié: (2024)