Identity-Preserving Text-to-Video Generation Guided by Simple yet Effective Spatial-Temporal Decoupled Representations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Yuji, Li, Moran, Hu, Xiaobin, Yi, Ran, Zhang, Jiangning, Feng, Han, Cao, Weijian, Wang, Yabiao, Wang, Chengjie, Ma, Lizhuang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Collaborative Face Experts Fusion in Video Generation: Boosting Identity Consistency Across Large Face Poses
par: Wang, Yuji, et autres
Publié: (2025)
par: Wang, Yuji, et autres
Publié: (2025)
Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation
par: Chen, Yuheng, et autres
Publié: (2026)
par: Chen, Yuheng, et autres
Publié: (2026)
Semantic Frame Interpolation
par: Hong, Yijia, et autres
Publié: (2025)
par: Hong, Yijia, et autres
Publié: (2025)
FreeMotion: A Unified Framework for Number-free Text-to-Motion Synthesis
par: Fan, Ke, et autres
Publié: (2024)
par: Fan, Ke, et autres
Publié: (2024)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
par: Chen, Yuheng, et autres
Publié: (2026)
par: Chen, Yuheng, et autres
Publié: (2026)
Transform Trained Transformer: Accelerating Naive 4K Video Generation Over 10$\times$
par: Zhang, Jiangning, et autres
Publié: (2025)
par: Zhang, Jiangning, et autres
Publié: (2025)
ID-Sculpt: ID-aware 3D Head Generation from Single In-the-wild Portrait Image
par: Hao, Jinkun, et autres
Publié: (2024)
par: Hao, Jinkun, et autres
Publié: (2024)
Textual Decomposition Then Sub-motion-space Scattering for Open-Vocabulary Motion Generation
par: Fan, Ke, et autres
Publié: (2024)
par: Fan, Ke, et autres
Publié: (2024)
SaRA: High-Efficient Diffusion Model Fine-tuning with Progressive Sparse Low-Rank Adaptation
par: Hu, Teng, et autres
Publié: (2024)
par: Hu, Teng, et autres
Publié: (2024)
MotionMaster: Training-free Camera Motion Transfer For Video Generation
par: Hu, Teng, et autres
Publié: (2024)
par: Hu, Teng, et autres
Publié: (2024)
VividPose: Advancing Stable Video Diffusion for Realistic Human Image Animation
par: Wang, Qilin, et autres
Publié: (2024)
par: Wang, Qilin, et autres
Publié: (2024)
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
par: Jin, Yizhang, et autres
Publié: (2024)
par: Jin, Yizhang, et autres
Publié: (2024)
StrandDesigner: Towards Practical Strand Generation with Sketch Guidance
par: Zhang, Na, et autres
Publié: (2025)
par: Zhang, Na, et autres
Publié: (2025)
Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory
par: Liu, Jinzhuo, et autres
Publié: (2026)
par: Liu, Jinzhuo, et autres
Publié: (2026)
Identity-Preserving Text-to-Image Generation via Dual-Level Feature Decoupling and Expert-Guided Fusion
par: Chen, Kewen, et autres
Publié: (2025)
par: Chen, Kewen, et autres
Publié: (2025)
Exploring Real&Synthetic Dataset and Linear Attention in Image Restoration
par: Du, Yuzhen, et autres
Publié: (2024)
par: Du, Yuzhen, et autres
Publié: (2024)
SwiftVideo: A Unified Framework for Few-Step Video Generation through Trajectory-Distribution Alignment
par: Sun, Yanxiao, et autres
Publié: (2025)
par: Sun, Yanxiao, et autres
Publié: (2025)
Improving Autoregressive Visual Generation with Cluster-Oriented Token Prediction
par: Hu, Teng, et autres
Publié: (2025)
par: Hu, Teng, et autres
Publié: (2025)
AnomalyDiffusion: Few-Shot Anomaly Image Generation with Diffusion Model
par: Hu, Teng, et autres
Publié: (2023)
par: Hu, Teng, et autres
Publié: (2023)
The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection
par: He, Qingdong, et autres
Publié: (2025)
par: He, Qingdong, et autres
Publié: (2025)
Reference Twice: A Simple and Unified Baseline for Few-Shot Instance Segmentation
par: Han, Yue, et autres
Publié: (2023)
par: Han, Yue, et autres
Publié: (2023)
M3DM-NR: RGB-3D Noisy-Resistant Industrial Anomaly Detection via Multimodal Denoising
par: Wang, Chengjie, et autres
Publié: (2024)
par: Wang, Chengjie, et autres
Publié: (2024)
PiT: Progressive Diffusion Transformer
par: Wu, Jiafu, et autres
Publié: (2025)
par: Wu, Jiafu, et autres
Publié: (2025)
DynamicControl: Adaptive Condition Selection for Improved Text-to-Image Generation
par: He, Qingdong, et autres
Publié: (2024)
par: He, Qingdong, et autres
Publié: (2024)
MambaGesture: Enhancing Co-Speech Gesture Generation with Mamba and Disentangled Multi-Modality Fusion
par: Fu, Chencan, et autres
Publié: (2024)
par: Fu, Chencan, et autres
Publié: (2024)
HumanVideo-MME: Benchmarking MLLMs for Human-Centric Video Understanding
par: Cai, Yuxuan, et autres
Publié: (2025)
par: Cai, Yuxuan, et autres
Publié: (2025)
CLIP-AD: A Language-Guided Staged Dual-Path Model for Zero-shot Anomaly Detection
par: Chen, Xuhai, et autres
Publié: (2023)
par: Chen, Xuhai, et autres
Publié: (2023)
MMoFusion: Multi-modal Co-Speech Motion Generation with Diffusion Model
par: Wang, Sen, et autres
Publié: (2024)
par: Wang, Sen, et autres
Publié: (2024)
InstanceV: Instance-Level Video Generation
par: Chen, Yuheng, et autres
Publié: (2025)
par: Chen, Yuheng, et autres
Publié: (2025)
Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning
par: He, Qingdong, et autres
Publié: (2025)
par: He, Qingdong, et autres
Publié: (2025)
PVG: Progressive Vision Graph for Vision Recognition
par: Wu, Jiafu, et autres
Publié: (2023)
par: Wu, Jiafu, et autres
Publié: (2023)
EATFormer: Improving Vision Transformer Inspired by Evolutionary Algorithm
par: Zhang, Jiangning, et autres
Publié: (2022)
par: Zhang, Jiangning, et autres
Publié: (2022)
PointRWKV: Efficient RWKV-Like Model for Hierarchical Point Cloud Learning
par: He, Qingdong, et autres
Publié: (2024)
par: He, Qingdong, et autres
Publié: (2024)
MobileMamba: Lightweight Multi-Receptive Visual Mamba Network
par: He, Haoyang, et autres
Publié: (2024)
par: He, Haoyang, et autres
Publié: (2024)
VTok: A Unified Video Tokenizer with Decoupled Spatial-Temporal Latents
par: Wang, Feng, et autres
Publié: (2026)
par: Wang, Feng, et autres
Publié: (2026)
DiffFAE: Advancing High-fidelity One-shot Facial Appearance Editing with Space-sensitive Customization and Semantic Preservation
par: Wang, Qilin, et autres
Publié: (2024)
par: Wang, Qilin, et autres
Publié: (2024)
CtlGAN: Few-shot Artistic Portraits Generation with Contrastive Transfer Learning
par: Wang, Yue, et autres
Publié: (2022)
par: Wang, Yue, et autres
Publié: (2022)
IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment
par: Chen, Yinan, et autres
Publié: (2025)
par: Chen, Yinan, et autres
Publié: (2025)
PoseAnything: Universal Pose-guided Video Generation with Part-aware Temporal Coherence
par: Wang, Ruiyan, et autres
Publié: (2025)
par: Wang, Ruiyan, et autres
Publié: (2025)
UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions
par: Xue, Zhucun, et autres
Publié: (2025)
par: Xue, Zhucun, et autres
Publié: (2025)
Documents similaires
-
Collaborative Face Experts Fusion in Video Generation: Boosting Identity Consistency Across Large Face Poses
par: Wang, Yuji, et autres
Publié: (2025) -
Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation
par: Chen, Yuheng, et autres
Publié: (2026) -
Semantic Frame Interpolation
par: Hong, Yijia, et autres
Publié: (2025) -
FreeMotion: A Unified Framework for Number-free Text-to-Motion Synthesis
par: Fan, Ke, et autres
Publié: (2024) -
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
par: Chen, Yuheng, et autres
Publié: (2026)