Identity-Preserving Text-to-Video Generation by Frequency Decomposition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yuan, Shenghai, Huang, Jinfa, He, Xianyi, Ge, Yunyuan, Shi, Yujun, Chen, Liuhan, Luo, Jiebo, Yuan, Li |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement
par: Gao, Jiayi, et autres
Publié: (2025)
par: Gao, Jiayi, et autres
Publié: (2025)
OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation
par: Yuan, Shenghai, et autres
Publié: (2025)
par: Yuan, Shenghai, et autres
Publié: (2025)
MagicTime: Time-lapse Video Generation Models as Metamorphic Simulators
par: Yuan, Shenghai, et autres
Publié: (2024)
par: Yuan, Shenghai, et autres
Publié: (2024)
ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation
par: Yuan, Shenghai, et autres
Publié: (2024)
par: Yuan, Shenghai, et autres
Publié: (2024)
T2VParser: Adaptive Decomposition Tokens for Partial Alignment in Text to Video Retrieval
par: Li, Yili, et autres
Publié: (2025)
par: Li, Yili, et autres
Publié: (2025)
PP-Motion: Physical-Perceptual Fidelity Evaluation for Human Motion Generation
par: Zhao, Sihan, et autres
Publié: (2025)
par: Zhao, Sihan, et autres
Publié: (2025)
Learning Spatial Adaptation and Temporal Coherence in Diffusion Models for Video Super-Resolution
par: Chen, Zhikai, et autres
Publié: (2024)
par: Chen, Zhikai, et autres
Publié: (2024)
Dual Attribute-Spatial Relation Alignment for 3D Visual Grounding
par: Xu, Yue, et autres
Publié: (2024)
par: Xu, Yue, et autres
Publié: (2024)
EF-VI: Enhancing End-Frame Injection for Video Inbetweening
par: Chen, Liuhan, et autres
Publié: (2025)
par: Chen, Liuhan, et autres
Publié: (2025)
Holistic Visual-Textual Sentiment Analysis with Prior Models
par: Chen, Junyu, et autres
Publié: (2022)
par: Chen, Junyu, et autres
Publié: (2022)
Bridging Your Imagination with Audio-Video Generation via a Unified Director
par: Zhang, Jiaxu, et autres
Publié: (2025)
par: Zhang, Jiaxu, et autres
Publié: (2025)
Reference-Guided Identity Preserving Face Restoration
par: Zhou, Mo, et autres
Publié: (2025)
par: Zhou, Mo, et autres
Publié: (2025)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
par: Liu, Kai, et autres
Publié: (2026)
par: Liu, Kai, et autres
Publié: (2026)
TAVGBench: Benchmarking Text to Audible-Video Generation
par: Mao, Yuxin, et autres
Publié: (2024)
par: Mao, Yuxin, et autres
Publié: (2024)
SNP-S3: Shared Network Pre-training and Significant Semantic Strengthening for Various Video-Text Tasks
par: Dong, Xingning, et autres
Publié: (2024)
par: Dong, Xingning, et autres
Publié: (2024)
In Anticipation of Perfect Deepfake: Identity-anchored Artifact-agnostic Detection under Rebalanced Deepfake Detection Protocol
par: Wang, Wei-Han, et autres
Publié: (2024)
par: Wang, Wei-Han, et autres
Publié: (2024)
MorphText: Deep Morphology Regularized Arbitrary-shape Scene Text Detection
par: Xu, Chengpei, et autres
Publié: (2024)
par: Xu, Chengpei, et autres
Publié: (2024)
Controllable Complex Human Motion Video Generation via Text-to-Skeleton Cascades
par: Taghipour, Ashkan, et autres
Publié: (2026)
par: Taghipour, Ashkan, et autres
Publié: (2026)
How Far Are Surgeons from Surgical World Models? A Pilot Study on Zero-shot Surgical Video Generation with Expert Assessment
par: Chen, Zhen, et autres
Publié: (2025)
par: Chen, Zhen, et autres
Publié: (2025)
Scene-Text Grounding for Text-Based Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2024)
par: Zhou, Sheng, et autres
Publié: (2024)
DanceCamAnimator: Keyframe-Based Controllable 3D Dance Camera Synthesis
par: Wang, Zixuan, et autres
Publié: (2024)
par: Wang, Zixuan, et autres
Publié: (2024)
FreeMask: Rethinking the Importance of Attention Masks for Zero-Shot Video Editing
par: Cai, Lingling, et autres
Publié: (2024)
par: Cai, Lingling, et autres
Publié: (2024)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
par: Dai, Yusheng, et autres
Publié: (2026)
par: Dai, Yusheng, et autres
Publié: (2026)
Prompt-aware of Frame Sampling for Efficient Text-Video Retrieval
par: Zhang, Deyu, et autres
Publié: (2025)
par: Zhang, Deyu, et autres
Publié: (2025)
Self-similarity Prior Distillation for Unsupervised Remote Physiological Measurement
par: Zhang, Xinyu, et autres
Publié: (2023)
par: Zhang, Xinyu, et autres
Publié: (2023)
HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
par: Chen, Liyang, et autres
Publié: (2025)
par: Chen, Liyang, et autres
Publié: (2025)
Long Video Diffusion Generation with Segmented Cross-Attention and Content-Rich Video Data Curation
par: Yan, Xin, et autres
Publié: (2024)
par: Yan, Xin, et autres
Publié: (2024)
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
par: Pian, Weiguo, et autres
Publié: (2026)
par: Pian, Weiguo, et autres
Publié: (2026)
Radio Frequency Signal based Human Silhouette Segmentation: A Sequential Diffusion Approach
par: Wen, Penghui, et autres
Publié: (2024)
par: Wen, Penghui, et autres
Publié: (2024)
MSVBench: Towards Human-Level Evaluation of Multi-Shot Video Generation
par: Shi, Haoyuan, et autres
Publié: (2026)
par: Shi, Haoyuan, et autres
Publié: (2026)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
par: Zhou, Sheng, et autres
Publié: (2025)
par: Zhou, Sheng, et autres
Publié: (2025)
VidCompress: Memory-Enhanced Temporal Compression for Video Understanding in Large Language Models
par: Lan, Xiaohan, et autres
Publié: (2024)
par: Lan, Xiaohan, et autres
Publié: (2024)
CBVS: A Large-Scale Chinese Image-Text Benchmark for Real-World Short Video Search Scenarios
par: Qiao, Xiangshuo, et autres
Publié: (2024)
par: Qiao, Xiangshuo, et autres
Publié: (2024)
STEAR: Layer-Aware Spatiotemporal Evidence Intervention for Hallucination Mitigation in Video Large Language Models
par: Fan, Linfeng, et autres
Publié: (2026)
par: Fan, Linfeng, et autres
Publié: (2026)
Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance
par: Zhang, Beiyuan, et autres
Publié: (2024)
par: Zhang, Beiyuan, et autres
Publié: (2024)
Moiré Video Authentication: A Physical Signature Against AI Video Generation
par: Qing, Yuan, et autres
Publié: (2026)
par: Qing, Yuan, et autres
Publié: (2026)
SMC++: Masked Learning of Unsupervised Video Semantic Compression
par: Tian, Yuan, et autres
Publié: (2024)
par: Tian, Yuan, et autres
Publié: (2024)
PDA: Text-Augmented Defense Framework for Robust Vision-Language Models against Adversarial Image Attacks
par: Xu, Jingning, et autres
Publié: (2026)
par: Xu, Jingning, et autres
Publié: (2026)
Visual Semantic Description Generation with MLLMs for Image-Text Matching
par: Chen, Junyu, et autres
Publié: (2025)
par: Chen, Junyu, et autres
Publié: (2025)
GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos
par: Li, Minghan, et autres
Publié: (2026)
par: Li, Minghan, et autres
Publié: (2026)
Documents similaires
-
Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement
par: Gao, Jiayi, et autres
Publié: (2025) -
OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation
par: Yuan, Shenghai, et autres
Publié: (2025) -
MagicTime: Time-lapse Video Generation Models as Metamorphic Simulators
par: Yuan, Shenghai, et autres
Publié: (2024) -
ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation
par: Yuan, Shenghai, et autres
Publié: (2024) -
T2VParser: Adaptive Decomposition Tokens for Partial Alignment in Text to Video Retrieval
par: Li, Yili, et autres
Publié: (2025)