Enregistré dans:
| Auteurs principaux: | Yan, Han, Song, Xibin, Wang, Yifu, Li, Hongdong, Ji, Pan, Ma, Chao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2510.21696 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Robust Dreamer: Deviation-Aware Latent Gaussian Memory for Action-Controlled AR Video Generation
par: Chen, Hanlin, et autres
Publié: (2026)
par: Chen, Hanlin, et autres
Publié: (2026)
I3DM: Implicit 3D-aware Memory Retrieval and Injection for Consistent Video Scene Generation
par: Li, Jia, et autres
Publié: (2026)
par: Li, Jia, et autres
Publié: (2026)
T$^3$-S2S: Training-free Triplet Tuning for Sketch to Scene Synthesis in Controllable Concept Art Generation
par: Sun, Zhenhong, et autres
Publié: (2024)
par: Sun, Zhenhong, et autres
Publié: (2024)
BAG: Body-Aligned 3D Wearable Asset Generation
par: Luo, Zhongjin, et autres
Publié: (2025)
par: Luo, Zhongjin, et autres
Publié: (2025)
EM-Vid: Training-Free Entity-Centric Memory for Efficient and Consistent Multi-Shot Video Generation
par: Vandersanden, Jente, et autres
Publié: (2026)
par: Vandersanden, Jente, et autres
Publié: (2026)
BlockVid: Block Diffusion for High-Quality and Consistent Minute-Long Video Generation
par: Zhang, Zeyu, et autres
Publié: (2025)
par: Zhang, Zeyu, et autres
Publié: (2025)
RelightVid: Temporal-Consistent Diffusion Model for Video Relighting
par: Fang, Ye, et autres
Publié: (2025)
par: Fang, Ye, et autres
Publié: (2025)
AlignVid: Training-Free Attention Scaling for Semantic Fidelity in Text-Guided Image-to-Video Generation
par: Liu, Yexin, et autres
Publié: (2025)
par: Liu, Yexin, et autres
Publié: (2025)
NeuSDFusion: A Spatial-Aware Generative Model for 3D Shape Completion, Reconstruction, and Generation
par: Cui, Ruikai, et autres
Publié: (2024)
par: Cui, Ruikai, et autres
Publié: (2024)
MARS: Mesh AutoRegressive Model for 3D Shape Detailization
par: Gao, Jingnan, et autres
Publié: (2025)
par: Gao, Jingnan, et autres
Publié: (2025)
Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors
par: Wang, Rong, et autres
Publié: (2026)
par: Wang, Rong, et autres
Publié: (2026)
Pandora3D: A Comprehensive Framework for High-Quality 3D Shape and Texture Generation
par: Yang, Jiayu, et autres
Publié: (2025)
par: Yang, Jiayu, et autres
Publié: (2025)
FlowVid: Taming Imperfect Optical Flows for Consistent Video-to-Video Synthesis
par: Liang, Feng, et autres
Publié: (2023)
par: Liang, Feng, et autres
Publié: (2023)
Sketch2Scene: Automatic Generation of Interactive 3D Game Scenes from User's Casual Sketches
par: Xu, Yongzhi, et autres
Publié: (2024)
par: Xu, Yongzhi, et autres
Publié: (2024)
LAM3D: Large Image-Point-Cloud Alignment Model for 3D Reconstruction from Single Image
par: Cui, Ruikai, et autres
Publié: (2024)
par: Cui, Ruikai, et autres
Publié: (2024)
PADS: Plug-and-Play 3D Human Pose Analysis via Diffusion Generative Modeling
par: Ji, Haorui, et autres
Publié: (2024)
par: Ji, Haorui, et autres
Publié: (2024)
CharacterFactory: Sampling Consistent Characters with GANs for Diffusion Models
par: Wang, Qinghe, et autres
Publié: (2024)
par: Wang, Qinghe, et autres
Publié: (2024)
BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations
par: Feng, Weixi, et autres
Publié: (2025)
par: Feng, Weixi, et autres
Publié: (2025)
SafeVid: Toward Safety Aligned Video Large Multimodal Models
par: Wang, Yixu, et autres
Publié: (2025)
par: Wang, Yixu, et autres
Publié: (2025)
Gloria: Consistent Character Video Generation via Content Anchors
par: Yang, Yuhang, et autres
Publié: (2026)
par: Yang, Yuhang, et autres
Publié: (2026)
Lumen: Consistent Video Relighting and Harmonious Background Replacement with Video Generative Models
par: Zeng, Jianshu, et autres
Publié: (2025)
par: Zeng, Jianshu, et autres
Publié: (2025)
A Survey: Spatiotemporal Consistency in Video Generation
par: Yin, Zhiyu, et autres
Publié: (2025)
par: Yin, Zhiyu, et autres
Publié: (2025)
InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation
par: Wang, Yi, et autres
Publié: (2023)
par: Wang, Yi, et autres
Publié: (2023)
Temporal-Consistent Video Restoration with Pre-trained Diffusion Models
par: Wang, Hengkang, et autres
Publié: (2025)
par: Wang, Hengkang, et autres
Publié: (2025)
VidText: Towards Comprehensive Evaluation for Video Text Understanding
par: Yang, Zhoufaran, et autres
Publié: (2025)
par: Yang, Zhoufaran, et autres
Publié: (2025)
CharaConsist: Fine-Grained Consistent Character Generation
par: Wang, Mengyu, et autres
Publié: (2025)
par: Wang, Mengyu, et autres
Publié: (2025)
JADE: Joint-aware Latent Diffusion for 3D Human Generative Modeling
par: Ji, Haorui, et autres
Publié: (2024)
par: Ji, Haorui, et autres
Publié: (2024)
Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance
par: Zhang, Beiyuan, et autres
Publié: (2024)
par: Zhang, Beiyuan, et autres
Publié: (2024)
PhyCAGE: Physically Plausible Compositional 3D Asset Generation from a Single Image
par: Yan, Han, et autres
Publié: (2024)
par: Yan, Han, et autres
Publié: (2024)
Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos
par: Feng, X., et autres
Publié: (2026)
par: Feng, X., et autres
Publié: (2026)
OmniVid: A Generative Framework for Universal Video Understanding
par: Wang, Junke, et autres
Publié: (2024)
par: Wang, Junke, et autres
Publié: (2024)
StoryBlender: Inter-Shot Consistent and Editable 3D Storyboard with Spatial-temporal Dynamics
par: Li, Bingliang, et autres
Publié: (2026)
par: Li, Bingliang, et autres
Publié: (2026)
GenVidBench: A 6-Million Benchmark for AI-Generated Video Detection
par: Ni, Zhenliang, et autres
Publié: (2025)
par: Ni, Zhenliang, et autres
Publié: (2025)
TextVidBench: A Benchmark for Long Video Scene Text Understanding
par: Zhong, Yangyang, et autres
Publié: (2025)
par: Zhong, Yangyang, et autres
Publié: (2025)
AnimeAdapter: Fine-grained and Consistent Zero-shot Anime Character Generation
par: Han, Yixuan
Publié: (2026)
par: Han, Yixuan
Publié: (2026)
SpotActor: Training-Free Layout-Controlled Consistent Image Generation
par: Wang, Jiahao, et autres
Publié: (2024)
par: Wang, Jiahao, et autres
Publié: (2024)
MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs
par: Ma, Junpeng, et autres
Publié: (2025)
par: Ma, Junpeng, et autres
Publié: (2025)
Animate-X++: Universal Character Image Animation with Dynamic Backgrounds
par: Tan, Shuai, et autres
Publié: (2025)
par: Tan, Shuai, et autres
Publié: (2025)
VidPrism: Heterogeneous Mixture of Experts for Image-to-Video Transfer
par: Lin, Rui, et autres
Publié: (2026)
par: Lin, Rui, et autres
Publié: (2026)
MovieCharacter: A Tuning-Free Framework for Controllable Character Video Synthesis
par: Qiu, Di, et autres
Publié: (2024)
par: Qiu, Di, et autres
Publié: (2024)
Documents similaires
-
Robust Dreamer: Deviation-Aware Latent Gaussian Memory for Action-Controlled AR Video Generation
par: Chen, Hanlin, et autres
Publié: (2026) -
I3DM: Implicit 3D-aware Memory Retrieval and Injection for Consistent Video Scene Generation
par: Li, Jia, et autres
Publié: (2026) -
T$^3$-S2S: Training-free Triplet Tuning for Sketch to Scene Synthesis in Controllable Concept Art Generation
par: Sun, Zhenhong, et autres
Publié: (2024) -
BAG: Body-Aligned 3D Wearable Asset Generation
par: Luo, Zhongjin, et autres
Publié: (2025) -
EM-Vid: Training-Free Entity-Centric Memory for Efficient and Consistent Multi-Shot Video Generation
par: Vandersanden, Jente, et autres
Publié: (2026)