Bridging Text and Video Generation: A Survey
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kumar, Nilay, Bhandari, Priyansh, Maragatham, G. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Survey on Quality Metrics for Text-to-Image Generation
par: Hartwig, Sebastian, et autres
Publié: (2024)
par: Hartwig, Sebastian, et autres
Publié: (2024)
VideoMV: Consistent Multi-View Generation Based on Large Video Generative Model
par: Zuo, Qi, et autres
Publié: (2024)
par: Zuo, Qi, et autres
Publié: (2024)
Mixture of Contexts for Long Video Generation
par: Cai, Shengqu, et autres
Publié: (2025)
par: Cai, Shengqu, et autres
Publié: (2025)
Physical Simulator In-the-Loop Video Generation
par: Foo, Lin Geng, et autres
Publié: (2026)
par: Foo, Lin Geng, et autres
Publié: (2026)
Intelligent Artistic Typography: A Comprehensive Review of Artistic Text Design and Generation
par: Bai, Yuhang, et autres
Publié: (2024)
par: Bai, Yuhang, et autres
Publié: (2024)
Diffusion as Shader: 3D-aware Video Diffusion for Versatile Video Generation Control
par: Gu, Zekai, et autres
Publié: (2025)
par: Gu, Zekai, et autres
Publié: (2025)
AMG: Avatar Motion Guided Video Generation
par: Yang, Zhangsihao, et autres
Publié: (2024)
par: Yang, Zhangsihao, et autres
Publié: (2024)
CASIM: Composite Aware Semantic Injection for Text to Motion Generation
par: Chang, Che-Jui, et autres
Publié: (2025)
par: Chang, Che-Jui, et autres
Publié: (2025)
Make It Count: Text-to-Image Generation with an Accurate Number of Objects
par: Binyamin, Lital, et autres
Publié: (2024)
par: Binyamin, Lital, et autres
Publié: (2024)
SeqTex: Generate Mesh Textures in Video Sequence
par: Yuan, Ze, et autres
Publié: (2025)
par: Yuan, Ze, et autres
Publié: (2025)
ObjectMover: Generative Object Movement with Video Prior
par: Yu, Xin, et autres
Publié: (2025)
par: Yu, Xin, et autres
Publié: (2025)
Evaluating Design Video Generation: Metrics for Compositional Fidelity
par: Deganutti, Adrienne, et autres
Publié: (2026)
par: Deganutti, Adrienne, et autres
Publié: (2026)
LAYOUTDREAMER: Physics-guided Layout for Text-to-3D Compositional Scene Generation
par: Zhou, Yang, et autres
Publié: (2025)
par: Zhou, Yang, et autres
Publié: (2025)
SVGBuilder: Component-Based Colored SVG Generation with Text-Guided Autoregressive Transformers
par: Chen, Zehao, et autres
Publié: (2024)
par: Chen, Zehao, et autres
Publié: (2024)
RealWonder: Real-Time Physical Action-Conditioned Video Generation
par: Liu, Wei, et autres
Publié: (2026)
par: Liu, Wei, et autres
Publié: (2026)
MV-S2V: Multi-View Subject-Consistent Video Generation
par: Song, Ziyang, et autres
Publié: (2026)
par: Song, Ziyang, et autres
Publié: (2026)
3DPhysVideo: Consistency-Guided Flow SDE for Video Generation via 3D Scene Reconstruction and Physical Simulation
par: Kim, Hwidong, et autres
Publié: (2026)
par: Kim, Hwidong, et autres
Publié: (2026)
HY-Motion 1.0: Scaling Flow Matching Models for Text-To-Motion Generation
par: Wen, Yuxin, et autres
Publié: (2025)
par: Wen, Yuxin, et autres
Publié: (2025)
DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos
par: Hu, Wenbo, et autres
Publié: (2024)
par: Hu, Wenbo, et autres
Publié: (2024)
DreamPolisher: Towards High-Quality Text-to-3D Generation via Geometric Diffusion
par: Lin, Yuanze, et autres
Publié: (2024)
par: Lin, Yuanze, et autres
Publié: (2024)
Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning
par: Girdhar, Rohit, et autres
Publié: (2023)
par: Girdhar, Rohit, et autres
Publié: (2023)
Progressive Rendering Distillation: Adapting Stable Diffusion for Instant Text-to-Mesh Generation without 3D Data
par: Ma, Zhiyuan, et autres
Publié: (2025)
par: Ma, Zhiyuan, et autres
Publié: (2025)
Meta 3D AssetGen: Text-to-Mesh Generation with High-Quality Geometry, Texture, and PBR Materials
par: Siddiqui, Yawar, et autres
Publié: (2024)
par: Siddiqui, Yawar, et autres
Publié: (2024)
Advances in 3D Neural Stylization: A Survey
par: Chen, Yingshu, et autres
Publié: (2023)
par: Chen, Yingshu, et autres
Publié: (2023)
Taming Video Models for 3D and 4D Generation via Zero-Shot Camera Control
par: Song, Chenxi, et autres
Publié: (2025)
par: Song, Chenxi, et autres
Publié: (2025)
Multimodal Cinematic Video Synthesis Using Text-to-Image and Audio Generation Models
par: S, Sridhar, et autres
Publié: (2025)
par: S, Sridhar, et autres
Publié: (2025)
VideoPanda: Video Panoramic Diffusion with Multi-view Attention
par: Xie, Kevin, et autres
Publié: (2025)
par: Xie, Kevin, et autres
Publié: (2025)
InfiniCube: Unbounded and Controllable Dynamic 3D Driving Scene Generation with World-Guided Video Models
par: Lu, Yifan, et autres
Publié: (2024)
par: Lu, Yifan, et autres
Publié: (2024)
DiffHDR: Re-Exposing LDR Videos with Video Diffusion Models
par: Yu, Zhengming, et autres
Publié: (2026)
par: Yu, Zhengming, et autres
Publié: (2026)
ReLumix: Extending Image Relighting to Video via Video Diffusion Models
par: Wang, Lezhong, et autres
Publié: (2025)
par: Wang, Lezhong, et autres
Publié: (2025)
A Survey on Event-driven 3D Reconstruction: Development under Different Categories
par: Xu, Chuanzhi, et autres
Publié: (2025)
par: Xu, Chuanzhi, et autres
Publié: (2025)
Synthetic-to-Real Domain Bridging for Single-View 3D Reconstruction of Ships for Maritime Monitoring
par: Carrillo-Perez, Borja, et autres
Publié: (2026)
par: Carrillo-Perez, Borja, et autres
Publié: (2026)
MotionPhysics: Learnable Motion Distillation for Text-Guided Simulation
par: Wang, Miaowei, et autres
Publié: (2026)
par: Wang, Miaowei, et autres
Publié: (2026)
Key-Locked Rank One Editing for Text-to-Image Personalization
par: Tewel, Yoad, et autres
Publié: (2023)
par: Tewel, Yoad, et autres
Publié: (2023)
LuxDiT: Lighting Estimation with Video Diffusion Transformer
par: Liang, Ruofan, et autres
Publié: (2025)
par: Liang, Ruofan, et autres
Publié: (2025)
In-Context Sync-LoRA for Portrait Video Editing
par: Polaczek, Sagi, et autres
Publié: (2025)
par: Polaczek, Sagi, et autres
Publié: (2025)
Seeing Fast and Slow: Learning the Flow of Time in Videos
par: Wu, Yen-Siang, et autres
Publié: (2026)
par: Wu, Yen-Siang, et autres
Publié: (2026)
VividFace: A Diffusion-Based Hybrid Framework for High-Fidelity Video Face Swapping
par: Shao, Hao, et autres
Publié: (2024)
par: Shao, Hao, et autres
Publié: (2024)
Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer
par: Yin, Zixin, et autres
Publié: (2025)
par: Yin, Zixin, et autres
Publié: (2025)
DiffPano: Scalable and Consistent Text to Panorama Generation with Spherical Epipolar-Aware Diffusion
par: Ye, Weicai, et autres
Publié: (2024)
par: Ye, Weicai, et autres
Publié: (2024)
Documents similaires
-
A Survey on Quality Metrics for Text-to-Image Generation
par: Hartwig, Sebastian, et autres
Publié: (2024) -
VideoMV: Consistent Multi-View Generation Based on Large Video Generative Model
par: Zuo, Qi, et autres
Publié: (2024) -
Mixture of Contexts for Long Video Generation
par: Cai, Shengqu, et autres
Publié: (2025) -
Physical Simulator In-the-Loop Video Generation
par: Foo, Lin Geng, et autres
Publié: (2026) -
Intelligent Artistic Typography: A Comprehensive Review of Artistic Text Design and Generation
par: Bai, Yuhang, et autres
Publié: (2024)