VidGen-1M: A Large-Scale Dataset for Text-to-video Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Tan, Zhiyu, Yang, Xiaomeng, Qin, Luozheng, Li, Hao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
por: Yang, Xiaomeng, et al.
Publicado: (2025)
por: Yang, Xiaomeng, et al.
Publicado: (2025)
OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation
por: Nan, Kepan, et al.
Publicado: (2024)
por: Nan, Kepan, et al.
Publicado: (2024)
Cockatiel: Ensembling Synthetic and Human Preferenced Training for Detailed Video Caption
por: Qin, Luozheng, et al.
Publicado: (2025)
por: Qin, Luozheng, et al.
Publicado: (2025)
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
por: Tan, Zhiyu, et al.
Publicado: (2024)
por: Tan, Zhiyu, et al.
Publicado: (2024)
An Empirical Study and Analysis of Text-to-Image Generation Using Large Language Model-Powered Textual Representation
por: Tan, Zhiyu, et al.
Publicado: (2024)
por: Tan, Zhiyu, et al.
Publicado: (2024)
Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing
por: Yang, Hao, et al.
Publicado: (2026)
por: Yang, Hao, et al.
Publicado: (2026)
Omni-Video: Democratizing Unified Video Understanding and Generation
por: Tan, Zhiyu, et al.
Publicado: (2025)
por: Tan, Zhiyu, et al.
Publicado: (2025)
Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision
por: Qin, Luozheng, et al.
Publicado: (2025)
por: Qin, Luozheng, et al.
Publicado: (2025)
DH-FaceVid-1K: A Large-Scale High-Quality Dataset for Face Video Generation
por: Di, Donglin, et al.
Publicado: (2024)
por: Di, Donglin, et al.
Publicado: (2024)
Raccoon: Multi-stage Diffusion Training with Coarse-to-Fine Curating Videos
por: Tan, Zhiyu, et al.
Publicado: (2025)
por: Tan, Zhiyu, et al.
Publicado: (2025)
InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation
por: Wang, Yi, et al.
Publicado: (2023)
por: Wang, Yi, et al.
Publicado: (2023)
EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation
por: Wang, Xiaofeng, et al.
Publicado: (2024)
por: Wang, Xiaofeng, et al.
Publicado: (2024)
OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video Generation
por: Li, Hui, et al.
Publicado: (2024)
por: Li, Hui, et al.
Publicado: (2024)
LiFT: Leveraging Human Feedback for Text-to-Video Model Alignment
por: Wang, Yibin, et al.
Publicado: (2024)
por: Wang, Yibin, et al.
Publicado: (2024)
Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator
por: Qin, Luozheng, et al.
Publicado: (2026)
por: Qin, Luozheng, et al.
Publicado: (2026)
TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis
por: Chen, Shunian, et al.
Publicado: (2025)
por: Chen, Shunian, et al.
Publicado: (2025)
VidProM: A Million-scale Real Prompt-Gallery Dataset for Text-to-Video Diffusion Models
por: Wang, Wenhao, et al.
Publicado: (2024)
por: Wang, Wenhao, et al.
Publicado: (2024)
TextAtlas5M: A Large-scale Dataset for Dense Text Image Generation
por: Wang, Alex Jinpeng, et al.
Publicado: (2025)
por: Wang, Alex Jinpeng, et al.
Publicado: (2025)
Diff-Aid: Inference-time Adaptive Interaction Denoising for Rectified Text-to-Image Generation
por: Li, Binglei, et al.
Publicado: (2026)
por: Li, Binglei, et al.
Publicado: (2026)
SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation
por: Zhang, Youliang, et al.
Publicado: (2025)
por: Zhang, Youliang, et al.
Publicado: (2025)
VidText: Towards Comprehensive Evaluation for Video Text Understanding
por: Yang, Zhoufaran, et al.
Publicado: (2025)
por: Yang, Zhoufaran, et al.
Publicado: (2025)
DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers
por: Yang, Mengping, et al.
Publicado: (2026)
por: Yang, Mengping, et al.
Publicado: (2026)
GenVidBench: A 6-Million Benchmark for AI-Generated Video Detection
por: Ni, Zhenliang, et al.
Publicado: (2025)
por: Ni, Zhenliang, et al.
Publicado: (2025)
AlignVid: Training-Free Attention Scaling for Semantic Fidelity in Text-Guided Image-to-Video Generation
por: Liu, Yexin, et al.
Publicado: (2025)
por: Liu, Yexin, et al.
Publicado: (2025)
VidCLearn: A Continual Learning Approach for Text-to-Video Generation
por: Zanchetta, Luca, et al.
Publicado: (2025)
por: Zanchetta, Luca, et al.
Publicado: (2025)
RSFAKE-1M: A Large-Scale Dataset for Detecting Diffusion-Generated Remote Sensing Forgeries
por: Tan, Zhihong, et al.
Publicado: (2025)
por: Tan, Zhihong, et al.
Publicado: (2025)
Unraveling MMDiT Blocks: Training-free Analysis and Enhancement of Text-conditioned Diffusion
por: Li, Binglei, et al.
Publicado: (2026)
por: Li, Binglei, et al.
Publicado: (2026)
FITA: Fine-grained Image-Text Aligner for Radiology Report Generation
por: Yang, Honglong, et al.
Publicado: (2024)
por: Yang, Honglong, et al.
Publicado: (2024)
TextVidBench: A Benchmark for Long Video Scene Text Understanding
por: Zhong, Yangyang, et al.
Publicado: (2025)
por: Zhong, Yangyang, et al.
Publicado: (2025)
GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning
por: Jiang, Kaixun, et al.
Publicado: (2026)
por: Jiang, Kaixun, et al.
Publicado: (2026)
EmoVid: A Multimodal Emotion Video Dataset for Emotion-Centric Video Understanding and Generation
por: Qiu, Zongyang, et al.
Publicado: (2025)
por: Qiu, Zongyang, et al.
Publicado: (2025)
LSReGen: Large-Scale Regional Generator via Backward Guidance Framework
por: Zhang, Bowen, et al.
Publicado: (2024)
por: Zhang, Bowen, et al.
Publicado: (2024)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
por: Huang, Xiaohu, et al.
Publicado: (2024)
por: Huang, Xiaohu, et al.
Publicado: (2024)
VidEvent: A Large Dataset for Understanding Dynamic Evolution of Events in Videos
por: Liang, Baoyu, et al.
Publicado: (2025)
por: Liang, Baoyu, et al.
Publicado: (2025)
Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models
por: Wang, Lehan, et al.
Publicado: (2025)
por: Wang, Lehan, et al.
Publicado: (2025)
LAION-SG: An Enhanced Large-Scale Dataset for Training Complex Image-Text Models with Structural Annotations
por: Li, Zejian, et al.
Publicado: (2024)
por: Li, Zejian, et al.
Publicado: (2024)
BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations
por: Feng, Weixi, et al.
Publicado: (2025)
por: Feng, Weixi, et al.
Publicado: (2025)
VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation
por: Wang, Wenhao, et al.
Publicado: (2025)
por: Wang, Wenhao, et al.
Publicado: (2025)
E.M.Ground: A Temporal Grounding Vid-LLM with Holistic Event Perception and Matching
por: Nie, Jiahao, et al.
Publicado: (2026)
por: Nie, Jiahao, et al.
Publicado: (2026)
GenAR: Next-Scale Autoregressive Generation for Spatial Gene Expression Prediction
por: Ouyang, Jiarui, et al.
Publicado: (2025)
por: Ouyang, Jiarui, et al.
Publicado: (2025)
Ejemplares similares
-
Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
por: Yang, Xiaomeng, et al.
Publicado: (2025) -
OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation
por: Nan, Kepan, et al.
Publicado: (2024) -
Cockatiel: Ensembling Synthetic and Human Preferenced Training for Detailed Video Caption
por: Qin, Luozheng, et al.
Publicado: (2025) -
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
por: Tan, Zhiyu, et al.
Publicado: (2024) -
An Empirical Study and Analysis of Text-to-Image Generation Using Large Language Model-Powered Textual Representation
por: Tan, Zhiyu, et al.
Publicado: (2024)