MiraData: A Large-Scale Video Dataset with Long Durations and Structured Captions
Fuente:
arXiv
Salvato in:
| Autori principali: | Ju, Xuan, Gao, Yiming, Zhang, Zhaoyang, Yuan, Ziyang, Wang, Xintao, Zeng, Ailing, Xiong, Yu, Xu, Qiang, Shan, Ying |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Consistent Human Image and Video Generation with Spatially Conditioned Diffusion
di: Cao, Mingdeng, et al.
Pubblicazione: (2024)
di: Cao, Mingdeng, et al.
Pubblicazione: (2024)
Image Conductor: Precision Control for Interactive Video Synthesis
di: Li, Yaowei, et al.
Pubblicazione: (2024)
di: Li, Yaowei, et al.
Pubblicazione: (2024)
VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control
di: Bian, Yuxuan, et al.
Pubblicazione: (2025)
di: Bian, Yuxuan, et al.
Pubblicazione: (2025)
MotionCraft: Crafting Whole-Body Motion with Plug-and-Play Multimodal Controls
di: Bian, Yuxuan, et al.
Pubblicazione: (2024)
di: Bian, Yuxuan, et al.
Pubblicazione: (2024)
ReVideo: Remake a Video with Motion and Content Control
di: Mou, Chong, et al.
Pubblicazione: (2024)
di: Mou, Chong, et al.
Pubblicazione: (2024)
BrushNet: A Plug-and-Play Image Inpainting Model with Decomposed Dual-Branch Diffusion
di: Ju, Xuan, et al.
Pubblicazione: (2024)
di: Ju, Xuan, et al.
Pubblicazione: (2024)
InstantMesh: Efficient 3D Mesh Generation from a Single Image with Sparse-view Large Reconstruction Models
di: Xu, Jiale, et al.
Pubblicazione: (2024)
di: Xu, Jiale, et al.
Pubblicazione: (2024)
MotionCtrl: A Unified and Flexible Motion Controller for Video Generation
di: Wang, Zhouxia, et al.
Pubblicazione: (2023)
di: Wang, Zhouxia, et al.
Pubblicazione: (2023)
Image Inpainting Models are Effective Tools for Instruction-guided Image Editing
di: Ju, Xuan, et al.
Pubblicazione: (2024)
di: Ju, Xuan, et al.
Pubblicazione: (2024)
LVD-2M: A Long-take Video Dataset with Temporally Dense Captions
di: Xiong, Tianwei, et al.
Pubblicazione: (2024)
di: Xiong, Tianwei, et al.
Pubblicazione: (2024)
LongCaptioning: Unlocking the Power of Long Video Caption Generation in Large Multimodal Models
di: Wei, Hongchen, et al.
Pubblicazione: (2025)
di: Wei, Hongchen, et al.
Pubblicazione: (2025)
Cobra: Efficient Line Art COlorization with BRoAder References
di: Zhuang, Junhao, et al.
Pubblicazione: (2025)
di: Zhuang, Junhao, et al.
Pubblicazione: (2025)
NovelGS: Consistent Novel-view Denoising via Large Gaussian Reconstruction Model
di: Liu, Jinpeng, et al.
Pubblicazione: (2024)
di: Liu, Jinpeng, et al.
Pubblicazione: (2024)
TalkCuts: A Large-Scale Dataset for Multi-Shot Human Speech Video Generation
di: Chen, Jiaben, et al.
Pubblicazione: (2025)
di: Chen, Jiaben, et al.
Pubblicazione: (2025)
Long-Duration Drone Tracking Dataset
di: Lenhard, Tamara Regina, et al.
Pubblicazione: (2025)
di: Lenhard, Tamara Regina, et al.
Pubblicazione: (2025)
VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models
di: Chen, Haoxin, et al.
Pubblicazione: (2024)
di: Chen, Haoxin, et al.
Pubblicazione: (2024)
ColorFlow: Retrieval-Augmented Image Sequence Colorization
di: Zhuang, Junhao, et al.
Pubblicazione: (2024)
di: Zhuang, Junhao, et al.
Pubblicazione: (2024)
FITS: Modeling Time Series with $10k$ Parameters
di: Xu, Zhijian, et al.
Pubblicazione: (2023)
di: Xu, Zhijian, et al.
Pubblicazione: (2023)
Training Data for Large Language Model
di: Ju, Yiming, et al.
Pubblicazione: (2024)
di: Ju, Yiming, et al.
Pubblicazione: (2024)
BrushEdit: All-In-One Image Inpainting and Editing
di: Li, Yaowei, et al.
Pubblicazione: (2024)
di: Li, Yaowei, et al.
Pubblicazione: (2024)
Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
EvalCrafter: Benchmarking and Evaluating Large Video Generation Models
di: Liu, Yaofang, et al.
Pubblicazione: (2023)
di: Liu, Yaofang, et al.
Pubblicazione: (2023)
SpatialVID: A Large-Scale Video Dataset with Spatial Annotations
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
di: Wang, Jiahao, et al.
Pubblicazione: (2025)
Frame-Level Captions for Long Video Generation with Complex Multi Scenes
di: Zheng, Guangcong, et al.
Pubblicazione: (2025)
di: Zheng, Guangcong, et al.
Pubblicazione: (2025)
Video ReCap: Recursive Captioning of Hour-Long Videos
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
di: Islam, Md Mohaiminul, et al.
Pubblicazione: (2024)
CASTELLA: Long Audio Dataset with Captions and Temporal Boundaries
di: Munakata, Hokuto, et al.
Pubblicazione: (2025)
di: Munakata, Hokuto, et al.
Pubblicazione: (2025)
Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioning
di: Jeon, MinJu, et al.
Pubblicazione: (2025)
di: Jeon, MinJu, et al.
Pubblicazione: (2025)
FullDiT: Multi-Task Video Generative Foundation Model with Full Attention
di: Ju, Xuan, et al.
Pubblicazione: (2025)
di: Ju, Xuan, et al.
Pubblicazione: (2025)
Scene Graph-guided SegCaptioning Transformer with Fine-grained Alignment for Controllable Video Segmentation and Captioning
di: Zhang, Xu, et al.
Pubblicazione: (2026)
di: Zhang, Xu, et al.
Pubblicazione: (2026)
MOFA-Video: Controllable Image Animation via Generative Motion Field Adaptions in Frozen Image-to-Video Diffusion Model
di: Niu, Muyao, et al.
Pubblicazione: (2024)
di: Niu, Muyao, et al.
Pubblicazione: (2024)
RSCC: A Large-Scale Remote Sensing Change Caption Dataset for Disaster Events
di: Chen, Zhenyuan, et al.
Pubblicazione: (2025)
di: Chen, Zhenyuan, et al.
Pubblicazione: (2025)
UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions
di: Xue, Zhucun, et al.
Pubblicazione: (2025)
di: Xue, Zhucun, et al.
Pubblicazione: (2025)
Streaming Dense Video Captioning
di: Zhou, Xingyi, et al.
Pubblicazione: (2024)
di: Zhou, Xingyi, et al.
Pubblicazione: (2024)
Motion-X++: A Large-Scale Multimodal 3D Whole-body Human Motion Dataset
di: Zhang, Yuhong, et al.
Pubblicazione: (2025)
di: Zhang, Yuhong, et al.
Pubblicazione: (2025)
Addressing the ID-Matching Challenge in Long Video Captioning
di: Yang, Zhantao, et al.
Pubblicazione: (2025)
di: Yang, Zhantao, et al.
Pubblicazione: (2025)
The Dawn of Video Generation: Preliminary Explorations with SORA-like Models
di: Zeng, Ailing, et al.
Pubblicazione: (2024)
di: Zeng, Ailing, et al.
Pubblicazione: (2024)
Shot2Tactic-Caption: Multi-Scale Captioning of Badminton Videos for Tactical Understanding
di: Ding, Ning, et al.
Pubblicazione: (2025)
di: Ding, Ning, et al.
Pubblicazione: (2025)
SnapCap: Efficient Snapshot Compressive Video Captioning
di: Sun, Jianqiao, et al.
Pubblicazione: (2024)
di: Sun, Jianqiao, et al.
Pubblicazione: (2024)
DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models
di: Chen, Xinlong, et al.
Pubblicazione: (2026)
di: Chen, Xinlong, et al.
Pubblicazione: (2026)
Reinforced Internal-External Knowledge Synergistic Reasoning for Efficient Adaptive Search Agent
di: Huang, Ziyang, et al.
Pubblicazione: (2025)
di: Huang, Ziyang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Consistent Human Image and Video Generation with Spatially Conditioned Diffusion
di: Cao, Mingdeng, et al.
Pubblicazione: (2024) -
Image Conductor: Precision Control for Interactive Video Synthesis
di: Li, Yaowei, et al.
Pubblicazione: (2024) -
VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control
di: Bian, Yuxuan, et al.
Pubblicazione: (2025) -
MotionCraft: Crafting Whole-Body Motion with Plug-and-Play Multimodal Controls
di: Bian, Yuxuan, et al.
Pubblicazione: (2024) -
ReVideo: Remake a Video with Motion and Content Control
di: Mou, Chong, et al.
Pubblicazione: (2024)