Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Qiuheng, Shi, Yukai, Ou, Jiarong, Chen, Rui, Lin, Ke, Wang, Jiahao, Jiang, Boyuan, Yang, Haotian, Zheng, Mingwu, Tao, Xin, Yang, Fei, Wan, Pengfei, Zhang, Di |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VIVID-10M: A Dataset and Baseline for Versatile and Interactive Video Local Editing
par: Hu, Jiahao, et autres
Publié: (2024)
par: Hu, Jiahao, et autres
Publié: (2024)
Imbalance in Balance: Online Concept Balancing in Generation Models
par: Shi, Yukai, et autres
Publié: (2025)
par: Shi, Yukai, et autres
Publié: (2025)
BadVideo: Stealthy Backdoor Attack against Text-to-Video Generation
par: Wang, Ruotong, et autres
Publié: (2025)
par: Wang, Ruotong, et autres
Publié: (2025)
Towards Precise Scaling Laws for Video Diffusion Transformers
par: Yin, Yuanyang, et autres
Publié: (2024)
par: Yin, Yuanyang, et autres
Publié: (2024)
Improving Video Generation with Human Feedback
par: Liu, Jie, et autres
Publié: (2025)
par: Liu, Jie, et autres
Publié: (2025)
Unleashing Video Language Models for Fine-grained HRCT Report Generation
par: Fang, Yingying, et autres
Publié: (2026)
par: Fang, Yingying, et autres
Publié: (2026)
MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models
par: Hong, Wenyi, et autres
Publié: (2025)
par: Hong, Wenyi, et autres
Publié: (2025)
Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation
par: Wu, Shengqiong, et autres
Publié: (2025)
par: Wu, Shengqiong, et autres
Publié: (2025)
VRMM: A Volumetric Relightable Morphable Head Model
par: Yang, Haotian, et autres
Publié: (2024)
par: Yang, Haotian, et autres
Publié: (2024)
Trajectory Attention for Fine-grained Video Motion Control
par: Xiao, Zeqi, et autres
Publié: (2024)
par: Xiao, Zeqi, et autres
Publié: (2024)
VideoTetris: Towards Compositional Text-to-Video Generation
par: Tian, Ye, et autres
Publié: (2024)
par: Tian, Ye, et autres
Publié: (2024)
Towards Fine-grained Interactive Segmentation in Images and Videos
par: Yao, Yuan, et autres
Publié: (2025)
par: Yao, Yuan, et autres
Publié: (2025)
Learning Temporally Consistent Video Depth from Video Diffusion Priors
par: Shao, Jiahao, et autres
Publié: (2024)
par: Shao, Jiahao, et autres
Publié: (2024)
Tri-Ergon: Fine-grained Video-to-Audio Generation with Multi-modal Conditions and LUFS Control
par: Li, Bingliang, et autres
Publié: (2024)
par: Li, Bingliang, et autres
Publié: (2024)
See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding
par: Sun, Boyuan, et autres
Publié: (2026)
par: Sun, Boyuan, et autres
Publié: (2026)
MemFlow: Flowing Adaptive Memory for Consistent and Efficient Long Video Narratives
par: Ji, Sihui, et autres
Publié: (2025)
par: Ji, Sihui, et autres
Publié: (2025)
Birding at Koala Park
par: NA
Publié: (1989)
par: NA
Publié: (1989)
Fisiología del Koala
Publié: (1980)
Publié: (1980)
Fine-grained Spatiotemporal Grounding on Egocentric Videos
par: Liang, Shuo, et autres
Publié: (2025)
par: Liang, Shuo, et autres
Publié: (2025)
Gloria: Consistent Character Video Generation via Content Anchors
par: Yang, Yuhang, et autres
Publié: (2026)
par: Yang, Yuhang, et autres
Publié: (2026)
CoCoCo: Improving Text-Guided Video Inpainting for Better Consistency, Controllability and Compatibility
par: Zi, Bojia, et autres
Publié: (2024)
par: Zi, Bojia, et autres
Publié: (2024)
FriendsQA: A New Large-Scale Deep Video Understanding Dataset with Fine-grained Topic Categorization for Story Videos
par: Wu, Zhengqian, et autres
Publié: (2024)
par: Wu, Zhengqian, et autres
Publié: (2024)
VC-Agent: An Interactive Agent for Customized Video Dataset Collection
par: Zhang, Yidan, et autres
Publié: (2025)
par: Zhang, Yidan, et autres
Publié: (2025)
VFRTok: Variable Frame Rates Video Tokenizer with Duration-Proportional Information Assumption
par: Zhong, Tianxiong, et autres
Publié: (2025)
par: Zhong, Tianxiong, et autres
Publié: (2025)
XS-VID: An Extremely Small Video Object Detection Dataset
par: Guo, Jiahao, et autres
Publié: (2024)
par: Guo, Jiahao, et autres
Publié: (2024)
VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation
par: Zhang, Shi-Xue, et autres
Publié: (2025)
par: Zhang, Shi-Xue, et autres
Publié: (2025)
AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation
par: Girish, Sharath, et autres
Publié: (2025)
par: Girish, Sharath, et autres
Publié: (2025)
Video Repurposing from User Generated Content: A Large-scale Dataset and Benchmark
par: Wu, Yongliang, et autres
Publié: (2024)
par: Wu, Yongliang, et autres
Publié: (2024)
FineVQ: Fine-Grained User Generated Content Video Quality Assessment
par: Duan, Huiyu, et autres
Publié: (2024)
par: Duan, Huiyu, et autres
Publié: (2024)
ColoDiff: Integrating Dynamic Consistency With Content Awareness for Colonoscopy Video Generation
par: Fu, Junhu, et autres
Publié: (2026)
par: Fu, Junhu, et autres
Publié: (2026)
BrokenVideos: A Benchmark Dataset for Fine-Grained Artifact Localization in AI-Generated Videos
par: Lin, Jiahao, et autres
Publié: (2025)
par: Lin, Jiahao, et autres
Publié: (2025)
FingER: Content Aware Fine-grained Evaluation with Reasoning for AI-Generated Videos
par: Chen, Rui, et autres
Publié: (2025)
par: Chen, Rui, et autres
Publié: (2025)
VideoStudio: Generating Consistent-Content and Multi-Scene Videos
par: Long, Fuchen, et autres
Publié: (2024)
par: Long, Fuchen, et autres
Publié: (2024)
Koala Tree Planting Day
par: NA
Publié: (2023)
par: NA
Publié: (2023)
Safe Delta: Consistently Preserving Safety when Fine-Tuning LLMs on Diverse Datasets
par: Lu, Ning, et autres
Publié: (2025)
par: Lu, Ning, et autres
Publié: (2025)
Storyboard guided Alignment for Fine-grained Video Action Recognition
par: Liu, Enqi, et autres
Publié: (2024)
par: Liu, Enqi, et autres
Publié: (2024)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
par: Wang, Haibo, et autres
Publié: (2024)
par: Wang, Haibo, et autres
Publié: (2024)
VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning
par: Cai, Minghong, et autres
Publié: (2025)
par: Cai, Minghong, et autres
Publié: (2025)
A Reason-then-Describe Instruction Interpreter for Controllable Video Generation
par: Wu, Shengqiong, et autres
Publié: (2025)
par: Wu, Shengqiong, et autres
Publié: (2025)
VMoBA: Mixture-of-Block Attention for Video Diffusion Models
par: Wu, Jianzong, et autres
Publié: (2025)
par: Wu, Jianzong, et autres
Publié: (2025)
Documents similaires
-
VIVID-10M: A Dataset and Baseline for Versatile and Interactive Video Local Editing
par: Hu, Jiahao, et autres
Publié: (2024) -
Imbalance in Balance: Online Concept Balancing in Generation Models
par: Shi, Yukai, et autres
Publié: (2025) -
BadVideo: Stealthy Backdoor Attack against Text-to-Video Generation
par: Wang, Ruotong, et autres
Publié: (2025) -
Towards Precise Scaling Laws for Video Diffusion Transformers
par: Yin, Yuanyang, et autres
Publié: (2024) -
Improving Video Generation with Human Feedback
par: Liu, Jie, et autres
Publié: (2025)