Towards Automated Movie Trailer Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Argaw, Dawit Mureja, Soldan, Mattia, Pardo, Alejandro, Zhao, Chen, Heilbron, Fabian Caba, Chung, Joon Son, Ghanem, Bernard |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Scaling Up Video Summarization Pretraining with Large Language Models
par: Argaw, Dawit Mureja, et autres
Publié: (2024)
par: Argaw, Dawit Mureja, et autres
Publié: (2024)
MambaVideo for Discrete Video Tokenization with Channel-Split Quantization
par: Argaw, Dawit Mureja, et autres
Publié: (2025)
par: Argaw, Dawit Mureja, et autres
Publié: (2025)
ResidualViT for Efficient Temporally Dense Video Encoding
par: Soldan, Mattia, et autres
Publié: (2025)
par: Soldan, Mattia, et autres
Publié: (2025)
Generative Timelines for Instructed Visual Assembly
par: Pardo, Alejandro, et autres
Publié: (2024)
par: Pardo, Alejandro, et autres
Publié: (2024)
Compressed-Language Models for Understanding Compressed File Formats: a JPEG Exploration
par: Pérez, Juan C., et autres
Publié: (2024)
par: Pérez, Juan C., et autres
Publié: (2024)
BEAT: Rhythm-Elastic Alignment for Agentic Music-guided Movie Trailer Generation
par: Wang, Yutong, et autres
Publié: (2026)
par: Wang, Yutong, et autres
Publié: (2026)
Self-Paced and Self-Corrective Masked Prediction for Movie Trailer Generation
par: Zhu, Sidan, et autres
Publié: (2025)
par: Zhu, Sidan, et autres
Publié: (2025)
Adapting Dual-encoder Vision-language Models for Paraphrased Retrieval
par: Cheng, Jiacheng, et autres
Publié: (2024)
par: Cheng, Jiacheng, et autres
Publié: (2024)
EditDuet: A Multi-Agent System for Video Non-Linear Editing
par: Sandoval-Castaneda, Marcelo, et autres
Publié: (2025)
par: Sandoval-Castaneda, Marcelo, et autres
Publié: (2025)
Videogenic: Identifying Highlight Moments in Videos with Professional Photographs as a Prior
par: Lin, David Chuan-En, et autres
Publié: (2022)
par: Lin, David Chuan-En, et autres
Publié: (2022)
VideoMap: Supporting Video Editing Exploration, Brainstorming, and Prototyping in the Latent Space
par: Lin, David Chuan-En, et autres
Publié: (2022)
par: Lin, David Chuan-En, et autres
Publié: (2022)
Sync from the Sea: Retrieving Alignable Videos from Large-Scale Datasets
par: Dave, Ishan Rajendrakumar, et autres
Publié: (2024)
par: Dave, Ishan Rajendrakumar, et autres
Publié: (2024)
Concept Weaver: Enabling Multi-Concept Fusion in Text-to-Image Models
par: Kwon, Gihyun, et autres
Publié: (2024)
par: Kwon, Gihyun, et autres
Publié: (2024)
Discovering Divergent Representations between Text-to-Image Models
par: Dunlap, Lisa, et autres
Publié: (2025)
par: Dunlap, Lisa, et autres
Publié: (2025)
Improving Personalized Search with Regularized Low-Rank Parameter Updates
par: Ryan, Fiona, et autres
Publié: (2025)
par: Ryan, Fiona, et autres
Publié: (2025)
Exploring Missing Modality in Multimodal Egocentric Datasets
par: Ramazanova, Merey, et autres
Publié: (2024)
par: Ramazanova, Merey, et autres
Publié: (2024)
Test-Time Adaptation for Combating Missing Modalities in Egocentric Videos
par: Ramazanova, Merey, et autres
Publié: (2024)
par: Ramazanova, Merey, et autres
Publié: (2024)
CineVerse: Consistent Keyframe Synthesis for Cinematic Scene Composition
par: Phung, Quynh, et autres
Publié: (2025)
par: Phung, Quynh, et autres
Publié: (2025)
OpenTAD: A Unified Framework and Comprehensive Study of Temporal Action Detection
par: Liu, Shuming, et autres
Publié: (2025)
par: Liu, Shuming, et autres
Publié: (2025)
Movie Trailer Genre Classification Using Multimodal Pretrained Features
par: Sulun, Serkan, et autres
Publié: (2024)
par: Sulun, Serkan, et autres
Publié: (2024)
Captain Cinema: Towards Short Movie Generation
par: Xiao, Junfei, et autres
Publié: (2025)
par: Xiao, Junfei, et autres
Publié: (2025)
Video Self-Stitching Graph Network for Temporal Action Localization
par: Zhao, Chen, et autres
Publié: (2020)
par: Zhao, Chen, et autres
Publié: (2020)
Automated Movie Generation via Multi-Agent CoT Planning
par: Wu, Weijia, et autres
Publié: (2025)
par: Wu, Weijia, et autres
Publié: (2025)
AVCD: Mitigating Hallucinations in Audio-Visual Large Language Models through Contrastive Decoding
par: Jung, Chaeyoung, et autres
Publié: (2025)
par: Jung, Chaeyoung, et autres
Publié: (2025)
On the Nature of Attention Sink that Shapes Decoding Strategy in Omni-LLMs
par: Yoo, Suho, et autres
Publié: (2026)
par: Yoo, Suho, et autres
Publié: (2026)
Test-Time Augmentation for Pose-invariant Face Recognition
par: Jung, Jaemin, et autres
Publié: (2025)
par: Jung, Jaemin, et autres
Publié: (2025)
BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding
par: Liu, Shuming, et autres
Publié: (2025)
par: Liu, Shuming, et autres
Publié: (2025)
$β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment
par: Zohra, Fatimah, et autres
Publié: (2025)
par: Zohra, Fatimah, et autres
Publié: (2025)
End-to-End Temporal Action Detection with 1B Parameters Across 1000 Frames
par: Liu, Shuming, et autres
Publié: (2023)
par: Liu, Shuming, et autres
Publié: (2023)
MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing
par: Zheng, Junjie, et autres
Publié: (2025)
par: Zheng, Junjie, et autres
Publié: (2025)
MovieDreamer: Hierarchical Generation for Coherent Long Visual Sequence
par: Zhao, Canyu, et autres
Publié: (2024)
par: Zhao, Canyu, et autres
Publié: (2024)
SMILE: Infusing Spatial and Motion Semantics in Masked Video Learning
par: Thoker, Fida Mohammad, et autres
Publié: (2025)
par: Thoker, Fida Mohammad, et autres
Publié: (2025)
Mind-the-Glitch: Visual Correspondence for Detecting Inconsistencies in Subject-Driven Generation
par: Eldesokey, Abdelrahman, et autres
Publié: (2025)
par: Eldesokey, Abdelrahman, et autres
Publié: (2025)
MovieBench: A Hierarchical Movie Level Dataset for Long Video Generation
par: Wu, Weijia, et autres
Publié: (2024)
par: Wu, Weijia, et autres
Publié: (2024)
Fork-Merge Decoding: Enhancing Multimodal Understanding in Audio-Visual Large Language Models
par: Jung, Chaeyoung, et autres
Publié: (2025)
par: Jung, Chaeyoung, et autres
Publié: (2025)
Deep Understanding of Sign Language for Sign to Subtitle Alignment
par: Jang, Youngjoon, et autres
Publié: (2025)
par: Jang, Youngjoon, et autres
Publié: (2025)
Keep What Audio Cannot Say: Context-Preserving Token Pruning for Omni-LLMs
par: Jung, Chaeyoung, et autres
Publié: (2026)
par: Jung, Chaeyoung, et autres
Publié: (2026)
Hybrid Structure-from-Motion and Camera Relocalization for Enhanced Egocentric Localization
par: Mai, Jinjie, et autres
Publié: (2024)
par: Mai, Jinjie, et autres
Publié: (2024)
MatchDiffusion: Training-free Generation of Match-cuts
par: Pardo, Alejandro, et autres
Publié: (2024)
par: Pardo, Alejandro, et autres
Publié: (2024)
MoCha: Towards Movie-Grade Talking Character Synthesis
par: Wei, Cong, et autres
Publié: (2025)
par: Wei, Cong, et autres
Publié: (2025)
Documents similaires
-
Scaling Up Video Summarization Pretraining with Large Language Models
par: Argaw, Dawit Mureja, et autres
Publié: (2024) -
MambaVideo for Discrete Video Tokenization with Channel-Split Quantization
par: Argaw, Dawit Mureja, et autres
Publié: (2025) -
ResidualViT for Efficient Temporally Dense Video Encoding
par: Soldan, Mattia, et autres
Publié: (2025) -
Generative Timelines for Instructed Visual Assembly
par: Pardo, Alejandro, et autres
Publié: (2024) -
Compressed-Language Models for Understanding Compressed File Formats: a JPEG Exploration
par: Pérez, Juan C., et autres
Publié: (2024)