SKALD: Learning-Based Shot Assembly for Coherent Multi-Shot Video Creation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lu, Chen Yi, Tanjim, Md Mehrab, Dasgupta, Ishita, Sarkhel, Somdeb, Wu, Gang, Mitra, Saayan, Chaterji, Somali |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Atom: Efficient On-Device Video-Language Pipelines Through Modular Reuse
par: Panchal, Kunjal, et autres
Publié: (2025)
par: Panchal, Kunjal, et autres
Publié: (2025)
GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling
par: Shekhar, Shivanshu, et autres
Publié: (2026)
par: Shekhar, Shivanshu, et autres
Publié: (2026)
A Penalty Goes a Long Way: Measuring Lexical Diversity in Synthetic Texts Under Prompt-Influenced Length Variations
par: Deshpande, Vijeta, et autres
Publié: (2025)
par: Deshpande, Vijeta, et autres
Publié: (2025)
X-Reflect: Cross-Reflection Prompting for Multimodal Recommendation
par: Lyu, Hanjia, et autres
Publié: (2024)
par: Lyu, Hanjia, et autres
Publié: (2024)
HanDiffuser: Text-to-Image Generation With Realistic Hand Appearances
par: Narasimhaswamy, Supreeth, et autres
Publié: (2024)
par: Narasimhaswamy, Supreeth, et autres
Publié: (2024)
On Explaining Visual Captioning with Hybrid Markov Logic Networks
par: Shah, Monika, et autres
Publié: (2025)
par: Shah, Monika, et autres
Publié: (2025)
Disentangling Fine-Tuning from Pre-Training in Visual Captioning with Hybrid Markov Logic
par: Shah, Monika, et autres
Publié: (2025)
par: Shah, Monika, et autres
Publié: (2025)
ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation
par: Yang, Songlin, et autres
Publié: (2026)
par: Yang, Songlin, et autres
Publié: (2026)
Rethinking Failure Attribution in Multi-Agent Systems: A Multi-Perspective Benchmark and Evaluation
par: In, Yeonjun, et autres
Publié: (2026)
par: In, Yeonjun, et autres
Publié: (2026)
MOCHA: Multi-Objective Chebyshev Annealing for Agent Skill Optimization
par: Tanjim, Md Mehrab, et autres
Publié: (2026)
par: Tanjim, Md Mehrab, et autres
Publié: (2026)
Learning to Inference Adaptively for Multimodal Large Language Models
par: Xu, Zhuoyan, et autres
Publié: (2025)
par: Xu, Zhuoyan, et autres
Publié: (2025)
OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory
par: An, Zhaochong, et autres
Publié: (2025)
par: An, Zhaochong, et autres
Publié: (2025)
Hubs and Spokes Learning: Efficient and Scalable Collaborative Machine Learning
par: Sharma, Atul, et autres
Publié: (2025)
par: Sharma, Atul, et autres
Publié: (2025)
Analyzing the Sensitivity of Vision Language Models in Visual Question Answering
par: Shah, Monika, et autres
Publié: (2025)
par: Shah, Monika, et autres
Publié: (2025)
MultiShotMaster: A Controllable Multi-Shot Video Generation Framework
par: Wang, Qinghe, et autres
Publié: (2025)
par: Wang, Qinghe, et autres
Publié: (2025)
EchoShot: Multi-Shot Portrait Video Generation
par: Wang, Jiahao, et autres
Publié: (2025)
par: Wang, Jiahao, et autres
Publié: (2025)
ShotDirector: Directorially Controllable Multi-Shot Video Generation with Cinematographic Transitions
par: Wu, Xiaoxue, et autres
Publié: (2025)
par: Wu, Xiaoxue, et autres
Publié: (2025)
Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles
par: Slyman, Eric, et autres
Publié: (2025)
par: Slyman, Eric, et autres
Publié: (2025)
ESA: Energy-Based Shot Assembly Optimization for Automatic Video Editing
par: Chen, Yaosen, et autres
Publié: (2025)
par: Chen, Yaosen, et autres
Publié: (2025)
MindShot: Multi-Shot Video Reconstruction from fMRI with LLM Decoding
par: Zeng, Wenwen, et autres
Publié: (2025)
par: Zeng, Wenwen, et autres
Publié: (2025)
ShotStream: Streaming Multi-Shot Video Generation for Interactive Storytelling
par: Luo, Yawen, et autres
Publié: (2026)
par: Luo, Yawen, et autres
Publié: (2026)
ShotAdapter: Text-to-Multi-Shot Video Generation with Diffusion Models
par: Kara, Ozgur, et autres
Publié: (2025)
par: Kara, Ozgur, et autres
Publié: (2025)
Few-Shot-Based Modular Image-to-Video Adapter for Diffusion Models
par: Li, Zhenhao, et autres
Publié: (2025)
par: Li, Zhenhao, et autres
Publié: (2025)
PVChat: Personalized Video Chat with One-Shot Learning
par: Shi, Yufei, et autres
Publié: (2025)
par: Shi, Yufei, et autres
Publié: (2025)
Aspect-Based Few-Shot Learning
par: van Engeland, Tim, et autres
Publié: (2024)
par: van Engeland, Tim, et autres
Publié: (2024)
Zero-Shot Long-Form Video Understanding through Screenplay
par: Wu, Yongliang, et autres
Publié: (2024)
par: Wu, Yongliang, et autres
Publié: (2024)
Few-Shot Learning in Video and 3D Object Detection: A Survey
par: Ferdaus, Md Meftahul, et autres
Publié: (2025)
par: Ferdaus, Md Meftahul, et autres
Publié: (2025)
One-Shot Learning Meets Depth Diffusion in Multi-Object Videos
par: Jain, Anisha
Publié: (2024)
par: Jain, Anisha
Publié: (2024)
Leveraging Pretrained Diffusion Models for Zero-Shot Part Assembly
par: Zhang, Ruiyuan, et autres
Publié: (2025)
par: Zhang, Ruiyuan, et autres
Publié: (2025)
MADS: Multi-Attribute Document Supervision for Zero-Shot Image Classification
par: Qu, Xiangyan, et autres
Publié: (2025)
par: Qu, Xiangyan, et autres
Publié: (2025)
Coherent Zero-Shot Visual Instruction Generation
par: Phung, Quynh, et autres
Publié: (2024)
par: Phung, Quynh, et autres
Publié: (2024)
Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation
par: Huang, Binyuan, et autres
Publié: (2026)
par: Huang, Binyuan, et autres
Publié: (2026)
AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation
par: Qiu, Lu, et autres
Publié: (2025)
par: Qiu, Lu, et autres
Publié: (2025)
Video In-context Learning: Autoregressive Transformers are Zero-Shot Video Imitators
par: Zhang, Wentao, et autres
Publié: (2024)
par: Zhang, Wentao, et autres
Publié: (2024)
Are Image-to-Video Models Good Zero-Shot Image Editors?
par: Zhang, Zechuan, et autres
Publié: (2025)
par: Zhang, Zechuan, et autres
Publié: (2025)
Zero-to-Hero: Zero-Shot Initialization Empowering Reference-Based Video Appearance Editing
par: Su, Tongtong, et autres
Publié: (2025)
par: Su, Tongtong, et autres
Publié: (2025)
VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning
par: Wang, Zikang, et autres
Publié: (2025)
par: Wang, Zikang, et autres
Publié: (2025)
Detecting Ambiguities to Guide Query Rewrite for Robust Conversations in Enterprise AI Assistants
par: Tanjim, Md Mehrab, et autres
Publié: (2025)
par: Tanjim, Md Mehrab, et autres
Publié: (2025)
DiTVR: Zero-Shot Diffusion Transformer for Video Restoration
par: Gao, Sicheng, et autres
Publié: (2025)
par: Gao, Sicheng, et autres
Publié: (2025)
Breaking Forgetting: Training-Free Few-Shot Class-Incremental Learning via Conditional Diffusion
par: Kang, Haidong, et autres
Publié: (2025)
par: Kang, Haidong, et autres
Publié: (2025)
Documents similaires
-
Atom: Efficient On-Device Video-Language Pipelines Through Modular Reuse
par: Panchal, Kunjal, et autres
Publié: (2025) -
GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling
par: Shekhar, Shivanshu, et autres
Publié: (2026) -
A Penalty Goes a Long Way: Measuring Lexical Diversity in Synthetic Texts Under Prompt-Influenced Length Variations
par: Deshpande, Vijeta, et autres
Publié: (2025) -
X-Reflect: Cross-Reflection Prompting for Multimodal Recommendation
par: Lyu, Hanjia, et autres
Publié: (2024) -
HanDiffuser: Text-to-Image Generation With Realistic Hand Appearances
par: Narasimhaswamy, Supreeth, et autres
Publié: (2024)