Trailer Reimagined: An Innovative, Llm-DRiven, Expressive Automated Movie Summary framework (TRAILDREAMS)
Fuente:
arXiv
Guardado en:
| Autores principales: | Balestri, Roberto, Cascarano, Pasquale, Esposti, Mirko Degli, Pescatore, Guglielmo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
An Automatic Deep Learning Approach for Trailer Generation through Large Language Models
por: Balestri, Roberto, et al.
Publicado: (2026)
por: Balestri, Roberto, et al.
Publicado: (2026)
Multi-Agent System for AI-Assisted Extraction of Narrative Arcs in TV Series
por: Balestri, Roberto, et al.
Publicado: (2025)
por: Balestri, Roberto, et al.
Publicado: (2025)
Narrative Memory in Machines: Multi-Agent Arc Extraction in Serialized TV
por: Balestri, Roberto, et al.
Publicado: (2025)
por: Balestri, Roberto, et al.
Publicado: (2025)
AI Blob! LLM-Driven Recontextualization of Italian Television Archives
por: Balestri, Roberto
Publicado: (2025)
por: Balestri, Roberto
Publicado: (2025)
Movie Trailer Genre Classification Using Multimodal Pretrained Features
por: Sulun, Serkan, et al.
Publicado: (2024)
por: Sulun, Serkan, et al.
Publicado: (2024)
An Inverse Partial Optimal Transport Framework for Music-guided Movie Trailer Generation
por: Wang, Yutong, et al.
Publicado: (2024)
por: Wang, Yutong, et al.
Publicado: (2024)
Unraveling Movie Genres through Cross-Attention Fusion of Bi-Modal Synergy of Poster
por: Nareti, Utsav Kumar, et al.
Publicado: (2024)
por: Nareti, Utsav Kumar, et al.
Publicado: (2024)
Pianist Transformer: Towards Expressive Piano Performance Rendering via Scalable Self-Supervised Pre-Training
por: You, Hong-Jie, et al.
Publicado: (2025)
por: You, Hong-Jie, et al.
Publicado: (2025)
ScreenWriter: Automatic Screenplay Generation and Movie Summarisation
por: Mahon, Louis, et al.
Publicado: (2024)
por: Mahon, Louis, et al.
Publicado: (2024)
MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation
por: Li, Haitian, et al.
Publicado: (2026)
por: Li, Haitian, et al.
Publicado: (2026)
Gesture2Speech: How Far Can Hand Movements Shape Expressive Speech?
por: Kumar, Lokesh, et al.
Publicado: (2026)
por: Kumar, Lokesh, et al.
Publicado: (2026)
Generative AI for Video Trailer Synthesis: From Extractive Heuristics to Autoregressive Creativity
por: Dharmaratnakar, Abhishek, et al.
Publicado: (2026)
por: Dharmaratnakar, Abhishek, et al.
Publicado: (2026)
Exploring Classical Piano Performance Generation with Expressive Music Variational AutoEncoder
por: Luo, Jing, et al.
Publicado: (2025)
por: Luo, Jing, et al.
Publicado: (2025)
Controllable Expressive 3D Facial Animation via Diffusion in a Unified Multimodal Space
por: Liu, Kangwei, et al.
Publicado: (2025)
por: Liu, Kangwei, et al.
Publicado: (2025)
Towards Automatic Soccer Commentary Generation with Knowledge-Enhanced Visual Reasoning
por: Jin, Zeyu, et al.
Publicado: (2026)
por: Jin, Zeyu, et al.
Publicado: (2026)
Semantic-Guided Unsupervised Video Summarization
por: Liu, Haizhou, et al.
Publicado: (2026)
por: Liu, Haizhou, et al.
Publicado: (2026)
QMAVIS: Long Video-Audio Understanding using Fusion of Large Multimodal Models
por: Lin, Zixing, et al.
Publicado: (2026)
por: Lin, Zixing, et al.
Publicado: (2026)
RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild
por: Xu, Danni, et al.
Publicado: (2026)
por: Xu, Danni, et al.
Publicado: (2026)
Contestable Multi-Agent Debate with Arena-based Argumentative Computation for Multimedia Verification
por: Nguyen, Truong Thanh Hung, et al.
Publicado: (2026)
por: Nguyen, Truong Thanh Hung, et al.
Publicado: (2026)
MMTB: Evaluating Terminal Agents on Multimedia-File Tasks
por: Heo, Chiyeong, et al.
Publicado: (2026)
por: Heo, Chiyeong, et al.
Publicado: (2026)
Enhancing Multimodal Retrieval via Complementary Information Extraction and Alignment
por: Zeng, Delong, et al.
Publicado: (2026)
por: Zeng, Delong, et al.
Publicado: (2026)
HCVR Scene Generation: High Compatibility Virtual Reality Environment Generation for Extended Redirected Walking
por: Zhang, Yiran, et al.
Publicado: (2026)
por: Zhang, Yiran, et al.
Publicado: (2026)
Exposing Cross-Modal Consistency for Fake News Detection in Short-Form Videos
por: Tian, Chong, et al.
Publicado: (2026)
por: Tian, Chong, et al.
Publicado: (2026)
Tri-Subspaces Disentanglement for Multimodal Sentiment Analysis
por: Meng, Chunlei, et al.
Publicado: (2026)
por: Meng, Chunlei, et al.
Publicado: (2026)
Back to Basics: Revisiting ASR in the Age of Voice Agents
por: Tay, Geeyang, et al.
Publicado: (2026)
por: Tay, Geeyang, et al.
Publicado: (2026)
ELF: A Family of Encoder-Free ECG-Language Models
por: Han, William, et al.
Publicado: (2026)
por: Han, William, et al.
Publicado: (2026)
Seeing Further and Wider: Joint Spatio-Temporal Enlargement for Micro-Video Popularity Prediction
por: Wang, Dali, et al.
Publicado: (2026)
por: Wang, Dali, et al.
Publicado: (2026)
LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?
por: Wang, Xiaohan, et al.
Publicado: (2026)
por: Wang, Xiaohan, et al.
Publicado: (2026)
Stage Light is Sequence$^2$: Multi-Light Control via Imitation Learning
por: Zhao, Zijian, et al.
Publicado: (2026)
por: Zhao, Zijian, et al.
Publicado: (2026)
Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs
por: Chen, Jianhao, et al.
Publicado: (2026)
por: Chen, Jianhao, et al.
Publicado: (2026)
3D Software Synthesis Guided by Constraint-Expressive Intermediate Representation
por: Li, Shuqing, et al.
Publicado: (2025)
por: Li, Shuqing, et al.
Publicado: (2025)
Real-Time Mobile Video Analytics for Pre-arrival Emergency Medical Services
por: Jin, Liuyi, et al.
Publicado: (2025)
por: Jin, Liuyi, et al.
Publicado: (2025)
Why We Feel: Breaking Boundaries in Emotional Reasoning with Multimodal Large Language Models
por: Lin, Yuxiang, et al.
Publicado: (2025)
por: Lin, Yuxiang, et al.
Publicado: (2025)
A Multi-modal Fusion Network for Terrain Perception Based on Illumination Aware
por: Wang, Rui, et al.
Publicado: (2025)
por: Wang, Rui, et al.
Publicado: (2025)
Synthesizing Sentiment-Controlled Feedback For Multimodal Text and Image Data
por: Kumar, Puneet, et al.
Publicado: (2024)
por: Kumar, Puneet, et al.
Publicado: (2024)
Wireless Video Semantic Communication with Decoupled Diffusion Multi-frame Compensation
por: Xie, Bingyan, et al.
Publicado: (2025)
por: Xie, Bingyan, et al.
Publicado: (2025)
HiQuE: Hierarchical Question Embedding Network for Multimodal Depression Detection
por: Jung, Juho, et al.
Publicado: (2024)
por: Jung, Juho, et al.
Publicado: (2024)
DiVR: incorporating context from diverse VR scenes for human trajectory prediction
por: Gallo, Franz Franco, et al.
Publicado: (2024)
por: Gallo, Franz Franco, et al.
Publicado: (2024)
A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects
por: Ruan, Shulan, et al.
Publicado: (2025)
por: Ruan, Shulan, et al.
Publicado: (2025)
When Harmful Content Gets Camouflaged: Unveiling Perception Failure of LVLMs with CamHarmTI
por: Li, Yanhui, et al.
Publicado: (2025)
por: Li, Yanhui, et al.
Publicado: (2025)
Ejemplares similares
-
An Automatic Deep Learning Approach for Trailer Generation through Large Language Models
por: Balestri, Roberto, et al.
Publicado: (2026) -
Multi-Agent System for AI-Assisted Extraction of Narrative Arcs in TV Series
por: Balestri, Roberto, et al.
Publicado: (2025) -
Narrative Memory in Machines: Multi-Agent Arc Extraction in Serialized TV
por: Balestri, Roberto, et al.
Publicado: (2025) -
AI Blob! LLM-Driven Recontextualization of Italian Television Archives
por: Balestri, Roberto
Publicado: (2025) -
Movie Trailer Genre Classification Using Multimodal Pretrained Features
por: Sulun, Serkan, et al.
Publicado: (2024)