Guardado en:
| Autores principales: | Li, Yizhi, Chen, Xiaohan, Jiang, Miao, Tang, Wentao, Wang, Gaoang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2602.23228 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MovieCORE: COgnitive REasoning in Movies
por: Faure, Gueter Josmy, et al.
Publicado: (2025)
por: Faure, Gueter Josmy, et al.
Publicado: (2025)
IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language Model
por: Ji, Yatai, et al.
Publicado: (2024)
por: Ji, Yatai, et al.
Publicado: (2024)
ScreenWriter: Automatic Screenplay Generation and Movie Summarisation
por: Mahon, Louis, et al.
Publicado: (2024)
por: Mahon, Louis, et al.
Publicado: (2024)
Demystifying Visual Features of Movie Posters for Multi-Label Genre Identification
por: Nareti, Utsav Kumar, et al.
Publicado: (2023)
por: Nareti, Utsav Kumar, et al.
Publicado: (2023)
Predicting Brain Responses To Natural Movies With Multimodal LLMs
por: Villanueva, Cesar Kadir Torrico, et al.
Publicado: (2025)
por: Villanueva, Cesar Kadir Torrico, et al.
Publicado: (2025)
ScriptViz: A Visualization Tool to Aid Scriptwriting based on a Large Movie Database
por: Rao, Anyi, et al.
Publicado: (2024)
por: Rao, Anyi, et al.
Publicado: (2024)
Movie Gen: A Cast of Media Foundation Models
por: Polyak, Adam, et al.
Publicado: (2024)
por: Polyak, Adam, et al.
Publicado: (2024)
StoryMovie: A Dataset for Semantic Alignment of Visual Stories with Movie Scripts and Subtitles
por: Oliveira, Daniel, et al.
Publicado: (2026)
por: Oliveira, Daniel, et al.
Publicado: (2026)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
por: Song, Enxin, et al.
Publicado: (2024)
por: Song, Enxin, et al.
Publicado: (2024)
Sam-Guided Enhanced Fine-Grained Encoding with Mixed Semantic Learning for Medical Image Captioning
por: Zhang, Zhenyu, et al.
Publicado: (2023)
por: Zhang, Zhenyu, et al.
Publicado: (2023)
Predicting Movie Production Years through Facial Recognition of Actors with Machine Learning
por: Abdalah, Asraa Muayed, et al.
Publicado: (2025)
por: Abdalah, Asraa Muayed, et al.
Publicado: (2025)
FunCineForge: A Unified Dataset Toolkit and Model for Zero-Shot Movie Dubbing in Diverse Cinematic Scenes
por: Liu, Jiaxuan, et al.
Publicado: (2026)
por: Liu, Jiaxuan, et al.
Publicado: (2026)
Movie2Story: A framework for understanding videos and telling stories in the form of novel text
por: Li, Kangning, et al.
Publicado: (2024)
por: Li, Kangning, et al.
Publicado: (2024)
Movie Trailer Genre Classification Using Multimodal Pretrained Features
por: Sulun, Serkan, et al.
Publicado: (2024)
por: Sulun, Serkan, et al.
Publicado: (2024)
See, Act, Adapt: Active Perception for Unsupervised Cross-Domain Visual Adaptation via Personalized VLM-Guided Agent
por: Tang, Tianci, et al.
Publicado: (2026)
por: Tang, Tianci, et al.
Publicado: (2026)
Incentivizing Tool-augmented Thinking with Images for Medical Image Analysis
por: Jiang, Yankai, et al.
Publicado: (2025)
por: Jiang, Yankai, et al.
Publicado: (2025)
Movie Gen: SWOT Analysis of Meta's Generative AI Foundation Model for Transforming Media Generation, Advertising, and Entertainment Industries
por: Ehtesham, Abul, et al.
Publicado: (2024)
por: Ehtesham, Abul, et al.
Publicado: (2024)
WithAnyone: Towards Controllable and ID Consistent Image Generation
por: Xu, Hengyuan, et al.
Publicado: (2025)
por: Xu, Hengyuan, et al.
Publicado: (2025)
ConsistentID: Portrait Generation with Multimodal Fine-Grained Identity Preserving
por: Huang, Jiehui, et al.
Publicado: (2024)
por: Huang, Jiehui, et al.
Publicado: (2024)
MovieBench: A Hierarchical Movie Level Dataset for Long Video Generation
por: Wu, Weijia, et al.
Publicado: (2024)
por: Wu, Weijia, et al.
Publicado: (2024)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
por: Guo, Xuechen, et al.
Publicado: (2024)
por: Guo, Xuechen, et al.
Publicado: (2024)
Hi-LSplat: Hierarchical 3D Language Gaussian Splatting
por: Zhan, Chenlu, et al.
Publicado: (2025)
por: Zhan, Chenlu, et al.
Publicado: (2025)
Movie101v2: Improved Movie Narration Benchmark
por: Yue, Zihao, et al.
Publicado: (2024)
por: Yue, Zihao, et al.
Publicado: (2024)
MovieChat: From Dense Token to Sparse Memory for Long Video Understanding
por: Song, Enxin, et al.
Publicado: (2023)
por: Song, Enxin, et al.
Publicado: (2023)
Hand3R: Online 4D Hand-Scene Reconstruction in the Wild
por: Hu, Wendi, et al.
Publicado: (2026)
por: Hu, Wendi, et al.
Publicado: (2026)
MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing
por: Zheng, Junjie, et al.
Publicado: (2025)
por: Zheng, Junjie, et al.
Publicado: (2025)
DynaHOI: Benchmarking Hand-Object Interaction for Dynamic Target
por: Hu, BoCheng, et al.
Publicado: (2026)
por: Hu, BoCheng, et al.
Publicado: (2026)
Large Language Model Guided Progressive Feature Alignment for Multimodal UAV Object Detection
por: Wu, Wentao, et al.
Publicado: (2025)
por: Wu, Wentao, et al.
Publicado: (2025)
Towards Automated Movie Trailer Generation
por: Argaw, Dawit Mureja, et al.
Publicado: (2024)
por: Argaw, Dawit Mureja, et al.
Publicado: (2024)
Chasing Better Deep Image Priors between Over- and Under-parameterization
por: Wu, Qiming, et al.
Publicado: (2024)
por: Wu, Qiming, et al.
Publicado: (2024)
Captain Cinema: Towards Short Movie Generation
por: Xiao, Junfei, et al.
Publicado: (2025)
por: Xiao, Junfei, et al.
Publicado: (2025)
Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark
por: Song, Enxin, et al.
Publicado: (2025)
por: Song, Enxin, et al.
Publicado: (2025)
InstantID: Zero-shot Identity-Preserving Generation in Seconds
por: Wang, Qixun, et al.
Publicado: (2024)
por: Wang, Qixun, et al.
Publicado: (2024)
Character-Centric Understanding of Animated Movies
por: Gui, Zhongrui, et al.
Publicado: (2025)
por: Gui, Zhongrui, et al.
Publicado: (2025)
Exploring Homogeneous and Heterogeneous Consistent Label Associations for Unsupervised Visible-Infrared Person ReID
por: He, Lingfeng, et al.
Publicado: (2024)
por: He, Lingfeng, et al.
Publicado: (2024)
ReTool-Video: Recursive Tool-Using Video Agents with Meta-Augmented Tool Grounding
por: Liu, Xiao, et al.
Publicado: (2026)
por: Liu, Xiao, et al.
Publicado: (2026)
DreamID: High-Fidelity and Fast diffusion-based Face Swapping via Triplet ID Group Learning
por: Ye, Fulong, et al.
Publicado: (2025)
por: Ye, Fulong, et al.
Publicado: (2025)
Designing Domain-Specific Agents via Hierarchical Task Abstraction Mechanism
por: Li, Kaiyu, et al.
Publicado: (2025)
por: Li, Kaiyu, et al.
Publicado: (2025)
Depth-Consistent 3D Gaussian Splatting via Physical Defocus Modeling and Multi-View Geometric Supervision
por: Deng, Yu, et al.
Publicado: (2025)
por: Deng, Yu, et al.
Publicado: (2025)
MovieDreamer: Hierarchical Generation for Coherent Long Visual Sequence
por: Zhao, Canyu, et al.
Publicado: (2024)
por: Zhao, Canyu, et al.
Publicado: (2024)
Ejemplares similares
-
MovieCORE: COgnitive REasoning in Movies
por: Faure, Gueter Josmy, et al.
Publicado: (2025) -
IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language Model
por: Ji, Yatai, et al.
Publicado: (2024) -
ScreenWriter: Automatic Screenplay Generation and Movie Summarisation
por: Mahon, Louis, et al.
Publicado: (2024) -
Demystifying Visual Features of Movie Posters for Multi-Label Genre Identification
por: Nareti, Utsav Kumar, et al.
Publicado: (2023) -
Predicting Brain Responses To Natural Movies With Multimodal LLMs
por: Villanueva, Cesar Kadir Torrico, et al.
Publicado: (2025)