Enregistré dans:
| Auteurs principaux: | Li, Yizhi, Chen, Xiaohan, Jiang, Miao, Tang, Wentao, Wang, Gaoang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.23228 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MovieCORE: COgnitive REasoning in Movies
par: Faure, Gueter Josmy, et autres
Publié: (2025)
par: Faure, Gueter Josmy, et autres
Publié: (2025)
IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language Model
par: Ji, Yatai, et autres
Publié: (2024)
par: Ji, Yatai, et autres
Publié: (2024)
ScreenWriter: Automatic Screenplay Generation and Movie Summarisation
par: Mahon, Louis, et autres
Publié: (2024)
par: Mahon, Louis, et autres
Publié: (2024)
Demystifying Visual Features of Movie Posters for Multi-Label Genre Identification
par: Nareti, Utsav Kumar, et autres
Publié: (2023)
par: Nareti, Utsav Kumar, et autres
Publié: (2023)
Predicting Brain Responses To Natural Movies With Multimodal LLMs
par: Villanueva, Cesar Kadir Torrico, et autres
Publié: (2025)
par: Villanueva, Cesar Kadir Torrico, et autres
Publié: (2025)
ScriptViz: A Visualization Tool to Aid Scriptwriting based on a Large Movie Database
par: Rao, Anyi, et autres
Publié: (2024)
par: Rao, Anyi, et autres
Publié: (2024)
Movie Gen: A Cast of Media Foundation Models
par: Polyak, Adam, et autres
Publié: (2024)
par: Polyak, Adam, et autres
Publié: (2024)
StoryMovie: A Dataset for Semantic Alignment of Visual Stories with Movie Scripts and Subtitles
par: Oliveira, Daniel, et autres
Publié: (2026)
par: Oliveira, Daniel, et autres
Publié: (2026)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
par: Song, Enxin, et autres
Publié: (2024)
par: Song, Enxin, et autres
Publié: (2024)
Sam-Guided Enhanced Fine-Grained Encoding with Mixed Semantic Learning for Medical Image Captioning
par: Zhang, Zhenyu, et autres
Publié: (2023)
par: Zhang, Zhenyu, et autres
Publié: (2023)
Predicting Movie Production Years through Facial Recognition of Actors with Machine Learning
par: Abdalah, Asraa Muayed, et autres
Publié: (2025)
par: Abdalah, Asraa Muayed, et autres
Publié: (2025)
FunCineForge: A Unified Dataset Toolkit and Model for Zero-Shot Movie Dubbing in Diverse Cinematic Scenes
par: Liu, Jiaxuan, et autres
Publié: (2026)
par: Liu, Jiaxuan, et autres
Publié: (2026)
Movie2Story: A framework for understanding videos and telling stories in the form of novel text
par: Li, Kangning, et autres
Publié: (2024)
par: Li, Kangning, et autres
Publié: (2024)
Movie Trailer Genre Classification Using Multimodal Pretrained Features
par: Sulun, Serkan, et autres
Publié: (2024)
par: Sulun, Serkan, et autres
Publié: (2024)
See, Act, Adapt: Active Perception for Unsupervised Cross-Domain Visual Adaptation via Personalized VLM-Guided Agent
par: Tang, Tianci, et autres
Publié: (2026)
par: Tang, Tianci, et autres
Publié: (2026)
Incentivizing Tool-augmented Thinking with Images for Medical Image Analysis
par: Jiang, Yankai, et autres
Publié: (2025)
par: Jiang, Yankai, et autres
Publié: (2025)
Movie Gen: SWOT Analysis of Meta's Generative AI Foundation Model for Transforming Media Generation, Advertising, and Entertainment Industries
par: Ehtesham, Abul, et autres
Publié: (2024)
par: Ehtesham, Abul, et autres
Publié: (2024)
WithAnyone: Towards Controllable and ID Consistent Image Generation
par: Xu, Hengyuan, et autres
Publié: (2025)
par: Xu, Hengyuan, et autres
Publié: (2025)
ConsistentID: Portrait Generation with Multimodal Fine-Grained Identity Preserving
par: Huang, Jiehui, et autres
Publié: (2024)
par: Huang, Jiehui, et autres
Publié: (2024)
MovieBench: A Hierarchical Movie Level Dataset for Long Video Generation
par: Wu, Weijia, et autres
Publié: (2024)
par: Wu, Weijia, et autres
Publié: (2024)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
par: Guo, Xuechen, et autres
Publié: (2024)
par: Guo, Xuechen, et autres
Publié: (2024)
Hi-LSplat: Hierarchical 3D Language Gaussian Splatting
par: Zhan, Chenlu, et autres
Publié: (2025)
par: Zhan, Chenlu, et autres
Publié: (2025)
Movie101v2: Improved Movie Narration Benchmark
par: Yue, Zihao, et autres
Publié: (2024)
par: Yue, Zihao, et autres
Publié: (2024)
MovieChat: From Dense Token to Sparse Memory for Long Video Understanding
par: Song, Enxin, et autres
Publié: (2023)
par: Song, Enxin, et autres
Publié: (2023)
Hand3R: Online 4D Hand-Scene Reconstruction in the Wild
par: Hu, Wendi, et autres
Publié: (2026)
par: Hu, Wendi, et autres
Publié: (2026)
MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing
par: Zheng, Junjie, et autres
Publié: (2025)
par: Zheng, Junjie, et autres
Publié: (2025)
DynaHOI: Benchmarking Hand-Object Interaction for Dynamic Target
par: Hu, BoCheng, et autres
Publié: (2026)
par: Hu, BoCheng, et autres
Publié: (2026)
Large Language Model Guided Progressive Feature Alignment for Multimodal UAV Object Detection
par: Wu, Wentao, et autres
Publié: (2025)
par: Wu, Wentao, et autres
Publié: (2025)
Towards Automated Movie Trailer Generation
par: Argaw, Dawit Mureja, et autres
Publié: (2024)
par: Argaw, Dawit Mureja, et autres
Publié: (2024)
Chasing Better Deep Image Priors between Over- and Under-parameterization
par: Wu, Qiming, et autres
Publié: (2024)
par: Wu, Qiming, et autres
Publié: (2024)
Captain Cinema: Towards Short Movie Generation
par: Xiao, Junfei, et autres
Publié: (2025)
par: Xiao, Junfei, et autres
Publié: (2025)
Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark
par: Song, Enxin, et autres
Publié: (2025)
par: Song, Enxin, et autres
Publié: (2025)
InstantID: Zero-shot Identity-Preserving Generation in Seconds
par: Wang, Qixun, et autres
Publié: (2024)
par: Wang, Qixun, et autres
Publié: (2024)
Character-Centric Understanding of Animated Movies
par: Gui, Zhongrui, et autres
Publié: (2025)
par: Gui, Zhongrui, et autres
Publié: (2025)
Exploring Homogeneous and Heterogeneous Consistent Label Associations for Unsupervised Visible-Infrared Person ReID
par: He, Lingfeng, et autres
Publié: (2024)
par: He, Lingfeng, et autres
Publié: (2024)
ReTool-Video: Recursive Tool-Using Video Agents with Meta-Augmented Tool Grounding
par: Liu, Xiao, et autres
Publié: (2026)
par: Liu, Xiao, et autres
Publié: (2026)
DreamID: High-Fidelity and Fast diffusion-based Face Swapping via Triplet ID Group Learning
par: Ye, Fulong, et autres
Publié: (2025)
par: Ye, Fulong, et autres
Publié: (2025)
Designing Domain-Specific Agents via Hierarchical Task Abstraction Mechanism
par: Li, Kaiyu, et autres
Publié: (2025)
par: Li, Kaiyu, et autres
Publié: (2025)
Depth-Consistent 3D Gaussian Splatting via Physical Defocus Modeling and Multi-View Geometric Supervision
par: Deng, Yu, et autres
Publié: (2025)
par: Deng, Yu, et autres
Publié: (2025)
MovieDreamer: Hierarchical Generation for Coherent Long Visual Sequence
par: Zhao, Canyu, et autres
Publié: (2024)
par: Zhao, Canyu, et autres
Publié: (2024)
Documents similaires
-
MovieCORE: COgnitive REasoning in Movies
par: Faure, Gueter Josmy, et autres
Publié: (2025) -
IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language Model
par: Ji, Yatai, et autres
Publié: (2024) -
ScreenWriter: Automatic Screenplay Generation and Movie Summarisation
par: Mahon, Louis, et autres
Publié: (2024) -
Demystifying Visual Features of Movie Posters for Multi-Label Genre Identification
par: Nareti, Utsav Kumar, et autres
Publié: (2023) -
Predicting Brain Responses To Natural Movies With Multimodal LLMs
par: Villanueva, Cesar Kadir Torrico, et autres
Publié: (2025)