IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ji, Yatai, Zhang, Shilong, Wu, Jie, Sun, Peize, Chen, Weifeng, Xiao, Xuefeng, Yang, Sidi, Yang, Yujiu, Luo, Ping |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM
par: Ji, Yatai, et autres
Publié: (2024)
par: Ji, Yatai, et autres
Publié: (2024)
From Denoising to Refining: A Corrective Framework for Vision-Language Diffusion Model
par: Ji, Yatai, et autres
Publié: (2025)
par: Ji, Yatai, et autres
Publié: (2025)
Taming Lookup Tables for Efficient Image Retouching
par: Yang, Sidi, et autres
Publié: (2024)
par: Yang, Sidi, et autres
Publié: (2024)
OnlineVPO: Align Video Diffusion Model with Online Video-Centric Preference Optimization
par: Zhang, Jiacheng, et autres
Publié: (2024)
par: Zhang, Jiacheng, et autres
Publié: (2024)
Multimodal Prototype-Enhanced Network for Few-Shot Action Recognition
par: Ni, Xinzhe, et autres
Publié: (2022)
par: Ni, Xinzhe, et autres
Publié: (2022)
PixelFlow: Pixel-Space Generative Models with Flow
par: Chen, Shoufa, et autres
Publié: (2025)
par: Chen, Shoufa, et autres
Publié: (2025)
GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest
par: Zhang, Shilong, et autres
Publié: (2023)
par: Zhang, Shilong, et autres
Publié: (2023)
Control-A-Video: Controllable Text-to-Video Diffusion Models with Motion Prior and Reward Feedback Learning
par: Chen, Weifeng, et autres
Publié: (2023)
par: Chen, Weifeng, et autres
Publié: (2023)
DnLUT: Ultra-Efficient Color Image Denoising via Channel-Aware Lookup Tables
par: Yang, Sidi, et autres
Publié: (2025)
par: Yang, Sidi, et autres
Publié: (2025)
Multilingual Synopses of Movie Narratives: A Dataset for Vision-Language Story Understanding
par: Sun, Yidan, et autres
Publié: (2024)
par: Sun, Yidan, et autres
Publié: (2024)
ID-Aligner: Enhancing Identity-Preserving Text-to-Image Generation with Reward Feedback Learning
par: Chen, Weifeng, et autres
Publié: (2024)
par: Chen, Weifeng, et autres
Publié: (2024)
VLM4D: Towards Spatiotemporal Awareness in Vision Language Models
par: Zhou, Shijie, et autres
Publié: (2025)
par: Zhou, Shijie, et autres
Publié: (2025)
Rolling Shutter Correction with Intermediate Distortion Flow Estimation
par: Cao, Mingdeng, et autres
Publié: (2024)
par: Cao, Mingdeng, et autres
Publié: (2024)
SongSage: A Large Musical Language Model with Lyric Generative Pre-training
par: Guo, Jiani, et autres
Publié: (2026)
par: Guo, Jiani, et autres
Publié: (2026)
Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation
par: Sun, Peize, et autres
Publié: (2024)
par: Sun, Peize, et autres
Publié: (2024)
VEN-VL: A Visual Ensemble MoE Framework for Effective and Efficient Multi-Modal Understanding
par: Wu, Yinghao, et autres
Publié: (2026)
par: Wu, Yinghao, et autres
Publié: (2026)
HyperSeg: Towards Universal Visual Segmentation with Large Language Model
par: Wei, Cong, et autres
Publié: (2024)
par: Wei, Cong, et autres
Publié: (2024)
City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning
par: Sun, Penglei, et autres
Publié: (2025)
par: Sun, Penglei, et autres
Publié: (2025)
RelationVLM: Making Large Vision-Language Models Understand Visual Relations
par: Huang, Zhipeng, et autres
Publié: (2024)
par: Huang, Zhipeng, et autres
Publié: (2024)
Grounded 3D-Aware Spatial Vision-Language Modeling
par: Cheng, An-Chieh, et autres
Publié: (2026)
par: Cheng, An-Chieh, et autres
Publié: (2026)
Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation
par: Ren, Yiming, et autres
Publié: (2026)
par: Ren, Yiming, et autres
Publié: (2026)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
par: Zhu, Yingjie, et autres
Publié: (2024)
par: Zhu, Yingjie, et autres
Publié: (2024)
SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
par: Chen, Pingyi, et autres
Publié: (2025)
par: Chen, Pingyi, et autres
Publié: (2025)
Captain Cinema: Towards Short Movie Generation
par: Xiao, Junfei, et autres
Publié: (2025)
par: Xiao, Junfei, et autres
Publié: (2025)
Immuno-VLM: Immunizing Large Vision-Language Models via Generative Semantic Antibodies for Open-World Trustworthiness
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
Q-VLM: Post-training Quantization for Large Vision-Language Models
par: Wang, Changyuan, et autres
Publié: (2024)
par: Wang, Changyuan, et autres
Publié: (2024)
AquaVLM: Improving Underwater Situation Awareness with Mobile Vision Language Models
par: Tian, Beitong, et autres
Publié: (2025)
par: Tian, Beitong, et autres
Publié: (2025)
A Comprehensive Study of Multimodal Large Language Models for Image Quality Assessment
par: Wu, Tianhe, et autres
Publié: (2024)
par: Wu, Tianhe, et autres
Publié: (2024)
FloorplanVLM: A Vision-Language Model for Floorplan Vectorization
par: Liu, Yuanqing, et autres
Publié: (2026)
par: Liu, Yuanqing, et autres
Publié: (2026)
DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models
par: Tian, Xiaoyu, et autres
Publié: (2024)
par: Tian, Xiaoyu, et autres
Publié: (2024)
CoHD: A Counting-Aware Hierarchical Decoding Framework for Generalized Referring Expression Segmentation
par: Luo, Zhuoyan, et autres
Publié: (2024)
par: Luo, Zhuoyan, et autres
Publié: (2024)
MovieTeller: Tool-augmented Movie Synopsis with ID Consistent Progressive Abstraction
par: Li, Yizhi, et autres
Publié: (2026)
par: Li, Yizhi, et autres
Publié: (2026)
Towards Understanding How Knowledge Evolves in Large Vision-Language Models
par: Wang, Sudong, et autres
Publié: (2025)
par: Wang, Sudong, et autres
Publié: (2025)
Toward Guidance-Free AR Visual Generation via Condition Contrastive Alignment
par: Chen, Huayu, et autres
Publié: (2024)
par: Chen, Huayu, et autres
Publié: (2024)
LongVLM: Efficient Long Video Understanding via Large Language Models
par: Weng, Yuetian, et autres
Publié: (2024)
par: Weng, Yuetian, et autres
Publié: (2024)
VLM4Rec: Multimodal Semantic Representation for Recommendation with Large Vision-Language Models
par: Valencia, Ty, et autres
Publié: (2026)
par: Valencia, Ty, et autres
Publié: (2026)
StateVLM: A State-Aware Vision-Language Model for Robotic Affordance Reasoning
par: Sun, Xiaowen, et autres
Publié: (2026)
par: Sun, Xiaowen, et autres
Publié: (2026)
HanMoVLM: Large Vision-Language Models for Professional Artistic Painting Evaluation
par: Yang, Hongji, et autres
Publié: (2026)
par: Yang, Hongji, et autres
Publié: (2026)
RegionGPT: Towards Region Understanding Vision Language Model
par: Guo, Qiushan, et autres
Publié: (2024)
par: Guo, Qiushan, et autres
Publié: (2024)
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
par: Liu, Hanqing, et autres
Publié: (2026)
par: Liu, Hanqing, et autres
Publié: (2026)
Documents similaires
-
Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM
par: Ji, Yatai, et autres
Publié: (2024) -
From Denoising to Refining: A Corrective Framework for Vision-Language Diffusion Model
par: Ji, Yatai, et autres
Publié: (2025) -
Taming Lookup Tables for Efficient Image Retouching
par: Yang, Sidi, et autres
Publié: (2024) -
OnlineVPO: Align Video Diffusion Model with Online Video-Centric Preference Optimization
par: Zhang, Jiacheng, et autres
Publié: (2024) -
Multimodal Prototype-Enhanced Network for Few-Shot Action Recognition
par: Ni, Xinzhe, et autres
Publié: (2022)