KeyVideoLLM: Towards Large-scale Video Keyframe Selection
Fuente:
arXiv
Guardado en:
| Autores principales: | Liang, Hao, Li, Jiapeng, Bai, Tianyi, Huang, Xijie, Sun, Linzhuang, Wang, Zhengren, He, Conghui, Cui, Bin, Chen, Chong, Zhang, Wentao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction
por: Zhang, Qintong, et al.
Publicado: (2024)
por: Zhang, Qintong, et al.
Publicado: (2024)
Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding
por: Wang, Shaoguang, et al.
Publicado: (2026)
por: Wang, Shaoguang, et al.
Publicado: (2026)
A Survey of Multimodal Large Language Model from A Data-centric Perspective
por: Bai, Tianyi, et al.
Publicado: (2024)
por: Bai, Tianyi, et al.
Publicado: (2024)
DrawVideo: Generating Long Video from Storyboard Keyframe Sketches
por: Xu, Chuanzhi, et al.
Publicado: (2026)
por: Xu, Chuanzhi, et al.
Publicado: (2026)
VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
por: Wang, Jiapeng, et al.
Publicado: (2024)
por: Wang, Jiapeng, et al.
Publicado: (2024)
Towards Emotion Analysis in Short-form Videos: A Large-Scale Dataset and Baseline
por: Wu, Xuecheng, et al.
Publicado: (2023)
por: Wu, Xuecheng, et al.
Publicado: (2023)
TheoremExplainAgent: Towards Video-based Multimodal Explanations for LLM Theorem Understanding
por: Ku, Max, et al.
Publicado: (2025)
por: Ku, Max, et al.
Publicado: (2025)
LLaVA-NeuMT: Selective Layer-Neuron Modulation for Efficient Multilingual Multimodal Translation
por: Wei, Jingxuan, et al.
Publicado: (2025)
por: Wei, Jingxuan, et al.
Publicado: (2025)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
por: Han, ZhaoYang, et al.
Publicado: (2025)
por: Han, ZhaoYang, et al.
Publicado: (2025)
Interpretable Embedding for Ad-hoc Video Search
por: Wu, Jiaxin, et al.
Publicado: (2024)
por: Wu, Jiaxin, et al.
Publicado: (2024)
MindCine: Multimodal EEG-to-Video Reconstruction with Large-Scale Pretrained Models
por: Zhou, Tian-Yi, et al.
Publicado: (2026)
por: Zhou, Tian-Yi, et al.
Publicado: (2026)
MindCross: Fast New Subject Adaptation with Limited Data for Cross-subject Video Reconstruction from Brain Signals
por: Liu, Xuan-Hao, et al.
Publicado: (2025)
por: Liu, Xuan-Hao, et al.
Publicado: (2025)
FlowVid: Taming Imperfect Optical Flows for Consistent Video-to-Video Synthesis
por: Liang, Feng, et al.
Publicado: (2023)
por: Liang, Feng, et al.
Publicado: (2023)
Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM
por: Ji, Yatai, et al.
Publicado: (2024)
por: Ji, Yatai, et al.
Publicado: (2024)
Looking Backward: Streaming Video-to-Video Translation with Feature Banks
por: Liang, Feng, et al.
Publicado: (2024)
por: Liang, Feng, et al.
Publicado: (2024)
Towards Event-oriented Long Video Understanding
por: Du, Yifan, et al.
Publicado: (2024)
por: Du, Yifan, et al.
Publicado: (2024)
Medical MLLM is Vulnerable: Cross-Modality Jailbreak and Mismatched Attacks on Medical Multimodal Large Language Models
por: Huang, Xijie, et al.
Publicado: (2024)
por: Huang, Xijie, et al.
Publicado: (2024)
FCMBench-Video: Benchmarking Document Video Intelligence
por: Cui, Runze, et al.
Publicado: (2026)
por: Cui, Runze, et al.
Publicado: (2026)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
por: Qu, Mengxue, et al.
Publicado: (2024)
por: Qu, Mengxue, et al.
Publicado: (2024)
Video Watermarking: Safeguarding Your Video from (Unauthorized) Annotations by Video-based LLMs
por: Li, Jinmin, et al.
Publicado: (2024)
por: Li, Jinmin, et al.
Publicado: (2024)
Scene Detection Policies and Keyframe Extraction Strategies for Large-Scale Video Analysis
por: Korolkov, Vasilii
Publicado: (2025)
por: Korolkov, Vasilii
Publicado: (2025)
Efficient Self-Supervised Video Hashing with Selective State Spaces
por: Wang, Jinpeng, et al.
Publicado: (2024)
por: Wang, Jinpeng, et al.
Publicado: (2024)
When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
por: Zhang, Pingping, et al.
Publicado: (2024)
por: Zhang, Pingping, et al.
Publicado: (2024)
VKIE: The Application of Key Information Extraction on Video Text
por: An, Siyu, et al.
Publicado: (2023)
por: An, Siyu, et al.
Publicado: (2023)
Efficient Selective Audio Masked Multimodal Bottleneck Transformer for Audio-Video Classification
por: Zhu, Wentao
Publicado: (2024)
por: Zhu, Wentao
Publicado: (2024)
HFS: Holistic Query-Aware Frame Selection for Efficient Video Reasoning
por: Yang, Yiqing, et al.
Publicado: (2025)
por: Yang, Yiqing, et al.
Publicado: (2025)
Shorter Is Different: Characterizing the Dynamics of Short-Form Video Platforms
por: Chen, Zhilong, et al.
Publicado: (2024)
por: Chen, Zhilong, et al.
Publicado: (2024)
SVFAP: Self-supervised Video Facial Affect Perceiver
por: Sun, Licai, et al.
Publicado: (2023)
por: Sun, Licai, et al.
Publicado: (2023)
DanceCamAnimator: Keyframe-Based Controllable 3D Dance Camera Synthesis
por: Wang, Zixuan, et al.
Publicado: (2024)
por: Wang, Zixuan, et al.
Publicado: (2024)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
por: Xu, Yifang, et al.
Publicado: (2025)
por: Xu, Yifang, et al.
Publicado: (2025)
LipGen: Viseme-Guided Lip Video Generation for Enhancing Visual Speech Recognition
por: Hao, Bowen, et al.
Publicado: (2025)
por: Hao, Bowen, et al.
Publicado: (2025)
MSVBench: Towards Human-Level Evaluation of Multi-Shot Video Generation
por: Shi, Haoyuan, et al.
Publicado: (2026)
por: Shi, Haoyuan, et al.
Publicado: (2026)
A Survey of Information Disorder on Video-Sharing Platforms
por: Li, Meiyu, et al.
Publicado: (2025)
por: Li, Meiyu, et al.
Publicado: (2025)
Failures to Surface Harmful Contents in Video Large Language Models
por: Cao, Yuxin, et al.
Publicado: (2025)
por: Cao, Yuxin, et al.
Publicado: (2025)
Context-Enhanced Video Moment Retrieval with Large Language Models
por: Liu, Weijia, et al.
Publicado: (2024)
por: Liu, Weijia, et al.
Publicado: (2024)
A Survey on Generative AI and LLM for Video Generation, Understanding, and Streaming
por: Zhou, Pengyuan, et al.
Publicado: (2024)
por: Zhou, Pengyuan, et al.
Publicado: (2024)
Synth-Empathy: Towards High-Quality Synthetic Empathy Data
por: Liang, Hao, et al.
Publicado: (2024)
por: Liang, Hao, et al.
Publicado: (2024)
Video Summarization: Towards Entity-Aware Captions
por: Ayyubi, Hammad A., et al.
Publicado: (2023)
por: Ayyubi, Hammad A., et al.
Publicado: (2023)
FunQA: Towards Surprising Video Comprehension
por: Xie, Binzhu, et al.
Publicado: (2023)
por: Xie, Binzhu, et al.
Publicado: (2023)
VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos
por: Yu, Jiashuo, et al.
Publicado: (2025)
por: Yu, Jiashuo, et al.
Publicado: (2025)
Ejemplares similares
-
Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction
por: Zhang, Qintong, et al.
Publicado: (2024) -
Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding
por: Wang, Shaoguang, et al.
Publicado: (2026) -
A Survey of Multimodal Large Language Model from A Data-centric Perspective
por: Bai, Tianyi, et al.
Publicado: (2024) -
DrawVideo: Generating Long Video from Storyboard Keyframe Sketches
por: Xu, Chuanzhi, et al.
Publicado: (2026) -
VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
por: Wang, Jiapeng, et al.
Publicado: (2024)