V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hua, Hang, Tang, Yolo Yunlong, Xu, Chenliang, Luo, Jiebo |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding
par: Tang, Yolo Yunlong, et autres
Publié: (2024)
par: Tang, Yolo Yunlong, et autres
Publié: (2024)
VideoXum: Cross-modal Visual and Textural Summarization of Videos
par: Lin, Jingyang, et autres
Publié: (2023)
par: Lin, Jingyang, et autres
Publié: (2023)
Can VLMs Truly Forget? Benchmarking Training-Free Visual Concept Unlearning
par: Tan, Zhangyun, et autres
Publié: (2026)
par: Tan, Zhangyun, et autres
Publié: (2026)
VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?
par: Tang, Yolo Y., et autres
Publié: (2024)
par: Tang, Yolo Y., et autres
Publié: (2024)
Multi-modal Segment Assemblage Network for Ad Video Editing with Importance-Coherence Reward
par: Tang, Yolo Yunlong, et autres
Publié: (2022)
par: Tang, Yolo Yunlong, et autres
Publié: (2022)
Dynamic Cross-Modal Prompt Generation for Multimodal Continual Instruction Tuning
par: Hu, Tao, et autres
Publié: (2026)
par: Hu, Tao, et autres
Publié: (2026)
Do More Details Always Introduce More Hallucinations in LVLM-based Image Captioning?
par: Feng, Mingqian, et autres
Publié: (2024)
par: Feng, Mingqian, et autres
Publié: (2024)
What to Do Next? Memorizing skills from Egocentric Instructional Video
par: Bi, Jing, et autres
Publié: (2025)
par: Bi, Jing, et autres
Publié: (2025)
TDMM-LM: Bridging Facial Understanding and Animation via Language Models
par: Song, Luchuan, et autres
Publié: (2026)
par: Song, Luchuan, et autres
Publié: (2026)
CaRDiff: Video Salient Object Ranking Chain of Thought Reasoning for Saliency Prediction with Diffusion
par: Tang, Yolo Yunlong, et autres
Publié: (2024)
par: Tang, Yolo Yunlong, et autres
Publié: (2024)
MM-Prompt: Cross-Modal Prompt Tuning for Continual Visual Question Answering
par: Li, Xu, et autres
Publié: (2025)
par: Li, Xu, et autres
Publié: (2025)
Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination
par: Tang, Yolo Y., et autres
Publié: (2025)
par: Tang, Yolo Y., et autres
Publié: (2025)
GenDDS: Generating Diverse Driving Video Scenarios with Prompt-to-Video Generative Model
par: Fu, Yongjie, et autres
Publié: (2024)
par: Fu, Yongjie, et autres
Publié: (2024)
EAGLE: Egocentric AGgregated Language-video Engine
par: Bi, Jing, et autres
Publié: (2024)
par: Bi, Jing, et autres
Publié: (2024)
Less is More: Label-Guided Summarization of Procedural and Instructional Videos
par: Rajpal, Shreya, et autres
Publié: (2026)
par: Rajpal, Shreya, et autres
Publié: (2026)
Cluster-based Video Summarization with Temporal Context Awareness
par: Huynh-Lam, Hai-Dang, et autres
Publié: (2024)
par: Huynh-Lam, Hai-Dang, et autres
Publié: (2024)
SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding
par: Chen, Zhen, et autres
Publié: (2025)
par: Chen, Zhen, et autres
Publié: (2025)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
par: Hua, Hang, et autres
Publié: (2024)
par: Hua, Hang, et autres
Publié: (2024)
GaussianStyle: Gaussian Head Avatar via StyleGAN
par: Liu, Pinxin, et autres
Publié: (2024)
par: Liu, Pinxin, et autres
Publié: (2024)
CVPT: Cross Visual Prompt Tuning
par: Huang, Lingyun, et autres
Publié: (2024)
par: Huang, Lingyun, et autres
Publié: (2024)
Towards Visual-Prompt Temporal Answering Grounding in Medical Instructional Video
par: Li, Bin, et autres
Publié: (2022)
par: Li, Bin, et autres
Publié: (2022)
OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation
par: Yuan, Shenghai, et autres
Publié: (2025)
par: Yuan, Shenghai, et autres
Publié: (2025)
Multi-Prompt with Depth Partitioned Cross-Modal Learning
par: Tian, Yingjie, et autres
Publié: (2023)
par: Tian, Yingjie, et autres
Publié: (2023)
MLVTG: Mamba-Based Feature Alignment and LLM-Driven Purification for Multi-Modal Video Temporal Grounding
par: Zhu, Zhiyi, et autres
Publié: (2025)
par: Zhu, Zhiyi, et autres
Publié: (2025)
TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization
par: Kim, Sumin, et autres
Publié: (2026)
par: Kim, Sumin, et autres
Publié: (2026)
Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization
par: Zhang, Zhiwang, et autres
Publié: (2025)
par: Zhang, Zhiwang, et autres
Publié: (2025)
Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs
par: Han, Kai, et autres
Publié: (2024)
par: Han, Kai, et autres
Publié: (2024)
Controllable Navigation Instruction Generation with Chain of Thought Prompting
par: Kong, Xianghao, et autres
Publié: (2024)
par: Kong, Xianghao, et autres
Publié: (2024)
Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification
par: Wang, Xiao, et autres
Publié: (2026)
par: Wang, Xiao, et autres
Publié: (2026)
Biomed-DPT: Dual Modality Prompt Tuning for Biomedical Vision-Language Models
par: Peng, Wei, et autres
Publié: (2025)
par: Peng, Wei, et autres
Publié: (2025)
VTG-GPT: Tuning-Free Zero-Shot Video Temporal Grounding with GPT
par: Xu, Yifang, et autres
Publié: (2024)
par: Xu, Yifang, et autres
Publié: (2024)
Video-As-Prompt: Unified Semantic Control for Video Generation
par: Bian, Yuxuan, et autres
Publié: (2025)
par: Bian, Yuxuan, et autres
Publié: (2025)
Understanding Temporal Logic Consistency in Video-Language Models through Cross-Modal Attention Discriminability
par: Li, Chengzhi, et autres
Publié: (2025)
par: Li, Chengzhi, et autres
Publié: (2025)
CMD-HAR: Cross-Modal Disentanglement for Wearable Human Activity Recognition
par: Yu, Ying, et autres
Publié: (2025)
par: Yu, Ying, et autres
Publié: (2025)
Video-STaR: Self-Training Enables Video Instruction Tuning with Any Supervision
par: Zohar, Orr, et autres
Publié: (2024)
par: Zohar, Orr, et autres
Publié: (2024)
Cross-Modal Transferable Image-to-Video Attack on Video Quality Metrics
par: Gotin, Georgii, et autres
Publié: (2025)
par: Gotin, Georgii, et autres
Publié: (2025)
Personalized Video Summarization by Multimodal Video Understanding
par: Chen, Brian, et autres
Publié: (2024)
par: Chen, Brian, et autres
Publié: (2024)
Dense Video Captioning using Graph-based Sentence Summarization
par: Zhang, Zhiwang, et autres
Publié: (2025)
par: Zhang, Zhiwang, et autres
Publié: (2025)
VideoSAGE: Video Summarization with Graph Representation Learning
par: Chaves, Jose M. Rojas, et autres
Publié: (2024)
par: Chaves, Jose M. Rojas, et autres
Publié: (2024)
Enhancing Video Summarization with Context Awareness
par: Huynh-Lam, Hai-Dang, et autres
Publié: (2024)
par: Huynh-Lam, Hai-Dang, et autres
Publié: (2024)
Documents similaires
-
Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding
par: Tang, Yolo Yunlong, et autres
Publié: (2024) -
VideoXum: Cross-modal Visual and Textural Summarization of Videos
par: Lin, Jingyang, et autres
Publié: (2023) -
Can VLMs Truly Forget? Benchmarking Training-Free Visual Concept Unlearning
par: Tan, Zhangyun, et autres
Publié: (2026) -
VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?
par: Tang, Yolo Y., et autres
Publié: (2024) -
Multi-modal Segment Assemblage Network for Ad Video Editing with Importance-Coherence Reward
par: Tang, Yolo Yunlong, et autres
Publié: (2022)