Prompt2LVideos: Exploring Prompts for Understanding Long-Form Multimodal Videos
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jahagirdar, Soumya Shamarao, Saha, Jayasree, Jawahar, C V |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TTA-Vid: Generalized Test-Time Adaptation for Video Reasoning
par: Jahagirdar, Soumya Shamarao, et autres
Publié: (2026)
par: Jahagirdar, Soumya Shamarao, et autres
Publié: (2026)
CoS: Chain-of-Shot Prompting for Long Video Understanding
par: Hu, Jian, et autres
Publié: (2025)
par: Hu, Jian, et autres
Publié: (2025)
Hallucination Mitigation Prompts Long-term Video Understanding
par: Sun, Yiwei, et autres
Publié: (2024)
par: Sun, Yiwei, et autres
Publié: (2024)
When LLaVA Meets Objects: Token Composition for Vision-Language-Models
par: Jahagirdar, Soumya, et autres
Publié: (2026)
par: Jahagirdar, Soumya, et autres
Publié: (2026)
Exploring Multimodal Prompts For Unsupervised Continuous Anomaly Detection
par: Zhou, Mingle, et autres
Publié: (2026)
par: Zhou, Mingle, et autres
Publié: (2026)
Source-free Video Domain Adaptation by Learning from Noisy Labels
par: Dasgupta, Avijit, et autres
Publié: (2023)
par: Dasgupta, Avijit, et autres
Publié: (2023)
REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding
par: Li, Jiaze, et autres
Publié: (2025)
par: Li, Jiaze, et autres
Publié: (2025)
Text-Conditioned Resampler For Long Form Video Understanding
par: Korbar, Bruno, et autres
Publié: (2023)
par: Korbar, Bruno, et autres
Publié: (2023)
PrismVAU: Prompt-Refined Inference System for Multimodal Video Anomaly Understanding
par: Erregue, Iñaki, et autres
Publié: (2026)
par: Erregue, Iñaki, et autres
Publié: (2026)
STOP: Integrated Spatial-Temporal Dynamic Prompting for Video Understanding
par: Liu, Zichen, et autres
Publié: (2025)
par: Liu, Zichen, et autres
Publié: (2025)
PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance
par: Sun, Shangkun, et autres
Publié: (2024)
par: Sun, Shangkun, et autres
Publié: (2024)
Assessment of Using Synthetic Data in Brain Tumor Segmentation
par: Jahagirdar, Aditi, et autres
Publié: (2025)
par: Jahagirdar, Aditi, et autres
Publié: (2025)
T*: Re-thinking Temporal Search for Long-Form Video Understanding
par: Ye, Jinhui, et autres
Publié: (2025)
par: Ye, Jinhui, et autres
Publié: (2025)
Zero-Shot Long-Form Video Understanding through Screenplay
par: Wu, Yongliang, et autres
Publié: (2024)
par: Wu, Yongliang, et autres
Publié: (2024)
Long-VMNet: Accelerating Long-Form Video Understanding via Fixed Memory
par: Gurukar, Saket, et autres
Publié: (2025)
par: Gurukar, Saket, et autres
Publié: (2025)
Understanding Long Videos with Multimodal Language Models
par: Ranasinghe, Kanchana, et autres
Publié: (2024)
par: Ranasinghe, Kanchana, et autres
Publié: (2024)
Point Cloud Quantization through Multimodal Prompting for 3D Understanding
par: Li, Hongxuan, et autres
Publié: (2025)
par: Li, Hongxuan, et autres
Publié: (2025)
Exploring Multimodal Diffusion Transformers for Enhanced Prompt-based Image Editing
par: Shin, Joonghyuk, et autres
Publié: (2025)
par: Shin, Joonghyuk, et autres
Publié: (2025)
HW-MLVQA: Elucidating Multilingual Handwritten Document Understanding with a Comprehensive VQA Benchmark
par: Pal, Aniket, et autres
Publié: (2025)
par: Pal, Aniket, et autres
Publié: (2025)
ViKey: Enhancing Temporal Understanding in Videos via Visual Prompting
par: Lee, Yeonkyung, et autres
Publié: (2026)
par: Lee, Yeonkyung, et autres
Publié: (2026)
Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers
par: Yao, Yuxuan, et autres
Publié: (2026)
par: Yao, Yuxuan, et autres
Publié: (2026)
PhyEduVideo: A Benchmark for Evaluating Text-to-Video Models for Physics Education
par: M, Megha Mariam K., et autres
Publié: (2026)
par: M, Megha Mariam K., et autres
Publié: (2026)
In the Eye of MLLM: Benchmarking Egocentric Video Intent Understanding with Gaze-Guided Prompting
par: Peng, Taiying, et autres
Publié: (2025)
par: Peng, Taiying, et autres
Publié: (2025)
X-Prompt: Multi-modal Visual Prompt for Video Object Segmentation
par: Guo, Pinxue, et autres
Publié: (2024)
par: Guo, Pinxue, et autres
Publié: (2024)
CacheFlow: Compressive Streaming Memory for Efficient Long-Form Video Understanding
par: Patel, Shrenik, et autres
Publié: (2025)
par: Patel, Shrenik, et autres
Publié: (2025)
Reading Between the Lanes: Text VideoQA on the Road
par: Tom, George, et autres
Publié: (2023)
par: Tom, George, et autres
Publié: (2023)
VideoAgent2: Enhancing the LLM-Based Agent System for Long-Form Video Understanding by Uncertainty-Aware CoT
par: Zhi, Zhuo, et autres
Publié: (2025)
par: Zhi, Zhuo, et autres
Publié: (2025)
LongViTU: Instruction Tuning for Long-Form Video Understanding
par: Wu, Rujie, et autres
Publié: (2025)
par: Wu, Rujie, et autres
Publié: (2025)
STORM: Token-Efficient Long Video Understanding for Multimodal LLMs
par: Jiang, Jindong, et autres
Publié: (2025)
par: Jiang, Jindong, et autres
Publié: (2025)
VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
par: Yin, Yufei, et autres
Publié: (2025)
par: Yin, Yufei, et autres
Publié: (2025)
State Space Prompting via Gathering and Spreading Spatio-Temporal Information for Video Understanding
par: Zhou, Jiahuan, et autres
Publié: (2025)
par: Zhou, Jiahuan, et autres
Publié: (2025)
GroPrompt: Efficient Grounded Prompting and Adaptation for Referring Video Object Segmentation
par: Lin, Ci-Siang, et autres
Publié: (2024)
par: Lin, Ci-Siang, et autres
Publié: (2024)
PromptMoG: Enhancing Diversity in Long-Prompt Image Generation via Prompt Embedding Mixture-of-Gaussian Sampling
par: Ruan, Bo-Kai, et autres
Publié: (2025)
par: Ruan, Bo-Kai, et autres
Publié: (2025)
Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models
par: Ma, Martin Q., et autres
Publié: (2026)
par: Ma, Martin Q., et autres
Publié: (2026)
MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding
par: Fang, Xinyu, et autres
Publié: (2024)
par: Fang, Xinyu, et autres
Publié: (2024)
MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding
par: Tan, Wenhui, et autres
Publié: (2026)
par: Tan, Wenhui, et autres
Publié: (2026)
Prompting classes: Exploring the Power of Prompt Class Learning in Weakly Supervised Semantic Segmentation
par: Murugesan, Balamurali, et autres
Publié: (2023)
par: Murugesan, Balamurali, et autres
Publié: (2023)
The Devil is in the Prompts: Retrieval-Augmented Prompt Optimization for Text-to-Video Generation
par: Gao, Bingjie, et autres
Publié: (2025)
par: Gao, Bingjie, et autres
Publié: (2025)
FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO
par: Zhao, Fufangchen, et autres
Publié: (2025)
par: Zhao, Fufangchen, et autres
Publié: (2025)
DynImg: Key Frames with Visual Prompts are Good Representation for Multi-Modal Video Understanding
par: Bao, Xiaoyi, et autres
Publié: (2025)
par: Bao, Xiaoyi, et autres
Publié: (2025)
Documents similaires
-
TTA-Vid: Generalized Test-Time Adaptation for Video Reasoning
par: Jahagirdar, Soumya Shamarao, et autres
Publié: (2026) -
CoS: Chain-of-Shot Prompting for Long Video Understanding
par: Hu, Jian, et autres
Publié: (2025) -
Hallucination Mitigation Prompts Long-term Video Understanding
par: Sun, Yiwei, et autres
Publié: (2024) -
When LLaVA Meets Objects: Token Composition for Vision-Language-Models
par: Jahagirdar, Soumya, et autres
Publié: (2026) -
Exploring Multimodal Prompts For Unsupervised Continuous Anomaly Detection
par: Zhou, Mingle, et autres
Publié: (2026)