Parameter-free Video Segmentation for Vision and Language Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Mahon, Louis, Lapata, Mirella |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ScreenWriter: Automatic Screenplay Generation and Movie Summarisation
di: Mahon, Louis, et al.
Pubblicazione: (2024)
di: Mahon, Louis, et al.
Pubblicazione: (2024)
TABLET: A Large-Scale Dataset for Robust Visual Table Understanding
di: Alonso, Iñigo, et al.
Pubblicazione: (2025)
di: Alonso, Iñigo, et al.
Pubblicazione: (2025)
Finding the Right Moment: Human-Assisted Trailer Creation via Task Composition
di: Papalampidi, Pinelopi, et al.
Pubblicazione: (2021)
di: Papalampidi, Pinelopi, et al.
Pubblicazione: (2021)
What Is That Talk About? A Video-to-Text Summarization Dataset for Scientific Presentations
di: Liu, Dongqi, et al.
Pubblicazione: (2025)
di: Liu, Dongqi, et al.
Pubblicazione: (2025)
Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering
di: Gupta, Akash, et al.
Pubblicazione: (2025)
di: Gupta, Akash, et al.
Pubblicazione: (2025)
K*-Means: A Parameter-free Clustering Algorithm
di: Mahon, Louis, et al.
Pubblicazione: (2025)
di: Mahon, Louis, et al.
Pubblicazione: (2025)
Local Compositional Complexity: How to Detect a Human-readable Messsage
di: Mahon, Louis
Pubblicazione: (2025)
di: Mahon, Louis
Pubblicazione: (2025)
Video-Panda: Parameter-efficient Alignment for Encoder-free Video-Language Models
di: Yi, Jinhui, et al.
Pubblicazione: (2024)
di: Yi, Jinhui, et al.
Pubblicazione: (2024)
Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models
di: Ma, Martin Q., et al.
Pubblicazione: (2026)
di: Ma, Martin Q., et al.
Pubblicazione: (2026)
Goldfish: Vision-Language Understanding of Arbitrarily Long Videos
di: Ataallah, Kirolos, et al.
Pubblicazione: (2024)
di: Ataallah, Kirolos, et al.
Pubblicazione: (2024)
Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding
di: Shu, Yan, et al.
Pubblicazione: (2024)
di: Shu, Yan, et al.
Pubblicazione: (2024)
Open-ended Hierarchical Streaming Video Understanding with Vision Language Models
di: Kang, Hyolim, et al.
Pubblicazione: (2025)
di: Kang, Hyolim, et al.
Pubblicazione: (2025)
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
di: Maaz, Muhammad, et al.
Pubblicazione: (2023)
di: Maaz, Muhammad, et al.
Pubblicazione: (2023)
A Modular Approach for Multimodal Summarization of TV Shows
di: Mahon, Louis, et al.
Pubblicazione: (2024)
di: Mahon, Louis, et al.
Pubblicazione: (2024)
Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models
di: Berman, Nimrod, et al.
Pubblicazione: (2025)
di: Berman, Nimrod, et al.
Pubblicazione: (2025)
Temporal-Oriented Recipe for Transferring Large Vision-Language Model to Video Understanding
di: Nguyen, Thong, et al.
Pubblicazione: (2025)
di: Nguyen, Thong, et al.
Pubblicazione: (2025)
Vivim: a Video Vision Mamba for Medical Video Segmentation
di: Yang, Yijun, et al.
Pubblicazione: (2024)
di: Yang, Yijun, et al.
Pubblicazione: (2024)
DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval
di: Shen, Leqi, et al.
Pubblicazione: (2025)
di: Shen, Leqi, et al.
Pubblicazione: (2025)
Self-ReS: Self-Reflection in Large Vision-Language Models for Long Video Understanding
di: Pereira, Joao, et al.
Pubblicazione: (2025)
di: Pereira, Joao, et al.
Pubblicazione: (2025)
Harnessing Vision-Language Pretrained Models with Temporal-Aware Adaptation for Referring Video Object Segmentation
di: Zhou, Zikun, et al.
Pubblicazione: (2024)
di: Zhou, Zikun, et al.
Pubblicazione: (2024)
HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding
di: Zhao, Jiaxing, et al.
Pubblicazione: (2025)
di: Zhao, Jiaxing, et al.
Pubblicazione: (2025)
BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding
di: Liu, Shuming, et al.
Pubblicazione: (2025)
di: Liu, Shuming, et al.
Pubblicazione: (2025)
GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models
di: Qi, Zhangyang, et al.
Pubblicazione: (2025)
di: Qi, Zhangyang, et al.
Pubblicazione: (2025)
MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models
di: Hong, Wenyi, et al.
Pubblicazione: (2025)
di: Hong, Wenyi, et al.
Pubblicazione: (2025)
Detection-Fusion for Knowledge Graph Extraction from Videos
di: Das, Taniya, et al.
Pubblicazione: (2024)
di: Das, Taniya, et al.
Pubblicazione: (2024)
PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning
di: Xu, Lin, et al.
Pubblicazione: (2024)
di: Xu, Lin, et al.
Pubblicazione: (2024)
Global Motion Understanding in Large-Scale Video Object Segmentation
di: Fedynyak, Volodymyr, et al.
Pubblicazione: (2024)
di: Fedynyak, Volodymyr, et al.
Pubblicazione: (2024)
Understanding Degradation with Vision Language Model
di: Lan, Guanzhou, et al.
Pubblicazione: (2026)
di: Lan, Guanzhou, et al.
Pubblicazione: (2026)
An Approach to Enriching Surgical Video Datasets for Fine-Grained Spatial-Temporal Understanding of Vision-Language Models
di: Maack, Lennart, et al.
Pubblicazione: (2026)
di: Maack, Lennart, et al.
Pubblicazione: (2026)
Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding
di: Sharma, Shivam, et al.
Pubblicazione: (2026)
di: Sharma, Shivam, et al.
Pubblicazione: (2026)
Language Repository for Long Video Understanding
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
UVOSAM: A Mask-free Paradigm for Unsupervised Video Object Segmentation via Segment Anything Model
di: Zhang, Zhenghao, et al.
Pubblicazione: (2023)
di: Zhang, Zhenghao, et al.
Pubblicazione: (2023)
LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation
di: Yuan, Yuqian, et al.
Pubblicazione: (2026)
di: Yuan, Yuqian, et al.
Pubblicazione: (2026)
When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding
di: Fang, Pengcheng, et al.
Pubblicazione: (2025)
di: Fang, Pengcheng, et al.
Pubblicazione: (2025)
Long Video Understanding with Learnable Retrieval in Video-Language Models
di: Xu, Jiaqi, et al.
Pubblicazione: (2023)
di: Xu, Jiaqi, et al.
Pubblicazione: (2023)
ViMoNet: A Multimodal Vision-Language Framework for Human Behavior Understanding from Motion and Video
di: Gupta, Rajan Das, et al.
Pubblicazione: (2025)
di: Gupta, Rajan Das, et al.
Pubblicazione: (2025)
VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding
di: Kim, Younggun, et al.
Pubblicazione: (2025)
di: Kim, Younggun, et al.
Pubblicazione: (2025)
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
di: Chen, Shimin, et al.
Pubblicazione: (2024)
di: Chen, Shimin, et al.
Pubblicazione: (2024)
Understanding Long Videos with Multimodal Language Models
di: Ranasinghe, Kanchana, et al.
Pubblicazione: (2024)
di: Ranasinghe, Kanchana, et al.
Pubblicazione: (2024)
Vision-Language Feature Alignment for Road Anomaly Segmentation
di: He, Zhuolin, et al.
Pubblicazione: (2026)
di: He, Zhuolin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
ScreenWriter: Automatic Screenplay Generation and Movie Summarisation
di: Mahon, Louis, et al.
Pubblicazione: (2024) -
TABLET: A Large-Scale Dataset for Robust Visual Table Understanding
di: Alonso, Iñigo, et al.
Pubblicazione: (2025) -
Finding the Right Moment: Human-Assisted Trailer Creation via Task Composition
di: Papalampidi, Pinelopi, et al.
Pubblicazione: (2021) -
What Is That Talk About? A Video-to-Text Summarization Dataset for Scientific Presentations
di: Liu, Dongqi, et al.
Pubblicazione: (2025) -
Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering
di: Gupta, Akash, et al.
Pubblicazione: (2025)