VELOCITI: Benchmarking Video-Language Compositional Reasoning with Strict Entailment
Fuente:
arXiv
Salvato in:
| Autori principali: | Saravanan, Darshana, Gupta, Varun, Singh, Darshan, Khan, Zeeshan, Gandhi, Vineet, Tapaswi, Makarand |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Investigating Mechanisms for In-Context Vision Language Binding
di: Saravanan, Darshana, et al.
Pubblicazione: (2025)
di: Saravanan, Darshana, et al.
Pubblicazione: (2025)
SRL-CLIP: Efficient CLIP Video Adaptation via Structured Semantic Role Labels
di: Singh, Darshan, et al.
Pubblicazione: (2024)
di: Singh, Darshan, et al.
Pubblicazione: (2024)
No Detail Left Behind: Revisiting Self-Retrieval for Fine-Grained Image Captioning
di: Gaur, Manu, et al.
Pubblicazione: (2024)
di: Gaur, Manu, et al.
Pubblicazione: (2024)
Detect, Describe, Discriminate: Moving Beyond VQA for MLLM Evaluation
di: Gaur, Manu, et al.
Pubblicazione: (2024)
di: Gaur, Manu, et al.
Pubblicazione: (2024)
What You See is What You Ask: Evaluating Audio Descriptions
di: Kala, Divy, et al.
Pubblicazione: (2025)
di: Kala, Divy, et al.
Pubblicazione: (2025)
Pseudo-labelling meets Label Smoothing for Noisy Partial Label Learning
di: Saravanan, Darshana, et al.
Pubblicazione: (2024)
di: Saravanan, Darshana, et al.
Pubblicazione: (2024)
MICap: A Unified Model for Identity-aware Movie Descriptions
di: Raajesh, Haran, et al.
Pubblicazione: (2024)
di: Raajesh, Haran, et al.
Pubblicazione: (2024)
Steerable Visual Representations
di: Ruthardt, Jona, et al.
Pubblicazione: (2026)
di: Ruthardt, Jona, et al.
Pubblicazione: (2026)
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
di: Liu, Huabin, et al.
Pubblicazione: (2025)
di: Liu, Huabin, et al.
Pubblicazione: (2025)
MALeR: Improving Compositional Fidelity in Layout-Guided Generation
di: Saxena, Shivank, et al.
Pubblicazione: (2025)
di: Saxena, Shivank, et al.
Pubblicazione: (2025)
One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition
di: Darur, Balaji, et al.
Pubblicazione: (2026)
di: Darur, Balaji, et al.
Pubblicazione: (2026)
IdentifyMe: A Challenging Long-Context Mention Resolution Benchmark for LLMs
di: Manikantan, Kawshik, et al.
Pubblicazione: (2024)
di: Manikantan, Kawshik, et al.
Pubblicazione: (2024)
Compositional Entailment Learning for Hyperbolic Vision-Language Models
di: Pal, Avik, et al.
Pubblicazione: (2024)
di: Pal, Avik, et al.
Pubblicazione: (2024)
CrossMed: A Multimodal Cross-Task Benchmark for Compositional Generalization in Medical Imaging
di: Singh, Pooja, et al.
Pubblicazione: (2025)
di: Singh, Pooja, et al.
Pubblicazione: (2025)
Abnormal Event Detection In Videos Using Deep Embedding
di: Venkatrayappa, Darshan
Pubblicazione: (2024)
di: Venkatrayappa, Darshan
Pubblicazione: (2024)
On Occlusions in Video Action Detection: Benchmark Datasets And Training Recipes
di: Modi, Rajat, et al.
Pubblicazione: (2024)
di: Modi, Rajat, et al.
Pubblicazione: (2024)
"Previously on ..." From Recaps to Story Summarization
di: Singh, Aditya Kumar, et al.
Pubblicazione: (2024)
di: Singh, Aditya Kumar, et al.
Pubblicazione: (2024)
Seeing Eye to AI: Comparing Human Gaze and Model Attention in Video Memorability
di: Kumar, Prajneya, et al.
Pubblicazione: (2023)
di: Kumar, Prajneya, et al.
Pubblicazione: (2023)
RAVU: Retrieval Augmented Video Understanding with Compositional Reasoning over Graph
di: Malik, Sameer, et al.
Pubblicazione: (2025)
di: Malik, Sameer, et al.
Pubblicazione: (2025)
Major Entity Identification: A Generalizable Alternative to Coreference Resolution
di: Manikantan, Kawshik, et al.
Pubblicazione: (2024)
di: Manikantan, Kawshik, et al.
Pubblicazione: (2024)
Defeasible Visual Entailment: Benchmark, Evaluator, and Reward-Driven Optimization
di: Zhang, Yue, et al.
Pubblicazione: (2024)
di: Zhang, Yue, et al.
Pubblicazione: (2024)
Probing Vision-Language Understanding through the Visual Entailment Task: promises and pitfalls
di: Pitta, Elena, et al.
Pubblicazione: (2025)
di: Pitta, Elena, et al.
Pubblicazione: (2025)
MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model
di: Lee, Youngwan, et al.
Pubblicazione: (2026)
di: Lee, Youngwan, et al.
Pubblicazione: (2026)
CycliST: A Video Language Model Benchmark for Reasoning on Cyclical State Transitions
di: Kohaut, Simon, et al.
Pubblicazione: (2025)
di: Kohaut, Simon, et al.
Pubblicazione: (2025)
Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning
di: Liu, Chengwen, et al.
Pubblicazione: (2026)
di: Liu, Chengwen, et al.
Pubblicazione: (2026)
Beyond Static Artifacts: A Forensic Benchmark for Video Deepfake Reasoning in Vision Language Models
di: Gu, Zheyuan, et al.
Pubblicazione: (2026)
di: Gu, Zheyuan, et al.
Pubblicazione: (2026)
Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench
di: Hu, Lanxiang, et al.
Pubblicazione: (2025)
di: Hu, Lanxiang, et al.
Pubblicazione: (2025)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
di: Deng, Andong, et al.
Pubblicazione: (2025)
di: Deng, Andong, et al.
Pubblicazione: (2025)
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
di: Li, Jingyao, et al.
Pubblicazione: (2025)
di: Li, Jingyao, et al.
Pubblicazione: (2025)
Fine-Tuning Without Forgetting: Adaptation of YOLOv8 Preserves COCO Performance
di: Gandhi, Vishal, et al.
Pubblicazione: (2025)
di: Gandhi, Vishal, et al.
Pubblicazione: (2025)
Personalized Image Generation from an Author Writing Style
di: Gandhi, Sagar, et al.
Pubblicazione: (2025)
di: Gandhi, Sagar, et al.
Pubblicazione: (2025)
TimeBlind: A Spatio-Temporal Compositionality Benchmark for Video LLMs
di: Li, Baiqi, et al.
Pubblicazione: (2026)
di: Li, Baiqi, et al.
Pubblicazione: (2026)
Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for Vision Language Models
di: Wang, Jiayu, et al.
Pubblicazione: (2024)
di: Wang, Jiayu, et al.
Pubblicazione: (2024)
DELST: Dual Entailment Learning for Hyperbolic Image-Gene Pretraining in Spatial Transcriptomics
di: Chen, Xulin, et al.
Pubblicazione: (2025)
di: Chen, Xulin, et al.
Pubblicazione: (2025)
Can Video Large Multimodal Models Think Like Doubters-or Double-Down: A Study on Defeasible Video Entailment
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning
di: Kong, Fanqi, et al.
Pubblicazione: (2025)
di: Kong, Fanqi, et al.
Pubblicazione: (2025)
CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos
di: Li, Xuchen, et al.
Pubblicazione: (2025)
di: Li, Xuchen, et al.
Pubblicazione: (2025)
EgoToM: Benchmarking Theory of Mind Reasoning from Egocentric Videos
di: Li, Yuxuan, et al.
Pubblicazione: (2025)
di: Li, Yuxuan, et al.
Pubblicazione: (2025)
Right Looks, Wrong Reasons: Compositional Fidelity in Text-to-Image Generation
di: Vatsa, Mayank, et al.
Pubblicazione: (2025)
di: Vatsa, Mayank, et al.
Pubblicazione: (2025)
TV-TREES: Multimodal Entailment Trees for Neuro-Symbolic Video Reasoning
di: Sanders, Kate, et al.
Pubblicazione: (2024)
di: Sanders, Kate, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Investigating Mechanisms for In-Context Vision Language Binding
di: Saravanan, Darshana, et al.
Pubblicazione: (2025) -
SRL-CLIP: Efficient CLIP Video Adaptation via Structured Semantic Role Labels
di: Singh, Darshan, et al.
Pubblicazione: (2024) -
No Detail Left Behind: Revisiting Self-Retrieval for Fine-Grained Image Captioning
di: Gaur, Manu, et al.
Pubblicazione: (2024) -
Detect, Describe, Discriminate: Moving Beyond VQA for MLLM Evaluation
di: Gaur, Manu, et al.
Pubblicazione: (2024) -
What You See is What You Ask: Evaluating Audio Descriptions
di: Kala, Divy, et al.
Pubblicazione: (2025)