InfiniBench: A Benchmark for Large Multi-Modal Models in Long-Form Movies and TV Shows
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ataallah, Kirolos, Abdelrahman, Eslam, Ahmed, Mahmoud, Gou, Chenhui, Pahwa, Khushbu, Ding, Jian, Elhoseiny, Mohamed |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens
par: Ataallah, Kirolos, et autres
Publié: (2024)
par: Ataallah, Kirolos, et autres
Publié: (2024)
Goldfish: Vision-Language Understanding of Arbitrarily Long Videos
par: Ataallah, Kirolos, et autres
Publié: (2024)
par: Ataallah, Kirolos, et autres
Publié: (2024)
InfiniBench: Infinite Benchmarking for Visual Spatial Reasoning with Customizable Scene Complexity
par: Wang, Haoming, et autres
Publié: (2025)
par: Wang, Haoming, et autres
Publié: (2025)
CoT3DRef: Chain-of-Thoughts Data-Efficient 3D Visual Grounding
par: Abdelrahman, Eslam, et autres
Publié: (2023)
par: Abdelrahman, Eslam, et autres
Publié: (2023)
Kestrel: 3D Multimodal LLM for Part-Aware Grounded Description
par: Ahmed, Mahmoud, et autres
Publié: (2024)
par: Ahmed, Mahmoud, et autres
Publié: (2024)
iMotion-LLM: Instruction-Conditioned Trajectory Generation
par: Felemban, Abdulwahab, et autres
Publié: (2024)
par: Felemban, Abdulwahab, et autres
Publié: (2024)
Analyzing Social Networks of Actors in Movies and TV Shows
par: Giri, Sarthak, et autres
Publié: (2024)
par: Giri, Sarthak, et autres
Publié: (2024)
VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
ToddlerDiffusion: Interactive Structured Image Generation with Cascaded Schrödinger Bridge
par: Abdelrahman, Eslam, et autres
Publié: (2023)
par: Abdelrahman, Eslam, et autres
Publié: (2023)
3DCoMPaT200: Language-Grounded Compositional Understanding of Parts and Materials of 3D Shapes
par: Ahmed, Mahmoud, et autres
Publié: (2025)
par: Ahmed, Mahmoud, et autres
Publié: (2025)
MagnetDB: A Longitudinal Torrent Discovery Dataset with IMDb-Matched Movies and TV Shows
par: Seidenberger, Scott, et autres
Publié: (2025)
par: Seidenberger, Scott, et autres
Publié: (2025)
MovieBench: A Hierarchical Movie Level Dataset for Long Video Generation
par: Wu, Weijia, et autres
Publié: (2024)
par: Wu, Weijia, et autres
Publié: (2024)
Why Pass@k Optimization Can Degrade Pass@1: Prompt Interference in LLM Post-training
par: Barakat, Anas, et autres
Publié: (2026)
par: Barakat, Anas, et autres
Publié: (2026)
StoryGPT-V: Large Language Models as Consistent Story Visualizers
par: Shen, Xiaoqian, et autres
Publié: (2023)
par: Shen, Xiaoqian, et autres
Publié: (2023)
How Well Can Vision Language Models See Image Details?
par: Gou, Chenhui, et autres
Publié: (2024)
par: Gou, Chenhui, et autres
Publié: (2024)
MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing
par: Zheng, Junjie, et autres
Publié: (2025)
par: Zheng, Junjie, et autres
Publié: (2025)
GNNX-BENCH: Unravelling the Utility of Perturbation-based GNN Explainers through In-depth Benchmarking
par: Kosan, Mert, et autres
Publié: (2023)
par: Kosan, Mert, et autres
Publié: (2023)
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
par: Bao, Han, et autres
Publié: (2024)
par: Bao, Han, et autres
Publié: (2024)
Liquid biopsy in genitourinary oncology: Current clinical applications and future prospects across prostate, bladder, and renal cancers
par: Kirolos Eskandar
Publié: (2025)
par: Kirolos Eskandar
Publié: (2025)
Bioimpressão no Transplante de Órgãos: Dos modelos Experimentais às Perspectivas Clínicas
par: Kirolos Eskandar
Publié: (2025)
par: Kirolos Eskandar
Publié: (2025)
Progressive trends in prenatal genetic screening
par: Kirolos Eskandar
Publié: (2022)
par: Kirolos Eskandar
Publié: (2022)
FishNet++: Analyzing the capabilities of Multimodal Large Language Models in marine biology
par: Khan, Faizan Farooq, et autres
Publié: (2025)
par: Khan, Faizan Farooq, et autres
Publié: (2025)
Movie Facts and Fibs (MF$^2$): A Benchmark for Long Movie Understanding
par: Zaranis, Emmanouil, et autres
Publié: (2025)
par: Zaranis, Emmanouil, et autres
Publié: (2025)
Affective Visual Dialog: A Large-Scale Benchmark for Emotional Reasoning Based on Visually Grounded Conversations
par: Haydarov, Kilichbek, et autres
Publié: (2023)
par: Haydarov, Kilichbek, et autres
Publié: (2023)
LongGenBench: Benchmarking Long-Form Generation in Long Context LLMs
par: Wu, Yuhao, et autres
Publié: (2024)
par: Wu, Yuhao, et autres
Publié: (2024)
INSTA-YOLO: Real-Time Instance Segmentation
par: Mohamed, Eslam, et autres
Publié: (2021)
par: Mohamed, Eslam, et autres
Publié: (2021)
The Morning Show at WLES-TV.
par: Blondell, Beverley
Publié: (1979)
par: Blondell, Beverley
Publié: (1979)
Experimental and Computational Fluid Dynamics Analysis of Industrial Water Desalination with High Salinity by Adsorption Chlorine on Resin in a Packed Column
par: Hamideh Mahmoodabadi, et autres
Publié: (2024)
par: Hamideh Mahmoodabadi, et autres
Publié: (2024)
4D-Bench: Benchmarking Multi-modal Large Language Models for 4D Object Understanding
par: Zhu, Wenxuan, et autres
Publié: (2025)
par: Zhu, Wenxuan, et autres
Publié: (2025)
VRU-Accident: A Vision-Language Benchmark for Video Question Answering and Dense Captioning for Accident Scene Understanding
par: Kim, Younggun, et autres
Publié: (2025)
par: Kim, Younggun, et autres
Publié: (2025)
Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding
par: Shen, Xiaoqian, et autres
Publié: (2025)
par: Shen, Xiaoqian, et autres
Publié: (2025)
Multimodal Chaptering for Long-Form TV Newscast Video
par: Guetari, Khalil, et autres
Publié: (2024)
par: Guetari, Khalil, et autres
Publié: (2024)
KnowMT-Bench: Benchmarking Knowledge-Intensive Long-Form Question Answering in Multi-Turn Dialogues
par: Chen, Junhao, et autres
Publié: (2025)
par: Chen, Junhao, et autres
Publié: (2025)
3DCoMPaT$^{++}$: An improved Large-scale 3D Vision Dataset for Compositional Recognition
par: Slim, Habib, et autres
Publié: (2023)
par: Slim, Habib, et autres
Publié: (2023)
Multi-modal brain encoding models for multi-modal stimuli
par: Oota, Subba Reddy, et autres
Publié: (2025)
par: Oota, Subba Reddy, et autres
Publié: (2025)
Long‐Term Effects of Sugarcane Cultivation on the Physicochemical Quality Indices of Saline and Sodic Soils: A Case Study of South Khuzestan
par: Najm Hashemy, et autres
Publié: (2024)
par: Najm Hashemy, et autres
Publié: (2024)
Patterns and Dynamics of Netflix TV Show Popularity
par: Lee, Nahyeon, et autres
Publié: (2025)
par: Lee, Nahyeon, et autres
Publié: (2025)
Movie101v2: Improved Movie Narration Benchmark
par: Yue, Zihao, et autres
Publié: (2024)
par: Yue, Zihao, et autres
Publié: (2024)
InfiniMotion: Mamba Boosts Memory in Transformer for Arbitrary Long Motion Generation
par: Zhang, Zeyu, et autres
Publié: (2024)
par: Zhang, Zeyu, et autres
Publié: (2024)
AutoFormBench: Benchmark Dataset for Automating Form Understanding
par: Baral, Gaurab, et autres
Publié: (2026)
par: Baral, Gaurab, et autres
Publié: (2026)
Documents similaires
-
MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens
par: Ataallah, Kirolos, et autres
Publié: (2024) -
Goldfish: Vision-Language Understanding of Arbitrarily Long Videos
par: Ataallah, Kirolos, et autres
Publié: (2024) -
InfiniBench: Infinite Benchmarking for Visual Spatial Reasoning with Customizable Scene Complexity
par: Wang, Haoming, et autres
Publié: (2025) -
CoT3DRef: Chain-of-Thoughts Data-Efficient 3D Visual Grounding
par: Abdelrahman, Eslam, et autres
Publié: (2023) -
Kestrel: 3D Multimodal LLM for Part-Aware Grounded Description
par: Ahmed, Mahmoud, et autres
Publié: (2024)