PosterSum: A Multimodal Benchmark for Scientific Poster Summarization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Saxena, Rohit, Minervini, Pasquale, Keller, Frank |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Lost in Time: Clock and Calendar Understanding Challenges in Multimodal LLMs
par: Saxena, Rohit, et autres
Publié: (2025)
par: Saxena, Rohit, et autres
Publié: (2025)
VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models
par: Saxena, Rohit, et autres
Publié: (2026)
par: Saxena, Rohit, et autres
Publié: (2026)
Paper2Poster: Towards Multimodal Poster Automation from Scientific Papers
par: Pang, Wei, et autres
Publié: (2025)
par: Pang, Wei, et autres
Publié: (2025)
MovieSum: An Abstractive Summarization Dataset for Movie Screenplays
par: Saxena, Rohit, et autres
Publié: (2024)
par: Saxena, Rohit, et autres
Publié: (2024)
What Is That Talk About? A Video-to-Text Summarization Dataset for Scientific Presentations
par: Liu, Dongqi, et autres
Publié: (2025)
par: Liu, Dongqi, et autres
Publié: (2025)
Do Composed Image Retrieval Benchmarks Require Multimodal Composition?
par: Attimonelli, Matteo, et autres
Publié: (2026)
par: Attimonelli, Matteo, et autres
Publié: (2026)
MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks
par: Papi, Sara, et autres
Publié: (2025)
par: Papi, Sara, et autres
Publié: (2025)
End-to-End Long Document Summarization using Gradient Caching
par: Saxena, Rohit, et autres
Publié: (2025)
par: Saxena, Rohit, et autres
Publié: (2025)
Scientific Reasoning: Assessment of Multimodal Generative LLMs
par: Dreyer, Florian, et autres
Publié: (2025)
par: Dreyer, Florian, et autres
Publié: (2025)
Poster: Camera Tampering Detection for Outdoor IoT Systems
par: Attarha, Shadi, et autres
Publié: (2026)
par: Attarha, Shadi, et autres
Publié: (2026)
SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers
par: Pramanick, Shraman, et autres
Publié: (2024)
par: Pramanick, Shraman, et autres
Publié: (2024)
SciMDR: Advancing Scientific Multimodal Document Reasoning
par: Chen, Ziyu, et autres
Publié: (2026)
par: Chen, Ziyu, et autres
Publié: (2026)
MMSci: A Dataset for Graduate-Level Multi-Discipline Multimodal Scientific Understanding
par: Li, Zekun, et autres
Publié: (2024)
par: Li, Zekun, et autres
Publié: (2024)
EfficientPosterGen: Semantic-aware Efficient Poster Generation via Token Compression and Accurate Violation Detection
par: Tang, Wenxin, et autres
Publié: (2026)
par: Tang, Wenxin, et autres
Publié: (2026)
MMInA: Benchmarking Multihop Multimodal Internet Agents
par: Tian, Shulin, et autres
Publié: (2024)
par: Tian, Shulin, et autres
Publié: (2024)
A Survey on Benchmarks of Multimodal Large Language Models
par: Li, Jian, et autres
Publié: (2024)
par: Li, Jian, et autres
Publié: (2024)
Demystifying Visual Features of Movie Posters for Multi-Label Genre Identification
par: Nareti, Utsav Kumar, et autres
Publié: (2023)
par: Nareti, Utsav Kumar, et autres
Publié: (2023)
POSTA: A Go-to Framework for Customized Artistic Poster Generation
par: Chen, Haoyu, et autres
Publié: (2025)
par: Chen, Haoyu, et autres
Publié: (2025)
MARBLE: A Hard Benchmark for Multimodal Spatial Reasoning and Planning
par: Jiang, Yulun, et autres
Publié: (2025)
par: Jiang, Yulun, et autres
Publié: (2025)
Same Answer, Different Representations: Hidden instability in VLMs
par: Wani, Farooq Ahmad, et autres
Publié: (2026)
par: Wani, Farooq Ahmad, et autres
Publié: (2026)
PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts
par: Li, Hengzhi, et autres
Publié: (2025)
par: Li, Hengzhi, et autres
Publié: (2025)
MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents
par: Li, Shilong, et autres
Publié: (2025)
par: Li, Shilong, et autres
Publié: (2025)
NeuroABench: A Multimodal Evaluation Benchmark for Neurosurgical Anatomy Identification
par: Song, Ziyang, et autres
Publié: (2025)
par: Song, Ziyang, et autres
Publié: (2025)
Certainly Uncertain: A Benchmark and Metric for Multimodal Epistemic and Aleatoric Awareness
par: Chandu, Khyathi Raghavi, et autres
Publié: (2024)
par: Chandu, Khyathi Raghavi, et autres
Publié: (2024)
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
par: Kil, Jihyung, et autres
Publié: (2024)
par: Kil, Jihyung, et autres
Publié: (2024)
CMMMU: A Chinese Massive Multi-discipline Multimodal Understanding Benchmark
par: Zhang, Ge, et autres
Publié: (2024)
par: Zhang, Ge, et autres
Publié: (2024)
ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?
par: Zhang, Leixin, et autres
Publié: (2024)
par: Zhang, Leixin, et autres
Publié: (2024)
Benchmarking Multimodal Large Language Models for Face Recognition
par: Shahreza, Hatef Otroshi, et autres
Publié: (2025)
par: Shahreza, Hatef Otroshi, et autres
Publié: (2025)
MMLongBench: Benchmarking Long-Context Vision-Language Models Effectively and Thoroughly
par: Wang, Zhaowei, et autres
Publié: (2025)
par: Wang, Zhaowei, et autres
Publié: (2025)
MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments
par: Wang, Han, et autres
Publié: (2026)
par: Wang, Han, et autres
Publié: (2026)
UniSAFE: A Comprehensive Benchmark for Safety Evaluation of Unified Multimodal Models
par: Lee, Segyu, et autres
Publié: (2026)
par: Lee, Segyu, et autres
Publié: (2026)
GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding
par: Chen, Dongping, et autres
Publié: (2024)
par: Chen, Dongping, et autres
Publié: (2024)
GAOKAO-MM: A Chinese Human-Level Benchmark for Multimodal Models Evaluation
par: Zong, Yi, et autres
Publié: (2024)
par: Zong, Yi, et autres
Publié: (2024)
MangaVQA and MangaLMM: A Benchmark and Specialized Model for Multimodal Manga Understanding
par: Baek, Jeonghun, et autres
Publié: (2025)
par: Baek, Jeonghun, et autres
Publié: (2025)
LinguaMark: Do Multimodal Models Speak Fairly? A Benchmark-Based Evaluation
par: Raval, Ananya, et autres
Publié: (2025)
par: Raval, Ananya, et autres
Publié: (2025)
From UAV Imagery to Agronomic Reasoning: A Multimodal LLM Benchmark for Plant Phenotyping
par: Wu, Yu, et autres
Publié: (2026)
par: Wu, Yu, et autres
Publié: (2026)
MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI
par: Yue, Xiang, et autres
Publié: (2023)
par: Yue, Xiang, et autres
Publié: (2023)
JMMMU-Pro: Image-based Japanese Multi-discipline Multimodal Understanding Benchmark via Vibe Benchmark Construction
par: Miyai, Atsuyuki, et autres
Publié: (2025)
par: Miyai, Atsuyuki, et autres
Publié: (2025)
Humor in Pixels: Benchmarking Large Multimodal Models Understanding of Online Comics
par: Ryan, Yuriel, et autres
Publié: (2025)
par: Ryan, Yuriel, et autres
Publié: (2025)
Unlearning Sensitive Information in Multimodal LLMs: Benchmark and Attack-Defense Evaluation
par: Patil, Vaidehi, et autres
Publié: (2025)
par: Patil, Vaidehi, et autres
Publié: (2025)
Documents similaires
-
Lost in Time: Clock and Calendar Understanding Challenges in Multimodal LLMs
par: Saxena, Rohit, et autres
Publié: (2025) -
VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models
par: Saxena, Rohit, et autres
Publié: (2026) -
Paper2Poster: Towards Multimodal Poster Automation from Scientific Papers
par: Pang, Wei, et autres
Publié: (2025) -
MovieSum: An Abstractive Summarization Dataset for Movie Screenplays
par: Saxena, Rohit, et autres
Publié: (2024) -
What Is That Talk About? A Video-to-Text Summarization Dataset for Scientific Presentations
par: Liu, Dongqi, et autres
Publié: (2025)