NTSEBENCH: Cognitive Reasoning Benchmark for Vision Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Pandya, Pranshu, Gupta, Vatsal, Talwarr, Agney S, Kataria, Tushar, Roth, Dan, Gupta, Vivek |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Evaluating Concurrent Robustness of Language Models Across Diverse Challenge Sets
di: Gupta, Vatsal, et al.
Pubblicazione: (2023)
di: Gupta, Vatsal, et al.
Pubblicazione: (2023)
TransientTables: Evaluating LLMs' Reasoning on Temporally Evolving Semi-structured Tables
di: Shankarampeta, Abhilash, et al.
Pubblicazione: (2025)
di: Shankarampeta, Abhilash, et al.
Pubblicazione: (2025)
FlowVQA: Mapping Multimodal Logic in Visual Question Answering with Flowcharts
di: Singh, Shubhankar, et al.
Pubblicazione: (2024)
di: Singh, Shubhankar, et al.
Pubblicazione: (2024)
ColPali: Efficient Document Retrieval with Vision Language Models
di: Faysse, Manuel, et al.
Pubblicazione: (2024)
di: Faysse, Manuel, et al.
Pubblicazione: (2024)
WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)
Towards Natural Language-Based Document Image Retrieval: New Dataset and Benchmark
di: Guo, Hao, et al.
Pubblicazione: (2025)
di: Guo, Hao, et al.
Pubblicazione: (2025)
Funnel-HOI: Top-Down Perception for Zero-Shot HOI Detection
di: Sarma, Sandipan, et al.
Pubblicazione: (2025)
di: Sarma, Sandipan, et al.
Pubblicazione: (2025)
Toward Automatic Relevance Judgment using Vision--Language Models for Image--Text Retrieval Evaluation
di: Yang, Jheng-Hong, et al.
Pubblicazione: (2024)
di: Yang, Jheng-Hong, et al.
Pubblicazione: (2024)
Large Language Model Informed Patent Image Retrieval
di: Lo, Hao-Cheng, et al.
Pubblicazione: (2024)
di: Lo, Hao-Cheng, et al.
Pubblicazione: (2024)
Indexing Multimodal Language Models for Large-scale Image Retrieval
di: Tharwat, Bahey, et al.
Pubblicazione: (2026)
di: Tharwat, Bahey, et al.
Pubblicazione: (2026)
E5-V: Universal Embeddings with Multimodal Large Language Models
di: Jiang, Ting, et al.
Pubblicazione: (2024)
di: Jiang, Ting, et al.
Pubblicazione: (2024)
InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search
di: Hou, Bohan, et al.
Pubblicazione: (2026)
di: Hou, Bohan, et al.
Pubblicazione: (2026)
Benchmarking Retrieval-Augmented Multimodal Generation for Document Question Answering
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
Rethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image Editing
di: Song, Tingyu, et al.
Pubblicazione: (2026)
di: Song, Tingyu, et al.
Pubblicazione: (2026)
Index Light, Reason Deep: Deferred Visual Ingestion for Visual-Dense Document Question Answering
di: Xu, Tao
Pubblicazione: (2026)
di: Xu, Tao
Pubblicazione: (2026)
Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture
di: Zhang, Longxiang, et al.
Pubblicazione: (2026)
di: Zhang, Longxiang, et al.
Pubblicazione: (2026)
ADAM: A Diverse Archive of Mankind for Evaluating and Enhancing LLMs in Biographical Reasoning
di: Cekinmez, Jasin, et al.
Pubblicazione: (2025)
di: Cekinmez, Jasin, et al.
Pubblicazione: (2025)
SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval
di: Wu, Siwei, et al.
Pubblicazione: (2024)
di: Wu, Siwei, et al.
Pubblicazione: (2024)
MapVerse: A Benchmark for Geospatial Question Answering on Diverse Real-World Maps
di: Bhat, Sharat, et al.
Pubblicazione: (2026)
di: Bhat, Sharat, et al.
Pubblicazione: (2026)
MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines
di: Jiang, Dongzhi, et al.
Pubblicazione: (2024)
di: Jiang, Dongzhi, et al.
Pubblicazione: (2024)
Design Your Ad: Personalized Advertising Image and Text Generation with Unified Autoregressive Models
di: Xu, Yexing, et al.
Pubblicazione: (2026)
di: Xu, Yexing, et al.
Pubblicazione: (2026)
Composite Sketch+Text Queries for Retrieving Objects with Elusive Names and Complex Interactions
di: Gatti, Prajwal, et al.
Pubblicazione: (2025)
di: Gatti, Prajwal, et al.
Pubblicazione: (2025)
CORE-T: COherent REtrieval of Tables for Text-to-SQL
di: Soliman, Hassan, et al.
Pubblicazione: (2026)
di: Soliman, Hassan, et al.
Pubblicazione: (2026)
Benchmarking Large Language Models for Geolocating Colonial Virginia Land Grants
di: Mioduski, Ryan
Pubblicazione: (2025)
di: Mioduski, Ryan
Pubblicazione: (2025)
EvdCLIP: Improving Vision-Language Retrieval with Entity Visual Descriptions from Large Language Models
di: Meng, GuangHao, et al.
Pubblicazione: (2025)
di: Meng, GuangHao, et al.
Pubblicazione: (2025)
Personalized Multimodal Large Language Models: A Survey
di: Wu, Junda, et al.
Pubblicazione: (2024)
di: Wu, Junda, et al.
Pubblicazione: (2024)
Progressive Multimodal Reasoning via Active Retrieval
di: Dong, Guanting, et al.
Pubblicazione: (2024)
di: Dong, Guanting, et al.
Pubblicazione: (2024)
MMDocIR: Benchmarking Multimodal Retrieval for Long Documents
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
di: Dong, Kuicai, et al.
Pubblicazione: (2025)
Two Experts Are All You Need for Steering Thinking: Reinforcing Cognitive Effort in MoE Reasoning Models Without Additional Training
di: Wang, Mengru, et al.
Pubblicazione: (2025)
di: Wang, Mengru, et al.
Pubblicazione: (2025)
MAPWise: Evaluating Vision-Language Models for Advanced Map Queries
di: Mukhopadhyay, Srija, et al.
Pubblicazione: (2024)
di: Mukhopadhyay, Srija, et al.
Pubblicazione: (2024)
Dual Prompt Learning for Adapting Vision-Language Models to Downstream Image-Text Retrieval
di: Wang, Yifan, et al.
Pubblicazione: (2025)
di: Wang, Yifan, et al.
Pubblicazione: (2025)
INQUIRE: A Natural World Text-to-Image Retrieval Benchmark
di: Vendrow, Edward, et al.
Pubblicazione: (2024)
di: Vendrow, Edward, et al.
Pubblicazione: (2024)
VideoAgent: Long-form Video Understanding with Large Language Model as Agent
di: Wang, Xiaohan, et al.
Pubblicazione: (2024)
di: Wang, Xiaohan, et al.
Pubblicazione: (2024)
Improving Applicability of Deep Learning based Token Classification models during Training
di: Mehra, Anket, et al.
Pubblicazione: (2025)
di: Mehra, Anket, et al.
Pubblicazione: (2025)
ITEm: Unsupervised Image-Text Embedding Learning for eCommerce
di: Liao, Baohao, et al.
Pubblicazione: (2023)
di: Liao, Baohao, et al.
Pubblicazione: (2023)
Visual Late Chunking: An Empirical Study of Contextual Chunking for Efficient Visual Document Retrieval
di: Yan, Yibo, et al.
Pubblicazione: (2026)
di: Yan, Yibo, et al.
Pubblicazione: (2026)
Sculpting the Vector Space: Towards Efficient Multi-Vector Visual Document Retrieval via Prune-then-Merge Framework
di: Yan, Yibo, et al.
Pubblicazione: (2026)
di: Yan, Yibo, et al.
Pubblicazione: (2026)
VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
di: Zhou, Junjie, et al.
Pubblicazione: (2024)
Windsock is Dancing: Adaptive Multimodal Retrieval-Augmented Generation
di: Zhao, Shu, et al.
Pubblicazione: (2025)
di: Zhao, Shu, et al.
Pubblicazione: (2025)
Attention Grounded Enhancement for Visual Document Retrieval
di: Cui, Wanqing, et al.
Pubblicazione: (2025)
di: Cui, Wanqing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Evaluating Concurrent Robustness of Language Models Across Diverse Challenge Sets
di: Gupta, Vatsal, et al.
Pubblicazione: (2023) -
TransientTables: Evaluating LLMs' Reasoning on Temporally Evolving Semi-structured Tables
di: Shankarampeta, Abhilash, et al.
Pubblicazione: (2025) -
FlowVQA: Mapping Multimodal Logic in Visual Question Answering with Flowcharts
di: Singh, Shubhankar, et al.
Pubblicazione: (2024) -
ColPali: Efficient Document Retrieval with Vision Language Models
di: Faysse, Manuel, et al.
Pubblicazione: (2024) -
WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
di: Zhu, Yingjian, et al.
Pubblicazione: (2026)