PRiSM: An Agentic Multimodal Benchmark for Scientific Reasoning via Python-Grounded Evaluation
Fuente:
arXiv
Guardado en:
| Autores principales: | Imani, Shima, Moon, Seungwhan, Ahmadyan, Adel, Zhang, Lu, Ahmed, Kirmani, Damavandi, Babak |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SymPyBench: A Dynamic Benchmark for Scientific Reasoning with Executable Python Code
por: Imani, Shima, et al.
Publicado: (2025)
por: Imani, Shima, et al.
Publicado: (2025)
TRACE: A Framework for Analyzing and Enhancing Stepwise Reasoning in Vision-Language Models
por: Imani, Shima, et al.
Publicado: (2025)
por: Imani, Shima, et al.
Publicado: (2025)
PRiSM: Benchmarking Phone Realization in Speech Models
por: Bharadwaj, Shikhar, et al.
Publicado: (2026)
por: Bharadwaj, Shikhar, et al.
Publicado: (2026)
Doppelgänger's Watch: A Split Objective Approach to Large Language Models
por: Ghasemlou, Shervin, et al.
Publicado: (2024)
por: Ghasemlou, Shervin, et al.
Publicado: (2024)
WearVQA: A Visual Question Answering Benchmark for Wearables in Egocentric Authentic Real-world scenarios
por: Chang, Eun, et al.
Publicado: (2025)
por: Chang, Eun, et al.
Publicado: (2025)
Proactive Assistant Dialogue Generation from Streaming Egocentric Videos
por: Zhang, Yichi, et al.
Publicado: (2025)
por: Zhang, Yichi, et al.
Publicado: (2025)
PaperArena: An Evaluation Benchmark for Tool-Augmented Agentic Reasoning on Scientific Literature
por: Wang, Daoyu, et al.
Publicado: (2025)
por: Wang, Daoyu, et al.
Publicado: (2025)
Pixel-Grounded Retrieval for Knowledgeable Large Multimodal Models
por: Kim, Jeonghwan, et al.
Publicado: (2026)
por: Kim, Jeonghwan, et al.
Publicado: (2026)
OMNIFLOW: A Physics-Grounded Multimodal Agent for Generalized Scientific Reasoning
por: Wu, Hao, et al.
Publicado: (2026)
por: Wu, Hao, et al.
Publicado: (2026)
LABSHIELD: A Multimodal Benchmark for Safety-Critical Reasoning and Planning in Scientific Laboratories
por: Sun, Qianpu, et al.
Publicado: (2026)
por: Sun, Qianpu, et al.
Publicado: (2026)
Reasoning With a Star: A Heliophysics Dataset and Benchmark for Agentic Scientific Reasoning
por: Lee, Kevin, et al.
Publicado: (2025)
por: Lee, Kevin, et al.
Publicado: (2025)
Agentic Spatio-Temporal Grounding via Collaborative Reasoning
por: Zhao, Heng, et al.
Publicado: (2026)
por: Zhao, Heng, et al.
Publicado: (2026)
Benchmarking Agentic Systems in Automated Scientific Information Extraction with ChemX
por: Vepreva, Anastasia, et al.
Publicado: (2025)
por: Vepreva, Anastasia, et al.
Publicado: (2025)
STEER: Flexible Robotic Manipulation via Dense Language Grounding
por: Smith, Laura, et al.
Publicado: (2024)
por: Smith, Laura, et al.
Publicado: (2024)
Spatial-Agent: Agentic Geo-spatial Reasoning with Scientific Core Concepts
por: Bao, Riyang, et al.
Publicado: (2026)
por: Bao, Riyang, et al.
Publicado: (2026)
MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains
por: Ning, Xuying, et al.
Publicado: (2026)
por: Ning, Xuying, et al.
Publicado: (2026)
An Agentic Evaluation Framework for AI-Generated Scientific Code in PETSc
por: Zhang, Hong, et al.
Publicado: (2026)
por: Zhang, Hong, et al.
Publicado: (2026)
AMIGO: Agentic Multi-Image Grounding Oracle Benchmark
por: Wang, Min, et al.
Publicado: (2026)
por: Wang, Min, et al.
Publicado: (2026)
BALROG: Benchmarking Agentic LLM and VLM Reasoning On Games
por: Paglieri, Davide, et al.
Publicado: (2024)
por: Paglieri, Davide, et al.
Publicado: (2024)
DeepPHY: Benchmarking Agentic VLMs on Physical Reasoning
por: Xu, Xinrun, et al.
Publicado: (2025)
por: Xu, Xinrun, et al.
Publicado: (2025)
The Path Ahead for Agentic AI: Challenges and Opportunities
por: Sibai, Nadia, et al.
Publicado: (2026)
por: Sibai, Nadia, et al.
Publicado: (2026)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
por: Deng, Andong, et al.
Publicado: (2025)
por: Deng, Andong, et al.
Publicado: (2025)
Seeing and Reasoning with Confidence: Supercharging Multimodal LLMs with an Uncertainty-Aware Agentic Framework
por: Zhi, Zhuo, et al.
Publicado: (2025)
por: Zhi, Zhuo, et al.
Publicado: (2025)
Agentic Scientific Simulation: Execution-Grounded Model Construction and Reconstruction
por: Lie, Knut-Andreas, et al.
Publicado: (2026)
por: Lie, Knut-Andreas, et al.
Publicado: (2026)
CARV: A Diagnostic Benchmark for Compositional Analogical Reasoning in Multimodal LLMs
por: Du, Yongkang, et al.
Publicado: (2026)
por: Du, Yongkang, et al.
Publicado: (2026)
$A^3$-Bench: Benchmarking Memory-Driven Scientific Reasoning via Anchor and Attractor Activation
por: Zhang, Jian, et al.
Publicado: (2026)
por: Zhang, Jian, et al.
Publicado: (2026)
MolQuest: A Benchmark for Agentic Evaluation of Abductive Reasoning in Chemical Structure Elucidation
por: Han, Taolin, et al.
Publicado: (2026)
por: Han, Taolin, et al.
Publicado: (2026)
Octopus: Agentic Multimodal Reasoning with Six-Capability Orchestration
por: Guo, Yifu, et al.
Publicado: (2025)
por: Guo, Yifu, et al.
Publicado: (2025)
Grounding LLMs in Scientific Discovery via Embodied Actions
por: Zhang, Bo, et al.
Publicado: (2026)
por: Zhang, Bo, et al.
Publicado: (2026)
CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework
por: Du, Yuexi, et al.
Publicado: (2026)
por: Du, Yuexi, et al.
Publicado: (2026)
From Prompts to Pavement Through Time: Temporal Grounding in Agentic Scene-to-Plan Reasoning
por: Gado, Ahmed Y., et al.
Publicado: (2026)
por: Gado, Ahmed Y., et al.
Publicado: (2026)
Measuring What Matters: Benchmarking Generative, Multimodal, and Agentic AI in Healthcare
por: Desikan, Prasanna, et al.
Publicado: (2026)
por: Desikan, Prasanna, et al.
Publicado: (2026)
VTC-Bench: Evaluating Agentic Multimodal Models via Compositional Visual Tool Chaining
por: Zhu, Xuanyu, et al.
Publicado: (2026)
por: Zhu, Xuanyu, et al.
Publicado: (2026)
CGBench: Benchmarking Language Model Scientific Reasoning for Clinical Genetics Research
por: Queen, Owen, et al.
Publicado: (2025)
por: Queen, Owen, et al.
Publicado: (2025)
TimeSage-MT: A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning
por: Kong, Yaxuan, et al.
Publicado: (2026)
por: Kong, Yaxuan, et al.
Publicado: (2026)
VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning
por: Jiang, Zhihuan, et al.
Publicado: (2024)
por: Jiang, Zhihuan, et al.
Publicado: (2024)
Higher-Order Knowledge Representations for Agentic Scientific Reasoning
por: Stewart, Isabella A., et al.
Publicado: (2026)
por: Stewart, Isabella A., et al.
Publicado: (2026)
TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use
por: He, Pengfei, et al.
Publicado: (2025)
por: He, Pengfei, et al.
Publicado: (2025)
PythonSaga: Redefining the Benchmark to Evaluate Code Generating LLMs
por: Yadav, Ankit, et al.
Publicado: (2024)
por: Yadav, Ankit, et al.
Publicado: (2024)
AEC-Bench: A Multimodal Benchmark for Agentic Systems in Architecture, Engineering, and Construction
por: Mankodiya, Harsh, et al.
Publicado: (2026)
por: Mankodiya, Harsh, et al.
Publicado: (2026)
Ejemplares similares
-
SymPyBench: A Dynamic Benchmark for Scientific Reasoning with Executable Python Code
por: Imani, Shima, et al.
Publicado: (2025) -
TRACE: A Framework for Analyzing and Enhancing Stepwise Reasoning in Vision-Language Models
por: Imani, Shima, et al.
Publicado: (2025) -
PRiSM: Benchmarking Phone Realization in Speech Models
por: Bharadwaj, Shikhar, et al.
Publicado: (2026) -
Doppelgänger's Watch: A Split Objective Approach to Large Language Models
por: Ghasemlou, Shervin, et al.
Publicado: (2024) -
WearVQA: A Visual Question Answering Benchmark for Wearables in Egocentric Authentic Real-world scenarios
por: Chang, Eun, et al.
Publicado: (2025)