Enregistré dans:
| Auteur principal: | Siedler, Philipp D. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2505.16048 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Strategic Persuasion with Trait-Conditioned Multi-Agent Systems for Iterative Legal Argumentation
par: Siedler, Philipp D.
Publié: (2026)
par: Siedler, Philipp D.
Publié: (2026)
Learning to Communicate and Collaborate in a Competitive Multi-Agent Setup to Clean the Ocean from Macroplastics
par: Siedler, Philipp Dominic
Publié: (2023)
par: Siedler, Philipp Dominic
Publié: (2023)
HIVEX: A High-Impact Environment Suite for Multi-Agent Research (extended version)
par: Siedler, Philipp Dominic
Publié: (2025)
par: Siedler, Philipp Dominic
Publié: (2025)
LLM-Mediated Guidance of MARL Systems
par: Siedler, Philipp D., et autres
Publié: (2025)
par: Siedler, Philipp D., et autres
Publié: (2025)
PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning
par: Zhang, Qiran, et autres
Publié: (2026)
par: Zhang, Qiran, et autres
Publié: (2026)
AtomWorld: A Benchmark for Evaluating Spatial Reasoning in Large Language Models on Crystalline Materials
par: Lv, Taoyuze, et autres
Publié: (2025)
par: Lv, Taoyuze, et autres
Publié: (2025)
Spatial CAPTCHA: Generatively Benchmarking Spatial Reasoning for Human-Machine Differentiation
par: Kharlamova, Arina, et autres
Publié: (2025)
par: Kharlamova, Arina, et autres
Publié: (2025)
Compositional-ARC: Assessing Systematic Generalization in Abstract Spatial Reasoning
par: Mondorf, Philipp, et autres
Publié: (2025)
par: Mondorf, Philipp, et autres
Publié: (2025)
MSQA: Benchmarking LLMs on Graduate-Level Materials Science Reasoning and Knowledge
par: Cheung, Jerry Junyang, et autres
Publié: (2025)
par: Cheung, Jerry Junyang, et autres
Publié: (2025)
FloorplanQA: A Benchmark for Spatial Reasoning in LLMs using Structured Representations
par: Rodionov, Fedor, et autres
Publié: (2025)
par: Rodionov, Fedor, et autres
Publié: (2025)
ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints
par: Xu, Rui, et autres
Publié: (2025)
par: Xu, Rui, et autres
Publié: (2025)
PhysReason: A Comprehensive Benchmark towards Physics-Based Reasoning
par: Zhang, Xinyu, et autres
Publié: (2025)
par: Zhang, Xinyu, et autres
Publié: (2025)
Spatial Reasoning in Multimodal Large Language Models: A Survey of Tasks, Benchmarks and Methods
par: Liu, Weichen, et autres
Publié: (2025)
par: Liu, Weichen, et autres
Publié: (2025)
GRASP: A Grid-Based Benchmark for Evaluating Commonsense Spatial Reasoning
par: Tang, Zhisheng, et autres
Publié: (2024)
par: Tang, Zhisheng, et autres
Publié: (2024)
DeepPHY: Benchmarking Agentic VLMs on Physical Reasoning
par: Xu, Xinrun, et autres
Publié: (2025)
par: Xu, Xinrun, et autres
Publié: (2025)
MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science
par: Zhang, Junkai, et autres
Publié: (2025)
par: Zhang, Junkai, et autres
Publié: (2025)
EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery
par: Xu, Zelin, et autres
Publié: (2026)
par: Xu, Zelin, et autres
Publié: (2026)
MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model
par: Lee, Youngwan, et autres
Publié: (2026)
par: Lee, Youngwan, et autres
Publié: (2026)
LogicSkills: A Structured Benchmark for Formal Reasoning in Large Language Models
par: Rabern, Brian, et autres
Publié: (2026)
par: Rabern, Brian, et autres
Publié: (2026)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
par: Jia, Mengdi, et autres
Publié: (2025)
par: Jia, Mengdi, et autres
Publié: (2025)
Spatial Atlas: Compute-Grounded Reasoning for Spatial-Aware Research Agent Benchmarks
par: Sharma, Arun
Publié: (2026)
par: Sharma, Arun
Publié: (2026)
FeynmanBench: Benchmarking Multimodal LLMs on Diagrammatic Physics Reasoning
par: Wang, Zeyu, et autres
Publié: (2026)
par: Wang, Zeyu, et autres
Publié: (2026)
Spatial457: A Diagnostic Benchmark for 6D Spatial Reasoning of Large Multimodal Models
par: Wang, Xingrui, et autres
Publié: (2025)
par: Wang, Xingrui, et autres
Publié: (2025)
QSTRBench: a New Benchmark to Evaluate the Ability of Language Models to Reason with Qualitative Spatial and Temporal Calculi
par: Cohn, Anthony G., et autres
Publié: (2026)
par: Cohn, Anthony G., et autres
Publié: (2026)
TableVision: A Large-Scale Benchmark for Spatially Grounded Reasoning over Complex Hierarchical Tables
par: Chen, Xiaoyu, et autres
Publié: (2026)
par: Chen, Xiaoyu, et autres
Publié: (2026)
Reframing Spatial Reasoning Evaluation in Language Models: A Real-World Simulation Benchmark for Qualitative Reasoning
par: Li, Fangjun, et autres
Publié: (2024)
par: Li, Fangjun, et autres
Publié: (2024)
MIRAGE: A Multi-modal Benchmark for Spatial Perception, Reasoning, and Intelligence
par: Liu, Chonghan, et autres
Publié: (2025)
par: Liu, Chonghan, et autres
Publié: (2025)
Xiangqi-R1: Enhancing Spatial Strategic Reasoning in LLMs for Chinese Chess via Reinforcement Learning
par: Chen, Yuhao, et autres
Publié: (2025)
par: Chen, Yuhao, et autres
Publié: (2025)
iVISPAR -- An Interactive Visual-Spatial Reasoning Benchmark for VLMs
par: Mayer, Julius, et autres
Publié: (2025)
par: Mayer, Julius, et autres
Publié: (2025)
MARBLE: A Hard Benchmark for Multimodal Spatial Reasoning and Planning
par: Jiang, Yulun, et autres
Publié: (2025)
par: Jiang, Yulun, et autres
Publié: (2025)
Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs
par: Anand, Dhruv, et autres
Publié: (2025)
par: Anand, Dhruv, et autres
Publié: (2025)
MIXPINN: Mixed-Material Simulations by Physics-Informed Neural Network
par: Yuan, Xintian, et autres
Publié: (2025)
par: Yuan, Xintian, et autres
Publié: (2025)
Spatial Competence Benchmark
par: Vira, Jash, et autres
Publié: (2026)
par: Vira, Jash, et autres
Publié: (2026)
Deconstructing Spatial Complexity: Hierarchical Decomposition for LLM Spatial Reasoning
par: Wang, Yi, et autres
Publié: (2026)
par: Wang, Yi, et autres
Publié: (2026)
SpeechR: A Benchmark for Speech Reasoning in Large Audio-Language Models
par: Yang, Wanqi, et autres
Publié: (2025)
par: Yang, Wanqi, et autres
Publié: (2025)
Pedagogy-R1: Pedagogically-Aligned Reasoning Model with Balanced Educational Benchmark
par: Lee, Unggi, et autres
Publié: (2025)
par: Lee, Unggi, et autres
Publié: (2025)
OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields
par: Liu, Wanhao, et autres
Publié: (2026)
par: Liu, Wanhao, et autres
Publié: (2026)
SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition
par: Xu, Peiran, et autres
Publié: (2025)
par: Xu, Peiran, et autres
Publié: (2025)
SpatialEpiBench: Benchmarking Spatial Information and Epidemic Priors in Forecasting
par: Lyu, Ruiqi, et autres
Publié: (2026)
par: Lyu, Ruiqi, et autres
Publié: (2026)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
par: Tian, Kexin, et autres
Publié: (2025)
par: Tian, Kexin, et autres
Publié: (2025)
Documents similaires
-
Strategic Persuasion with Trait-Conditioned Multi-Agent Systems for Iterative Legal Argumentation
par: Siedler, Philipp D.
Publié: (2026) -
Learning to Communicate and Collaborate in a Competitive Multi-Agent Setup to Clean the Ocean from Macroplastics
par: Siedler, Philipp Dominic
Publié: (2023) -
HIVEX: A High-Impact Environment Suite for Multi-Agent Research (extended version)
par: Siedler, Philipp Dominic
Publié: (2025) -
LLM-Mediated Guidance of MARL Systems
par: Siedler, Philipp D., et autres
Publié: (2025) -
PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning
par: Zhang, Qiran, et autres
Publié: (2026)