PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Qiran, Wang, Yuheng, Yang, Runde, Wu, Lin, Fan, Jingru, Yao, Shu, Zhang, Jie, Zhou, Tianle, Li, Huatao, Shi, Ruijie, Li, Yihan, Qian, Chen |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
TeachMaster: Generative Teaching via Code
by: Wang, Yuheng, et al.
Published: (2025)
by: Wang, Yuheng, et al.
Published: (2025)
AppCopilot: Toward General, Accurate, Long-Horizon, and Efficient Mobile Agent
by: Fan, Jingru, et al.
Published: (2025)
by: Fan, Jingru, et al.
Published: (2025)
AgentXRay: White-Boxing Agentic Systems via Workflow Reconstruction
by: Shi, Ruijie, et al.
Published: (2026)
by: Shi, Ruijie, et al.
Published: (2026)
PRISM: Programmatic Reasoning with Image Sequence Manipulation for LVLM Jailbreaking
by: Zou, Quanchen, et al.
Published: (2025)
by: Zou, Quanchen, et al.
Published: (2025)
Scaling Spatial Reasoning in MLLMs through Programmatic Data Synthesis
by: Helu, Zhi, et al.
Published: (2025)
by: Helu, Zhi, et al.
Published: (2025)
AudioRAG: A Challenging Benchmark for Audio Reasoning and Information Retrieval
by: Lin, Jingru, et al.
Published: (2026)
by: Lin, Jingru, et al.
Published: (2026)
Towards a Science of Collective AI: LLM-based Multi-Agent Systems Need a Transition from Blind Trial-and-Error to Rigorous Science
by: Fan, Jingru, et al.
Published: (2026)
by: Fan, Jingru, et al.
Published: (2026)
InfinityMATH: A Scalable Instruction Tuning Dataset in Programmatic Mathematical Reasoning
by: Zhang, Bo-Wen, et al.
Published: (2024)
by: Zhang, Bo-Wen, et al.
Published: (2024)
(Non-)amenability of the Fourier algebra in the cb-multiplier norm
by: Runde, Volker
Published: (2019)
by: Runde, Volker
Published: (2019)
TACIT Benchmark: A Programmatic Visual Reasoning Benchmark for Generative and Discriminative Models
by: Medeiros, Daniel Nobrega
Published: (2026)
by: Medeiros, Daniel Nobrega
Published: (2026)
PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments
by: Lim, Yunn Kang, et al.
Published: (2026)
by: Lim, Yunn Kang, et al.
Published: (2026)
BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD
by: Zhang, Haozhe, et al.
Published: (2026)
by: Zhang, Haozhe, et al.
Published: (2026)
PRISM: Probing Reasoning, Instruction, and Source Memory in LLM Hallucinations
by: Wu, Yuhe, et al.
Published: (2026)
by: Wu, Yuhe, et al.
Published: (2026)
RAGCap-Bench: Benchmarking Capabilities of LLMs in Agentic Retrieval Augmented Generation Systems
by: Lin, Jingru, et al.
Published: (2025)
by: Lin, Jingru, et al.
Published: (2025)
MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning
by: Shen, Haozhan, et al.
Published: (2026)
by: Shen, Haozhan, et al.
Published: (2026)
Chain of Functions: A Programmatic Pipeline for Fine-Grained Chart Reasoning Data
by: Li, Zijian, et al.
Published: (2025)
by: Li, Zijian, et al.
Published: (2025)
ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch
by: Liu, Zheng, et al.
Published: (2026)
by: Liu, Zheng, et al.
Published: (2026)
M2A: Synergizing Mathematical and Agentic Reasoning in Large Language Models
by: Wang, Junjian, et al.
Published: (2026)
by: Wang, Junjian, et al.
Published: (2026)
PRISM: Photonics-Informed Inverse Lithography for Manufacturable Inverse-Designed Photonic Integrated Circuits
by: Zhou, Hongjian, et al.
Published: (2026)
by: Zhou, Hongjian, et al.
Published: (2026)
MORSE-500: A Programmatically Controllable Video Benchmark to Stress-Test Multimodal Reasoning
by: Cai, Zikui, et al.
Published: (2025)
by: Cai, Zikui, et al.
Published: (2025)
TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis
by: Wang, Xi, et al.
Published: (2026)
by: Wang, Xi, et al.
Published: (2026)
TableMind: An Autonomous Programmatic Agent for Tool-Augmented Table Reasoning
by: Jiang, Chuang, et al.
Published: (2025)
by: Jiang, Chuang, et al.
Published: (2025)
Temporally-Constrained Video Reasoning Segmentation and Automated Benchmark Construction
by: Shen, Yiqing, et al.
Published: (2025)
by: Shen, Yiqing, et al.
Published: (2025)
VProChart: Answering Chart Question through Visual Perception Alignment Agent and Programmatic Solution Reasoning
by: Huang, Muye, et al.
Published: (2024)
by: Huang, Muye, et al.
Published: (2024)
PRISM: Progressive Reasoning through Iterative Slot Memory for Vision
by: Wang, Ziyu, et al.
Published: (2026)
by: Wang, Ziyu, et al.
Published: (2026)
PRISM: Parallel Residual Iterative Sequence Model
by: Jiang, Jie, et al.
Published: (2026)
by: Jiang, Jie, et al.
Published: (2026)
Die Alte Aula der Universität Heidelberg
by: Runde, Ingo, et al.
Published: (2017)
by: Runde, Ingo, et al.
Published: (2017)
FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark
by: Fang, Rongyao, et al.
Published: (2025)
by: Fang, Rongyao, et al.
Published: (2025)
Evolving Programmatic Skill Networks
by: Shi, Haochen, et al.
Published: (2026)
by: Shi, Haochen, et al.
Published: (2026)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
by: Jia, Mengdi, et al.
Published: (2025)
by: Jia, Mengdi, et al.
Published: (2025)
MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models
by: Wu, Xiyang, et al.
Published: (2025)
by: Wu, Xiyang, et al.
Published: (2025)
The Connected k-Vertex One-Center Problem on Graphs
by: Zhang, Jingru
Published: (2024)
by: Zhang, Jingru
Published: (2024)
PRISM-Physics: Causal DAG-Based Process Evaluation for Physics Reasoning
by: Zhao, Wanjia, et al.
Published: (2025)
by: Zhao, Wanjia, et al.
Published: (2025)
An Efficient Inference Framework for Early-exit Large Language Models
by: Miao, Ruijie, et al.
Published: (2024)
by: Miao, Ruijie, et al.
Published: (2024)
Shared Nature, Unique Nurture: PRISM for Pluralistic Reasoning via In-context Structure Modeling
by: Tu, Guancheng, et al.
Published: (2026)
by: Tu, Guancheng, et al.
Published: (2026)
Common Benchmarks Undervalue the Generalization Power of Programmatic Policies
by: Rajabpour, Amirhossein, et al.
Published: (2025)
by: Rajabpour, Amirhossein, et al.
Published: (2025)
TableMind++: An Uncertainty-Aware Programmatic Agent for Tool-Augmented Table Reasoning
by: Cheng, Mingyue, et al.
Published: (2026)
by: Cheng, Mingyue, et al.
Published: (2026)
Variance-Adaptive Muon: Accelerating LLM Pretraining with NSR-Modulated and Variance-Scaled Momentum
by: Li, Jingru, et al.
Published: (2026)
by: Li, Jingru, et al.
Published: (2026)
DN-4DGS: Denoised Deformable Network with Temporal-Spatial Aggregation for Dynamic Scene Rendering
by: Lu, Jiahao, et al.
Published: (2024)
by: Lu, Jiahao, et al.
Published: (2024)
STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models
by: Liang, Yiming, et al.
Published: (2026)
by: Liang, Yiming, et al.
Published: (2026)
Similar Items
-
TeachMaster: Generative Teaching via Code
by: Wang, Yuheng, et al.
Published: (2025) -
AppCopilot: Toward General, Accurate, Long-Horizon, and Efficient Mobile Agent
by: Fan, Jingru, et al.
Published: (2025) -
AgentXRay: White-Boxing Agentic Systems via Workflow Reconstruction
by: Shi, Ruijie, et al.
Published: (2026) -
PRISM: Programmatic Reasoning with Image Sequence Manipulation for LVLM Jailbreaking
by: Zou, Quanchen, et al.
Published: (2025) -
Scaling Spatial Reasoning in MLLMs through Programmatic Data Synthesis
by: Helu, Zhi, et al.
Published: (2025)