PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Hengzhi, Zhang, Justin, Jiang, Brendon, Naehu, Alexander, Song, Regan, Tjandrasuwita, Megan, Ekbote, Chanakya, Chen, Steven-Shine, Balachandran, Adithya, Dai, Wei, Chang, Rebecca, Liang, Paul Pu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Understanding the Emergence of Multimodal Representation Alignment
by: Tjandrasuwita, Megan, et al.
Published: (2025)
by: Tjandrasuwita, Megan, et al.
Published: (2025)
QoQ-Med: Building Multimodal Clinical Foundation Models with Domain-Aware GRPO Training
by: Dai, Wei, et al.
Published: (2025)
by: Dai, Wei, et al.
Published: (2025)
MimeQA: Towards Socially-Intelligent Nonverbal Foundation Models
by: Li, Hengzhi, et al.
Published: (2025)
by: Li, Hengzhi, et al.
Published: (2025)
TAMP: Token-Adaptive Layerwise Pruning in Multimodal Large Language Models
by: Lee, Jaewoo, et al.
Published: (2025)
by: Lee, Jaewoo, et al.
Published: (2025)
Interactive Sketchpad: A Multimodal Tutoring System for Collaborative, Visual Problem-Solving
by: Chen, Steven-Shine, et al.
Published: (2025)
by: Chen, Steven-Shine, et al.
Published: (2025)
Partial Information Decomposition via Normalizing Flows in Latent Gaussian Distributions
by: Zhao, Wenyuan, et al.
Published: (2025)
by: Zhao, Wenyuan, et al.
Published: (2025)
OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
by: Xie, Tianbao, et al.
Published: (2024)
by: Xie, Tianbao, et al.
Published: (2024)
Benchmarking Vision, Language, & Action Models in Procedurally Generated, Open Ended Action Environments
by: Guruprasad, Pranav, et al.
Published: (2025)
by: Guruprasad, Pranav, et al.
Published: (2025)
MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark
by: Shaar, Shaden, et al.
Published: (2026)
by: Shaar, Shaden, et al.
Published: (2026)
Semantic Agreement Enables Efficient Open-Ended LLM Cascades
by: Soiffer, Duncan, et al.
Published: (2025)
by: Soiffer, Duncan, et al.
Published: (2025)
Dreaming in Code for Curriculum Learning in Open-Ended Worlds
by: Mitsides, Konstantinos, et al.
Published: (2026)
by: Mitsides, Konstantinos, et al.
Published: (2026)
Pencil Puzzle Bench: A Benchmark for Multi-Step Verifiable Reasoning
by: Waugh, Justin
Published: (2026)
by: Waugh, Justin
Published: (2026)
GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasks
by: Yang, Saelyne, et al.
Published: (2026)
by: Yang, Saelyne, et al.
Published: (2026)
In Search of the Ingredients of Open-Endedness: Replicating Picbreeder with Large Vision-Language Models
by: Earle, Sam, et al.
Published: (2026)
by: Earle, Sam, et al.
Published: (2026)
From OSS to Open Source AI: an Exploratory Study of Collaborative Development Paradigm Divergence
by: Ye, Hengzhi, et al.
Published: (2026)
by: Ye, Hengzhi, et al.
Published: (2026)
ONEBench to Test Them All: Sample-Level Benchmarking Over Open-Ended Capabilities
by: Ghosh, Adhiraj, et al.
Published: (2024)
by: Ghosh, Adhiraj, et al.
Published: (2024)
GuessingGame: Measuring the Informativeness of Open-Ended Questions in Large Language Models
by: Hutson, Dylan, et al.
Published: (2025)
by: Hutson, Dylan, et al.
Published: (2025)
Open-Ended Wargames with Large Language Models
by: Hogan, Daniel P., et al.
Published: (2024)
by: Hogan, Daniel P., et al.
Published: (2024)
OpenEP: Open-Ended Future Event Prediction
by: Guan, Yong, et al.
Published: (2024)
by: Guan, Yong, et al.
Published: (2024)
OpenSIR: Open-Ended Self-Improving Reasoner
by: Kwan, Wai-Chung, et al.
Published: (2025)
by: Kwan, Wai-Chung, et al.
Published: (2025)
Assessing Bias in Metric Models for LLM Open-Ended Generation Bias Benchmarks
by: Demchak, Nathaniel, et al.
Published: (2024)
by: Demchak, Nathaniel, et al.
Published: (2024)
MMReason: An Open-Ended Multi-Modal Multi-Step Reasoning Benchmark for MLLMs Toward AGI
by: Yao, Huanjin, et al.
Published: (2025)
by: Yao, Huanjin, et al.
Published: (2025)
Embodied World Models Emerge from Navigational Task in Open-Ended Environments
by: Jin, Li, et al.
Published: (2025)
by: Jin, Li, et al.
Published: (2025)
OpenGenAlign: A Preference Dataset and Benchmark for Trustworthy Reward Modeling in Open-Ended, Long-Context Generation
by: Zhang, Hanning, et al.
Published: (2025)
by: Zhang, Hanning, et al.
Published: (2025)
PuzzlePlex: Benchmarking Foundation Models on Reasoning and Planning with Puzzles
by: Long, Yitao, et al.
Published: (2025)
by: Long, Yitao, et al.
Published: (2025)
On Improvisation and Open-Endedness: Insights for Experiential AI
by: Hu, Botao 'Amber'
Published: (2025)
by: Hu, Botao 'Amber'
Published: (2025)
AEL: Agent Evolving Learning for Open-Ended Environments
by: Xu, Wujiang, et al.
Published: (2026)
by: Xu, Wujiang, et al.
Published: (2026)
M3DR: Towards Universal Multilingual Multimodal Document Retrieval
by: Kolavi, Adithya S, et al.
Published: (2025)
by: Kolavi, Adithya S, et al.
Published: (2025)
ChinaTravel: An Open-Ended Travel Planning Benchmark with Compositional Constraint Validation for Language Agents
by: Shao, Jie-Jing, et al.
Published: (2024)
by: Shao, Jie-Jing, et al.
Published: (2024)
A Mixture-of-Experts Approach to Few-Shot Task Transfer in Open-Ended Text Worlds
by: Cui, Christopher Z., et al.
Published: (2024)
by: Cui, Christopher Z., et al.
Published: (2024)
Benchmarking Content-Based Puzzle Solvers on Corrupted Jigsaw Puzzles
by: Dirauf, Richard, et al.
Published: (2025)
by: Dirauf, Richard, et al.
Published: (2025)
Open-Det: An Efficient Learning Framework for Open-Ended Detection
by: Cao, Guiping, et al.
Published: (2025)
by: Cao, Guiping, et al.
Published: (2025)
MCU: An Evaluation Framework for Open-Ended Game Agents
by: Zheng, Xinyue, et al.
Published: (2023)
by: Zheng, Xinyue, et al.
Published: (2023)
Reverse-Engineered Reasoning for Open-Ended Generation
by: Wang, Haozhe, et al.
Published: (2025)
by: Wang, Haozhe, et al.
Published: (2025)
Scaling Open-Ended Reasoning to Predict the Future
by: Chandak, Nikhil, et al.
Published: (2025)
by: Chandak, Nikhil, et al.
Published: (2025)
Marco-o1: Towards Open Reasoning Models for Open-Ended Solutions
by: Zhao, Yu, et al.
Published: (2024)
by: Zhao, Yu, et al.
Published: (2024)
GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows
by: Wang, Jize, et al.
Published: (2026)
by: Wang, Jize, et al.
Published: (2026)
SCATR: Simple Calibrated Test-Time Ranking
by: Shyamal, Divya, et al.
Published: (2026)
by: Shyamal, Divya, et al.
Published: (2026)
OpenWatch: A Multimodal Benchmark for Hand Gesture Recognition on Smartwatches
by: Bonazzi, Pietro, et al.
Published: (2026)
by: Bonazzi, Pietro, et al.
Published: (2026)
JaxLife: An Open-Ended Agentic Simulator
by: Lu, Chris, et al.
Published: (2024)
by: Lu, Chris, et al.
Published: (2024)
Similar Items
-
Understanding the Emergence of Multimodal Representation Alignment
by: Tjandrasuwita, Megan, et al.
Published: (2025) -
QoQ-Med: Building Multimodal Clinical Foundation Models with Domain-Aware GRPO Training
by: Dai, Wei, et al.
Published: (2025) -
MimeQA: Towards Socially-Intelligent Nonverbal Foundation Models
by: Li, Hengzhi, et al.
Published: (2025) -
TAMP: Token-Adaptive Layerwise Pruning in Multimodal Large Language Models
by: Lee, Jaewoo, et al.
Published: (2025) -
Interactive Sketchpad: A Multimodal Tutoring System for Collaborative, Visual Problem-Solving
by: Chen, Steven-Shine, et al.
Published: (2025)