The Token Games: Evaluating Language Model Reasoning with Puzzle Duels
Fuente:
arXiv
Saved in:
| Main Authors: | Henniger, Simon, Poesia, Gabriel |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
From Next-Token to Mathematics: The Learning Dynamics of Mathematical Reasoning in Language Models
by: Mishra, Shubhra, et al.
Published: (2024)
by: Mishra, Shubhra, et al.
Published: (2024)
Hypothesis Search: Inductive Reasoning with Language Models
by: Wang, Ruocheng, et al.
Published: (2023)
by: Wang, Ruocheng, et al.
Published: (2023)
TextGames: Learning to Self-Play Text-Based Puzzle Games via Language Model Reasoning
by: Hudi, Frederikus, et al.
Published: (2025)
by: Hudi, Frederikus, et al.
Published: (2025)
Vision-Language Models Suppress Female Representations Under Ambiguous Input
by: Marin-Llobet, Arnau, et al.
Published: (2026)
by: Marin-Llobet, Arnau, et al.
Published: (2026)
HardcoreLogic: Challenging Large Reasoning Models with Long-tail Logic Puzzle Games
by: Liang, Jingcong, et al.
Published: (2025)
by: Liang, Jingcong, et al.
Published: (2025)
Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models
by: Hawkins, John
Published: (2025)
by: Hawkins, John
Published: (2025)
Evaluating Game Difficulty in Tetris Block Puzzle
by: Wang, Chun-Jui, et al.
Published: (2026)
by: Wang, Chun-Jui, et al.
Published: (2026)
dafny-annotator: AI-Assisted Verification of Dafny Programs
by: Poesia, Gabriel, et al.
Published: (2024)
by: Poesia, Gabriel, et al.
Published: (2024)
When Do Skills Help Reinforcement Learning? A Theoretical Analysis of Temporal Abstractions
by: Li, Zhening, et al.
Published: (2024)
by: Li, Zhening, et al.
Published: (2024)
Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models
by: Lyu, Zesen, et al.
Published: (2025)
by: Lyu, Zesen, et al.
Published: (2025)
PuzzlePlex: Benchmarking Foundation Models on Reasoning and Planning with Puzzles
by: Long, Yitao, et al.
Published: (2025)
by: Long, Yitao, et al.
Published: (2025)
Are Language Models Puzzle Prodigies? Algorithmic Puzzles Unveil Serious Challenges in Multimodal Reasoning
by: Ghosal, Deepanway, et al.
Published: (2024)
by: Ghosal, Deepanway, et al.
Published: (2024)
ProofCompass: Enhancing Specialized Provers with LLM Guidance
by: Wischermann, Nicolas, et al.
Published: (2025)
by: Wischermann, Nicolas, et al.
Published: (2025)
Learning To Play Atari Games Using Dueling Q-Learning and Hebbian Plasticity
by: Salehin, Md Ashfaq
Published: (2024)
by: Salehin, Md Ashfaq
Published: (2024)
TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning
by: Liu, Daixian, et al.
Published: (2026)
by: Liu, Daixian, et al.
Published: (2026)
Puzzle Solving using Reasoning of Large Language Models: A Survey
by: Giadikiaroglou, Panagiotis, et al.
Published: (2024)
by: Giadikiaroglou, Panagiotis, et al.
Published: (2024)
Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles
by: Chen, Jiangjie, et al.
Published: (2025)
by: Chen, Jiangjie, et al.
Published: (2025)
Haiku to Opus in Just 10 bits: LLMs Unlock Massive Compression Gains
by: Rinberg, Roy, et al.
Published: (2026)
by: Rinberg, Roy, et al.
Published: (2026)
Evaluating Interactive Reasoning in Large Language Models: A Hierarchical Benchmark with Executable Games
by: Fan, Mingyuan, et al.
Published: (2026)
by: Fan, Mingyuan, et al.
Published: (2026)
Online Clustering of Dueling Bandits
by: Wang, Zhiyong, et al.
Published: (2025)
by: Wang, Zhiyong, et al.
Published: (2025)
Learning Formal Mathematics From Intrinsic Motivation
by: Poesia, Gabriel, et al.
Published: (2024)
by: Poesia, Gabriel, et al.
Published: (2024)
Phenomenal Yet Puzzling: Testing Inductive Reasoning Capabilities of Language Models with Hypothesis Refinement
by: Qiu, Linlu, et al.
Published: (2023)
by: Qiu, Linlu, et al.
Published: (2023)
Formal Mathematical Reasoning: A New Frontier in AI
by: Yang, Kaiyu, et al.
Published: (2024)
by: Yang, Kaiyu, et al.
Published: (2024)
DocPuzzle: A Process-Aware Benchmark for Evaluating Realistic Long-Context Reasoning Capabilities
by: Zhuang, Tianyi, et al.
Published: (2025)
by: Zhuang, Tianyi, et al.
Published: (2025)
Evaluating Language Models' Evaluations of Games
by: Collins, Katherine M., et al.
Published: (2025)
by: Collins, Katherine M., et al.
Published: (2025)
ScriptDoctor: Automatic Generation of PuzzleScript Games via Large Language Models and Tree Search
by: Earle, Sam, et al.
Published: (2025)
by: Earle, Sam, et al.
Published: (2025)
Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models
by: Liao, Yi, et al.
Published: (2025)
by: Liao, Yi, et al.
Published: (2025)
Lost in the Logic: An Evaluation of Large Language Models' Reasoning Capabilities on LSAT Logic Games
by: Malik, Saumya
Published: (2024)
by: Malik, Saumya
Published: (2024)
Evaluating Implicit Biases in LLM Reasoning through Logic Grid Puzzles
by: Jahara, Fatima, et al.
Published: (2025)
by: Jahara, Fatima, et al.
Published: (2025)
Linear and Neural Dueling Bandits with Delayed Feedback
by: Wang, Xiangyi, et al.
Published: (2026)
by: Wang, Xiangyi, et al.
Published: (2026)
Fusing Reward and Dueling Feedback in Stochastic Bandits
by: Wang, Xuchuang, et al.
Published: (2025)
by: Wang, Xuchuang, et al.
Published: (2025)
Measuring Iterative Temporal Reasoning with Time Puzzles
by: Wang, Zhengxiang, et al.
Published: (2026)
by: Wang, Zhengxiang, et al.
Published: (2026)
PuzzleJAX: A Benchmark for Reasoning and Learning
by: Earle, Sam, et al.
Published: (2025)
by: Earle, Sam, et al.
Published: (2025)
Learning to Rank the Initial Branching Order of SAT Solvers
by: Eriksson, Arvid, et al.
Published: (2026)
by: Eriksson, Arvid, et al.
Published: (2026)
Guiding Language Model Reasoning with Planning Tokens
by: Wang, Xinyi, et al.
Published: (2023)
by: Wang, Xinyi, et al.
Published: (2023)
Code-enabled language models can outperform reasoning models on diverse tasks
by: Zhang, Cedegao E., et al.
Published: (2025)
by: Zhang, Cedegao E., et al.
Published: (2025)
Difficulty Modelling in Mobile Puzzle Games: An Empirical Study on Different Methods to Combine Player Analytics and Simulated Data
by: Kristensen, Jeppe Theiss, et al.
Published: (2024)
by: Kristensen, Jeppe Theiss, et al.
Published: (2024)
Reasoning, Memorization, and Fine-Tuning Language Models for Non-Cooperative Games
by: Yang, Yunhao, et al.
Published: (2024)
by: Yang, Yunhao, et al.
Published: (2024)
Enhance Reasoning for Large Language Models in the Game Werewolf
by: Wu, Shuang, et al.
Published: (2024)
by: Wu, Shuang, et al.
Published: (2024)
PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving
by: Zhang, Zeyu, et al.
Published: (2025)
by: Zhang, Zeyu, et al.
Published: (2025)
Similar Items
-
From Next-Token to Mathematics: The Learning Dynamics of Mathematical Reasoning in Language Models
by: Mishra, Shubhra, et al.
Published: (2024) -
Hypothesis Search: Inductive Reasoning with Language Models
by: Wang, Ruocheng, et al.
Published: (2023) -
TextGames: Learning to Self-Play Text-Based Puzzle Games via Language Model Reasoning
by: Hudi, Frederikus, et al.
Published: (2025) -
Vision-Language Models Suppress Female Representations Under Ambiguous Input
by: Marin-Llobet, Arnau, et al.
Published: (2026) -
HardcoreLogic: Challenging Large Reasoning Models with Long-tail Logic Puzzle Games
by: Liang, Jingcong, et al.
Published: (2025)