Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Lyu, Zesen, Zhang, Dandan, Ye, Wei, Li, Fangdi, Jiang, Zhihang, Yang, Yao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Benchmarking Content-Based Puzzle Solvers on Corrupted Jigsaw Puzzles
by: Dirauf, Richard, et al.
Published: (2025)
by: Dirauf, Richard, et al.
Published: (2025)
Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models
by: Zeng, Yu, et al.
Published: (2025)
by: Zeng, Yu, et al.
Published: (2025)
Jigsaw-R1: A Study of Rule-based Visual Reinforcement Learning with Jigsaw Puzzles
by: Wang, Zifu, et al.
Published: (2025)
by: Wang, Zifu, et al.
Published: (2025)
Vision Language Models See What You Want but not What You See
by: Gao, Qingying, et al.
Published: (2024)
by: Gao, Qingying, et al.
Published: (2024)
Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models
by: Ye, Zekai, et al.
Published: (2026)
by: Ye, Zekai, et al.
Published: (2026)
Graph-to-Vision: Multi-graph Understanding and Reasoning using Vision-Language Models
by: Ai, Qihang, et al.
Published: (2025)
by: Ai, Qihang, et al.
Published: (2025)
The Missing GAP: From Solving Square Jigsaw Puzzles to Handling Real World Archaeological Fragments
by: Shahar, Ofir Itzhak, et al.
Published: (2026)
by: Shahar, Ofir Itzhak, et al.
Published: (2026)
Seeing Through Experts Eyes A Foundational Vision Language Model Trained on Radiologists Gaze and Reasoning
by: Lee, Kinhei, et al.
Published: (2026)
by: Lee, Kinhei, et al.
Published: (2026)
PuzzlePlex: Benchmarking Foundation Models on Reasoning and Planning with Puzzles
by: Long, Yitao, et al.
Published: (2025)
by: Long, Yitao, et al.
Published: (2025)
The Token Games: Evaluating Language Model Reasoning with Puzzle Duels
by: Henniger, Simon, et al.
Published: (2026)
by: Henniger, Simon, et al.
Published: (2026)
Large Language Models Can Self-Improve in Long-context Reasoning
by: Li, Siheng, et al.
Published: (2024)
by: Li, Siheng, et al.
Published: (2024)
A Unified Masked Jigsaw Puzzle Framework for Vision and Language Models
by: Ye, Weixin, et al.
Published: (2026)
by: Ye, Weixin, et al.
Published: (2026)
Safe Semantics, Unsafe Interpretations: Tackling Implicit Reasoning Safety in Large Vision-Language Models
by: Cai, Wei, et al.
Published: (2025)
by: Cai, Wei, et al.
Published: (2025)
TimeCapsule: Solving the Jigsaw Puzzle of Long-Term Time Series Forecasting with Compressed Predictive Representations
by: Lu, Yihang, et al.
Published: (2025)
by: Lu, Yihang, et al.
Published: (2025)
"I See What You Did There": Can Large Vision-Language Models Understand Multimodal Puns?
by: Xu, Naen, et al.
Published: (2026)
by: Xu, Naen, et al.
Published: (2026)
InsightSee: Advancing Multi-agent Vision-Language Models for Enhanced Visual Understanding
by: Zhang, Huaxiang, et al.
Published: (2024)
by: Zhang, Huaxiang, et al.
Published: (2024)
Are Language Models Puzzle Prodigies? Algorithmic Puzzles Unveil Serious Challenges in Multimodal Reasoning
by: Ghosal, Deepanway, et al.
Published: (2024)
by: Ghosal, Deepanway, et al.
Published: (2024)
Probing Mechanical Reasoning in Large Vision Language Models
by: Sun, Haoran, et al.
Published: (2024)
by: Sun, Haoran, et al.
Published: (2024)
Reasoning under Vision: Understanding Visual-Spatial Cognition in Vision-Language Models for CAPTCHA
by: Song, Python, et al.
Published: (2025)
by: Song, Python, et al.
Published: (2025)
See or Say Graphs: Agent-Driven Scalable Graph Structure Understanding with Vision-Language Models
by: Han, Shuo, et al.
Published: (2025)
by: Han, Shuo, et al.
Published: (2025)
Phenomenal Yet Puzzling: Testing Inductive Reasoning Capabilities of Language Models with Hypothesis Refinement
by: Qiu, Linlu, et al.
Published: (2023)
by: Qiu, Linlu, et al.
Published: (2023)
From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models
by: Zhou, Chenyue, et al.
Published: (2025)
by: Zhou, Chenyue, et al.
Published: (2025)
SUM-AgriVLN: Spatial Understanding Memory for Agricultural Vision-and-Language Navigation
by: Zhao, Xiaobei, et al.
Published: (2025)
by: Zhao, Xiaobei, et al.
Published: (2025)
LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?
by: Tang, Kexian, et al.
Published: (2025)
by: Tang, Kexian, et al.
Published: (2025)
Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles
by: Chen, Jiangjie, et al.
Published: (2025)
by: Chen, Jiangjie, et al.
Published: (2025)
Puzzle Solving using Reasoning of Large Language Models: A Survey
by: Giadikiaroglou, Panagiotis, et al.
Published: (2024)
by: Giadikiaroglou, Panagiotis, et al.
Published: (2024)
HardcoreLogic: Challenging Large Reasoning Models with Long-tail Logic Puzzle Games
by: Liang, Jingcong, et al.
Published: (2025)
by: Liang, Jingcong, et al.
Published: (2025)
Understanding Reasoning Ability of Language Models From the Perspective of Reasoning Paths Aggregation
by: Wang, Xinyi, et al.
Published: (2024)
by: Wang, Xinyi, et al.
Published: (2024)
PuzzleJAX: A Benchmark for Reasoning and Learning
by: Earle, Sam, et al.
Published: (2025)
by: Earle, Sam, et al.
Published: (2025)
Logic-of-Thought: Empowering Large Language Models with Logic Programs for Solving Puzzles in Natural Language
by: Li, Naiqi, et al.
Published: (2025)
by: Li, Naiqi, et al.
Published: (2025)
Puzzled by Puzzles: When Vision-Language Models Can't Take a Hint
by: Lee, Heekyung, et al.
Published: (2025)
by: Lee, Heekyung, et al.
Published: (2025)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
by: Tian, Kexin, et al.
Published: (2025)
by: Tian, Kexin, et al.
Published: (2025)
Cumulative Reasoning with Large Language Models
by: Zhang, Yifan, et al.
Published: (2023)
by: Zhang, Yifan, et al.
Published: (2023)
SeePhys: Does Seeing Help Thinking? -- Benchmarking Vision-Based Physics Reasoning
by: Xiang, Kun, et al.
Published: (2025)
by: Xiang, Kun, et al.
Published: (2025)
Vision Language Models Know Law of Conservation without Understanding More-or-Less
by: Luo, Dezhi, et al.
Published: (2024)
by: Luo, Dezhi, et al.
Published: (2024)
Bad Seeing or Bad Thinking? Rewarding Perception for Vision-Language Reasoning
by: Wang, Haozhe, et al.
Published: (2026)
by: Wang, Haozhe, et al.
Published: (2026)
Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models
by: Hawkins, John
Published: (2025)
by: Hawkins, John
Published: (2025)
Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model
by: Li, Tianle, et al.
Published: (2025)
by: Li, Tianle, et al.
Published: (2025)
Seeing Symbols, Missing Cultures: Probing Vision-Language Models' Reasoning on Fire Imagery and Cultural Meaning
by: Yu, Haorui, et al.
Published: (2025)
by: Yu, Haorui, et al.
Published: (2025)
When Vision-Language Models Judge Without Seeing: Exposing Informativeness Bias
by: Zou, Xiaohan, et al.
Published: (2026)
by: Zou, Xiaohan, et al.
Published: (2026)
Similar Items
-
Benchmarking Content-Based Puzzle Solvers on Corrupted Jigsaw Puzzles
by: Dirauf, Richard, et al.
Published: (2025) -
Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models
by: Zeng, Yu, et al.
Published: (2025) -
Jigsaw-R1: A Study of Rule-based Visual Reinforcement Learning with Jigsaw Puzzles
by: Wang, Zifu, et al.
Published: (2025) -
Vision Language Models See What You Want but not What You See
by: Gao, Qingying, et al.
Published: (2024) -
Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models
by: Ye, Zekai, et al.
Published: (2026)