Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Lyu, Zesen, Zhang, Dandan, Ye, Wei, Li, Fangdi, Jiang, Zhihang, Yang, Yao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Benchmarking Content-Based Puzzle Solvers on Corrupted Jigsaw Puzzles
por: Dirauf, Richard, et al.
Publicado: (2025)
por: Dirauf, Richard, et al.
Publicado: (2025)
Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models
por: Zeng, Yu, et al.
Publicado: (2025)
por: Zeng, Yu, et al.
Publicado: (2025)
Jigsaw-R1: A Study of Rule-based Visual Reinforcement Learning with Jigsaw Puzzles
por: Wang, Zifu, et al.
Publicado: (2025)
por: Wang, Zifu, et al.
Publicado: (2025)
Vision Language Models See What You Want but not What You See
por: Gao, Qingying, et al.
Publicado: (2024)
por: Gao, Qingying, et al.
Publicado: (2024)
Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models
por: Ye, Zekai, et al.
Publicado: (2026)
por: Ye, Zekai, et al.
Publicado: (2026)
Graph-to-Vision: Multi-graph Understanding and Reasoning using Vision-Language Models
por: Ai, Qihang, et al.
Publicado: (2025)
por: Ai, Qihang, et al.
Publicado: (2025)
The Missing GAP: From Solving Square Jigsaw Puzzles to Handling Real World Archaeological Fragments
por: Shahar, Ofir Itzhak, et al.
Publicado: (2026)
por: Shahar, Ofir Itzhak, et al.
Publicado: (2026)
Seeing Through Experts Eyes A Foundational Vision Language Model Trained on Radiologists Gaze and Reasoning
por: Lee, Kinhei, et al.
Publicado: (2026)
por: Lee, Kinhei, et al.
Publicado: (2026)
PuzzlePlex: Benchmarking Foundation Models on Reasoning and Planning with Puzzles
por: Long, Yitao, et al.
Publicado: (2025)
por: Long, Yitao, et al.
Publicado: (2025)
The Token Games: Evaluating Language Model Reasoning with Puzzle Duels
por: Henniger, Simon, et al.
Publicado: (2026)
por: Henniger, Simon, et al.
Publicado: (2026)
Large Language Models Can Self-Improve in Long-context Reasoning
por: Li, Siheng, et al.
Publicado: (2024)
por: Li, Siheng, et al.
Publicado: (2024)
A Unified Masked Jigsaw Puzzle Framework for Vision and Language Models
por: Ye, Weixin, et al.
Publicado: (2026)
por: Ye, Weixin, et al.
Publicado: (2026)
Safe Semantics, Unsafe Interpretations: Tackling Implicit Reasoning Safety in Large Vision-Language Models
por: Cai, Wei, et al.
Publicado: (2025)
por: Cai, Wei, et al.
Publicado: (2025)
TimeCapsule: Solving the Jigsaw Puzzle of Long-Term Time Series Forecasting with Compressed Predictive Representations
por: Lu, Yihang, et al.
Publicado: (2025)
por: Lu, Yihang, et al.
Publicado: (2025)
"I See What You Did There": Can Large Vision-Language Models Understand Multimodal Puns?
por: Xu, Naen, et al.
Publicado: (2026)
por: Xu, Naen, et al.
Publicado: (2026)
InsightSee: Advancing Multi-agent Vision-Language Models for Enhanced Visual Understanding
por: Zhang, Huaxiang, et al.
Publicado: (2024)
por: Zhang, Huaxiang, et al.
Publicado: (2024)
Are Language Models Puzzle Prodigies? Algorithmic Puzzles Unveil Serious Challenges in Multimodal Reasoning
por: Ghosal, Deepanway, et al.
Publicado: (2024)
por: Ghosal, Deepanway, et al.
Publicado: (2024)
Probing Mechanical Reasoning in Large Vision Language Models
por: Sun, Haoran, et al.
Publicado: (2024)
por: Sun, Haoran, et al.
Publicado: (2024)
Reasoning under Vision: Understanding Visual-Spatial Cognition in Vision-Language Models for CAPTCHA
por: Song, Python, et al.
Publicado: (2025)
por: Song, Python, et al.
Publicado: (2025)
See or Say Graphs: Agent-Driven Scalable Graph Structure Understanding with Vision-Language Models
por: Han, Shuo, et al.
Publicado: (2025)
por: Han, Shuo, et al.
Publicado: (2025)
Phenomenal Yet Puzzling: Testing Inductive Reasoning Capabilities of Language Models with Hypothesis Refinement
por: Qiu, Linlu, et al.
Publicado: (2023)
por: Qiu, Linlu, et al.
Publicado: (2023)
From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models
por: Zhou, Chenyue, et al.
Publicado: (2025)
por: Zhou, Chenyue, et al.
Publicado: (2025)
SUM-AgriVLN: Spatial Understanding Memory for Agricultural Vision-and-Language Navigation
por: Zhao, Xiaobei, et al.
Publicado: (2025)
por: Zhao, Xiaobei, et al.
Publicado: (2025)
LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?
por: Tang, Kexian, et al.
Publicado: (2025)
por: Tang, Kexian, et al.
Publicado: (2025)
Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles
por: Chen, Jiangjie, et al.
Publicado: (2025)
por: Chen, Jiangjie, et al.
Publicado: (2025)
Puzzle Solving using Reasoning of Large Language Models: A Survey
por: Giadikiaroglou, Panagiotis, et al.
Publicado: (2024)
por: Giadikiaroglou, Panagiotis, et al.
Publicado: (2024)
HardcoreLogic: Challenging Large Reasoning Models with Long-tail Logic Puzzle Games
por: Liang, Jingcong, et al.
Publicado: (2025)
por: Liang, Jingcong, et al.
Publicado: (2025)
Understanding Reasoning Ability of Language Models From the Perspective of Reasoning Paths Aggregation
por: Wang, Xinyi, et al.
Publicado: (2024)
por: Wang, Xinyi, et al.
Publicado: (2024)
PuzzleJAX: A Benchmark for Reasoning and Learning
por: Earle, Sam, et al.
Publicado: (2025)
por: Earle, Sam, et al.
Publicado: (2025)
Logic-of-Thought: Empowering Large Language Models with Logic Programs for Solving Puzzles in Natural Language
por: Li, Naiqi, et al.
Publicado: (2025)
por: Li, Naiqi, et al.
Publicado: (2025)
Puzzled by Puzzles: When Vision-Language Models Can't Take a Hint
por: Lee, Heekyung, et al.
Publicado: (2025)
por: Lee, Heekyung, et al.
Publicado: (2025)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
por: Tian, Kexin, et al.
Publicado: (2025)
por: Tian, Kexin, et al.
Publicado: (2025)
Cumulative Reasoning with Large Language Models
por: Zhang, Yifan, et al.
Publicado: (2023)
por: Zhang, Yifan, et al.
Publicado: (2023)
SeePhys: Does Seeing Help Thinking? -- Benchmarking Vision-Based Physics Reasoning
por: Xiang, Kun, et al.
Publicado: (2025)
por: Xiang, Kun, et al.
Publicado: (2025)
Vision Language Models Know Law of Conservation without Understanding More-or-Less
por: Luo, Dezhi, et al.
Publicado: (2024)
por: Luo, Dezhi, et al.
Publicado: (2024)
Bad Seeing or Bad Thinking? Rewarding Perception for Vision-Language Reasoning
por: Wang, Haozhe, et al.
Publicado: (2026)
por: Wang, Haozhe, et al.
Publicado: (2026)
Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models
por: Hawkins, John
Publicado: (2025)
por: Hawkins, John
Publicado: (2025)
Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model
por: Li, Tianle, et al.
Publicado: (2025)
por: Li, Tianle, et al.
Publicado: (2025)
Seeing Symbols, Missing Cultures: Probing Vision-Language Models' Reasoning on Fire Imagery and Cultural Meaning
por: Yu, Haorui, et al.
Publicado: (2025)
por: Yu, Haorui, et al.
Publicado: (2025)
When Vision-Language Models Judge Without Seeing: Exposing Informativeness Bias
por: Zou, Xiaohan, et al.
Publicado: (2026)
por: Zou, Xiaohan, et al.
Publicado: (2026)
Ejemplares similares
-
Benchmarking Content-Based Puzzle Solvers on Corrupted Jigsaw Puzzles
por: Dirauf, Richard, et al.
Publicado: (2025) -
Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models
por: Zeng, Yu, et al.
Publicado: (2025) -
Jigsaw-R1: A Study of Rule-based Visual Reinforcement Learning with Jigsaw Puzzles
por: Wang, Zifu, et al.
Publicado: (2025) -
Vision Language Models See What You Want but not What You See
por: Gao, Qingying, et al.
Publicado: (2024) -
Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models
por: Ye, Zekai, et al.
Publicado: (2026)