PuzzleGPT: Emulating Human Puzzle-Solving Ability for Time and Location Prediction
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ayyubi, Hammad, Feng, Xuande, Liu, Junzhang, Lin, Xudong, Wang, Zhecan, Chang, Shih-Fu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Detecting Multimodal Situations with Insufficient Context and Abstaining from Baseless Predictions
von: Liu, Junzhang, et al.
Veröffentlicht: (2024)
von: Liu, Junzhang, et al.
Veröffentlicht: (2024)
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
von: You, Haoxuan, et al.
Veröffentlicht: (2023)
von: You, Haoxuan, et al.
Veröffentlicht: (2023)
ENTER: Event Based Interpretable Reasoning for VideoQA
von: Ayyubi, Hammad, et al.
Veröffentlicht: (2025)
von: Ayyubi, Hammad, et al.
Veröffentlicht: (2025)
ERL-MPP: Evolutionary Reinforcement Learning with Multi-head Puzzle Perception for Solving Large-scale Jigsaw Puzzles of Eroded Gaps
von: Song, Xingke, et al.
Veröffentlicht: (2025)
von: Song, Xingke, et al.
Veröffentlicht: (2025)
JourneyBench: A Challenging One-Stop Vision-Language Understanding Benchmark of Generated Images
von: Wang, Zhecan, et al.
Veröffentlicht: (2024)
von: Wang, Zhecan, et al.
Veröffentlicht: (2024)
RAP: Retrieval-Augmented Planner for Adaptive Procedure Planning in Instructional Videos
von: Zare, Ali, et al.
Veröffentlicht: (2024)
von: Zare, Ali, et al.
Veröffentlicht: (2024)
MonetGPT: Solving Puzzles Enhances MLLMs' Image Retouching Skills
von: Dutt, Niladri Shekhar, et al.
Veröffentlicht: (2025)
von: Dutt, Niladri Shekhar, et al.
Veröffentlicht: (2025)
Solving Masked Jigsaw Puzzles with Diffusion Vision Transformers
von: Liu, Jinyang, et al.
Veröffentlicht: (2024)
von: Liu, Jinyang, et al.
Veröffentlicht: (2024)
Solving Convex Partition Visual Jigsaw Puzzles
von: Ohayon, Yaniv, et al.
Veröffentlicht: (2025)
von: Ohayon, Yaniv, et al.
Veröffentlicht: (2025)
PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving
von: Zhang, Zeyu, et al.
Veröffentlicht: (2025)
von: Zhang, Zeyu, et al.
Veröffentlicht: (2025)
Solving Jigsaw Puzzles in the Wild: Human-Guided Reconstruction of Cultural Heritage Fragments
von: Safaei, Omidreza, et al.
Veröffentlicht: (2026)
von: Safaei, Omidreza, et al.
Veröffentlicht: (2026)
Video Summarization: Towards Entity-Aware Captions
von: Ayyubi, Hammad A., et al.
Veröffentlicht: (2023)
von: Ayyubi, Hammad A., et al.
Veröffentlicht: (2023)
PuzzlePoles: Cylindrical Fiducial Markers Based on the PuzzleBoard Pattern
von: Zach, Juri, et al.
Veröffentlicht: (2025)
von: Zach, Juri, et al.
Veröffentlicht: (2025)
PuzLM: Solving Jigsaw Puzzles with Sequence-to-Sequence Language Models
von: Elkin, Gur, et al.
Veröffentlicht: (2025)
von: Elkin, Gur, et al.
Veröffentlicht: (2025)
PuzzleCraft: Exploration-Aware Curriculum Learning for Puzzle-Based RLVR in VLMs
von: Jeddi, Ahmadreza, et al.
Veröffentlicht: (2025)
von: Jeddi, Ahmadreza, et al.
Veröffentlicht: (2025)
Benchmarking Content-Based Puzzle Solvers on Corrupted Jigsaw Puzzles
von: Dirauf, Richard, et al.
Veröffentlicht: (2025)
von: Dirauf, Richard, et al.
Veröffentlicht: (2025)
BrainPuzzle: Hybrid Physics and Data-Driven Reconstruction for Transcranial Ultrasound Tomography
von: Chen, Shengyu, et al.
Veröffentlicht: (2025)
von: Chen, Shengyu, et al.
Veröffentlicht: (2025)
Are Language Models Puzzle Prodigies? Algorithmic Puzzles Unveil Serious Challenges in Multimodal Reasoning
von: Ghosal, Deepanway, et al.
Veröffentlicht: (2024)
von: Ghosal, Deepanway, et al.
Veröffentlicht: (2024)
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
von: Wang, Zhecan, et al.
Veröffentlicht: (2023)
von: Wang, Zhecan, et al.
Veröffentlicht: (2023)
Puzzle Pieces Picker: Deciphering Ancient Chinese Characters with Radical Reconstruction
von: Wang, Pengjie, et al.
Veröffentlicht: (2024)
von: Wang, Pengjie, et al.
Veröffentlicht: (2024)
The Missing GAP: From Solving Square Jigsaw Puzzles to Handling Real World Archaeological Fragments
von: Shahar, Ofir Itzhak, et al.
Veröffentlicht: (2026)
von: Shahar, Ofir Itzhak, et al.
Veröffentlicht: (2026)
Eye-Q: A Multilingual Benchmark for Visual Word Puzzle Solving and Image-to-Phrase Reasoning
von: Najar, Ali, et al.
Veröffentlicht: (2026)
von: Najar, Ali, et al.
Veröffentlicht: (2026)
A Unified Masked Jigsaw Puzzle Framework for Vision and Language Models
von: Ye, Weixin, et al.
Veröffentlicht: (2026)
von: Ye, Weixin, et al.
Veröffentlicht: (2026)
Puzzled by Puzzles: When Vision-Language Models Can't Take a Hint
von: Lee, Heekyung, et al.
Veröffentlicht: (2025)
von: Lee, Heekyung, et al.
Veröffentlicht: (2025)
GenVP: Generating Visual Puzzles with Contrastive Hierarchical VAEs
von: Basioti, Kalliopi, et al.
Veröffentlicht: (2025)
von: Basioti, Kalliopi, et al.
Veröffentlicht: (2025)
MoviePuzzle: Visual Narrative Reasoning through Multimodal Order Learning
von: Wang, Jianghui, et al.
Veröffentlicht: (2023)
von: Wang, Jianghui, et al.
Veröffentlicht: (2023)
PuzzleBoard: A New Camera Calibration Pattern with Position Encoding
von: Stelldinger, Peer, et al.
Veröffentlicht: (2024)
von: Stelldinger, Peer, et al.
Veröffentlicht: (2024)
VisualSphinx: Large-Scale Synthetic Vision Logic Puzzles for RL
von: Feng, Yichen, et al.
Veröffentlicht: (2025)
von: Feng, Yichen, et al.
Veröffentlicht: (2025)
Reasoning or Pattern Matching? Probing Large Vision-Language Models with Visual Puzzles
von: Lymperaiou, Maria, et al.
Veröffentlicht: (2026)
von: Lymperaiou, Maria, et al.
Veröffentlicht: (2026)
MathSticks: A Benchmark for Visual Symbolic Compositional Reasoning with Matchstick Puzzles
von: Ji, Yuheng, et al.
Veröffentlicht: (2025)
von: Ji, Yuheng, et al.
Veröffentlicht: (2025)
PuzzleFusion++: Auto-agglomerative 3D Fracture Assembly by Denoise and Verify
von: Wang, Zhengqing, et al.
Veröffentlicht: (2024)
von: Wang, Zhengqing, et al.
Veröffentlicht: (2024)
Improved Baselines with Synchronized Encoding for Universal Medical Image Segmentation
von: Yang, Sihan, et al.
Veröffentlicht: (2024)
von: Yang, Sihan, et al.
Veröffentlicht: (2024)
PRISM-Bench: A Benchmark of Puzzle-Based Visual Tasks with CoT Error Detection
von: Qian, Yusu, et al.
Veröffentlicht: (2025)
von: Qian, Yusu, et al.
Veröffentlicht: (2025)
Puzzles: Unbounded Video-Depth Augmentation for Scalable End-to-End 3D Reconstruction
von: Ma, Jiahao, et al.
Veröffentlicht: (2025)
von: Ma, Jiahao, et al.
Veröffentlicht: (2025)
VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models
von: Ren, Yufan, et al.
Veröffentlicht: (2025)
von: Ren, Yufan, et al.
Veröffentlicht: (2025)
PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns
von: Chia, Yew Ken, et al.
Veröffentlicht: (2024)
von: Chia, Yew Ken, et al.
Veröffentlicht: (2024)
The Jumping Reasoning Curve? Tracking the Evolution of Reasoning Performance in GPT-[n] and o-[n] Models on Multimodal Puzzles
von: Toh, Vernon Y. H., et al.
Veröffentlicht: (2025)
von: Toh, Vernon Y. H., et al.
Veröffentlicht: (2025)
Layer as Puzzle Pieces: Compressing Large Language Models through Layer Concatenation
von: Wang, Fei, et al.
Veröffentlicht: (2025)
von: Wang, Fei, et al.
Veröffentlicht: (2025)
PuzzleAvatar: Assembling 3D Avatars from Personal Albums
von: Xiu, Yuliang, et al.
Veröffentlicht: (2024)
von: Xiu, Yuliang, et al.
Veröffentlicht: (2024)
GenEscape: Hierarchical Multi-Agent Generation of Escape Room Puzzles
von: Shan, Mengyi, et al.
Veröffentlicht: (2025)
von: Shan, Mengyi, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Detecting Multimodal Situations with Insufficient Context and Abstaining from Baseless Predictions
von: Liu, Junzhang, et al.
Veröffentlicht: (2024) -
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
von: You, Haoxuan, et al.
Veröffentlicht: (2023) -
ENTER: Event Based Interpretable Reasoning for VideoQA
von: Ayyubi, Hammad, et al.
Veröffentlicht: (2025) -
ERL-MPP: Evolutionary Reinforcement Learning with Multi-head Puzzle Perception for Solving Large-scale Jigsaw Puzzles of Eroded Gaps
von: Song, Xingke, et al.
Veröffentlicht: (2025) -
JourneyBench: A Challenging One-Stop Vision-Language Understanding Benchmark of Generated Images
von: Wang, Zhecan, et al.
Veröffentlicht: (2024)