PuzzleGPT: Emulating Human Puzzle-Solving Ability for Time and Location Prediction
Fuente:
arXiv
Salvato in:
| Autori principali: | Ayyubi, Hammad, Feng, Xuande, Liu, Junzhang, Lin, Xudong, Wang, Zhecan, Chang, Shih-Fu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Detecting Multimodal Situations with Insufficient Context and Abstaining from Baseless Predictions
di: Liu, Junzhang, et al.
Pubblicazione: (2024)
di: Liu, Junzhang, et al.
Pubblicazione: (2024)
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
di: You, Haoxuan, et al.
Pubblicazione: (2023)
di: You, Haoxuan, et al.
Pubblicazione: (2023)
ENTER: Event Based Interpretable Reasoning for VideoQA
di: Ayyubi, Hammad, et al.
Pubblicazione: (2025)
di: Ayyubi, Hammad, et al.
Pubblicazione: (2025)
ERL-MPP: Evolutionary Reinforcement Learning with Multi-head Puzzle Perception for Solving Large-scale Jigsaw Puzzles of Eroded Gaps
di: Song, Xingke, et al.
Pubblicazione: (2025)
di: Song, Xingke, et al.
Pubblicazione: (2025)
JourneyBench: A Challenging One-Stop Vision-Language Understanding Benchmark of Generated Images
di: Wang, Zhecan, et al.
Pubblicazione: (2024)
di: Wang, Zhecan, et al.
Pubblicazione: (2024)
RAP: Retrieval-Augmented Planner for Adaptive Procedure Planning in Instructional Videos
di: Zare, Ali, et al.
Pubblicazione: (2024)
di: Zare, Ali, et al.
Pubblicazione: (2024)
MonetGPT: Solving Puzzles Enhances MLLMs' Image Retouching Skills
di: Dutt, Niladri Shekhar, et al.
Pubblicazione: (2025)
di: Dutt, Niladri Shekhar, et al.
Pubblicazione: (2025)
Solving Masked Jigsaw Puzzles with Diffusion Vision Transformers
di: Liu, Jinyang, et al.
Pubblicazione: (2024)
di: Liu, Jinyang, et al.
Pubblicazione: (2024)
Solving Convex Partition Visual Jigsaw Puzzles
di: Ohayon, Yaniv, et al.
Pubblicazione: (2025)
di: Ohayon, Yaniv, et al.
Pubblicazione: (2025)
PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving
di: Zhang, Zeyu, et al.
Pubblicazione: (2025)
di: Zhang, Zeyu, et al.
Pubblicazione: (2025)
Solving Jigsaw Puzzles in the Wild: Human-Guided Reconstruction of Cultural Heritage Fragments
di: Safaei, Omidreza, et al.
Pubblicazione: (2026)
di: Safaei, Omidreza, et al.
Pubblicazione: (2026)
Video Summarization: Towards Entity-Aware Captions
di: Ayyubi, Hammad A., et al.
Pubblicazione: (2023)
di: Ayyubi, Hammad A., et al.
Pubblicazione: (2023)
PuzzlePoles: Cylindrical Fiducial Markers Based on the PuzzleBoard Pattern
di: Zach, Juri, et al.
Pubblicazione: (2025)
di: Zach, Juri, et al.
Pubblicazione: (2025)
PuzLM: Solving Jigsaw Puzzles with Sequence-to-Sequence Language Models
di: Elkin, Gur, et al.
Pubblicazione: (2025)
di: Elkin, Gur, et al.
Pubblicazione: (2025)
PuzzleCraft: Exploration-Aware Curriculum Learning for Puzzle-Based RLVR in VLMs
di: Jeddi, Ahmadreza, et al.
Pubblicazione: (2025)
di: Jeddi, Ahmadreza, et al.
Pubblicazione: (2025)
Benchmarking Content-Based Puzzle Solvers on Corrupted Jigsaw Puzzles
di: Dirauf, Richard, et al.
Pubblicazione: (2025)
di: Dirauf, Richard, et al.
Pubblicazione: (2025)
BrainPuzzle: Hybrid Physics and Data-Driven Reconstruction for Transcranial Ultrasound Tomography
di: Chen, Shengyu, et al.
Pubblicazione: (2025)
di: Chen, Shengyu, et al.
Pubblicazione: (2025)
Are Language Models Puzzle Prodigies? Algorithmic Puzzles Unveil Serious Challenges in Multimodal Reasoning
di: Ghosal, Deepanway, et al.
Pubblicazione: (2024)
di: Ghosal, Deepanway, et al.
Pubblicazione: (2024)
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
di: Wang, Zhecan, et al.
Pubblicazione: (2023)
di: Wang, Zhecan, et al.
Pubblicazione: (2023)
Puzzle Pieces Picker: Deciphering Ancient Chinese Characters with Radical Reconstruction
di: Wang, Pengjie, et al.
Pubblicazione: (2024)
di: Wang, Pengjie, et al.
Pubblicazione: (2024)
The Missing GAP: From Solving Square Jigsaw Puzzles to Handling Real World Archaeological Fragments
di: Shahar, Ofir Itzhak, et al.
Pubblicazione: (2026)
di: Shahar, Ofir Itzhak, et al.
Pubblicazione: (2026)
Eye-Q: A Multilingual Benchmark for Visual Word Puzzle Solving and Image-to-Phrase Reasoning
di: Najar, Ali, et al.
Pubblicazione: (2026)
di: Najar, Ali, et al.
Pubblicazione: (2026)
A Unified Masked Jigsaw Puzzle Framework for Vision and Language Models
di: Ye, Weixin, et al.
Pubblicazione: (2026)
di: Ye, Weixin, et al.
Pubblicazione: (2026)
Puzzled by Puzzles: When Vision-Language Models Can't Take a Hint
di: Lee, Heekyung, et al.
Pubblicazione: (2025)
di: Lee, Heekyung, et al.
Pubblicazione: (2025)
GenVP: Generating Visual Puzzles with Contrastive Hierarchical VAEs
di: Basioti, Kalliopi, et al.
Pubblicazione: (2025)
di: Basioti, Kalliopi, et al.
Pubblicazione: (2025)
MoviePuzzle: Visual Narrative Reasoning through Multimodal Order Learning
di: Wang, Jianghui, et al.
Pubblicazione: (2023)
di: Wang, Jianghui, et al.
Pubblicazione: (2023)
PuzzleBoard: A New Camera Calibration Pattern with Position Encoding
di: Stelldinger, Peer, et al.
Pubblicazione: (2024)
di: Stelldinger, Peer, et al.
Pubblicazione: (2024)
VisualSphinx: Large-Scale Synthetic Vision Logic Puzzles for RL
di: Feng, Yichen, et al.
Pubblicazione: (2025)
di: Feng, Yichen, et al.
Pubblicazione: (2025)
Reasoning or Pattern Matching? Probing Large Vision-Language Models with Visual Puzzles
di: Lymperaiou, Maria, et al.
Pubblicazione: (2026)
di: Lymperaiou, Maria, et al.
Pubblicazione: (2026)
MathSticks: A Benchmark for Visual Symbolic Compositional Reasoning with Matchstick Puzzles
di: Ji, Yuheng, et al.
Pubblicazione: (2025)
di: Ji, Yuheng, et al.
Pubblicazione: (2025)
PuzzleFusion++: Auto-agglomerative 3D Fracture Assembly by Denoise and Verify
di: Wang, Zhengqing, et al.
Pubblicazione: (2024)
di: Wang, Zhengqing, et al.
Pubblicazione: (2024)
Improved Baselines with Synchronized Encoding for Universal Medical Image Segmentation
di: Yang, Sihan, et al.
Pubblicazione: (2024)
di: Yang, Sihan, et al.
Pubblicazione: (2024)
PRISM-Bench: A Benchmark of Puzzle-Based Visual Tasks with CoT Error Detection
di: Qian, Yusu, et al.
Pubblicazione: (2025)
di: Qian, Yusu, et al.
Pubblicazione: (2025)
Puzzles: Unbounded Video-Depth Augmentation for Scalable End-to-End 3D Reconstruction
di: Ma, Jiahao, et al.
Pubblicazione: (2025)
di: Ma, Jiahao, et al.
Pubblicazione: (2025)
VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models
di: Ren, Yufan, et al.
Pubblicazione: (2025)
di: Ren, Yufan, et al.
Pubblicazione: (2025)
PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns
di: Chia, Yew Ken, et al.
Pubblicazione: (2024)
di: Chia, Yew Ken, et al.
Pubblicazione: (2024)
The Jumping Reasoning Curve? Tracking the Evolution of Reasoning Performance in GPT-[n] and o-[n] Models on Multimodal Puzzles
di: Toh, Vernon Y. H., et al.
Pubblicazione: (2025)
di: Toh, Vernon Y. H., et al.
Pubblicazione: (2025)
Layer as Puzzle Pieces: Compressing Large Language Models through Layer Concatenation
di: Wang, Fei, et al.
Pubblicazione: (2025)
di: Wang, Fei, et al.
Pubblicazione: (2025)
PuzzleAvatar: Assembling 3D Avatars from Personal Albums
di: Xiu, Yuliang, et al.
Pubblicazione: (2024)
di: Xiu, Yuliang, et al.
Pubblicazione: (2024)
GenEscape: Hierarchical Multi-Agent Generation of Escape Room Puzzles
di: Shan, Mengyi, et al.
Pubblicazione: (2025)
di: Shan, Mengyi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Detecting Multimodal Situations with Insufficient Context and Abstaining from Baseless Predictions
di: Liu, Junzhang, et al.
Pubblicazione: (2024) -
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
di: You, Haoxuan, et al.
Pubblicazione: (2023) -
ENTER: Event Based Interpretable Reasoning for VideoQA
di: Ayyubi, Hammad, et al.
Pubblicazione: (2025) -
ERL-MPP: Evolutionary Reinforcement Learning with Multi-head Puzzle Perception for Solving Large-scale Jigsaw Puzzles of Eroded Gaps
di: Song, Xingke, et al.
Pubblicazione: (2025) -
JourneyBench: A Challenging One-Stop Vision-Language Understanding Benchmark of Generated Images
di: Wang, Zhecan, et al.
Pubblicazione: (2024)