Solving Masked Jigsaw Puzzles with Diffusion Vision Transformers
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Jinyang, Teshome, Wondmgezahu, Ghimire, Sandesh, Sznaier, Mario, Camps, Octavia |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
3D-HGS: 3D Half-Gaussian Splatting
por: Li, Haolin, et al.
Publicado: (2024)
por: Li, Haolin, et al.
Publicado: (2024)
A Unified Masked Jigsaw Puzzle Framework for Vision and Language Models
por: Ye, Weixin, et al.
Publicado: (2026)
por: Ye, Weixin, et al.
Publicado: (2026)
Solving Convex Partition Visual Jigsaw Puzzles
por: Ohayon, Yaniv, et al.
Publicado: (2025)
por: Ohayon, Yaniv, et al.
Publicado: (2025)
PuzLM: Solving Jigsaw Puzzles with Sequence-to-Sequence Language Models
por: Elkin, Gur, et al.
Publicado: (2025)
por: Elkin, Gur, et al.
Publicado: (2025)
Solving Jigsaw Puzzles in the Wild: Human-Guided Reconstruction of Cultural Heritage Fragments
por: Safaei, Omidreza, et al.
Publicado: (2026)
por: Safaei, Omidreza, et al.
Publicado: (2026)
ERL-MPP: Evolutionary Reinforcement Learning with Multi-head Puzzle Perception for Solving Large-scale Jigsaw Puzzles of Eroded Gaps
por: Song, Xingke, et al.
Publicado: (2025)
por: Song, Xingke, et al.
Publicado: (2025)
SAIF: Sparse Adversarial and Imperceptible Attack Framework
por: Imtiaz, Tooba, et al.
Publicado: (2022)
por: Imtiaz, Tooba, et al.
Publicado: (2022)
Real-Time Adaptive Motion Planning via Point Cloud-Guided, Energy-Based Diffusion and Potential Fields
por: Teshome, Wondmgezahu, et al.
Publicado: (2025)
por: Teshome, Wondmgezahu, et al.
Publicado: (2025)
Benchmarking Content-Based Puzzle Solvers on Corrupted Jigsaw Puzzles
por: Dirauf, Richard, et al.
Publicado: (2025)
por: Dirauf, Richard, et al.
Publicado: (2025)
The Missing GAP: From Solving Square Jigsaw Puzzles to Handling Real World Archaeological Fragments
por: Shahar, Ofir Itzhak, et al.
Publicado: (2026)
por: Shahar, Ofir Itzhak, et al.
Publicado: (2026)
HAT: History-Augmented Anchor Transformer for Online Temporal Action Localization
por: Reza, Sakib, et al.
Publicado: (2024)
por: Reza, Sakib, et al.
Publicado: (2024)
Jigsaw-R1: A Study of Rule-based Visual Reinforcement Learning with Jigsaw Puzzles
por: Wang, Zifu, et al.
Publicado: (2025)
por: Wang, Zifu, et al.
Publicado: (2025)
Jigsaw3D: Disentangled 3D Style Transfer via Patch Shuffling and Masking
por: Ye, Yuteng, et al.
Publicado: (2025)
por: Ye, Yuteng, et al.
Publicado: (2025)
Cracking Instance Jigsaw Puzzles: An Alternative to Multiple Instance Learning for Whole Slide Image Analysis
por: Chen, Xiwen, et al.
Publicado: (2025)
por: Chen, Xiwen, et al.
Publicado: (2025)
Visual Jigsaw Post-Training Improves MLLMs
por: Wu, Penghao, et al.
Publicado: (2025)
por: Wu, Penghao, et al.
Publicado: (2025)
Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study
por: Torop, Max, et al.
Publicado: (2025)
por: Torop, Max, et al.
Publicado: (2025)
Nash Meets Wertheimer: Using Good Continuation in Jigsaw Puzzles
por: Khoroshiltseva, Marina, et al.
Publicado: (2024)
por: Khoroshiltseva, Marina, et al.
Publicado: (2024)
REEF: Relevance-Aware and Efficient LLM Adapter for Video Understanding
por: Reza, Sakib, et al.
Publicado: (2025)
por: Reza, Sakib, et al.
Publicado: (2025)
UniVerse: A Unified Modulation Framework for Segmentation-Free,Disentangled Multi-Concept Personalization
por: Phung, Quynh, et al.
Publicado: (2026)
por: Phung, Quynh, et al.
Publicado: (2026)
Polyline Path Masked Attention for Vision Transformer
por: Zhao, Zhongchen, et al.
Publicado: (2025)
por: Zhao, Zhongchen, et al.
Publicado: (2025)
Jigsaw Regularization in Whole-Slide Image Classification
por: Jeong, So Won, et al.
Publicado: (2026)
por: Jeong, So Won, et al.
Publicado: (2026)
PuzzleBench: A Fully Dynamic Evaluation Framework for Large Multimodal Models on Puzzle Solving
por: Zhang, Zeyu, et al.
Publicado: (2025)
por: Zhang, Zeyu, et al.
Publicado: (2025)
Diffusion Transformer Meets Random Masks: An Advanced PET Reconstruction Framework
por: Huang, Bin, et al.
Publicado: (2025)
por: Huang, Bin, et al.
Publicado: (2025)
Touch-GS: Visual-Tactile Supervised 3D Gaussian Splatting
por: Swann, Aiden, et al.
Publicado: (2024)
por: Swann, Aiden, et al.
Publicado: (2024)
Mask$^2$DiT: Dual Mask-based Diffusion Transformer for Multi-Scene Long Video Generation
por: Qi, Tianhao, et al.
Publicado: (2025)
por: Qi, Tianhao, et al.
Publicado: (2025)
Solving the Inverse Problem of Electrocardiography for Cardiac Digital Twins: A Survey
por: Li, Lei, et al.
Publicado: (2024)
por: Li, Lei, et al.
Publicado: (2024)
Jigsaw++: Imagining Complete Shape Priors for Object Reassembly
por: Lu, Jiaxin, et al.
Publicado: (2024)
por: Lu, Jiaxin, et al.
Publicado: (2024)
PuzzleGPT: Emulating Human Puzzle-Solving Ability for Time and Location Prediction
por: Ayyubi, Hammad, et al.
Publicado: (2025)
por: Ayyubi, Hammad, et al.
Publicado: (2025)
Token-Space Mask Prediction for Efficient Vision Transformer Segmentation
por: Galagain, Calvin, et al.
Publicado: (2026)
por: Galagain, Calvin, et al.
Publicado: (2026)
Masked Diffusion Vision-Language Models for Temporal Action Localization
por: Wang, Fengshun, et al.
Publicado: (2026)
por: Wang, Fengshun, et al.
Publicado: (2026)
Graph-Jigsaw Conditioned Diffusion Model for Skeleton-based Video Anomaly Detection
por: Karami, Ali, et al.
Publicado: (2024)
por: Karami, Ali, et al.
Publicado: (2024)
Cross-view Masked Diffusion Transformers for Person Image Synthesis
por: Pham, Trung X., et al.
Publicado: (2024)
por: Pham, Trung X., et al.
Publicado: (2024)
GMT: Guided Mask Transformer for Leaf Instance Segmentation
por: Chen, Feng, et al.
Publicado: (2024)
por: Chen, Feng, et al.
Publicado: (2024)
Efficient Token Compression for Vision Transformer with Spatial Information Preserved
por: Mao, Junzhu, et al.
Publicado: (2025)
por: Mao, Junzhu, et al.
Publicado: (2025)
FiT: Flexible Vision Transformer for Diffusion Model
por: Lu, Zeyu, et al.
Publicado: (2024)
por: Lu, Zeyu, et al.
Publicado: (2024)
Entropy Reveals Block Importance in Masked Self-Supervised Vision Transformers
por: Xiang, Peihao, et al.
Publicado: (2026)
por: Xiang, Peihao, et al.
Publicado: (2026)
HarmoniCa: Harmonizing Training and Inference for Better Feature Caching in Diffusion Transformer Acceleration
por: Huang, Yushi, et al.
Publicado: (2024)
por: Huang, Yushi, et al.
Publicado: (2024)
OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering
por: Jia, Yiduo, et al.
Publicado: (2026)
por: Jia, Yiduo, et al.
Publicado: (2026)
MDTv2: Masked Diffusion Transformer is a Strong Image Synthesizer
por: Gao, Shanghua, et al.
Publicado: (2023)
por: Gao, Shanghua, et al.
Publicado: (2023)
Memory-Distilled Selection for Noise-Robust Anomaly Detection
por: Safarov, Sirojbek, et al.
Publicado: (2026)
por: Safarov, Sirojbek, et al.
Publicado: (2026)
Ejemplares similares
-
3D-HGS: 3D Half-Gaussian Splatting
por: Li, Haolin, et al.
Publicado: (2024) -
A Unified Masked Jigsaw Puzzle Framework for Vision and Language Models
por: Ye, Weixin, et al.
Publicado: (2026) -
Solving Convex Partition Visual Jigsaw Puzzles
por: Ohayon, Yaniv, et al.
Publicado: (2025) -
PuzLM: Solving Jigsaw Puzzles with Sequence-to-Sequence Language Models
por: Elkin, Gur, et al.
Publicado: (2025) -
Solving Jigsaw Puzzles in the Wild: Human-Guided Reconstruction of Cultural Heritage Fragments
por: Safaei, Omidreza, et al.
Publicado: (2026)