A Unified Masked Jigsaw Puzzle Framework for Vision and Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Ye, Weixin, Wang, Wei, Liu, Yahui, Song, Yue, Ren, Bin, Bi, Wei, Cucchiara, Rita, Sebe, Nicu |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Solving Masked Jigsaw Puzzles with Diffusion Vision Transformers
by: Liu, Jinyang, et al.
Published: (2024)
by: Liu, Jinyang, et al.
Published: (2024)
Inverse Virtual Try-On: Generating Multi-Category Product-Style Images from Clothed Individuals
by: Lobba, Davide, et al.
Published: (2025)
by: Lobba, Davide, et al.
Published: (2025)
Dress-ED: Instruction-Guided Editing for Virtual Try-On and Try-Off
by: Sanguigni, Fulvio, et al.
Published: (2026)
by: Sanguigni, Fulvio, et al.
Published: (2026)
Hallucination Early Detection in Diffusion Models
by: Betti, Federico, et al.
Published: (2026)
by: Betti, Federico, et al.
Published: (2026)
Optimizing Resource Consumption in Diffusion Models through Hallucination Early Detection
by: Betti, Federico, et al.
Published: (2024)
by: Betti, Federico, et al.
Published: (2024)
Bringing Masked Autoencoders Explicit Contrastive Properties for Point Cloud Self-Supervised Learning
by: Ren, Bin, et al.
Published: (2024)
by: Ren, Bin, et al.
Published: (2024)
RankFeat&RankWeight: Rank-1 Feature/Weight Removal for Out-of-distribution Detection
by: Song, Yue, et al.
Published: (2023)
by: Song, Yue, et al.
Published: (2023)
Masked Clustering Prediction for Unsupervised Point Cloud Pre-training
by: Ren, Bin, et al.
Published: (2025)
by: Ren, Bin, et al.
Published: (2025)
PuzLM: Solving Jigsaw Puzzles with Sequence-to-Sequence Language Models
by: Elkin, Gur, et al.
Published: (2025)
by: Elkin, Gur, et al.
Published: (2025)
Vision+X: A Survey on Multimodal Learning in the Light of Data
by: Zhu, Ye, et al.
Published: (2022)
by: Zhu, Ye, et al.
Published: (2022)
Sharing Key Semantics in Transformer Makes Efficient Image Restoration
by: Ren, Bin, et al.
Published: (2024)
by: Ren, Bin, et al.
Published: (2024)
Fractal-IR: A Unified Framework for Efficient and Scalable Image Restoration
by: Li, Yawei, et al.
Published: (2025)
by: Li, Yawei, et al.
Published: (2025)
Training and Tuning Generative Neural Radiance Fields for Attribute-Conditional 3D-Aware Face Generation
by: Zhang, Jichao, et al.
Published: (2022)
by: Zhang, Jichao, et al.
Published: (2022)
Graph Transformer GANs with Graph Masked Modeling for Architectural Layout Generation
by: Tang, Hao, et al.
Published: (2024)
by: Tang, Hao, et al.
Published: (2024)
What Changed? Detecting and Evaluating Instruction-Guided Image Edits with Multimodal Large Language Models
by: Baraldi, Lorenzo, et al.
Published: (2025)
by: Baraldi, Lorenzo, et al.
Published: (2025)
Hierarchical Cross-Attention Network for Virtual Try-On
by: Tang, Hao, et al.
Published: (2024)
by: Tang, Hao, et al.
Published: (2024)
Solving Convex Partition Visual Jigsaw Puzzles
by: Ohayon, Yaniv, et al.
Published: (2025)
by: Ohayon, Yaniv, et al.
Published: (2025)
ERL-MPP: Evolutionary Reinforcement Learning with Multi-head Puzzle Perception for Solving Large-scale Jigsaw Puzzles of Eroded Gaps
by: Song, Xingke, et al.
Published: (2025)
by: Song, Xingke, et al.
Published: (2025)
A Closer Look at Conditional Prompt Tuning for Vision-Language Models
by: Zhang, Ji, et al.
Published: (2025)
by: Zhang, Ji, et al.
Published: (2025)
Key-Graph Transformer for Image Restoration
by: Ren, Bin, et al.
Published: (2024)
by: Ren, Bin, et al.
Published: (2024)
Benchmarking Content-Based Puzzle Solvers on Corrupted Jigsaw Puzzles
by: Dirauf, Richard, et al.
Published: (2025)
by: Dirauf, Richard, et al.
Published: (2025)
Reverse Personalization
by: Kung, Han-Wei, et al.
Published: (2025)
by: Kung, Han-Wei, et al.
Published: (2025)
Enhancing Robustness of Vision-Language Models through Orthogonality Learning and Self-Regularization
by: Li, Jinlong, et al.
Published: (2024)
by: Li, Jinlong, et al.
Published: (2024)
Jigsaw3D: Disentangled 3D Style Transfer via Patch Shuffling and Masking
by: Ye, Yuteng, et al.
Published: (2025)
by: Ye, Yuteng, et al.
Published: (2025)
All-in-One Slider for Attribute Manipulation in Diffusion Models
by: Ye, Weixin, et al.
Published: (2025)
by: Ye, Weixin, et al.
Published: (2025)
Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models
by: Li, Jinlong, et al.
Published: (2026)
by: Li, Jinlong, et al.
Published: (2026)
DSGC-Net: A Dual-Stream Graph Convolutional Network for Crowd Counting via Feature Correlation Mining
by: Wu, Yihong, et al.
Published: (2025)
by: Wu, Yihong, et al.
Published: (2025)
Uni4D: A Unified Self-Supervised Learning Framework for Point Cloud Videos
by: Zuo, Zhi, et al.
Published: (2025)
by: Zuo, Zhi, et al.
Published: (2025)
Loomis Painter: Reconstructing the Painting Process
by: Pobitzer, Markus, et al.
Published: (2025)
by: Pobitzer, Markus, et al.
Published: (2025)
NullFace: Training-Free Localized Face Anonymization
by: Kung, Han-Wei, et al.
Published: (2025)
by: Kung, Han-Wei, et al.
Published: (2025)
Safe Vision-Language Models via Unsafe Weights Manipulation
by: D'Incà, Moreno, et al.
Published: (2025)
by: D'Incà, Moreno, et al.
Published: (2025)
Solving Jigsaw Puzzles in the Wild: Human-Guided Reconstruction of Cultural Heritage Fragments
by: Safaei, Omidreza, et al.
Published: (2026)
by: Safaei, Omidreza, et al.
Published: (2026)
Masked Image Modeling: A Survey
by: Hondru, Vlad, et al.
Published: (2024)
by: Hondru, Vlad, et al.
Published: (2024)
CLIP is Strong Enough to Fight Back: Test-time Counterattacks towards Zero-shot Adversarial Robustness of CLIP
by: Xing, Songlong, et al.
Published: (2025)
by: Xing, Songlong, et al.
Published: (2025)
Jigsaw-R1: A Study of Rule-based Visual Reinforcement Learning with Jigsaw Puzzles
by: Wang, Zifu, et al.
Published: (2025)
by: Wang, Zifu, et al.
Published: (2025)
Towards End-to-End Explainable Facial Action Unit Recognition via Vision-Language Joint Learning
by: Ge, Xuri, et al.
Published: (2024)
by: Ge, Xuri, et al.
Published: (2024)
Democratizing Fine-grained Visual Recognition with Large Language Models
by: Liu, Mingxuan, et al.
Published: (2024)
by: Liu, Mingxuan, et al.
Published: (2024)
ZeroReg: Zero-Shot Point Cloud Registration with Foundation Models
by: Wang, Weijie, et al.
Published: (2023)
by: Wang, Weijie, et al.
Published: (2023)
High-Fidelity 3D Facial Avatar Synthesis with Controllable Fine-Grained Expressions
by: He, Yikang, et al.
Published: (2026)
by: He, Yikang, et al.
Published: (2026)
Understanding Matrix Function Normalizations in Covariance Pooling through the Lens of Riemannian Geometry
by: Chen, Ziheng, et al.
Published: (2024)
by: Chen, Ziheng, et al.
Published: (2024)
Similar Items
-
Solving Masked Jigsaw Puzzles with Diffusion Vision Transformers
by: Liu, Jinyang, et al.
Published: (2024) -
Inverse Virtual Try-On: Generating Multi-Category Product-Style Images from Clothed Individuals
by: Lobba, Davide, et al.
Published: (2025) -
Dress-ED: Instruction-Guided Editing for Virtual Try-On and Try-Off
by: Sanguigni, Fulvio, et al.
Published: (2026) -
Hallucination Early Detection in Diffusion Models
by: Betti, Federico, et al.
Published: (2026) -
Optimizing Resource Consumption in Diffusion Models through Hallucination Early Detection
by: Betti, Federico, et al.
Published: (2024)