VisualCloze: A Universal Image Generation Framework via Visual In-Context Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Zhong-Yu, Du, Ruoyi, Yan, Juncheng, Zhuo, Le, Wu, Qilong, Li, Zhen, Gao, Peng, Ma, Zhanyu, Cheng, Ming-Ming |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
I-Max: Maximize the Resolution Potential of Pre-trained Rectified Flow Transformers with Projected Flow
par: Du, Ruoyi, et autres
Publié: (2024)
par: Du, Ruoyi, et autres
Publié: (2024)
Recolour What Matters: Region-Aware Colour Editing via Token-Level Diffusion
par: Yang, Yuqi, et autres
Publié: (2026)
par: Yang, Yuqi, et autres
Publié: (2026)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
par: Zeng, Quan-Sheng, et autres
Publié: (2025)
par: Zeng, Quan-Sheng, et autres
Publié: (2025)
Generative Visual Chain-of-Thought for Image Editing
par: Yin, Zijin, et autres
Publié: (2026)
par: Yin, Zijin, et autres
Publié: (2026)
IMAGINE-E: Image Generation Intelligence Evaluation of State-of-the-art Text-to-Image Models
par: Lei, Jiayi, et autres
Publié: (2025)
par: Lei, Jiayi, et autres
Publié: (2025)
Multi-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Speaker Diarization
par: Cheng, Ming, et autres
Publié: (2024)
par: Cheng, Ming, et autres
Publié: (2024)
Visually Evaluating Generative Adversarial Networks Using Itself under Multivariate Time Series
par: Pan, Qilong
Publié: (2022)
par: Pan, Qilong
Publié: (2022)
Lumina-Image 2.0: A Unified and Efficient Image Generative Framework
par: Qin, Qi, et autres
Publié: (2025)
par: Qin, Qi, et autres
Publié: (2025)
Visual Bridge: Universal Visual Perception Representations Generating
par: Gao, Yilin, et autres
Publié: (2025)
par: Gao, Yilin, et autres
Publié: (2025)
OneVAE: Joint Discrete and Continuous Optimization Helps Discrete Video VAE Train Better
par: Zhou, Yupeng, et autres
Publié: (2025)
par: Zhou, Yupeng, et autres
Publié: (2025)
Constructing Cloze Questions Generatively
par: Sun, Yicheng, et autres
Publié: (2024)
par: Sun, Yicheng, et autres
Publié: (2024)
LLMs as Visual Explainers: Advancing Image Classification with Evolving Visual Descriptions
par: Han, Songhao, et autres
Publié: (2023)
par: Han, Songhao, et autres
Publié: (2023)
Audio-Visual Speech Enhancement In Complex Scenarios With Separation And Dereverberation Joint Modeling
par: Du, Jiarong, et autres
Publié: (2025)
par: Du, Jiarong, et autres
Publié: (2025)
Semantic Visual Anomaly Detection and Reasoning in AI-Generated Images
par: Tan, Chuangchuang, et autres
Publié: (2025)
par: Tan, Chuangchuang, et autres
Publié: (2025)
OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models
par: Weng, Tengjin, et autres
Publié: (2026)
par: Weng, Tengjin, et autres
Publié: (2026)
Structural Color Liquids with Sol‐Gel Irreversibility for Visualized Freeze‐Thaw Monitoring
par: Qilong Zhao, et autres
Publié: (2025)
par: Qilong Zhao, et autres
Publié: (2025)
ResTok: Learning Hierarchical Residuals in 1D Visual Tokenizers for Autoregressive Image Generation
par: Zhang, Xu, et autres
Publié: (2026)
par: Zhang, Xu, et autres
Publié: (2026)
Decoupled DMD: CFG Augmentation as the Spear, Distribution Matching as the Shield
par: Liu, Dongyang, et autres
Publié: (2025)
par: Liu, Dongyang, et autres
Publié: (2025)
Adaptive Interfacial Materials and Implants for Visual Restoration
par: Xule Zhu, et autres
Publié: (2024)
par: Xule Zhu, et autres
Publié: (2024)
CoIDO: Efficient Data Selection for Visual Instruction Tuning via Coupled Importance-Diversity Optimization
par: Yan, Yichen, et autres
Publié: (2025)
par: Yan, Yichen, et autres
Publié: (2025)
Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer
par: Image Team, et autres
Publié: (2025)
par: Image Team, et autres
Publié: (2025)
Robust Wake Word Spotting With Frame-Level Cross-Modal Attention Based Audio-Visual Conformer
par: Wang, Haoxu, et autres
Publié: (2024)
par: Wang, Haoxu, et autres
Publié: (2024)
From Reading to Following: Threat Contexts Influence Visual Attention to Leader‐Related Information and Leader‐Following
par: Nan Zhu, et autres
Publié: (2025)
par: Nan Zhu, et autres
Publié: (2025)
PixWizard: Versatile Image-to-Image Visual Assistant with Open-Language Instructions
par: Lin, Weifeng, et autres
Publié: (2024)
par: Lin, Weifeng, et autres
Publié: (2024)
SRFormerV2: Taking a Closer Look at Permuted Self-Attention for Image Super-Resolution
par: Zhou, Yupeng, et autres
Publié: (2023)
par: Zhou, Yupeng, et autres
Publié: (2023)
Visual Instruction Pretraining for Domain-Specific Foundation Models
par: Li, Yuxuan, et autres
Publié: (2025)
par: Li, Yuxuan, et autres
Publié: (2025)
Graphic Notation as Generative System: Visual Logic in Composition and Improvisation
par: Ming Yang
Publié: (2025)
par: Ming Yang
Publié: (2025)
Difficulty-Controllable Cloze Question Distractor Generation
par: Kang, Seokhoon, et autres
Publié: (2025)
par: Kang, Seokhoon, et autres
Publié: (2025)
Towards Privacy-Preserving Fine-Grained Visual Classification via Hierarchical Learning from Label Proportions
par: Chang, Jinyi, et autres
Publié: (2025)
par: Chang, Jinyi, et autres
Publié: (2025)
Efficient Video to Audio Mapper with Visual Scene Detection
par: Yi, Mingjing, et autres
Publié: (2024)
par: Yi, Mingjing, et autres
Publié: (2024)
RewardDance: Reward Scaling in Visual Generation
par: Wu, Jie, et autres
Publié: (2025)
par: Wu, Jie, et autres
Publié: (2025)
LeX-Art: Rethinking Text Generation via Scalable High-Quality Data Synthesis
par: Zhao, Shitian, et autres
Publié: (2025)
par: Zhao, Shitian, et autres
Publié: (2025)
Integrating Visual Interpretation and Linguistic Reasoning for Math Problem Solving
par: Guo, Zixian, et autres
Publié: (2025)
par: Guo, Zixian, et autres
Publié: (2025)
Clozing the Gap: Exploring Why Language Model Surprisal Outperforms Cloze Surprisal
par: Nair, Sathvik, et autres
Publié: (2026)
par: Nair, Sathvik, et autres
Publié: (2026)
Mixture of Style Experts for Diverse Image Stylization
par: Zhu, Shihao, et autres
Publié: (2026)
par: Zhu, Shihao, et autres
Publié: (2026)
VFXMaster: Unlocking Dynamic Visual Effect Generation via In-Context Learning
par: Li, Baolu, et autres
Publié: (2025)
par: Li, Baolu, et autres
Publié: (2025)
PR-MIM: Delving Deeper into Partial Reconstruction in Masked Image Modeling
par: Li, Zhong-Yu, et autres
Publié: (2024)
par: Li, Zhong-Yu, et autres
Publié: (2024)
Customize Your Visual Autoregressive Recipe with Set Autoregressive Modeling
par: Liu, Wenze, et autres
Publié: (2024)
par: Liu, Wenze, et autres
Publié: (2024)
CDGP: Automatic Cloze Distractor Generation based on Pre-trained Language Model
par: Chiang, Shang-Hsuan, et autres
Publié: (2024)
par: Chiang, Shang-Hsuan, et autres
Publié: (2024)
Text-Visual Semantic Constrained AI-Generated Image Quality Assessment
par: Li, Qiang, et autres
Publié: (2025)
par: Li, Qiang, et autres
Publié: (2025)
Documents similaires
-
I-Max: Maximize the Resolution Potential of Pre-trained Rectified Flow Transformers with Projected Flow
par: Du, Ruoyi, et autres
Publié: (2024) -
Recolour What Matters: Region-Aware Colour Editing via Token-Level Diffusion
par: Yang, Yuqi, et autres
Publié: (2026) -
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
par: Zeng, Quan-Sheng, et autres
Publié: (2025) -
Generative Visual Chain-of-Thought for Image Editing
par: Yin, Zijin, et autres
Publié: (2026) -
IMAGINE-E: Image Generation Intelligence Evaluation of State-of-the-art Text-to-Image Models
par: Lei, Jiayi, et autres
Publié: (2025)