Forge-and-Quench: Enhancing Image Generation for Higher Fidelity in Unified Multimodal Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zeng, Yanbing, Wang, Jia, Ma, Hanghang, Wu, Junqiang, Zhu, Jie, Wei, Xiaoming, Hu, Jie |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MagicMirror: A Large-Scale Dataset and Benchmark for Fine-Grained Artifacts Assessment in Text-to-Image Generation
par: Wang, Jia, et autres
Publié: (2025)
par: Wang, Jia, et autres
Publié: (2025)
A Simple Baseline for Unifying Understanding, Generation, and Editing via Vanilla Next-token Prediction
par: Zhu, Jie, et autres
Publié: (2026)
par: Zhu, Jie, et autres
Publié: (2026)
Rascene: High-Fidelity 3D Scene Imaging with mmWave Communication Signals
par: Song, Kunzhe, et autres
Publié: (2026)
par: Song, Kunzhe, et autres
Publié: (2026)
LongCat-Image Technical Report
par: Meituan LongCat Team, et autres
Publié: (2025)
par: Meituan LongCat Team, et autres
Publié: (2025)
Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input
par: Liu, Jiajun, et autres
Publié: (2024)
par: Liu, Jiajun, et autres
Publié: (2024)
Enhancing Image Generation Fidelity via Progressive Prompts
par: Xiong, Zhen, et autres
Publié: (2025)
par: Xiong, Zhen, et autres
Publié: (2025)
Scale Your Instructions: Enhance the Instruction-Following Fidelity of Unified Image Generation Model by Self-Adaptive Attention Scaling
par: Zhou, Chao, et autres
Publié: (2025)
par: Zhou, Chao, et autres
Publié: (2025)
MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models
par: Wu, Mingrui, et autres
Publié: (2026)
par: Wu, Mingrui, et autres
Publié: (2026)
Object Fidelity Diffusion for Remote Sensing Image Generation
par: Ye, Ziqi, et autres
Publié: (2025)
par: Ye, Ziqi, et autres
Publié: (2025)
ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction
par: Tan, Jiangtong, et autres
Publié: (2025)
par: Tan, Jiangtong, et autres
Publié: (2025)
FusionAgent: A Multimodal Agent with Dynamic Model Selection for Human Recognition
par: Zhu, Jie, et autres
Publié: (2026)
par: Zhu, Jie, et autres
Publié: (2026)
Multimodal Generation of Animatable 3D Human Models with AvatarForge
par: Liu, Xinhang, et autres
Publié: (2025)
par: Liu, Xinhang, et autres
Publié: (2025)
RDPM: Solve Diffusion Probabilistic Models via Recurrent Token Prediction
par: Wu, Xiaoping, et autres
Publié: (2024)
par: Wu, Xiaoping, et autres
Publié: (2024)
U-Mind: A Unified Framework for Real-Time Multimodal Interaction with Audiovisual Generation
par: Deng, Xiang, et autres
Publié: (2026)
par: Deng, Xiang, et autres
Publié: (2026)
Towards Generalized Multi-Image Editing for Unified Multimodal Models
par: Xu, Pengcheng, et autres
Publié: (2026)
par: Xu, Pengcheng, et autres
Publié: (2026)
A Comprehensive Study of Multimodal Large Language Models for Image Quality Assessment
par: Wu, Tianhe, et autres
Publié: (2024)
par: Wu, Tianhe, et autres
Publié: (2024)
Query-Kontext: An Unified Multimodal Model for Image Generation and Editing
par: Song, Yuxin, et autres
Publié: (2025)
par: Song, Yuxin, et autres
Publié: (2025)
CharGen: High Accurate Character-Level Visual Text Generation Model with MultiModal Encoder
par: Ma, Lichen, et autres
Publié: (2024)
par: Ma, Lichen, et autres
Publié: (2024)
An Analysis for Image-to-Image Translation and Style Transfer
par: Yu, Xiaoming, et autres
Publié: (2024)
par: Yu, Xiaoming, et autres
Publié: (2024)
On the Holistic Approach for Detecting Human Image Forgery
par: Guo, Xiao, et autres
Publié: (2026)
par: Guo, Xiao, et autres
Publié: (2026)
DreamPoster: A Unified Framework for Image-Conditioned Generative Poster Design
par: Hu, Xiwei, et autres
Publié: (2025)
par: Hu, Xiwei, et autres
Publié: (2025)
Omni-Dish: Photorealistic and Faithful Image Generation and Editing for Arbitrary Chinese Dishes
par: Liu, Huijie, et autres
Publié: (2025)
par: Liu, Huijie, et autres
Publié: (2025)
Towards Better & Faster Autoregressive Image Generation: From the Perspective of Entropy
par: Ma, Xiaoxiao, et autres
Publié: (2025)
par: Ma, Xiaoxiao, et autres
Publié: (2025)
UniCorn: Towards Self-Improving Unified Multimodal Models through Self-Generated Supervision
par: Han, Ruiyan, et autres
Publié: (2026)
par: Han, Ruiyan, et autres
Publié: (2026)
MM-R1: Unleashing the Power of Unified Multimodal Large Language Models for Personalized Image Generation
par: Liang, Qian, et autres
Publié: (2025)
par: Liang, Qian, et autres
Publié: (2025)
Images Speak Louder Than Scores: Failure Mode Escape for Enhancing Generative Quality
par: Shao, Jie, et autres
Publié: (2025)
par: Shao, Jie, et autres
Publié: (2025)
Large Language Models for Multimodal Deformable Image Registration
par: Ma, Mingrui, et autres
Publié: (2024)
par: Ma, Mingrui, et autres
Publié: (2024)
Denoising with a Joint-Embedding Predictive Architecture
par: Chen, Dengsheng, et autres
Publié: (2024)
par: Chen, Dengsheng, et autres
Publié: (2024)
Fine-gained Zero-shot Video Sampling
par: Chen, Dengsheng, et autres
Publié: (2024)
par: Chen, Dengsheng, et autres
Publié: (2024)
DF-SLAM: Dictionary Factors Representation for High-Fidelity Neural Implicit Dense Visual SLAM System
par: Wei, Weifeng, et autres
Publié: (2024)
par: Wei, Weifeng, et autres
Publié: (2024)
FlightForge: Advancing UAV Research with Procedural Generation of High-Fidelity Simulation and Integrated Autonomy
par: Čapek, David, et autres
Publié: (2025)
par: Čapek, David, et autres
Publié: (2025)
PositionIC: Unified Position and Identity Consistency for Image Customization
par: Hu, Junjie, et autres
Publié: (2025)
par: Hu, Junjie, et autres
Publié: (2025)
High-Resolution Image Synthesis via Next-Token Prediction
par: Chen, Dengsheng, et autres
Publié: (2024)
par: Chen, Dengsheng, et autres
Publié: (2024)
UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation
par: Tian, Rui, et autres
Publié: (2025)
par: Tian, Rui, et autres
Publié: (2025)
UNIMO-G: Unified Image Generation through Multimodal Conditional Diffusion
par: Li, Wei, et autres
Publié: (2024)
par: Li, Wei, et autres
Publié: (2024)
PlanGen: Towards Unified Layout Planning and Image Generation in Auto-Regressive Vision Language Models
par: He, Runze, et autres
Publié: (2025)
par: He, Runze, et autres
Publié: (2025)
Hummingbird: High Fidelity Image Generation via Multimodal Context Alignment
par: Le, Minh-Quan, et autres
Publié: (2025)
par: Le, Minh-Quan, et autres
Publié: (2025)
Enhancing Spatial Understanding in Image Generation via Reward Modeling
par: Tang, Zhenyu, et autres
Publié: (2026)
par: Tang, Zhenyu, et autres
Publié: (2026)
Can Textual Reasoning Improve the Performance of MLLMs on Fine-grained Visual Classification?
par: Zhu, Jie, et autres
Publié: (2026)
par: Zhu, Jie, et autres
Publié: (2026)
OneReward: Unified Mask-Guided Image Generation via Multi-Task Human Preference Learning
par: Gong, Yuan, et autres
Publié: (2025)
par: Gong, Yuan, et autres
Publié: (2025)
Documents similaires
-
MagicMirror: A Large-Scale Dataset and Benchmark for Fine-Grained Artifacts Assessment in Text-to-Image Generation
par: Wang, Jia, et autres
Publié: (2025) -
A Simple Baseline for Unifying Understanding, Generation, and Editing via Vanilla Next-token Prediction
par: Zhu, Jie, et autres
Publié: (2026) -
Rascene: High-Fidelity 3D Scene Imaging with mmWave Communication Signals
par: Song, Kunzhe, et autres
Publié: (2026) -
LongCat-Image Technical Report
par: Meituan LongCat Team, et autres
Publié: (2025) -
Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input
par: Liu, Jiajun, et autres
Publié: (2024)