EasyRef: Omni-Generalized Group Image Reference for Diffusion Models via Multimodal LLM
Fuente:
arXiv
Saved in:
| Main Authors: | Zong, Zhuofan, Jiang, Dongzhi, Ma, Bingqi, Song, Guanglu, Shao, Hao, Shen, Dazhong, Liu, Yu, Li, Hongsheng |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MoVA: Adapting Mixture of Vision Experts to Multimodal Context
by: Zong, Zhuofan, et al.
Published: (2024)
by: Zong, Zhuofan, et al.
Published: (2024)
ADT: Tuning Diffusion Models with Adversarial Supervision
by: Shen, Dazhong, et al.
Published: (2025)
by: Shen, Dazhong, et al.
Published: (2025)
CoMat: Aligning Text-to-Image Diffusion Model with Image-to-Text Concept Matching
by: Jiang, Dongzhi, et al.
Published: (2024)
by: Jiang, Dongzhi, et al.
Published: (2024)
Exploring the Role of Large Language Models in Prompt Encoding for Diffusion Models
by: Ma, Bingqi, et al.
Published: (2024)
by: Ma, Bingqi, et al.
Published: (2024)
VividFace: A Diffusion-Based Hybrid Framework for High-Fidelity Video Face Swapping
by: Shao, Hao, et al.
Published: (2024)
by: Shao, Hao, et al.
Published: (2024)
RAPHAEL: Text-to-Image Generation via Large Mixture of Diffusion Paths
by: Xue, Zeyue, et al.
Published: (2023)
by: Xue, Zeyue, et al.
Published: (2023)
High-Fidelity Diffusion Face Swapping with ID-Constrained Facial Conditioning
by: He, Dailan, et al.
Published: (2025)
by: He, Dailan, et al.
Published: (2025)
Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning
by: Shao, Hao, et al.
Published: (2024)
by: Shao, Hao, et al.
Published: (2024)
T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT
by: Jiang, Dongzhi, et al.
Published: (2025)
by: Jiang, Dongzhi, et al.
Published: (2025)
Rethinking the Spatial Inconsistency in Classifier-Free Diffusion Guidance
by: Shen, Dazhong, et al.
Published: (2024)
by: Shen, Dazhong, et al.
Published: (2024)
AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization
by: He, Dailan, et al.
Published: (2026)
by: He, Dailan, et al.
Published: (2026)
LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving
by: Shao, Hao, et al.
Published: (2026)
by: Shao, Hao, et al.
Published: (2026)
DrivingGen: A Comprehensive Benchmark for Generative Video World Models in Autonomous Driving
by: Zhou, Yang, et al.
Published: (2026)
by: Zhou, Yang, et al.
Published: (2026)
DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation
by: Jiang, Dongzhi, et al.
Published: (2025)
by: Jiang, Dongzhi, et al.
Published: (2025)
MultiRef: Controllable Image Generation with Multiple Visual References
by: Chen, Ruoxi, et al.
Published: (2025)
by: Chen, Ruoxi, et al.
Published: (2025)
Omni-Referring Image Segmentation
by: Zheng, Qiancheng, et al.
Published: (2025)
by: Zheng, Qiancheng, et al.
Published: (2025)
Be-Your-Outpainter: Mastering Video Outpainting through Input-Specific Adaptation
by: Wang, Fu-Yun, et al.
Published: (2024)
by: Wang, Fu-Yun, et al.
Published: (2024)
Pretrained Reversible Generation as Unsupervised Visual Representation Learning
by: Xue, Rongkun, et al.
Published: (2024)
by: Xue, Rongkun, et al.
Published: (2024)
RefAerial: A Benchmark and Approach for Referring Detection in Aerial Images
by: Hu, Guyue, et al.
Published: (2026)
by: Hu, Guyue, et al.
Published: (2026)
Omni-AutoThink: Adaptive Multimodal Reasoning via Reinforcement Learning
by: Yang, Dongchao, et al.
Published: (2025)
by: Yang, Dongchao, et al.
Published: (2025)
Deep Reward Supervisions for Tuning Text-to-Image Diffusion Models
by: Wu, Xiaoshi, et al.
Published: (2024)
by: Wu, Xiaoshi, et al.
Published: (2024)
RefTok: Reference-Based Tokenization for Video Generation
by: Fan, Xiang, et al.
Published: (2025)
by: Fan, Xiang, et al.
Published: (2025)
RefAlign: Representation Alignment for Reference-to-Video Generation
by: Wang, Lei, et al.
Published: (2026)
by: Wang, Lei, et al.
Published: (2026)
RefDrop: Controllable Consistency in Image or Video Generation via Reference Feature Guidance
by: Fan, Jiaojiao, et al.
Published: (2024)
by: Fan, Jiaojiao, et al.
Published: (2024)
Neighbor GRPO: Contrastive ODE Policy Optimization Aligns Flow Models
by: He, Dailan, et al.
Published: (2025)
by: He, Dailan, et al.
Published: (2025)
RefSR-Adv: Adversarial Attack on Reference-based Image Super-Resolution Models
by: Dai, Jiazhu, et al.
Published: (2026)
by: Dai, Jiazhu, et al.
Published: (2026)
Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion
by: Li, Lijiang, et al.
Published: (2026)
by: Li, Lijiang, et al.
Published: (2026)
MolEditRL: Structure-Preserving Molecular Editing via Discrete Diffusion and Reinforcement Learning
by: Zhuang, Yuanxin, et al.
Published: (2025)
by: Zhuang, Yuanxin, et al.
Published: (2025)
Improving Joint Audio-Video Generation with Cross-Modal Context Learning
by: Ma, Bingqi, et al.
Published: (2026)
by: Ma, Bingqi, et al.
Published: (2026)
BluRef: Unsupervised Image Deblurring with Dense-Matching References
by: Pham, Bang-Dang, et al.
Published: (2026)
by: Pham, Bang-Dang, et al.
Published: (2026)
RefTon: Reference person shot assist virtual Try-on
by: Li, Liuzhuozheng, et al.
Published: (2025)
by: Li, Liuzhuozheng, et al.
Published: (2025)
BadRefSR: Backdoor Attacks Against Reference-based Image Super Resolution
by: Yang, Xue, et al.
Published: (2025)
by: Yang, Xue, et al.
Published: (2025)
TransRef: Multi-Scale Reference Embedding Transformer for Reference-Guided Image Inpainting
by: Liu, Taorong, et al.
Published: (2023)
by: Liu, Taorong, et al.
Published: (2023)
UniRef-Image-Edit: Towards Scalable and Consistent Multi-Reference Image Editing
by: Wei, Hongyang, et al.
Published: (2026)
by: Wei, Hongyang, et al.
Published: (2026)
RefQSR: Reference-based Quantization for Image Super-Resolution Networks
by: Lee, Hongjae, et al.
Published: (2024)
by: Lee, Hongjae, et al.
Published: (2024)
RefFusion: Reference Adapted Diffusion Models for 3D Scene Inpainting
by: Mirzaei, Ashkan, et al.
Published: (2024)
by: Mirzaei, Ashkan, et al.
Published: (2024)
LLM-Ref: Enhancing Reference Handling in Technical Writing with Large Language Models
by: Fuad, Kazi Ahmed Asif, et al.
Published: (2024)
by: Fuad, Kazi Ahmed Asif, et al.
Published: (2024)
SlidesGen-Bench: Evaluating Slides Generation via Computational and Quantitative Metrics
by: Yang, Yunqiao, et al.
Published: (2026)
by: Yang, Yunqiao, et al.
Published: (2026)
Salt: Self-Consistent Distribution Matching with Cache-Aware Training for Fast Video Generation
by: Ge, Xingtong, et al.
Published: (2026)
by: Ge, Xingtong, et al.
Published: (2026)
FullStack-Agent: Enhancing Agentic Full-Stack Web Coding via Development-Oriented Testing and Repository Back-Translation
by: Lu, Zimu, et al.
Published: (2026)
by: Lu, Zimu, et al.
Published: (2026)
Similar Items
-
MoVA: Adapting Mixture of Vision Experts to Multimodal Context
by: Zong, Zhuofan, et al.
Published: (2024) -
ADT: Tuning Diffusion Models with Adversarial Supervision
by: Shen, Dazhong, et al.
Published: (2025) -
CoMat: Aligning Text-to-Image Diffusion Model with Image-to-Text Concept Matching
by: Jiang, Dongzhi, et al.
Published: (2024) -
Exploring the Role of Large Language Models in Prompt Encoding for Diffusion Models
by: Ma, Bingqi, et al.
Published: (2024) -
VividFace: A Diffusion-Based Hybrid Framework for High-Fidelity Video Face Swapping
by: Shao, Hao, et al.
Published: (2024)