UniRef-Image-Edit: Towards Scalable and Consistent Multi-Reference Image Editing
Fuente:
arXiv
Saved in:
| Main Authors: | Wei, Hongyang, Wen, Bin, Long, Yancheng, Yang, Yankai, Hu, Yuhang, Zhang, Tianke, Chen, Wei, Fan, Haonan, Jiang, Kaiyu, Chen, Jiankang, Liu, Changyi, Tang, Kaiyu, Ding, Haojie, Yang, Xiao, Sun, Jia, Wang, Huaiqing, Yang, Zhenyu, Wei, Xinyu, He, Xianglong, Li, Yangguang, Yang, Fan, Gao, Tingting, Zhang, Lei, Zhou, Guorui, Li, Han |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning
by: Long, Yancheng, et al.
Published: (2026)
by: Long, Yancheng, et al.
Published: (2026)
Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models
by: Yang, Yankai, et al.
Published: (2026)
by: Yang, Yankai, et al.
Published: (2026)
Thyme: Think Beyond Images
by: Zhang, Yi-Fan, et al.
Published: (2025)
by: Zhang, Yi-Fan, et al.
Published: (2025)
InstructEngine: Instruction-driven Text-to-Image Alignment
by: Lu, Xingyu, et al.
Published: (2025)
by: Lu, Xingyu, et al.
Published: (2025)
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
by: Lu, Xingyu, et al.
Published: (2026)
by: Lu, Xingyu, et al.
Published: (2026)
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
by: Zhang, Yi-Fan, et al.
Published: (2025)
by: Zhang, Yi-Fan, et al.
Published: (2025)
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
by: Liu, Wenqi, et al.
Published: (2026)
by: Liu, Wenqi, et al.
Published: (2026)
Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation
by: Chen, Wei, et al.
Published: (2026)
by: Chen, Wei, et al.
Published: (2026)
ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL
by: Lu, Xingyu, et al.
Published: (2026)
by: Lu, Xingyu, et al.
Published: (2026)
TimeBrush : An Intelligent Expert System for Restoring Historical Images With Temporal and Stylistic Guidance
by: Kaiyu Zhang
Published: (2025)
by: Kaiyu Zhang
Published: (2025)
TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types
by: Chen, Jiankang, et al.
Published: (2025)
by: Chen, Jiankang, et al.
Published: (2025)
Skywork UniPic 3.0: Unified Multi-Image Composition via Sequence Modeling
by: Wei, Hongyang, et al.
Published: (2026)
by: Wei, Hongyang, et al.
Published: (2026)
VLM as Policy: Common-Law Content Moderation Framework for Short Video Platform
by: Lu, Xingyu, et al.
Published: (2025)
by: Lu, Xingyu, et al.
Published: (2025)
Angle‐Insensitive Spectral Imaging Based on Topology‐Optimized Plasmonic Metasurfaces
by: Jiawei Yang, et al.
Published: (2024)
by: Jiawei Yang, et al.
Published: (2024)
Angle‐Insensitive Spectral Imaging Based on Topology‐Optimized Plasmonic Metasurfaces (Laser Photonics Rev. 18(12)/2024)
by: Jiawei Yang, et al.
Published: (2024)
by: Jiawei Yang, et al.
Published: (2024)
RefAdGen: High-Fidelity Advertising Image Generation
by: Chen, Yiyun, et al.
Published: (2025)
by: Chen, Yiyun, et al.
Published: (2025)
Kwai-STaR: Transform LLMs into State-Transition Reasoners
by: Lu, Xingyu, et al.
Published: (2024)
by: Lu, Xingyu, et al.
Published: (2024)
Semantically Robust Unsupervised Image Translation for Paired Remote Sensing Images
by: Fang, Sheng, et al.
Published: (2025)
by: Fang, Sheng, et al.
Published: (2025)
RefEdit: A Benchmark and Method for Improving Instruction-based Image Editing Model on Referring Expressions
by: Pathiraja, Bimsara, et al.
Published: (2025)
by: Pathiraja, Bimsara, et al.
Published: (2025)
ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models
by: Yi, Jingwei, et al.
Published: (2025)
by: Yi, Jingwei, et al.
Published: (2025)
UniPlanner: A Unified Motion Planning Framework for Autonomous Vehicle Decision-Making Systems via Multi-Dataset Integration
by: Yang, Xin, et al.
Published: (2025)
by: Yang, Xin, et al.
Published: (2025)
RefDrop: Controllable Consistency in Image or Video Generation via Reference Feature Guidance
by: Fan, Jiaojiao, et al.
Published: (2024)
by: Fan, Jiaojiao, et al.
Published: (2024)
HumanEdit: A High-Quality Human-Rewarded Dataset for Instruction-based Image Editing
by: Bai, Jinbin, et al.
Published: (2024)
by: Bai, Jinbin, et al.
Published: (2024)
Orbital-selective Superconductivity in the Pressurized Bilayer Nickelate La$_3$Ni$_2$O$_7$: An Infinite Projected Entangled-Pair State Study
by: Chen, Jialin, et al.
Published: (2023)
by: Chen, Jialin, et al.
Published: (2023)
MDE-Edit: Masked Dual-Editing for Multi-Object Image Editing via Diffusion Models
by: Zhu, Hongyang, et al.
Published: (2025)
by: Zhu, Hongyang, et al.
Published: (2025)
Lean Copilot: Large Language Models as Copilots for Theorem Proving in Lean
by: Song, Peiyang, et al.
Published: (2024)
by: Song, Peiyang, et al.
Published: (2024)
Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning
by: Hu, Xiao, et al.
Published: (2025)
by: Hu, Xiao, et al.
Published: (2025)
RISE: Enhancing VLM Image Annotation with Self-Supervised Reasoning
by: Hu, Suhang, et al.
Published: (2025)
by: Hu, Suhang, et al.
Published: (2025)
Octree-based Learned Point Cloud Geometry Compression: A Lossy Perspective
by: Zheng, Kaiyu, et al.
Published: (2026)
by: Zheng, Kaiyu, et al.
Published: (2026)
Ref-GS: Directional Factorization for 2D Gaussian Splatting
by: Zhang, Youjia, et al.
Published: (2024)
by: Zhang, Youjia, et al.
Published: (2024)
Latent Feature-Guided Conditional Diffusion for Generative Image Semantic Communication
by: Chen, Zehao, et al.
Published: (2025)
by: Chen, Zehao, et al.
Published: (2025)
Proving Olympiad Inequalities by Synergizing LLMs and Symbolic Reasoning
by: Li, Zenan, et al.
Published: (2025)
by: Li, Zenan, et al.
Published: (2025)
UniRestore: Unified Perceptual and Task-Oriented Image Restoration Model Using Diffusion Prior
by: Chen, I-Hsiang, et al.
Published: (2025)
by: Chen, I-Hsiang, et al.
Published: (2025)
CoMM: A Coherent Interleaved Image-Text Dataset for Multimodal Understanding and Generation
by: Chen, Wei, et al.
Published: (2024)
by: Chen, Wei, et al.
Published: (2024)
From Reasoning to Learning: A Survey on Hypothesis Discovery and Rule Learning with Large Language Models
by: He, Kaiyu, et al.
Published: (2025)
by: He, Kaiyu, et al.
Published: (2025)
BadRefSR: Backdoor Attacks Against Reference-based Image Super Resolution
by: Yang, Xue, et al.
Published: (2025)
by: Yang, Xue, et al.
Published: (2025)
Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling
by: Bai, Xuehai, et al.
Published: (2026)
by: Bai, Xuehai, et al.
Published: (2026)
Kwai Keye-VL 1.5 Technical Report
by: Yang, Biao, et al.
Published: (2025)
by: Yang, Biao, et al.
Published: (2025)
Few-shot Unknown Class Discovery of Hyperspectral Images with Prototype Learning and Clustering
by: Liu, Chun, et al.
Published: (2025)
by: Liu, Chun, et al.
Published: (2025)
Language-oriented Semantic Communication for Image Transmission with Fine-Tuned Diffusion Model
by: Wei, Xinfeng, et al.
Published: (2024)
by: Wei, Xinfeng, et al.
Published: (2024)
Similar Items
-
SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning
by: Long, Yancheng, et al.
Published: (2026) -
Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models
by: Yang, Yankai, et al.
Published: (2026) -
Thyme: Think Beyond Images
by: Zhang, Yi-Fan, et al.
Published: (2025) -
InstructEngine: Instruction-driven Text-to-Image Alignment
by: Lu, Xingyu, et al.
Published: (2025) -
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
by: Lu, Xingyu, et al.
Published: (2026)