RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Qiucheng, Shi, Jing, Jenni, Simon, Kafle, Kushal, Wang, Tianyu, Chang, Shiyu, Zhao, Handong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Seeing Through Words: Controlling Visual Retrieval Quality with Language Models
por: Lu, Jianglin, et al.
Publicado: (2026)
por: Lu, Jianglin, et al.
Publicado: (2026)
DiffRetouch: Using Diffusion to Retouch on the Shoulder of Experts
por: Duan, Zheng-Peng, et al.
Publicado: (2024)
por: Duan, Zheng-Peng, et al.
Publicado: (2024)
RetouchLLM: Training-free Code-based Image Retouching with Vision Language Models
por: Ye-Bin, Moon, et al.
Publicado: (2025)
por: Ye-Bin, Moon, et al.
Publicado: (2025)
PerTouch: VLM-Driven Agent for Personalized and Semantic Image Retouching
por: Chang, Zewei, et al.
Publicado: (2025)
por: Chang, Zewei, et al.
Publicado: (2025)
Agentic Retoucher for Text-To-Image Generation
por: Shen, Shaocheng, et al.
Publicado: (2026)
por: Shen, Shaocheng, et al.
Publicado: (2026)
Label-guided Facial Retouching Reversion
por: Zhao, Guanhua, et al.
Publicado: (2024)
por: Zhao, Guanhua, et al.
Publicado: (2024)
VeraRetouch: A Lightweight Fully Differentiable Framework for Multi-Task Reasoning Photo Retouching
por: Guo, Yihong, et al.
Publicado: (2026)
por: Guo, Yihong, et al.
Publicado: (2026)
VividCam: Learning Unconventional Camera Motions from Virtual Synthetic Videos
por: Wu, Qiucheng, et al.
Publicado: (2025)
por: Wu, Qiucheng, et al.
Publicado: (2025)
FRRffusion: Unveiling Authenticity with Diffusion-Based Face Retouching Reversal
por: Xing, Fengchuang, et al.
Publicado: (2024)
por: Xing, Fengchuang, et al.
Publicado: (2024)
Content-Adaptive Image Retouching Guided by Attribute-Based Text Representation
por: Zhu, Hancheng, et al.
Publicado: (2025)
por: Zhu, Hancheng, et al.
Publicado: (2025)
Improving Large Vision and Language Models by Learning from a Panel of Peers
por: Hernandez, Jefferson, et al.
Publicado: (2025)
por: Hernandez, Jefferson, et al.
Publicado: (2025)
Taming Lookup Tables for Efficient Image Retouching
por: Yang, Sidi, et al.
Publicado: (2024)
por: Yang, Sidi, et al.
Publicado: (2024)
PhotoArtAgent: Intelligent Photo Retouching with Language Model-Based Artist Agents
por: Chen, Haoyu, et al.
Publicado: (2025)
por: Chen, Haoyu, et al.
Publicado: (2025)
Type-R: Automatically Retouching Typos for Text-to-Image Generation
por: Shimoda, Wataru, et al.
Publicado: (2024)
por: Shimoda, Wataru, et al.
Publicado: (2024)
More Than the Final Answer: Improving Visual Extraction and Logical Consistency in Vision-Language Models
por: Just, Hoang Anh, et al.
Publicado: (2025)
por: Just, Hoang Anh, et al.
Publicado: (2025)
Controllable and Gradual Facial Blemishes Retouching via Physics-Based Modelling
por: Shuai, Chenhao, et al.
Publicado: (2024)
por: Shuai, Chenhao, et al.
Publicado: (2024)
INRetouch: Context Aware Implicit Neural Representation for Photography Retouching
por: Elezabi, Omar, et al.
Publicado: (2024)
por: Elezabi, Omar, et al.
Publicado: (2024)
MoFRR: Mixture of Diffusion Models for Face Retouching Restoration
por: Liu, Jiaxin, et al.
Publicado: (2025)
por: Liu, Jiaxin, et al.
Publicado: (2025)
Detection of Digital Facial Retouching utilizing Face Beauty Information
por: Srock, Philipp, et al.
Publicado: (2025)
por: Srock, Philipp, et al.
Publicado: (2025)
MonetGPT: Solving Puzzles Enhances MLLMs' Image Retouching Skills
por: Dutt, Niladri Shekhar, et al.
Publicado: (2025)
por: Dutt, Niladri Shekhar, et al.
Publicado: (2025)
JarvisArt: Liberating Human Artistic Creativity via an Intelligent Photo Retouching Agent
por: Lin, Yunlong, et al.
Publicado: (2025)
por: Lin, Yunlong, et al.
Publicado: (2025)
CameraMaster: Unified Camera Semantic-Parameter Control for Photography Retouching
por: Yang, Qirui, et al.
Publicado: (2025)
por: Yang, Qirui, et al.
Publicado: (2025)
Layout-and-Retouch: A Dual-stage Framework for Improving Diversity in Personalized Image Generation
por: Kim, Kangyeol, et al.
Publicado: (2024)
por: Kim, Kangyeol, et al.
Publicado: (2024)
FINEMATCH: Aspect-based Fine-grained Image and Text Mismatch Detection and Correction
por: Hua, Hang, et al.
Publicado: (2024)
por: Hua, Hang, et al.
Publicado: (2024)
Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles
por: Slyman, Eric, et al.
Publicado: (2025)
por: Slyman, Eric, et al.
Publicado: (2025)
NCST: Neural-based Color Style Transfer for Video Retouching
por: Jiang, Xintao, et al.
Publicado: (2024)
por: Jiang, Xintao, et al.
Publicado: (2024)
Plot'n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models
por: Akdemir, Kiymet, et al.
Publicado: (2025)
por: Akdemir, Kiymet, et al.
Publicado: (2025)
Draw Like an Artist: Complex Scene Generation with Diffusion Model via Composition, Painting, and Retouching
por: Liu, Minghao, et al.
Publicado: (2024)
por: Liu, Minghao, et al.
Publicado: (2024)
BeautyGRPO: Aesthetic Alignment for Face Retouching via Dynamic Path Guidance and Fine-Grained Preference Modeling
por: Yang, Jiachen, et al.
Publicado: (2026)
por: Yang, Jiachen, et al.
Publicado: (2026)
The Photographer Eye: Teaching Multimodal Large Language Models to Understand Image Aesthetics like Photographers
por: Qi, Daiqing, et al.
Publicado: (2025)
por: Qi, Daiqing, et al.
Publicado: (2025)
MAGNET: Augmenting Generative Decoders with Representation Learning and Infilling Capabilities
por: Khosla, Savya, et al.
Publicado: (2025)
por: Khosla, Savya, et al.
Publicado: (2025)
Visual Grounding Methods for VQA are Working for the Wrong Reasons!
por: Shrestha, Robik, et al.
Publicado: (2020)
por: Shrestha, Robik, et al.
Publicado: (2020)
Are Bias Mitigation Techniques for Deep Learning Effective?
por: Shrestha, Robik, et al.
Publicado: (2021)
por: Shrestha, Robik, et al.
Publicado: (2021)
InstantRetouch: Personalized Image Retouching without Test-time Fine-tuning Using an Asymmetric Auto-Encoder
por: Weldengus, Temesgen Muruts, et al.
Publicado: (2025)
por: Weldengus, Temesgen Muruts, et al.
Publicado: (2025)
LocateEdit-Bench: A Benchmark for Instruction-Based Editing Localization
por: Wu, Shiyu, et al.
Publicado: (2026)
por: Wu, Shiyu, et al.
Publicado: (2026)
Revisiting MLLM Based Image Quality Assessment: Errors and Remedy
por: Tang, Zhenchen, et al.
Publicado: (2025)
por: Tang, Zhenchen, et al.
Publicado: (2025)
Improving Visual Grounding by Encouraging Consistent Gradient-based Explanations
por: Yang, Ziyan, et al.
Publicado: (2022)
por: Yang, Ziyan, et al.
Publicado: (2022)
MS4UI: A Dataset for Multi-modal Summarization of User Interface Instructional Videos
por: Zang, Yuan, et al.
Publicado: (2025)
por: Zang, Yuan, et al.
Publicado: (2025)
Follow-Your-Instruction: A Comprehensive MLLM Agent for World Data Synthesis
por: Feng, Kunyu, et al.
Publicado: (2025)
por: Feng, Kunyu, et al.
Publicado: (2025)
PresentAgent-2: Towards Generalist Multimodal Presentation Agents
por: Wu, Wei, et al.
Publicado: (2026)
por: Wu, Wei, et al.
Publicado: (2026)
Ejemplares similares
-
Seeing Through Words: Controlling Visual Retrieval Quality with Language Models
por: Lu, Jianglin, et al.
Publicado: (2026) -
DiffRetouch: Using Diffusion to Retouch on the Shoulder of Experts
por: Duan, Zheng-Peng, et al.
Publicado: (2024) -
RetouchLLM: Training-free Code-based Image Retouching with Vision Language Models
por: Ye-Bin, Moon, et al.
Publicado: (2025) -
PerTouch: VLM-Driven Agent for Personalized and Semantic Image Retouching
por: Chang, Zewei, et al.
Publicado: (2025) -
Agentic Retoucher for Text-To-Image Generation
por: Shen, Shaocheng, et al.
Publicado: (2026)