Inline Critic Steers Image Editing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kang, Weitai, Zhan, Xiaohang, Wang, Yizhou, Chiu, Mang Tik, Kuen, Jason, Liu, Kangning, Yan, Yan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VGent: Visual Grounding via Modular Design for Disentangling Reasoning and Prediction
par: Kang, Weitai, et autres
Publié: (2025)
par: Kang, Weitai, et autres
Publié: (2025)
Pose-Star: Anatomy-Aware Editing for Open-World Fashion Images
par: Dong, Yuran, et autres
Publié: (2025)
par: Dong, Yuran, et autres
Publié: (2025)
Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning
par: Kang, Weitai, et autres
Publié: (2024)
par: Kang, Weitai, et autres
Publié: (2024)
Refer to Any Segmentation Mask Group With Vision-Language Prompts
par: Cao, Shengcao, et autres
Publié: (2025)
par: Cao, Shengcao, et autres
Publié: (2025)
ExpVG: Investigating the Design Space of Visual Grounding in Multimodal Large Language Model
par: Kang, Weitai, et autres
Publié: (2025)
par: Kang, Weitai, et autres
Publié: (2025)
Stable-SCore: A Stable Registration-based Framework for 3D Shape Correspondence
par: Liu, Haolin, et autres
Publié: (2025)
par: Liu, Haolin, et autres
Publié: (2025)
VAGS: Velocity Adaptive Guidance Scale for Image Editing and Generation
par: Luo, Yan, et autres
Publié: (2026)
par: Luo, Yan, et autres
Publié: (2026)
InverseMeetInsert: Robust Real Image Editing via Geometric Accumulation Inversion in Guided Diffusion Models
par: Zheng, Yan, et autres
Publié: (2024)
par: Zheng, Yan, et autres
Publié: (2024)
Clinical Inspired MRI Lesion Segmentation
par: Yan, Lijun, et autres
Publié: (2025)
par: Yan, Lijun, et autres
Publié: (2025)
Video-T1: Test-Time Scaling for Video Generation
par: Liu, Fangfu, et autres
Publié: (2025)
par: Liu, Fangfu, et autres
Publié: (2025)
High Quality Segmentation for Ultra High-resolution Images
par: Shen, Tiancheng, et autres
Publié: (2021)
par: Shen, Tiancheng, et autres
Publié: (2021)
PostEdit: Posterior Sampling for Efficient Zero-Shot Image Editing
par: Tian, Feng, et autres
Publié: (2024)
par: Tian, Feng, et autres
Publié: (2024)
Omni-Dish: Photorealistic and Faithful Image Generation and Editing for Arbitrary Chinese Dishes
par: Liu, Huijie, et autres
Publié: (2025)
par: Liu, Huijie, et autres
Publié: (2025)
Consistent Video Editing as Flow-Driven Image-to-Video Generation
par: Wang, Ge, et autres
Publié: (2025)
par: Wang, Ge, et autres
Publié: (2025)
SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding
par: Kang, Weitai, et autres
Publié: (2024)
par: Kang, Weitai, et autres
Publié: (2024)
D-CoDe: Scaling Image-Pretrained VLMs to Video via Dynamic Compression and Question Decomposition
par: Huang, Yiyang, et autres
Publié: (2025)
par: Huang, Yiyang, et autres
Publié: (2025)
Robust Latent Matters: Boosting Image Generation with Sampling Error Synthesis
par: Qiu, Kai, et autres
Publié: (2025)
par: Qiu, Kai, et autres
Publié: (2025)
Interpolating Video-LLMs: Toward Longer-sequence LMMs in a Training-free Manner
par: Shang, Yuzhang, et autres
Publié: (2024)
par: Shang, Yuzhang, et autres
Publié: (2024)
ContextDrag: Precise Drag-Based Image Editing via Context-Preserving Token Injection and Position-Aligned Attention
par: He, Huiguo, et autres
Publié: (2025)
par: He, Huiguo, et autres
Publié: (2025)
DIVE: Taming DINO for Subject-Driven Video Editing
par: Huang, Yi, et autres
Publié: (2024)
par: Huang, Yi, et autres
Publié: (2024)
MedEBench: Diagnosing Reliability in Text-Guided Medical Image Editing
par: Liu, Minghao, et autres
Publié: (2025)
par: Liu, Minghao, et autres
Publié: (2025)
COCO-Inpaint: A Benchmark for Detecting and Localizing Inpainting-Based Image Manipulations
par: Yan, Haozhen, et autres
Publié: (2025)
par: Yan, Haozhen, et autres
Publié: (2025)
Identifying Critical Tokens for Accurate Predictions in Transformer-based Medical Imaging Models
par: Kang, Solha, et autres
Publié: (2025)
par: Kang, Solha, et autres
Publié: (2025)
FlowSteer: Guiding Few-Step Image Synthesis with Authentic Trajectories
par: Ke, Lei, et autres
Publié: (2025)
par: Ke, Lei, et autres
Publié: (2025)
Deep Learning in Dental Image Analysis: A Systematic Review of Datasets, Methodologies, and Emerging Challenges
par: Zhou, Zhenhuan, et autres
Publié: (2025)
par: Zhou, Zhenhuan, et autres
Publié: (2025)
PrimeComposer: Faster Progressively Combined Diffusion for Image Composition with Attention Steering
par: Wang, Yibin, et autres
Publié: (2024)
par: Wang, Yibin, et autres
Publié: (2024)
UniSER: A Foundation Model for Unified Soft Effects Removal
par: Zhang, Jingdong, et autres
Publié: (2025)
par: Zhang, Jingdong, et autres
Publié: (2025)
DLEBench: Evaluating Small-scale Object Editing Ability for Instruction-based Image Editing Model
par: Hong, Shibo, et autres
Publié: (2026)
par: Hong, Shibo, et autres
Publié: (2026)
Learning Joint ID-Textual Representation for ID-Preserving Image Synthesis
par: Liu, Zichuan, et autres
Publié: (2025)
par: Liu, Zichuan, et autres
Publié: (2025)
SNCE: Geometry-Aware Supervision for Scalable Discrete Image Generation
par: Li, Shufan, et autres
Publié: (2026)
par: Li, Shufan, et autres
Publié: (2026)
EditWorld: Simulating World Dynamics for Instruction-Following Image Editing
par: Yang, Ling, et autres
Publié: (2024)
par: Yang, Ling, et autres
Publié: (2024)
ControlVAR: Exploring Controllable Visual Autoregressive Modeling
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
Training-Free Text-Guided Image Editing with Visual Autoregressive Model
par: Wang, Yufei, et autres
Publié: (2025)
par: Wang, Yufei, et autres
Publié: (2025)
Towards Robust Sequential Decomposition for Complex Image Editing
par: Zeng, Zilai, et autres
Publié: (2026)
par: Zeng, Zilai, et autres
Publié: (2026)
DPDEdit: Detail-Preserved Diffusion Models for Multimodal Fashion Image Editing
par: Wang, Xiaolong, et autres
Publié: (2024)
par: Wang, Xiaolong, et autres
Publié: (2024)
ACTRESS: Active Retraining for Semi-supervised Visual Grounding
par: Kang, Weitai, et autres
Publié: (2024)
par: Kang, Weitai, et autres
Publié: (2024)
MieDB-100k: A Comprehensive Dataset for Medical Image Editing
par: Lai, Yongfan, et autres
Publié: (2026)
par: Lai, Yongfan, et autres
Publié: (2026)
DeltaSpace: A Semantic-aligned Feature Space for Flexible Text-guided Image Editing
par: Lyu, Yueming, et autres
Publié: (2023)
par: Lyu, Yueming, et autres
Publié: (2023)
Vision-Language Introspection: Mitigating Overconfident Hallucinations in MLLMs via Interpretable Bi-Causal Steering
par: Liu, Shuliang, et autres
Publié: (2026)
par: Liu, Shuliang, et autres
Publié: (2026)
Agentic Surgical AI: Surgeon Style Fingerprinting and Privacy Risk Quantification via Discrete Diffusion in a Vision-Language-Action Framework
par: Zhan, Huixin, et autres
Publié: (2025)
par: Zhan, Huixin, et autres
Publié: (2025)
Documents similaires
-
VGent: Visual Grounding via Modular Design for Disentangling Reasoning and Prediction
par: Kang, Weitai, et autres
Publié: (2025) -
Pose-Star: Anatomy-Aware Editing for Open-World Fashion Images
par: Dong, Yuran, et autres
Publié: (2025) -
Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning
par: Kang, Weitai, et autres
Publié: (2024) -
Refer to Any Segmentation Mask Group With Vision-Language Prompts
par: Cao, Shengcao, et autres
Publié: (2025) -
ExpVG: Investigating the Design Space of Visual Grounding in Multimodal Large Language Model
par: Kang, Weitai, et autres
Publié: (2025)