MIND-Edit: MLLM Insight-Driven Editing via Language-Vision Projection
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Shuyu, Li, Weiqi, Wang, Qian, Zhao, Shijie, Zhang, Jian |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement Learning
von: Zhang, Xuanyu, et al.
Veröffentlicht: (2025)
von: Zhang, Xuanyu, et al.
Veröffentlicht: (2025)
Q-Insight: Understanding Image Quality via Visual Reinforcement Learning
von: Li, Weiqi, et al.
Veröffentlicht: (2025)
von: Li, Weiqi, et al.
Veröffentlicht: (2025)
ComplexBench-Edit: Benchmarking Complex Instruction-Driven Image Editing via Compositional Dependencies
von: Wang, Chenglin, et al.
Veröffentlicht: (2025)
von: Wang, Chenglin, et al.
Veröffentlicht: (2025)
UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement
von: Li, Weiqi, et al.
Veröffentlicht: (2025)
von: Li, Weiqi, et al.
Veröffentlicht: (2025)
Lego-Edit: A General Image Editing Framework with Model-Level Bricks and MLLM Builder
von: Jia, Qifei, et al.
Veröffentlicht: (2025)
von: Jia, Qifei, et al.
Veröffentlicht: (2025)
EditCLIP: Representation Learning for Image Editing
von: Wang, Qian, et al.
Veröffentlicht: (2025)
von: Wang, Qian, et al.
Veröffentlicht: (2025)
InstructX: Towards Unified Visual Editing with MLLM Guidance
von: Mou, Chong, et al.
Veröffentlicht: (2025)
von: Mou, Chong, et al.
Veröffentlicht: (2025)
InsightEdit: Towards Better Instruction Following for Image Editing
von: Xu, Yingjing, et al.
Veröffentlicht: (2024)
von: Xu, Yingjing, et al.
Veröffentlicht: (2024)
Moodifier: MLLM-Enhanced Emotion-Driven Image Editing
von: Ye, Jiarong, et al.
Veröffentlicht: (2025)
von: Ye, Jiarong, et al.
Veröffentlicht: (2025)
Attribution Analysis Meets Model Editing: Advancing Knowledge Correction in Vision Language Models with VisEdit
von: Chen, Qizhou, et al.
Veröffentlicht: (2024)
von: Chen, Qizhou, et al.
Veröffentlicht: (2024)
DualEdit: Dual Editing for Knowledge Updating in Vision-Language Models
von: Shi, Zhiyi, et al.
Veröffentlicht: (2025)
von: Shi, Zhiyi, et al.
Veröffentlicht: (2025)
Edit Transfer: Learning Image Editing via Vision In-Context Relations
von: Chen, Lan, et al.
Veröffentlicht: (2025)
von: Chen, Lan, et al.
Veröffentlicht: (2025)
FireEdit: Fine-grained Instruction-based Image Editing via Region-aware Vision Language Model
von: Zhou, Jun, et al.
Veröffentlicht: (2025)
von: Zhou, Jun, et al.
Veröffentlicht: (2025)
FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation
von: Yang, Fan, et al.
Veröffentlicht: (2025)
von: Yang, Fan, et al.
Veröffentlicht: (2025)
When Privacy Meets Recovery: The Overlooked Half of Surrogate-Driven Privacy Preservation for MLLM Editing
von: Xu, Siyuan, et al.
Veröffentlicht: (2025)
von: Xu, Siyuan, et al.
Veröffentlicht: (2025)
EditGarment: An Instruction-Based Garment Editing Dataset Constructed with Automated MLLM Synthesis and Semantic-Aware Evaluation
von: Yin, Deqiang, et al.
Veröffentlicht: (2025)
von: Yin, Deqiang, et al.
Veröffentlicht: (2025)
OmniDrag: Enabling Motion Control for Omnidirectional Image-to-Video Generation
von: Li, Weiqi, et al.
Veröffentlicht: (2024)
von: Li, Weiqi, et al.
Veröffentlicht: (2024)
VQ-Jarvis: Retrieval-Augmented Video Restoration Agent with Sharp Vision and Fast Thought
von: Zhang, Xuanyu, et al.
Veröffentlicht: (2026)
von: Zhang, Xuanyu, et al.
Veröffentlicht: (2026)
Group Editing: Edit Multiple Images in One Go
von: Ma, Yue, et al.
Veröffentlicht: (2026)
von: Ma, Yue, et al.
Veröffentlicht: (2026)
AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control
von: Guo, Xinyue, et al.
Veröffentlicht: (2025)
von: Guo, Xinyue, et al.
Veröffentlicht: (2025)
MDE-Edit: Masked Dual-Editing for Multi-Object Image Editing via Diffusion Models
von: Zhu, Hongyang, et al.
Veröffentlicht: (2025)
von: Zhu, Hongyang, et al.
Veröffentlicht: (2025)
MLLM-Enhanced Face Forgery Detection: A Vision-Language Fusion Solution
von: Peng, Siran, et al.
Veröffentlicht: (2025)
von: Peng, Siran, et al.
Veröffentlicht: (2025)
X-Edit: Exact, Explicit, and Explainable Null-Space Editing for Medical Vision Transformers
von: Liu, Yuanye, et al.
Veröffentlicht: (2026)
von: Liu, Yuanye, et al.
Veröffentlicht: (2026)
ReasonEdit: Editing Vision-Language Models using Human Reasoning
von: Qiu, Jiaxing, et al.
Veröffentlicht: (2026)
von: Qiu, Jiaxing, et al.
Veröffentlicht: (2026)
FREE-Edit: Using Editing-aware Injection in Rectified Flow Models for Zero-shot Image-Driven Video Editing
von: Li, Maomao, et al.
Veröffentlicht: (2026)
von: Li, Maomao, et al.
Veröffentlicht: (2026)
Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning
von: He, Qingdong, et al.
Veröffentlicht: (2025)
von: He, Qingdong, et al.
Veröffentlicht: (2025)
Beyond Simple Edits: X-Planner for Complex Instruction-Based Image Editing
von: Yeh, Chun-Hsiao, et al.
Veröffentlicht: (2025)
von: Yeh, Chun-Hsiao, et al.
Veröffentlicht: (2025)
HulluEdit: Single-Pass Evidence-Consistent Subspace Editing for Mitigating Hallucinations in Large Vision-Language Models
von: Lin, Yangguang, et al.
Veröffentlicht: (2026)
von: Lin, Yangguang, et al.
Veröffentlicht: (2026)
ReasonEdit: Towards Reasoning-Enhanced Image Editing Models
von: Yin, Fukun, et al.
Veröffentlicht: (2025)
von: Yin, Fukun, et al.
Veröffentlicht: (2025)
POEM: Precise Object-level Editing via MLLM control
von: Schouten, Marco, et al.
Veröffentlicht: (2025)
von: Schouten, Marco, et al.
Veröffentlicht: (2025)
Edit-Your-Interest: Efficient Video Editing via Feature Most-Similar Propagation
von: Zuo, Yi, et al.
Veröffentlicht: (2025)
von: Zuo, Yi, et al.
Veröffentlicht: (2025)
VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization
von: Liu, Yikun, et al.
Veröffentlicht: (2026)
von: Liu, Yikun, et al.
Veröffentlicht: (2026)
Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling
von: Bai, Xuehai, et al.
Veröffentlicht: (2026)
von: Bai, Xuehai, et al.
Veröffentlicht: (2026)
ResetEdit: Precise Text-guided Editing of Generated Image via Resettable Starting Latent
von: Wang, Hanyi, et al.
Veröffentlicht: (2026)
von: Wang, Hanyi, et al.
Veröffentlicht: (2026)
Reasoning as Representation: Rethinking Visual Reinforcement Learning in Image Quality Assessment
von: Zhao, Shijie, et al.
Veröffentlicht: (2025)
von: Zhao, Shijie, et al.
Veröffentlicht: (2025)
DiT4Edit: Diffusion Transformer for Image Editing
von: Feng, Kunyu, et al.
Veröffentlicht: (2024)
von: Feng, Kunyu, et al.
Veröffentlicht: (2024)
Improved Adversarial Diffusion Compression for Real-World Video Super-Resolution
von: Chen, Bin, et al.
Veröffentlicht: (2026)
von: Chen, Bin, et al.
Veröffentlicht: (2026)
LocateEdit-Bench: A Benchmark for Instruction-Based Editing Localization
von: Wu, Shiyu, et al.
Veröffentlicht: (2026)
von: Wu, Shiyu, et al.
Veröffentlicht: (2026)
EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning
von: Ju, Xuan, et al.
Veröffentlicht: (2025)
von: Ju, Xuan, et al.
Veröffentlicht: (2025)
Edit as You See: Image-guided Video Editing via Masked Motion Modeling
von: Huang, Zhi-Lin, et al.
Veröffentlicht: (2025)
von: Huang, Zhi-Lin, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement Learning
von: Zhang, Xuanyu, et al.
Veröffentlicht: (2025) -
Q-Insight: Understanding Image Quality via Visual Reinforcement Learning
von: Li, Weiqi, et al.
Veröffentlicht: (2025) -
ComplexBench-Edit: Benchmarking Complex Instruction-Driven Image Editing via Compositional Dependencies
von: Wang, Chenglin, et al.
Veröffentlicht: (2025) -
UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement
von: Li, Weiqi, et al.
Veröffentlicht: (2025) -
Lego-Edit: A General Image Editing Framework with Model-Level Bricks and MLLM Builder
von: Jia, Qifei, et al.
Veröffentlicht: (2025)