PromptFix: You Prompt and We Fix the Photo
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Yongsheng, Zeng, Ziyun, Hua, Hang, Fu, Jianlong, Luo, Jiebo |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MIRA: Multimodal Iterative Reasoning Agent for Image Editing
par: Zeng, Ziyun, et autres
Publié: (2025)
par: Zeng, Ziyun, et autres
Publié: (2025)
Chain-of-Thought Prompting for Demographic Inference with Large Multimodal Models
par: Yu, Yongsheng, et autres
Publié: (2024)
par: Yu, Yongsheng, et autres
Publié: (2024)
OmniPaint: Mastering Object-Oriented Editing via Disentangled Insertion-Removal Inpainting
par: Yu, Yongsheng, et autres
Publié: (2025)
par: Yu, Yongsheng, et autres
Publié: (2025)
Aurora: Unified Video Editing with a Tool-Using Agent
par: Yu, Yongsheng, et autres
Publié: (2026)
par: Yu, Yongsheng, et autres
Publié: (2026)
MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents
par: Zeng, Ziyun, et autres
Publié: (2026)
par: Zeng, Ziyun, et autres
Publié: (2026)
V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning
par: Hua, Hang, et autres
Publié: (2024)
par: Hua, Hang, et autres
Publié: (2024)
A Fixed-Point Approach to Unified Prompt-Based Counting
par: Lin, Wei, et autres
Publié: (2024)
par: Lin, Wei, et autres
Publié: (2024)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
par: Hua, Hang, et autres
Publié: (2024)
par: Hua, Hang, et autres
Publié: (2024)
MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models
par: Hua, Hang, et autres
Publié: (2025)
par: Hua, Hang, et autres
Publié: (2025)
End-to-end Open-vocabulary Video Visual Relationship Detection using Multi-modal Prompting
par: Wang, Yongqi, et autres
Publié: (2024)
par: Wang, Yongqi, et autres
Publié: (2024)
LION: Implicit Vision Prompt Tuning
par: Wang, Haixin, et autres
Publié: (2023)
par: Wang, Haixin, et autres
Publié: (2023)
Localization Is All You Evaluate: Data Leakage in Online Mapping Datasets and How to Fix It
par: Lilja, Adam, et autres
Publié: (2023)
par: Lilja, Adam, et autres
Publié: (2023)
FINECAPTION: Compositional Image Captioning Focusing on Wherever You Want at Any Granularity
par: Hua, Hang, et autres
Publié: (2024)
par: Hua, Hang, et autres
Publié: (2024)
Evolver: Chain-of-Evolution Prompting to Boost Large Multimodal Models for Hateful Meme Detection
par: Huang, Jinfa, et autres
Publié: (2024)
par: Huang, Jinfa, et autres
Publié: (2024)
PromptFix: Few-shot Backdoor Removal via Adversarial Prompt Tuning
par: Zhang, Tianrong, et autres
Publié: (2024)
par: Zhang, Tianrong, et autres
Publié: (2024)
CoCoT: Contrastive Chain-of-Thought Prompting for Large Multimodal Models with Multiple Image Inputs
par: Zhang, Daoan, et autres
Publié: (2024)
par: Zhang, Daoan, et autres
Publié: (2024)
NSFW-Classifier Guided Prompt Sanitization for Safe Text-to-Image Generation
par: Xie, Yu, et autres
Publié: (2025)
par: Xie, Yu, et autres
Publié: (2025)
PixelDiT: Pixel Diffusion Transformers for Image Generation
par: Yu, Yongsheng, et autres
Publié: (2025)
par: Yu, Yongsheng, et autres
Publié: (2025)
PixPerfect: Seamless Latent Diffusion Local Editing with Discriminative Pixel-Space Refinement
par: Zheng, Haitian, et autres
Publié: (2025)
par: Zheng, Haitian, et autres
Publié: (2025)
Token Coordinated Prompt Attention is Needed for Visual Prompting
par: Liu, Zichen, et autres
Publié: (2025)
par: Liu, Zichen, et autres
Publié: (2025)
X-Reflect: Cross-Reflection Prompting for Multimodal Recommendation
par: Lyu, Hanjia, et autres
Publié: (2024)
par: Lyu, Hanjia, et autres
Publié: (2024)
Efficient Motion Prompt Learning for Robust Visual Tracking
par: Zhao, Jie, et autres
Publié: (2025)
par: Zhao, Jie, et autres
Publié: (2025)
Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
par: Tang, Yunlong, et autres
Publié: (2025)
par: Tang, Yunlong, et autres
Publié: (2025)
SyncFix: Fixing 3D Reconstructions via Multi-View Synchronization
par: Li, Deming, et autres
Publié: (2026)
par: Li, Deming, et autres
Publié: (2026)
Fixed Anchors Are Not Enough: Dynamic Retrieval and Persistent Homology for Dataset Distillation
par: Li, Muquan, et autres
Publié: (2026)
par: Li, Muquan, et autres
Publié: (2026)
Tri-Prompting: Video Diffusion with Unified Control over Scene, Subject, and Motion
par: Zhou, Zhenghong, et autres
Publié: (2026)
par: Zhou, Zhenghong, et autres
Publié: (2026)
Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want
par: Lin, Weifeng, et autres
Publié: (2024)
par: Lin, Weifeng, et autres
Publié: (2024)
Memory-SAM: Human-Prompt-Free Tongue Segmentation via Retrieval-to-Prompt
par: Chae, Joongwon, et autres
Publié: (2025)
par: Chae, Joongwon, et autres
Publié: (2025)
Fixing the RANSAC Stopping Criterion
par: Schönberger, Johannes, et autres
Publié: (2025)
par: Schönberger, Johannes, et autres
Publié: (2025)
Is Temporal Prompting All We Need For Limited Labeled Action Recognition?
par: Gowda, Shreyank N, et autres
Publié: (2025)
par: Gowda, Shreyank N, et autres
Publié: (2025)
PromptKD: Unsupervised Prompt Distillation for Vision-Language Models
par: Li, Zheng, et autres
Publié: (2024)
par: Li, Zheng, et autres
Publié: (2024)
Local-Prompt: Extensible Local Prompts for Few-Shot Out-of-Distribution Detection
par: Zeng, Fanhu, et autres
Publié: (2024)
par: Zeng, Fanhu, et autres
Publié: (2024)
Are You Copying My Prompt? Protecting the Copyright of Vision Prompt for VPaaS via Watermark
par: Ren, Huali, et autres
Publié: (2024)
par: Ren, Huali, et autres
Publié: (2024)
Graph Your Own Prompt
par: Ding, Xi, et autres
Publié: (2025)
par: Ding, Xi, et autres
Publié: (2025)
An Iteration-Free Fixed-Point Estimator for Diffusion Inversion
par: Chen, Yifei, et autres
Publié: (2025)
par: Chen, Yifei, et autres
Publié: (2025)
We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback
par: Choi, Minkyu, et autres
Publié: (2025)
par: Choi, Minkyu, et autres
Publié: (2025)
KEPIL: Knowledge-Enhanced Prompt-Image Learning for Prompt-Robust Disease Detection
par: Luo, Haozhe, et autres
Publié: (2026)
par: Luo, Haozhe, et autres
Publié: (2026)
SurgicalPart-SAM: Part-to-Whole Collaborative Prompting for Surgical Instrument Segmentation
par: Yue, Wenxi, et autres
Publié: (2023)
par: Yue, Wenxi, et autres
Publié: (2023)
Latent-Reframe: Enabling Camera Control for Video Diffusion Model without Training
par: Zhou, Zhenghong, et autres
Publié: (2024)
par: Zhou, Zhenghong, et autres
Publié: (2024)
Aggregated Contextual Transformations for High-Resolution Image Inpainting
par: Zeng, Yanhong, et autres
Publié: (2021)
par: Zeng, Yanhong, et autres
Publié: (2021)
Documents similaires
-
MIRA: Multimodal Iterative Reasoning Agent for Image Editing
par: Zeng, Ziyun, et autres
Publié: (2025) -
Chain-of-Thought Prompting for Demographic Inference with Large Multimodal Models
par: Yu, Yongsheng, et autres
Publié: (2024) -
OmniPaint: Mastering Object-Oriented Editing via Disentangled Insertion-Removal Inpainting
par: Yu, Yongsheng, et autres
Publié: (2025) -
Aurora: Unified Video Editing with a Tool-Using Agent
par: Yu, Yongsheng, et autres
Publié: (2026) -
MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents
par: Zeng, Ziyun, et autres
Publié: (2026)