PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Jinlong, He, Wanggui, Zhang, Peng, Liu, Mushui, Jiang, Hao, Huang, Pipei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO
par: Tong, Yunze, et autres
Publié: (2026)
par: Tong, Yunze, et autres
Publié: (2026)
DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding
par: Zhang, Peng, et autres
Publié: (2026)
par: Zhang, Peng, et autres
Publié: (2026)
PatchDPO: Patch-level DPO for Finetuning-free Personalized Image Generation
par: Huang, Qihan, et autres
Publié: (2024)
par: Huang, Qihan, et autres
Publié: (2024)
Boosting MLLM Reasoning with Text-Debiased Hint-GRPO
par: Huang, Qihan, et autres
Publié: (2025)
par: Huang, Qihan, et autres
Publié: (2025)
MARS: Mixture of Auto-Regressive Models for Fine-grained Text-to-image Synthesis
par: He, Wanggui, et autres
Publié: (2024)
par: He, Wanggui, et autres
Publié: (2024)
DCoAR: Deep Concept Injection into Unified Autoregressive Models for Personalized Text-to-Image Generation
par: Wu, Fangtai, et autres
Publié: (2025)
par: Wu, Fangtai, et autres
Publié: (2025)
Towards Enhanced Image Generation Via Multi-modal Chain of Thought in Unified Generative Models
par: Wang, Yi, et autres
Publié: (2025)
par: Wang, Yi, et autres
Publié: (2025)
Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation
par: Yang, Hongji, et autres
Publié: (2025)
par: Yang, Hongji, et autres
Publié: (2025)
CMMCoT: Enhancing Complex Multi-Image Comprehension via Multi-Modal Chain-of-Thought and Memory Augmentation
par: Zhang, Guanghao, et autres
Publié: (2025)
par: Zhang, Guanghao, et autres
Publié: (2025)
MS-Diffusion: Multi-subject Zero-shot Image Personalization with Layout Guidance
par: Wang, Xierui, et autres
Publié: (2024)
par: Wang, Xierui, et autres
Publié: (2024)
Unified Prompt Attack Against Text-to-Image Generation Models
par: Peng, Duo, et autres
Publié: (2025)
par: Peng, Duo, et autres
Publié: (2025)
Denoising as Path Planning: Training-Free Acceleration of Diffusion Models with DPCache
par: Cui, Bowen, et autres
Publié: (2026)
par: Cui, Bowen, et autres
Publié: (2026)
Debiased Prompt Tuning in Vision-Language Model without Annotations
par: Jiang, Chaoquan, et autres
Publié: (2025)
par: Jiang, Chaoquan, et autres
Publié: (2025)
Hierarchical Cross-modal Prompt Learning for Vision-Language Models
par: Zheng, Hao, et autres
Publié: (2025)
par: Zheng, Hao, et autres
Publié: (2025)
Tuning-Free Image Customization with Image and Text Guidance
par: Li, Pengzhi, et autres
Publié: (2024)
par: Li, Pengzhi, et autres
Publié: (2024)
VLM-CPL: Consensus Pseudo Labels from Vision-Language Models for Annotation-Free Pathological Image Classification
par: Zhong, Lanfeng, et autres
Publié: (2024)
par: Zhong, Lanfeng, et autres
Publié: (2024)
Hybrid Mask Generation for Infrared Small Target Detection with Single-Point Supervision
par: He, Weijie, et autres
Publié: (2024)
par: He, Weijie, et autres
Publié: (2024)
Resolving Multi-Condition Confusion for Finetuning-Free Personalized Image Generation
par: Huang, Qihan, et autres
Publié: (2024)
par: Huang, Qihan, et autres
Publié: (2024)
DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation
par: He, Weijie, et autres
Publié: (2025)
par: He, Weijie, et autres
Publié: (2025)
Dual Prompt Learning for Adapting Vision-Language Models to Downstream Image-Text Retrieval
par: Wang, Yifan, et autres
Publié: (2025)
par: Wang, Yifan, et autres
Publié: (2025)
Understanding Reward Hacking in Text-to-Image Reinforcement Learning
par: Hong, Yunqi, et autres
Publié: (2026)
par: Hong, Yunqi, et autres
Publié: (2026)
OmniCLIP: Adapting CLIP for Video Recognition with Spatial-Temporal Omni-Scale Feature Learning
par: Liu, Mushui, et autres
Publié: (2024)
par: Liu, Mushui, et autres
Publié: (2024)
Fully Fine-tuned CLIP Models are Efficient Few-Shot Learners
par: Liu, Mushui, et autres
Publié: (2024)
par: Liu, Mushui, et autres
Publié: (2024)
Learning to Prompt with Text Only Supervision for Vision-Language Models
par: Khattak, Muhammad Uzair, et autres
Publié: (2024)
par: Khattak, Muhammad Uzair, et autres
Publié: (2024)
Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models
par: Han, Yuhang, et autres
Publié: (2026)
par: Han, Yuhang, et autres
Publié: (2026)
The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation
par: Mao, Weijia, et autres
Publié: (2025)
par: Mao, Weijia, et autres
Publié: (2025)
T2I-FactualBench: Benchmarking the Factuality of Text-to-Image Models with Knowledge-Intensive Concepts
par: Huang, Ziwei, et autres
Publié: (2024)
par: Huang, Ziwei, et autres
Publié: (2024)
Annotation-Free Curb Detection Leveraging Altitude Difference Image
par: Ma, Fulong, et autres
Publié: (2024)
par: Ma, Fulong, et autres
Publié: (2024)
Envisioning Class Entity Reasoning by Large Language Models for Few-shot Learning
par: Liu, Mushui, et autres
Publié: (2024)
par: Liu, Mushui, et autres
Publié: (2024)
Deep Reward Supervisions for Tuning Text-to-Image Diffusion Models
par: Wu, Xiaoshi, et autres
Publié: (2024)
par: Wu, Xiaoshi, et autres
Publié: (2024)
EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model
par: Zhang, Yuxuan, et autres
Publié: (2024)
par: Zhang, Yuxuan, et autres
Publié: (2024)
Prompt-Softbox-Prompt: A Free-Text Embedding Control for Image Editing
par: Yang, Yitong, et autres
Publié: (2024)
par: Yang, Yitong, et autres
Publié: (2024)
Vision-Language Models as Differentiable Semantic and Spatial Rewards for Text-to-3D Generation
par: Bai, Weimin, et autres
Publié: (2025)
par: Bai, Weimin, et autres
Publié: (2025)
Reinforcement Learning with Inverse Rewards for World Model Post-training
par: Ye, Yang, et autres
Publié: (2025)
par: Ye, Yang, et autres
Publié: (2025)
TextRefiner: Internal Visual Feature as Efficient Refiner for Vision-Language Models Prompt Tuning
par: Xie, Jingjing, et autres
Publié: (2024)
par: Xie, Jingjing, et autres
Publié: (2024)
Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers
par: Zhu, Jingyuan, et autres
Publié: (2026)
par: Zhu, Jingyuan, et autres
Publié: (2026)
CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning
par: Tang, Zhijiang, et autres
Publié: (2026)
par: Tang, Zhijiang, et autres
Publié: (2026)
Detecting and Mitigating Hallucination in Large Vision Language Models via Fine-Grained AI Feedback
par: Xiao, Wenyi, et autres
Publié: (2024)
par: Xiao, Wenyi, et autres
Publié: (2024)
HydraPrompt: An Adaptive and Asymmetric Framework of Vision-Language Models for Synthetic Image Detection
par: Shi, Senyuan, et autres
Publié: (2026)
par: Shi, Senyuan, et autres
Publié: (2026)
Integrated Structural Prompt Learning for Vision-Language Models
par: Wang, Jiahui, et autres
Publié: (2025)
par: Wang, Jiahui, et autres
Publié: (2025)
Documents similaires
-
Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO
par: Tong, Yunze, et autres
Publié: (2026) -
DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding
par: Zhang, Peng, et autres
Publié: (2026) -
PatchDPO: Patch-level DPO for Finetuning-free Personalized Image Generation
par: Huang, Qihan, et autres
Publié: (2024) -
Boosting MLLM Reasoning with Text-Debiased Hint-GRPO
par: Huang, Qihan, et autres
Publié: (2025) -
MARS: Mixture of Auto-Regressive Models for Fine-grained Text-to-image Synthesis
par: He, Wanggui, et autres
Publié: (2024)