PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Jinlong, He, Wanggui, Zhang, Peng, Liu, Mushui, Jiang, Hao, Huang, Pipei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO
por: Tong, Yunze, et al.
Publicado: (2026)
por: Tong, Yunze, et al.
Publicado: (2026)
DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding
por: Zhang, Peng, et al.
Publicado: (2026)
por: Zhang, Peng, et al.
Publicado: (2026)
PatchDPO: Patch-level DPO for Finetuning-free Personalized Image Generation
por: Huang, Qihan, et al.
Publicado: (2024)
por: Huang, Qihan, et al.
Publicado: (2024)
Boosting MLLM Reasoning with Text-Debiased Hint-GRPO
por: Huang, Qihan, et al.
Publicado: (2025)
por: Huang, Qihan, et al.
Publicado: (2025)
MARS: Mixture of Auto-Regressive Models for Fine-grained Text-to-image Synthesis
por: He, Wanggui, et al.
Publicado: (2024)
por: He, Wanggui, et al.
Publicado: (2024)
DCoAR: Deep Concept Injection into Unified Autoregressive Models for Personalized Text-to-Image Generation
por: Wu, Fangtai, et al.
Publicado: (2025)
por: Wu, Fangtai, et al.
Publicado: (2025)
Towards Enhanced Image Generation Via Multi-modal Chain of Thought in Unified Generative Models
por: Wang, Yi, et al.
Publicado: (2025)
por: Wang, Yi, et al.
Publicado: (2025)
Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation
por: Yang, Hongji, et al.
Publicado: (2025)
por: Yang, Hongji, et al.
Publicado: (2025)
CMMCoT: Enhancing Complex Multi-Image Comprehension via Multi-Modal Chain-of-Thought and Memory Augmentation
por: Zhang, Guanghao, et al.
Publicado: (2025)
por: Zhang, Guanghao, et al.
Publicado: (2025)
MS-Diffusion: Multi-subject Zero-shot Image Personalization with Layout Guidance
por: Wang, Xierui, et al.
Publicado: (2024)
por: Wang, Xierui, et al.
Publicado: (2024)
Unified Prompt Attack Against Text-to-Image Generation Models
por: Peng, Duo, et al.
Publicado: (2025)
por: Peng, Duo, et al.
Publicado: (2025)
Denoising as Path Planning: Training-Free Acceleration of Diffusion Models with DPCache
por: Cui, Bowen, et al.
Publicado: (2026)
por: Cui, Bowen, et al.
Publicado: (2026)
Debiased Prompt Tuning in Vision-Language Model without Annotations
por: Jiang, Chaoquan, et al.
Publicado: (2025)
por: Jiang, Chaoquan, et al.
Publicado: (2025)
Hierarchical Cross-modal Prompt Learning for Vision-Language Models
por: Zheng, Hao, et al.
Publicado: (2025)
por: Zheng, Hao, et al.
Publicado: (2025)
Tuning-Free Image Customization with Image and Text Guidance
por: Li, Pengzhi, et al.
Publicado: (2024)
por: Li, Pengzhi, et al.
Publicado: (2024)
VLM-CPL: Consensus Pseudo Labels from Vision-Language Models for Annotation-Free Pathological Image Classification
por: Zhong, Lanfeng, et al.
Publicado: (2024)
por: Zhong, Lanfeng, et al.
Publicado: (2024)
Hybrid Mask Generation for Infrared Small Target Detection with Single-Point Supervision
por: He, Weijie, et al.
Publicado: (2024)
por: He, Weijie, et al.
Publicado: (2024)
Resolving Multi-Condition Confusion for Finetuning-Free Personalized Image Generation
por: Huang, Qihan, et al.
Publicado: (2024)
por: Huang, Qihan, et al.
Publicado: (2024)
DyST-XL: Dynamic Layout Planning and Content Control for Compositional Text-to-Video Generation
por: He, Weijie, et al.
Publicado: (2025)
por: He, Weijie, et al.
Publicado: (2025)
Dual Prompt Learning for Adapting Vision-Language Models to Downstream Image-Text Retrieval
por: Wang, Yifan, et al.
Publicado: (2025)
por: Wang, Yifan, et al.
Publicado: (2025)
Understanding Reward Hacking in Text-to-Image Reinforcement Learning
por: Hong, Yunqi, et al.
Publicado: (2026)
por: Hong, Yunqi, et al.
Publicado: (2026)
OmniCLIP: Adapting CLIP for Video Recognition with Spatial-Temporal Omni-Scale Feature Learning
por: Liu, Mushui, et al.
Publicado: (2024)
por: Liu, Mushui, et al.
Publicado: (2024)
Fully Fine-tuned CLIP Models are Efficient Few-Shot Learners
por: Liu, Mushui, et al.
Publicado: (2024)
por: Liu, Mushui, et al.
Publicado: (2024)
Learning to Prompt with Text Only Supervision for Vision-Language Models
por: Khattak, Muhammad Uzair, et al.
Publicado: (2024)
por: Khattak, Muhammad Uzair, et al.
Publicado: (2024)
Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models
por: Han, Yuhang, et al.
Publicado: (2026)
por: Han, Yuhang, et al.
Publicado: (2026)
The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation
por: Mao, Weijia, et al.
Publicado: (2025)
por: Mao, Weijia, et al.
Publicado: (2025)
T2I-FactualBench: Benchmarking the Factuality of Text-to-Image Models with Knowledge-Intensive Concepts
por: Huang, Ziwei, et al.
Publicado: (2024)
por: Huang, Ziwei, et al.
Publicado: (2024)
Annotation-Free Curb Detection Leveraging Altitude Difference Image
por: Ma, Fulong, et al.
Publicado: (2024)
por: Ma, Fulong, et al.
Publicado: (2024)
Envisioning Class Entity Reasoning by Large Language Models for Few-shot Learning
por: Liu, Mushui, et al.
Publicado: (2024)
por: Liu, Mushui, et al.
Publicado: (2024)
Deep Reward Supervisions for Tuning Text-to-Image Diffusion Models
por: Wu, Xiaoshi, et al.
Publicado: (2024)
por: Wu, Xiaoshi, et al.
Publicado: (2024)
EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model
por: Zhang, Yuxuan, et al.
Publicado: (2024)
por: Zhang, Yuxuan, et al.
Publicado: (2024)
Prompt-Softbox-Prompt: A Free-Text Embedding Control for Image Editing
por: Yang, Yitong, et al.
Publicado: (2024)
por: Yang, Yitong, et al.
Publicado: (2024)
Vision-Language Models as Differentiable Semantic and Spatial Rewards for Text-to-3D Generation
por: Bai, Weimin, et al.
Publicado: (2025)
por: Bai, Weimin, et al.
Publicado: (2025)
Reinforcement Learning with Inverse Rewards for World Model Post-training
por: Ye, Yang, et al.
Publicado: (2025)
por: Ye, Yang, et al.
Publicado: (2025)
TextRefiner: Internal Visual Feature as Efficient Refiner for Vision-Language Models Prompt Tuning
por: Xie, Jingjing, et al.
Publicado: (2024)
por: Xie, Jingjing, et al.
Publicado: (2024)
Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers
por: Zhu, Jingyuan, et al.
Publicado: (2026)
por: Zhu, Jingyuan, et al.
Publicado: (2026)
CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning
por: Tang, Zhijiang, et al.
Publicado: (2026)
por: Tang, Zhijiang, et al.
Publicado: (2026)
Detecting and Mitigating Hallucination in Large Vision Language Models via Fine-Grained AI Feedback
por: Xiao, Wenyi, et al.
Publicado: (2024)
por: Xiao, Wenyi, et al.
Publicado: (2024)
HydraPrompt: An Adaptive and Asymmetric Framework of Vision-Language Models for Synthetic Image Detection
por: Shi, Senyuan, et al.
Publicado: (2026)
por: Shi, Senyuan, et al.
Publicado: (2026)
Integrated Structural Prompt Learning for Vision-Language Models
por: Wang, Jiahui, et al.
Publicado: (2025)
por: Wang, Jiahui, et al.
Publicado: (2025)
Ejemplares similares
-
Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO
por: Tong, Yunze, et al.
Publicado: (2026) -
DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding
por: Zhang, Peng, et al.
Publicado: (2026) -
PatchDPO: Patch-level DPO for Finetuning-free Personalized Image Generation
por: Huang, Qihan, et al.
Publicado: (2024) -
Boosting MLLM Reasoning with Text-Debiased Hint-GRPO
por: Huang, Qihan, et al.
Publicado: (2025) -
MARS: Mixture of Auto-Regressive Models for Fine-grained Text-to-image Synthesis
por: He, Wanggui, et al.
Publicado: (2024)