CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning
Fuente:
arXiv
Saved in:
| Main Authors: | Tang, Zhijiang, Wang, Linhua, Qi, Jiaxin, Jiang, Weihao, Hou, Peng, Zeng, Anxiang, Huang, Jianqiang |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Long-CODE: Isolating Pure Long-Context as an Orthogonal Dimension in Video Evaluation
by: Tang, Zhijiang, et al.
Published: (2026)
by: Tang, Zhijiang, et al.
Published: (2026)
SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning
by: Zhang, Lin, et al.
Published: (2025)
by: Zhang, Lin, et al.
Published: (2025)
Transformer-empowered Multi-modal Item Embedding for Enhanced Image Search in E-Commerce
by: Liu, Chang, et al.
Published: (2023)
by: Liu, Chang, et al.
Published: (2023)
Scaling Test-Time Robustness of Vision-Language Models via Self-Critical Inference Framework
by: Tang, Kaihua, et al.
Published: (2026)
by: Tang, Kaihua, et al.
Published: (2026)
OwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward
by: Zhong, Chunlin, et al.
Published: (2025)
by: Zhong, Chunlin, et al.
Published: (2025)
Spatial Transcriptomics as Images for Large-Scale Pretraining
by: Zhu, Yishun, et al.
Published: (2026)
by: Zhu, Yishun, et al.
Published: (2026)
The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation
by: Mao, Weijia, et al.
Published: (2025)
by: Mao, Weijia, et al.
Published: (2025)
Dual-Stream Collaborative Transformer for Image Captioning
by: Wan, Jun, et al.
Published: (2026)
by: Wan, Jun, et al.
Published: (2026)
Two Causal Principles for Improving Visual Dialog
by: Qi, Jiaxin, et al.
Published: (2019)
by: Qi, Jiaxin, et al.
Published: (2019)
VLRM: Vision-Language Models act as Reward Models for Image Captioning
by: Dzabraev, Maksim, et al.
Published: (2024)
by: Dzabraev, Maksim, et al.
Published: (2024)
Fluent and Accurate Image Captioning with a Self-Trained Reward Model
by: Moratelli, Nicholas, et al.
Published: (2024)
by: Moratelli, Nicholas, et al.
Published: (2024)
PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning
by: Liu, Jinlong, et al.
Published: (2026)
by: Liu, Jinlong, et al.
Published: (2026)
OmniDiff: A Comprehensive Benchmark for Fine-grained Image Difference Captioning
by: Liu, Yuan, et al.
Published: (2025)
by: Liu, Yuan, et al.
Published: (2025)
Distinctive Image Captioning: Leveraging Ground Truth Captions in CLIP Guided Reinforcement Learning
by: Chaffin, Antoine, et al.
Published: (2024)
by: Chaffin, Antoine, et al.
Published: (2024)
Defect Image Sample Generation With Diffusion Prior for Steel Surface Defect Recognition
by: Tai, Yichun, et al.
Published: (2024)
by: Tai, Yichun, et al.
Published: (2024)
EIFNet: Leveraging Event-Image Fusion for Robust Semantic Segmentation
by: Li, Zhijiang, et al.
Published: (2025)
by: Li, Zhijiang, et al.
Published: (2025)
Understanding Reward Hacking in Text-to-Image Reinforcement Learning
by: Hong, Yunqi, et al.
Published: (2026)
by: Hong, Yunqi, et al.
Published: (2026)
Towards On-Policy SFT: Distribution Discriminant Theory and its Applications in LLM Training
by: Zhang, Miaosen, et al.
Published: (2026)
by: Zhang, Miaosen, et al.
Published: (2026)
Painting with Words: Elevating Detailed Image Captioning with Benchmark and Alignment Learning
by: Ye, Qinghao, et al.
Published: (2025)
by: Ye, Qinghao, et al.
Published: (2025)
Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning
by: Deria, Ankan, et al.
Published: (2025)
by: Deria, Ankan, et al.
Published: (2025)
Incentivizing Generative Zero-Shot Learning via Outcome-Reward Reinforcement Learning with Visual Cues
by: Hou, Wenjin, et al.
Published: (2026)
by: Hou, Wenjin, et al.
Published: (2026)
ECCV Caption: Correcting False Negatives by Collecting Machine-and-Human-verified Image-Caption Associations for MS-COCO
by: Chun, Sanghyuk, et al.
Published: (2022)
by: Chun, Sanghyuk, et al.
Published: (2022)
ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation
by: Peng, Cihang, et al.
Published: (2025)
by: Peng, Cihang, et al.
Published: (2025)
Video2Reward: Generating Reward Function from Videos for Legged Robot Behavior Learning
by: Zeng, Runhao, et al.
Published: (2024)
by: Zeng, Runhao, et al.
Published: (2024)
DualCap: Enhancing Lightweight Image Captioning via Dual Retrieval with Similar Scenes Visual Prompts
by: Li, Binbin, et al.
Published: (2025)
by: Li, Binbin, et al.
Published: (2025)
DMF-Net: Image-Guided Point Cloud Completion with Dual-Channel Modality Fusion and Shape-Aware Upsampling Transformer
by: Mao, Aihua, et al.
Published: (2024)
by: Mao, Aihua, et al.
Published: (2024)
RubiCap: Rubric-Guided Reinforcement Learning for Dense Image Captioning
by: Huang, Tzu-Heng, et al.
Published: (2026)
by: Huang, Tzu-Heng, et al.
Published: (2026)
Self-Paced Learning for Images of Antinuclear Antibodies
by: Jiang, Yiyang, et al.
Published: (2025)
by: Jiang, Yiyang, et al.
Published: (2025)
Unbiased Scene Graph Generation from Biased Training
by: Tang, Kaihua, et al.
Published: (2020)
by: Tang, Kaihua, et al.
Published: (2020)
DefFiller: Mask-Conditioned Diffusion for Salient Steel Surface Defect Generation
by: Tai, Yichun, et al.
Published: (2024)
by: Tai, Yichun, et al.
Published: (2024)
Enhancing Image Caption Generation Using Reinforcement Learning with Human Feedback
by: L, Adarsh N, et al.
Published: (2024)
by: L, Adarsh N, et al.
Published: (2024)
Reinforcement Learning with Inverse Rewards for World Model Post-training
by: Ye, Yang, et al.
Published: (2025)
by: Ye, Yang, et al.
Published: (2025)
Jigsaw++: Imagining Complete Shape Priors for Object Reassembly
by: Lu, Jiaxin, et al.
Published: (2024)
by: Lu, Jiaxin, et al.
Published: (2024)
Reinforcement Learning with Robust Rubric Rewards
by: Yu, Ya-Qi, et al.
Published: (2026)
by: Yu, Ya-Qi, et al.
Published: (2026)
CaptionQA: Is Your Caption as Useful as the Image Itself?
by: Yang, Shijia, et al.
Published: (2025)
by: Yang, Shijia, et al.
Published: (2025)
A Benchmark for Multi-Lingual Vision-Language Learning in Remote Sensing Image Captioning
by: Zhou, Qing, et al.
Published: (2025)
by: Zhou, Qing, et al.
Published: (2025)
Aesthetic Image Captioning with Saliency Enhanced MLLMs
by: Tao, Yilin, et al.
Published: (2025)
by: Tao, Yilin, et al.
Published: (2025)
Spotlight and Shadow: Attention-Guided Dual-Anchor Introspective Decoding for MLLM Hallucination Mitigation
by: Wu, Yebo, et al.
Published: (2026)
by: Wu, Yebo, et al.
Published: (2026)
Multi-Perspective Subimage CLIP with Keyword Guidance for Remote Sensing Image-Text Retrieval
by: Li, Yifan, et al.
Published: (2026)
by: Li, Yifan, et al.
Published: (2026)
HICEScore: A Hierarchical Metric for Image Captioning Evaluation
by: Zeng, Zequn, et al.
Published: (2024)
by: Zeng, Zequn, et al.
Published: (2024)
Similar Items
-
Long-CODE: Isolating Pure Long-Context as an Orthogonal Dimension in Video Evaluation
by: Tang, Zhijiang, et al.
Published: (2026) -
SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning
by: Zhang, Lin, et al.
Published: (2025) -
Transformer-empowered Multi-modal Item Embedding for Enhanced Image Search in E-Commerce
by: Liu, Chang, et al.
Published: (2023) -
Scaling Test-Time Robustness of Vision-Language Models via Self-Critical Inference Framework
by: Tang, Kaihua, et al.
Published: (2026) -
OwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward
by: Zhong, Chunlin, et al.
Published: (2025)