Answer-Consistent Chain-of-thought Reinforcement Learning For Multi-modal Large Langauge Models

Fuente: arXiv
Saved in:
Bibliographic Details
Main Authors: Huang, Minbin, Huang, Runhui, Zheng, Chuanyang, Li, Jingyao, Chen, Guoxuan, Shi, Han, Cheng, Hong
Format: Preprint
Published: 2025
Subjects:
Online Access:
Tags: Add Tag
No Tags, Be the first to tag this record!