ARES: Alternating Reinforcement Learning and Supervised Fine-Tuning for Enhanced Multi-Modal Chain-of-Thought Reasoning Through Diverse AI Feedback
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Byun, Ju-Seung, Chun, Jiyun, Kil, Jihyung, Perrault, Andrew |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Symmetric Reinforcement Learning Loss for Robust Learning on Diverse Tasks and Model Scales
von: Byun, Ju-Seung, et al.
Veröffentlicht: (2024)
von: Byun, Ju-Seung, et al.
Veröffentlicht: (2024)
Fine-Tuning Text-to-Speech Diffusion Models Using Reinforcement Learning with Human Feedback
von: Chen, Jingyi, et al.
Veröffentlicht: (2025)
von: Chen, Jingyi, et al.
Veröffentlicht: (2025)
Normality-Guided Distributional Reinforcement Learning for Continuous Control
von: Byun, Ju-Seung, et al.
Veröffentlicht: (2022)
von: Byun, Ju-Seung, et al.
Veröffentlicht: (2022)
DLPO: Diffusion Model Loss-Guided Reinforcement Learning for Fine-Tuning Text-to-Speech Diffusion Models
von: Chen, Jingyi, et al.
Veröffentlicht: (2024)
von: Chen, Jingyi, et al.
Veröffentlicht: (2024)
History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM
von: Kiruluta, Andrew, et al.
Veröffentlicht: (2025)
von: Kiruluta, Andrew, et al.
Veröffentlicht: (2025)
II-MMR: Identifying and Improving Multi-modal Multi-hop Reasoning in Visual Question Answering
von: Kil, Jihyung, et al.
Veröffentlicht: (2024)
von: Kil, Jihyung, et al.
Veröffentlicht: (2024)
On the Impact of Fine-Tuning on Chain-of-Thought Reasoning
von: Lobo, Elita, et al.
Veröffentlicht: (2024)
von: Lobo, Elita, et al.
Veröffentlicht: (2024)
On the Role of Reasoning Patterns in the Generalization Discrepancy of Long Chain-of-Thought Supervised Fine-Tuning
von: Li, Zhaoyi, et al.
Veröffentlicht: (2026)
von: Li, Zhaoyi, et al.
Veröffentlicht: (2026)
Beyond Length: Context-Aware Expansion and Independence as Developmentally Sensitive Evaluation in Child Utterances
von: Chun, Jiyun, et al.
Veröffentlicht: (2026)
von: Chun, Jiyun, et al.
Veröffentlicht: (2026)
Fine-Tuned Thoughts: Leveraging Chain-of-Thought Reasoning for Industrial Asset Health Monitoring
von: Lin, Shuxin, et al.
Veröffentlicht: (2025)
von: Lin, Shuxin, et al.
Veröffentlicht: (2025)
Long-Short Chain-of-Thought Mixture Supervised Fine-Tuning Eliciting Efficient Reasoning in Large Language Models
von: Yu, Bin, et al.
Veröffentlicht: (2025)
von: Yu, Bin, et al.
Veröffentlicht: (2025)
Long-Context Reasoning Through Proxy-Based Chain-of-Thought Tuning
von: Li, Miao, et al.
Veröffentlicht: (2026)
von: Li, Miao, et al.
Veröffentlicht: (2026)
CARFT: Boosting LLM Reasoning via Contrastive Learning with Annotated Chain-of-Thought-based Reinforced Fine-Tuning
von: Zhu, Wenqiao, et al.
Veröffentlicht: (2025)
von: Zhu, Wenqiao, et al.
Veröffentlicht: (2025)
Enhancing Chain-of-Thought Reasoning with Critical Representation Fine-tuning
von: Huang, Chenxi, et al.
Veröffentlicht: (2025)
von: Huang, Chenxi, et al.
Veröffentlicht: (2025)
Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
von: Wang, Yibin, et al.
Veröffentlicht: (2025)
von: Wang, Yibin, et al.
Veröffentlicht: (2025)
Beyond Fine-Tuning: In-Context Learning and Chain-of-Thought for Reasoned Distractor Generation
von: Alhazmi, Elaf, et al.
Veröffentlicht: (2026)
von: Alhazmi, Elaf, et al.
Veröffentlicht: (2026)
Refining Input Guardrails: Enhancing LLM-as-a-Judge Efficiency Through Chain-of-Thought Fine-Tuning and Alignment
von: Rad, Melissa Kazemi, et al.
Veröffentlicht: (2025)
von: Rad, Melissa Kazemi, et al.
Veröffentlicht: (2025)
Chart-R1: Chain-of-Thought Supervision and Reinforcement for Advanced Chart Reasoner
von: Chen, Lei, et al.
Veröffentlicht: (2025)
von: Chen, Lei, et al.
Veröffentlicht: (2025)
Do Audio LLMs Really LISTEN, or Just Transcribe? Measuring Lexical vs. Acoustic Emotion Cues Reliance
von: Chen, Jingyi, et al.
Veröffentlicht: (2025)
von: Chen, Jingyi, et al.
Veröffentlicht: (2025)
Optimizing Resource-Constrained Non-Pharmaceutical Interventions for Multi-Cluster Outbreak Control Using Hierarchical Reinforcement Learning
von: Peng, Xueqiao, et al.
Veröffentlicht: (2026)
von: Peng, Xueqiao, et al.
Veröffentlicht: (2026)
Enhancing LLMs' Reasoning-Intensive Multimedia Search Capabilities through Fine-Tuning and Reinforcement Learning
von: Li, Jinzheng, et al.
Veröffentlicht: (2025)
von: Li, Jinzheng, et al.
Veröffentlicht: (2025)
ThinkDrive: Chain-of-Thought Guided Progressive Reinforcement Learning Fine-Tuning for Autonomous Driving
von: Zhao, Chang, et al.
Veröffentlicht: (2026)
von: Zhao, Chang, et al.
Veröffentlicht: (2026)
Unlocking Multi-Spectral Data for Multi-Modal Models with Guided Inputs and Chain-of-Thought Reasoning
von: Kim, Dahun, et al.
Veröffentlicht: (2026)
von: Kim, Dahun, et al.
Veröffentlicht: (2026)
Imitation Game for Adversarial Disillusion with Chain-of-Thought Reasoning in Generative AI
von: Chang, Ching-Chun, et al.
Veröffentlicht: (2025)
von: Chang, Ching-Chun, et al.
Veröffentlicht: (2025)
Supervised Chain of Thought
von: Zhang, Xiang, et al.
Veröffentlicht: (2024)
von: Zhang, Xiang, et al.
Veröffentlicht: (2024)
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
Fine-Tuning on Diverse Reasoning Chains Drives Within-Inference CoT Refinement in LLMs
von: Puerto, Haritz, et al.
Veröffentlicht: (2024)
von: Puerto, Haritz, et al.
Veröffentlicht: (2024)
Teaching AI to Handle Exceptions: Supervised Fine-Tuning with Human-Aligned Judgment
von: DiSorbo, Matthew DosSantos, et al.
Veröffentlicht: (2025)
von: DiSorbo, Matthew DosSantos, et al.
Veröffentlicht: (2025)
Learning Modal-Mixed Chain-of-Thought Reasoning with Latent Embeddings
von: Shao, Yifei, et al.
Veröffentlicht: (2026)
von: Shao, Yifei, et al.
Veröffentlicht: (2026)
TrackRec: Iterative Alternating Feedback with Chain-of-Thought via Preference Alignment for Recommendation
von: Xia, Yu, et al.
Veröffentlicht: (2025)
von: Xia, Yu, et al.
Veröffentlicht: (2025)
GRE Suite: Geo-localization Inference via Fine-Tuned Vision-Language Models and Enhanced Reasoning Chains
von: Wang, Chun, et al.
Veröffentlicht: (2025)
von: Wang, Chun, et al.
Veröffentlicht: (2025)
Long-Document QA with Chain-of-Structured-Thought and Fine-Tuned SLMs
von: Liang, Zhuowen, et al.
Veröffentlicht: (2026)
von: Liang, Zhuowen, et al.
Veröffentlicht: (2026)
ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning
von: Li, Xiaoyuan, et al.
Veröffentlicht: (2026)
von: Li, Xiaoyuan, et al.
Veröffentlicht: (2026)
Reinforcing Chain-of-Thought Reasoning with Self-Evolving Rubrics
von: Sheng, Leheng, et al.
Veröffentlicht: (2026)
von: Sheng, Leheng, et al.
Veröffentlicht: (2026)
Supervised Fine-Tuning as Inverse Reinforcement Learning
von: Sun, Hao
Veröffentlicht: (2024)
von: Sun, Hao
Veröffentlicht: (2024)
UFT: Unifying Supervised and Reinforcement Fine-Tuning
von: Liu, Mingyang, et al.
Veröffentlicht: (2025)
von: Liu, Mingyang, et al.
Veröffentlicht: (2025)
On-Policy Supervised Fine-Tuning for Efficient Reasoning
von: Zhao, Anhao, et al.
Veröffentlicht: (2026)
von: Zhao, Anhao, et al.
Veröffentlicht: (2026)
Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models
von: Xu, Qinwu, et al.
Veröffentlicht: (2026)
von: Xu, Qinwu, et al.
Veröffentlicht: (2026)
Resource-Efficient Fine-Tuning of LLaMA-3.2-3B for Medical Chain-of-Thought Reasoning
von: Mansha, Imran
Veröffentlicht: (2025)
von: Mansha, Imran
Veröffentlicht: (2025)
Robotic Fire Risk Detection based on Dynamic Knowledge Graph Reasoning: An LLM-Driven Approach with Graph Chain-of-Thought
von: Pan, Haimei, et al.
Veröffentlicht: (2025)
von: Pan, Haimei, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Symmetric Reinforcement Learning Loss for Robust Learning on Diverse Tasks and Model Scales
von: Byun, Ju-Seung, et al.
Veröffentlicht: (2024) -
Fine-Tuning Text-to-Speech Diffusion Models Using Reinforcement Learning with Human Feedback
von: Chen, Jingyi, et al.
Veröffentlicht: (2025) -
Normality-Guided Distributional Reinforcement Learning for Continuous Control
von: Byun, Ju-Seung, et al.
Veröffentlicht: (2022) -
DLPO: Diffusion Model Loss-Guided Reinforcement Learning for Fine-Tuning Text-to-Speech Diffusion Models
von: Chen, Jingyi, et al.
Veröffentlicht: (2024) -
History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM
von: Kiruluta, Andrew, et al.
Veröffentlicht: (2025)