RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization
Fuente:
arXiv
Saved in:
| Main Authors: | Bao, Qiming, Leinonen, Juho, Denny, Paul, Witbrock, Michael J. |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Exploring Iterative Enhancement for Improving Learnersourced Multiple-Choice Question Explanations with Large Language Models
by: Bao, Qiming, et al.
Published: (2023)
by: Bao, Qiming, et al.
Published: (2023)
Conflict-Aware Fusion: Mitigating Logic Inertia in Large Language Models via Structured Cognitive Priors
by: Bao, Qiming, et al.
Published: (2025)
by: Bao, Qiming, et al.
Published: (2025)
Assessing and Enhancing the Robustness of Large Language Models with Task Structure Variations for Logical Reasoning
by: Bao, Qiming, et al.
Published: (2023)
by: Bao, Qiming, et al.
Published: (2023)
Abstract Meaning Representation-Based Logic-Driven Data Augmentation for Logical Reasoning
by: Bao, Qiming, et al.
Published: (2023)
by: Bao, Qiming, et al.
Published: (2023)
Open Source Language Models Can Provide Feedback: Evaluating LLMs' Ability to Help Students Using GPT-4-As-A-Judge
by: Koutcheme, Charles, et al.
Published: (2024)
by: Koutcheme, Charles, et al.
Published: (2024)
Using Large Language Models to Enhance Programming Error Messages
by: Leinonen, Juho, et al.
Published: (2022)
by: Leinonen, Juho, et al.
Published: (2022)
"Like a Nesting Doll": Analyzing Recursion Analogies Generated by CS Students using Large Language Models
by: Bernstein, Seth, et al.
Published: (2024)
by: Bernstein, Seth, et al.
Published: (2024)
Teaching Language Models How to Code Like Learners: Conversational Serialization for Student Simulation
by: Koutcheme, Charles, et al.
Published: (2026)
by: Koutcheme, Charles, et al.
Published: (2026)
Using Large Language Models for the Interpretation of Building Regulations
by: Fuchs, Stefan, et al.
Published: (2024)
by: Fuchs, Stefan, et al.
Published: (2024)
Comparing Code Explanations Created by Students and Large Language Models
by: Leinonen, Juho, et al.
Published: (2023)
by: Leinonen, Juho, et al.
Published: (2023)
Benchmarking Educational Program Repair
by: Koutcheme, Charles, et al.
Published: (2024)
by: Koutcheme, Charles, et al.
Published: (2024)
Synthetic Students: A Comparative Study of Bug Distribution Between Large Language Models and Computing Students
by: MacNeil, Stephen, et al.
Published: (2024)
by: MacNeil, Stephen, et al.
Published: (2024)
Knowledge Editing in Language Models via Adapted Direct Preference Optimization
by: Rozner, Amit, et al.
Published: (2024)
by: Rozner, Amit, et al.
Published: (2024)
Fine Tuning Large Language Models for Medicine: The Role and Importance of Direct Preference Optimization
by: Savage, Thomas, et al.
Published: (2024)
by: Savage, Thomas, et al.
Published: (2024)
Preference Packing: Efficient Preference Optimization for Large Language Models
by: Cho, Jaekyung
Published: (2026)
by: Cho, Jaekyung
Published: (2026)
Fairness or Fluency? An Investigation into Language Bias of Pairwise LLM-as-a-Judge
by: Zhou, Xiaolin, et al.
Published: (2026)
by: Zhou, Xiaolin, et al.
Published: (2026)
Multi-Step Deductive Reasoning Over Natural Language: An Empirical Study on Out-of-Distribution Generalisation
by: Bao, Qiming, et al.
Published: (2022)
by: Bao, Qiming, et al.
Published: (2022)
Large Language Models as Common-Sense Heuristics
by: Borro, Andrey, et al.
Published: (2025)
by: Borro, Andrey, et al.
Published: (2025)
Large Language Models as Optimizers
by: Yang, Chengrun, et al.
Published: (2023)
by: Yang, Chengrun, et al.
Published: (2023)
Weights-Rotated Preference Optimization for Large Language Models
by: Yang, Chenxu, et al.
Published: (2025)
by: Yang, Chenxu, et al.
Published: (2025)
Evaluating Language Models for Generating and Judging Programming Feedback
by: Koutcheme, Charles, et al.
Published: (2024)
by: Koutcheme, Charles, et al.
Published: (2024)
AI-Generated Slides: Are They Good? Can Students Tell?
by: Leinonen, Juho, et al.
Published: (2026)
by: Leinonen, Juho, et al.
Published: (2026)
CoRA: Optimizing Low-Rank Adaptation with Common Subspace of Large Language Models
by: Xiao, Xiaojun, et al.
Published: (2024)
by: Xiao, Xiaojun, et al.
Published: (2024)
Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models
by: Zhang, Wenxuan, et al.
Published: (2024)
by: Zhang, Wenxuan, et al.
Published: (2024)
On the Opportunities of Large Language Models for Programming Process Data
by: Edwards, John, et al.
Published: (2024)
by: Edwards, John, et al.
Published: (2024)
Aligning with Logic: Measuring, Evaluating and Improving Logical Preference Consistency in Large Language Models
by: Liu, Yinhong, et al.
Published: (2024)
by: Liu, Yinhong, et al.
Published: (2024)
Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences
by: Rosset, Corby, et al.
Published: (2024)
by: Rosset, Corby, et al.
Published: (2024)
Model Fusion through Bayesian Optimization in Language Model Fine-Tuning
by: Jang, Chaeyun, et al.
Published: (2024)
by: Jang, Chaeyun, et al.
Published: (2024)
Mitigating Hallucination in Multimodal Large Language Model via Hallucination-targeted Direct Preference Optimization
by: Fu, Yuhan, et al.
Published: (2024)
by: Fu, Yuhan, et al.
Published: (2024)
Premise Order Matters in Reasoning with Large Language Models
by: Chen, Xinyun, et al.
Published: (2024)
by: Chen, Xinyun, et al.
Published: (2024)
ChatLogic: Integrating Logic Programming with Large Language Models for Multi-Step Reasoning
by: Wang, Zhongsheng, et al.
Published: (2024)
by: Wang, Zhongsheng, et al.
Published: (2024)
Effectively Steer LLM To Follow Preference via Building Confident Directions
by: Song, Bingqing, et al.
Published: (2025)
by: Song, Bingqing, et al.
Published: (2025)
RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models
by: Khaki, Saeed, et al.
Published: (2024)
by: Khaki, Saeed, et al.
Published: (2024)
Large Language Models Are Not Strong Abstract Reasoners
by: Gendron, Gaël, et al.
Published: (2023)
by: Gendron, Gaël, et al.
Published: (2023)
Token-level Direct Preference Optimization
by: Zeng, Yongcheng, et al.
Published: (2024)
by: Zeng, Yongcheng, et al.
Published: (2024)
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
by: Rafailov, Rafael, et al.
Published: (2023)
by: Rafailov, Rafael, et al.
Published: (2023)
ROPO: Robust Preference Optimization for Large Language Models
by: Liang, Xize, et al.
Published: (2024)
by: Liang, Xize, et al.
Published: (2024)
Accelerated Preference Optimization for Large Language Model Alignment
by: He, Jiafan, et al.
Published: (2024)
by: He, Jiafan, et al.
Published: (2024)
Think$^{2}$: Grounded Metacognitive Reasoning in Large Language Models
by: Elenjical, Abraham Paul, et al.
Published: (2026)
by: Elenjical, Abraham Paul, et al.
Published: (2026)
Towards Safety and Helpfulness Balanced Responses via Controllable Large Language Models
by: Tuan, Yi-Lin, et al.
Published: (2024)
by: Tuan, Yi-Lin, et al.
Published: (2024)
Similar Items
-
Exploring Iterative Enhancement for Improving Learnersourced Multiple-Choice Question Explanations with Large Language Models
by: Bao, Qiming, et al.
Published: (2023) -
Conflict-Aware Fusion: Mitigating Logic Inertia in Large Language Models via Structured Cognitive Priors
by: Bao, Qiming, et al.
Published: (2025) -
Assessing and Enhancing the Robustness of Large Language Models with Task Structure Variations for Logical Reasoning
by: Bao, Qiming, et al.
Published: (2023) -
Abstract Meaning Representation-Based Logic-Driven Data Augmentation for Logical Reasoning
by: Bao, Qiming, et al.
Published: (2023) -
Open Source Language Models Can Provide Feedback: Evaluating LLMs' Ability to Help Students Using GPT-4-As-A-Judge
by: Koutcheme, Charles, et al.
Published: (2024)