Self-Correcting Large Language Models: Generation vs. Multiple Choice
Fuente:
arXiv
Salvato in:
| Autori principali: | Rahmani, Hossein A., Krishna, Satyapriya, Wang, Xi, Naghiaei, Mohammadmehdi, Yilmaz, Emine |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Personalized Framework for Consumer and Producer Group Fairness Optimization in Recommender Systems
di: Rahmani, Hossein A., et al.
Pubblicazione: (2024)
di: Rahmani, Hossein A., et al.
Pubblicazione: (2024)
Understanding the Role of User Profile in the Personalization of Large Language Models
di: Wu, Bin, et al.
Pubblicazione: (2024)
di: Wu, Bin, et al.
Pubblicazione: (2024)
Beyond Output Critique: Self-Correction via Task Distillation
di: Rahmani, Hossein A., et al.
Pubblicazione: (2026)
di: Rahmani, Hossein A., et al.
Pubblicazione: (2026)
Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems
di: Chen, Yinzhu, et al.
Pubblicazione: (2026)
di: Chen, Yinzhu, et al.
Pubblicazione: (2026)
Clarifying the Path to User Satisfaction: An Investigation into Clarification Usefulness
di: Rahmani, Hossein A., et al.
Pubblicazione: (2024)
di: Rahmani, Hossein A., et al.
Pubblicazione: (2024)
PREF: Reference-Free Evaluation of Personalised Text Generation in LLMs
di: Fu, Xiao, et al.
Pubblicazione: (2025)
di: Fu, Xiao, et al.
Pubblicazione: (2025)
Multiple-Choice Question Generation Using Large Language Models: Methodology and Educator Insights
di: Biancini, Giorgio, et al.
Pubblicazione: (2025)
di: Biancini, Giorgio, et al.
Pubblicazione: (2025)
More RLHF, More Trust? On The Impact of Preference Alignment On Trustworthiness
di: Li, Aaron J., et al.
Pubblicazione: (2024)
di: Li, Aaron J., et al.
Pubblicazione: (2024)
MCQG-SRefine: Multiple Choice Question Generation and Evaluation with Iterative Self-Critique, Correction, and Comparison Feedback
di: Yao, Zonghai, et al.
Pubblicazione: (2024)
di: Yao, Zonghai, et al.
Pubblicazione: (2024)
Multiple Choice Questions: Reasoning Makes Large Language Models (LLMs) More Self-Confident, Especially When They are Wrong
di: Fu, Tairan, et al.
Pubblicazione: (2025)
di: Fu, Tairan, et al.
Pubblicazione: (2025)
Balancing Rigor and Utility: Mitigating Cognitive Biases in Large Language Models for Multiple-Choice Questions
di: Zhong, Hanyang, et al.
Pubblicazione: (2024)
di: Zhong, Hanyang, et al.
Pubblicazione: (2024)
Cognitively Diverse Multiple-Choice Question Generation: A Hybrid Multi-Agent Framework with Large Language Models
di: Tian, Yu, et al.
Pubblicazione: (2026)
di: Tian, Yu, et al.
Pubblicazione: (2026)
Incorporating Error Level Noise Embedding for Improving LLM-Assisted Robustness in Persian Speech Recognition
di: Rahmani, Zahra, et al.
Pubblicazione: (2025)
di: Rahmani, Zahra, et al.
Pubblicazione: (2025)
Boosting Process-Correct CoT Reasoning by Modeling Solvability of Multiple-Choice QA
di: Schumann, Raphael, et al.
Pubblicazione: (2025)
di: Schumann, Raphael, et al.
Pubblicazione: (2025)
Overview of the TREC 2023 deep learning track
di: Craswell, Nick, et al.
Pubblicazione: (2025)
di: Craswell, Nick, et al.
Pubblicazione: (2025)
Exploring Iterative Enhancement for Improving Learnersourced Multiple-Choice Question Explanations with Large Language Models
di: Bao, Qiming, et al.
Pubblicazione: (2023)
di: Bao, Qiming, et al.
Pubblicazione: (2023)
RECALL-MM: A Multimodal Dataset of Consumer Product Recalls for Risk Analysis using Computational Methods and Large Language Models
di: Bolanos, Diana, et al.
Pubblicazione: (2025)
di: Bolanos, Diana, et al.
Pubblicazione: (2025)
Beyond Multiple Choice: Verifiable OpenQA for Robust Vision-Language RFT
di: Liu, Yesheng, et al.
Pubblicazione: (2025)
di: Liu, Yesheng, et al.
Pubblicazione: (2025)
In-Context Explainers: Harnessing LLMs for Explaining Black Box Models
di: Kroeger, Nicholas, et al.
Pubblicazione: (2023)
di: Kroeger, Nicholas, et al.
Pubblicazione: (2023)
Attributing Response to Context: A Jensen-Shannon Divergence Driven Mechanistic Study of Context Attribution in Retrieval-Augmented Generation
di: Li, Ruizhe, et al.
Pubblicazione: (2025)
di: Li, Ruizhe, et al.
Pubblicazione: (2025)
DesignQA: A Multimodal Benchmark for Evaluating Large Language Models' Understanding of Engineering Documentation
di: Doris, Anna C., et al.
Pubblicazione: (2024)
di: Doris, Anna C., et al.
Pubblicazione: (2024)
Large Language Models Cannot Self-Correct Reasoning Yet
di: Huang, Jie, et al.
Pubblicazione: (2023)
di: Huang, Jie, et al.
Pubblicazione: (2023)
Large Language Models have Intrinsic Self-Correction Ability
di: Liu, Dancheng, et al.
Pubblicazione: (2024)
di: Liu, Dancheng, et al.
Pubblicazione: (2024)
A Study on Large Language Models' Limitations in Multiple-Choice Question Answering
di: Khatun, Aisha, et al.
Pubblicazione: (2024)
di: Khatun, Aisha, et al.
Pubblicazione: (2024)
Differentiating Choices via Commonality for Multiple-Choice Question Answering
di: Deng, Wenqing, et al.
Pubblicazione: (2024)
di: Deng, Wenqing, et al.
Pubblicazione: (2024)
Generating Multiple-Choice Knowledge Questions with Interpretable Difficulty Estimation using Knowledge Graphs and Large Language Models
di: Şakiroğlu, Mehmet Can, et al.
Pubblicazione: (2026)
di: Şakiroğlu, Mehmet Can, et al.
Pubblicazione: (2026)
Learning to Check: Unleashing Potentials for Self-Correction in Large Language Models
di: Zhang, Che, et al.
Pubblicazione: (2024)
di: Zhang, Che, et al.
Pubblicazione: (2024)
MegaChat: A Synthetic Persian Q&A Dataset for High-Quality Sales Chatbot Evaluation
di: Rahmani, Mahdi, et al.
Pubblicazione: (2025)
di: Rahmani, Mahdi, et al.
Pubblicazione: (2025)
CyberCorrect: A Cybernetic Framework for Closed-Loop Self-Correction in Large Language Models
di: Wu, Yuning, et al.
Pubblicazione: (2026)
di: Wu, Yuning, et al.
Pubblicazione: (2026)
Quantifying Label-Induced Bias in Large Language Model Self- and Cross-Evaluations
di: Saraf, Muskan, et al.
Pubblicazione: (2025)
di: Saraf, Muskan, et al.
Pubblicazione: (2025)
Intent-Aware Self-Correction for Mitigating Social Biases in Large Language Models
di: Anantaprayoon, Panatchakorn, et al.
Pubblicazione: (2025)
di: Anantaprayoon, Panatchakorn, et al.
Pubblicazione: (2025)
Confidence Matters: Revisiting Intrinsic Self-Correction Capabilities of Large Language Models
di: Li, Loka, et al.
Pubblicazione: (2024)
di: Li, Loka, et al.
Pubblicazione: (2024)
CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
Skewed Memorization in Large Language Models: Quantification and Decomposition
di: Li, Hao, et al.
Pubblicazione: (2025)
di: Li, Hao, et al.
Pubblicazione: (2025)
Look at the Text: Instruction-Tuned Language Models are More Robust Multiple Choice Selectors than You Think
di: Wang, Xinpeng, et al.
Pubblicazione: (2024)
di: Wang, Xinpeng, et al.
Pubblicazione: (2024)
Answer Matching Outperforms Multiple Choice for Language Model Evaluation
di: Chandak, Nikhil, et al.
Pubblicazione: (2025)
di: Chandak, Nikhil, et al.
Pubblicazione: (2025)
Multiple Choice Learning of Low-Rank Adapters for Language Modeling
di: Letzelter, Victor, et al.
Pubblicazione: (2025)
di: Letzelter, Victor, et al.
Pubblicazione: (2025)
Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models
di: Tsui, Ken
Pubblicazione: (2025)
di: Tsui, Ken
Pubblicazione: (2025)
Large Language Models for Multi-Choice Question Classification of Medical Subjects
di: Ponce-López, Víctor
Pubblicazione: (2024)
di: Ponce-López, Víctor
Pubblicazione: (2024)
Embedding Self-Correction as an Inherent Ability in Large Language Models for Enhanced Mathematical Reasoning
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
di: Gao, Kuofeng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A Personalized Framework for Consumer and Producer Group Fairness Optimization in Recommender Systems
di: Rahmani, Hossein A., et al.
Pubblicazione: (2024) -
Understanding the Role of User Profile in the Personalization of Large Language Models
di: Wu, Bin, et al.
Pubblicazione: (2024) -
Beyond Output Critique: Self-Correction via Task Distillation
di: Rahmani, Hossein A., et al.
Pubblicazione: (2026) -
Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems
di: Chen, Yinzhu, et al.
Pubblicazione: (2026) -
Clarifying the Path to User Satisfaction: An Investigation into Clarification Usefulness
di: Rahmani, Hossein A., et al.
Pubblicazione: (2024)