Reference-based Metrics Disprove Themselves in Question Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nguyen, Bang, Yu, Mengxia, Huang, Yun, Jiang, Meng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
QG-SMS: Enhancing Test Item Analysis via Student Modeling and Simulation
par: Nguyen, Bang, et autres
Publié: (2025)
par: Nguyen, Bang, et autres
Publié: (2025)
Rephrase and Respond: Let Large Language Models Ask Better Questions for Themselves
par: Deng, Yihe, et autres
Publié: (2023)
par: Deng, Yihe, et autres
Publié: (2023)
Context Selection and Rewriting for Video-based Educational Question Generation
par: Yu, Mengxia, et autres
Publié: (2025)
par: Yu, Mengxia, et autres
Publié: (2025)
When Models Examine Themselves: Vocabulary-Activation Correspondence in Self-Referential Processing
par: Dadfar, Zachary Pedram
Publié: (2026)
par: Dadfar, Zachary Pedram
Publié: (2026)
Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking
par: Zelikman, Eric, et autres
Publié: (2024)
par: Zelikman, Eric, et autres
Publié: (2024)
QOG:Question and Options Generation based on Language Model
par: Zhou, Jincheng
Publié: (2024)
par: Zhou, Jincheng
Publié: (2024)
Can Large Language Models Still Explain Themselves? Investigating the Impact of Quantization on Self-Explanations
par: Wang, Qianli, et autres
Publié: (2026)
par: Wang, Qianli, et autres
Publié: (2026)
Graph-based Uncertainty Metrics for Long-form Language Model Outputs
par: Jiang, Mingjian, et autres
Publié: (2024)
par: Jiang, Mingjian, et autres
Publié: (2024)
Synthetic Multimodal Question Generation
par: Wu, Ian, et autres
Publié: (2024)
par: Wu, Ian, et autres
Publié: (2024)
Clinically Grounded Agent-based Report Evaluation: An Interpretable Metric for Radiology Report Generation
par: Dua, Radhika, et autres
Publié: (2025)
par: Dua, Radhika, et autres
Publié: (2025)
Beyond Independent Passages: Adaptive Passage Combination Retrieval for Retrieval Augmented Open-Domain Question Answering
par: Ko, Ting-Wen, et autres
Publié: (2025)
par: Ko, Ting-Wen, et autres
Publié: (2025)
Towards Verifiable Text Generation with Symbolic References
par: Hennigen, Lucas Torroba, et autres
Publié: (2023)
par: Hennigen, Lucas Torroba, et autres
Publié: (2023)
Rhetorical Questions in LLM Representations: A Linear Probing Study
par: Yao, Louie Hong, et autres
Publié: (2026)
par: Yao, Louie Hong, et autres
Publié: (2026)
RadioRAG: Online Retrieval-augmented Generation for Radiology Question Answering
par: Arasteh, Soroosh Tayebi, et autres
Publié: (2024)
par: Arasteh, Soroosh Tayebi, et autres
Publié: (2024)
Machine Unlearning in Generative AI: A Survey
par: Liu, Zheyuan, et autres
Publié: (2024)
par: Liu, Zheyuan, et autres
Publié: (2024)
$C^2$: Scalable Auto-Feedback for LLM-based Chart Generation
par: Koh, Woosung, et autres
Publié: (2024)
par: Koh, Woosung, et autres
Publié: (2024)
Beyond LLM-as-a-Judge: Deterministic Metrics for Multilingual Generative Text Evaluation
par: Alam, Firoj, et autres
Publié: (2026)
par: Alam, Firoj, et autres
Publié: (2026)
Is Conformal Factuality for RAG-based LLMs Robust? Novel Metrics and Systematic Insights
par: Chen, Yi, et autres
Publié: (2026)
par: Chen, Yi, et autres
Publié: (2026)
An Examination of the Robustness of Reference-Free Image Captioning Evaluation Metrics
par: Ahmadi, Saba, et autres
Publié: (2023)
par: Ahmadi, Saba, et autres
Publié: (2023)
Explicit Diversity Conditions for Effective Question Answer Generation with Large Language Models
par: Yadav, Vikas, et autres
Publié: (2024)
par: Yadav, Vikas, et autres
Publié: (2024)
Generating Plausible Distractors for Multiple-Choice Questions via Student Choice Prediction
par: Lee, Yooseop, et autres
Publié: (2025)
par: Lee, Yooseop, et autres
Publié: (2025)
The Challenge of Achieving Attributability in Multilingual Table-to-Text Generation with Question-Answer Blueprints
par: Haussmann, Aden
Publié: (2025)
par: Haussmann, Aden
Publié: (2025)
Evaluating Evaluation Metrics -- The Mirage of Hallucination Detection
par: Kulkarni, Atharva, et autres
Publié: (2025)
par: Kulkarni, Atharva, et autres
Publié: (2025)
Towards Enriched Controllability for Educational Question Generation
par: Leite, Bernardo, et autres
Publié: (2023)
par: Leite, Bernardo, et autres
Publié: (2023)
A Dataset for Evaluating LLM-based Evaluation Functions for Research Question Extraction Task
par: Fujisaki, Yuya, et autres
Publié: (2024)
par: Fujisaki, Yuya, et autres
Publié: (2024)
ReALM: Reference Resolution As Language Modeling
par: Moniz, Joel Ruben Antony, et autres
Publié: (2024)
par: Moniz, Joel Ruben Antony, et autres
Publié: (2024)
TopBench: A Benchmark for Implicit Prediction and Reasoning over Tabular Question Answering
par: Ji, An-Yang, et autres
Publié: (2026)
par: Ji, An-Yang, et autres
Publié: (2026)
Large Language Models in Fire Engineering: An Examination of Technical Questions Against Domain Knowledge
par: Hostetter, Haley, et autres
Publié: (2024)
par: Hostetter, Haley, et autres
Publié: (2024)
MeDiSumQA: Patient-Oriented Question-Answer Generation from Discharge Letters
par: Dada, Amin, et autres
Publié: (2025)
par: Dada, Amin, et autres
Publié: (2025)
Listen to the Context: Towards Faithful Large Language Models for Retrieval Augmented Generation on Climate Questions
par: Thulke, David, et autres
Publié: (2025)
par: Thulke, David, et autres
Publié: (2025)
On the Shelf Life of Fine-Tuned LLM-Judges: Future-Proofing, Backward-Compatibility, and Question Generalization
par: Singh, Janvijay, et autres
Publié: (2025)
par: Singh, Janvijay, et autres
Publié: (2025)
MetaMetrics-MT: Tuning Meta-Metrics for Machine Translation via Human Preference Calibration
par: Anugraha, David, et autres
Publié: (2024)
par: Anugraha, David, et autres
Publié: (2024)
Multi-hop Question Answering under Temporal Knowledge Editing
par: Cheng, Keyuan, et autres
Publié: (2024)
par: Cheng, Keyuan, et autres
Publié: (2024)
Deep Learning Approaches for Improving Question Answering Systems in Hepatocellular Carcinoma Research
par: Huo, Shuning, et autres
Publié: (2024)
par: Huo, Shuning, et autres
Publié: (2024)
When Answers Stray from Questions: Hallucination Detection via Question-Answer Orthogonal Decomposition
par: Yao, Siyang, et autres
Publié: (2026)
par: Yao, Siyang, et autres
Publié: (2026)
AutoLibra: Agent Metric Induction from Open-Ended Human Feedback
par: Zhu, Hao, et autres
Publié: (2025)
par: Zhu, Hao, et autres
Publié: (2025)
QuIM-RAG: Advancing Retrieval-Augmented Generation with Inverted Question Matching for Enhanced QA Performance
par: Saha, Binita, et autres
Publié: (2025)
par: Saha, Binita, et autres
Publié: (2025)
Transformer Circuit Faithfulness Metrics are not Robust
par: Miller, Joseph, et autres
Publié: (2024)
par: Miller, Joseph, et autres
Publié: (2024)
To be Continuous, or to be Discrete, Those are Bits of Questions
par: Wang, Yiran, et autres
Publié: (2024)
par: Wang, Yiran, et autres
Publié: (2024)
Generating Multiple-Choice Knowledge Questions with Interpretable Difficulty Estimation using Knowledge Graphs and Large Language Models
par: Şakiroğlu, Mehmet Can, et autres
Publié: (2026)
par: Şakiroğlu, Mehmet Can, et autres
Publié: (2026)
Documents similaires
-
QG-SMS: Enhancing Test Item Analysis via Student Modeling and Simulation
par: Nguyen, Bang, et autres
Publié: (2025) -
Rephrase and Respond: Let Large Language Models Ask Better Questions for Themselves
par: Deng, Yihe, et autres
Publié: (2023) -
Context Selection and Rewriting for Video-based Educational Question Generation
par: Yu, Mengxia, et autres
Publié: (2025) -
When Models Examine Themselves: Vocabulary-Activation Correspondence in Self-Referential Processing
par: Dadfar, Zachary Pedram
Publié: (2026) -
Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking
par: Zelikman, Eric, et autres
Publié: (2024)