Guardado en:
| Autores principales: | Kahana, Adar, Mathew, Jaya Susan, Bleik, Said, Reynolds, Jeremy, Elisha, Oren |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2402.01065 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Emotions Where Art Thou: Understanding and Characterizing the Emotional Latent Space of Large Language Models
por: Reichman, Benjamin, et al.
Publicado: (2025)
por: Reichman, Benjamin, et al.
Publicado: (2025)
Automatic Question & Answer Generation Using Generative Large Language Model (LLM)
por: Ehsan, Md. Alvee, et al.
Publicado: (2025)
por: Ehsan, Md. Alvee, et al.
Publicado: (2025)
Multilingual Medical Reasoning for Question Answering with Large Language Models
por: Ferrazzi, Pietro, et al.
Publicado: (2025)
por: Ferrazzi, Pietro, et al.
Publicado: (2025)
Evaluating Monolingual and Multilingual Large Language Models for Greek Question Answering: The DemosQA Benchmark
por: Mastrokostas, Charalampos, et al.
Publicado: (2026)
por: Mastrokostas, Charalampos, et al.
Publicado: (2026)
Enhancing Large Language Model Performance To Answer Questions and Extract Information More Accurately
por: Zhang, Liang, et al.
Publicado: (2024)
por: Zhang, Liang, et al.
Publicado: (2024)
From Answers to Questions: EQGBench for Evaluating LLMs' Educational Question Generation
por: Zhou, Chengliang, et al.
Publicado: (2025)
por: Zhou, Chengliang, et al.
Publicado: (2025)
Fine-Tuning or Retrieval? Comparing Knowledge Injection in LLMs
por: Ovadia, Oded, et al.
Publicado: (2023)
por: Ovadia, Oded, et al.
Publicado: (2023)
Explicit Diversity Conditions for Effective Question Answer Generation with Large Language Models
por: Yadav, Vikas, et al.
Publicado: (2024)
por: Yadav, Vikas, et al.
Publicado: (2024)
TimelineKGQA: A Comprehensive Question-Answer Pair Generator for Temporal Knowledge Graphs
por: Sun, Qiang, et al.
Publicado: (2025)
por: Sun, Qiang, et al.
Publicado: (2025)
Multilingual Non-Factoid Question Answering with Answer Paragraph Selection
por: Mishra, Ritwik, et al.
Publicado: (2024)
por: Mishra, Ritwik, et al.
Publicado: (2024)
The Challenge of Achieving Attributability in Multilingual Table-to-Text Generation with Question-Answer Blueprints
por: Haussmann, Aden
Publicado: (2025)
por: Haussmann, Aden
Publicado: (2025)
Can Large Language Models Make the Grade? An Empirical Study Evaluating LLMs Ability to Mark Short Answer Questions in K-12 Education
por: Henkel, Owen, et al.
Publicado: (2024)
por: Henkel, Owen, et al.
Publicado: (2024)
Finding Answers in Thought Matters: Revisiting Evaluation on Large Language Models with Reasoning
por: Jo, Hwiyeol, et al.
Publicado: (2025)
por: Jo, Hwiyeol, et al.
Publicado: (2025)
Multiple-Choice Question Generation Using Large Language Models: Methodology and Educator Insights
por: Biancini, Giorgio, et al.
Publicado: (2025)
por: Biancini, Giorgio, et al.
Publicado: (2025)
Is It Good Data for Multilingual Instruction Tuning or Just Bad Multilingual Evaluation for Large Language Models?
por: Chen, Pinzhen, et al.
Publicado: (2024)
por: Chen, Pinzhen, et al.
Publicado: (2024)
Task-Centric Acceleration of Small-Language Models
por: Tsur, Dor, et al.
Publicado: (2026)
por: Tsur, Dor, et al.
Publicado: (2026)
MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks
por: Veuthey, Jaime Raldua, et al.
Publicado: (2025)
por: Veuthey, Jaime Raldua, et al.
Publicado: (2025)
QGen Studio: An Adaptive Question-Answer Generation, Training and Evaluation Platform
por: Moses, Movina, et al.
Publicado: (2025)
por: Moses, Movina, et al.
Publicado: (2025)
Tourism Question Answer System in Indian Language using Domain-Adapted Foundation Models
por: Gatla, Praveen, et al.
Publicado: (2025)
por: Gatla, Praveen, et al.
Publicado: (2025)
DataAgent: Evaluating Large Language Models' Ability to Answer Zero-Shot, Natural Language Queries
por: Mishra, Manit, et al.
Publicado: (2024)
por: Mishra, Manit, et al.
Publicado: (2024)
Evaluating the Elementary Multilingual Capabilities of Large Language Models with MultiQ
por: Holtermann, Carolin, et al.
Publicado: (2024)
por: Holtermann, Carolin, et al.
Publicado: (2024)
Follow-Up Questions Improve Documents Generated by Large Language Models
por: Tix, Bernadette J
Publicado: (2024)
por: Tix, Bernadette J
Publicado: (2024)
An Empirical Evaluation of Large Language Models on Consumer Health Questions
por: Abrar, Moaiz, et al.
Publicado: (2024)
por: Abrar, Moaiz, et al.
Publicado: (2024)
Multilingual State Space Models for Structured Question Answering in Indic Languages
por: Vats, Arpita, et al.
Publicado: (2025)
por: Vats, Arpita, et al.
Publicado: (2025)
How do you know that? Teaching Generative Language Models to Reference Answers to Biomedical Questions
por: Bašaragin, Bojana, et al.
Publicado: (2024)
por: Bašaragin, Bojana, et al.
Publicado: (2024)
Answer, Assemble, Ace: Understanding How LMs Answer Multiple Choice Questions
por: Wiegreffe, Sarah, et al.
Publicado: (2024)
por: Wiegreffe, Sarah, et al.
Publicado: (2024)
Evaluating Large Language Models for Detecting Antisemitism
por: Patel, Jay, et al.
Publicado: (2025)
por: Patel, Jay, et al.
Publicado: (2025)
Facts Do Care About Your Language: Assessing Answer Quality of Multilingual LLMs
por: Kansal, Yuval, et al.
Publicado: (2025)
por: Kansal, Yuval, et al.
Publicado: (2025)
Not Your Typical Sycophant: The Elusive Nature of Sycophancy in Large Language Models
por: Natan, Shahar Ben, et al.
Publicado: (2026)
por: Natan, Shahar Ben, et al.
Publicado: (2026)
Beyond Questions: Evaluating What Large Language Models (Actually) Know
por: Giordano, Luca, et al.
Publicado: (2026)
por: Giordano, Luca, et al.
Publicado: (2026)
SAS-Bench: A Fine-Grained Benchmark for Evaluating Short Answer Scoring with Large Language Models
por: Lai, Peichao, et al.
Publicado: (2025)
por: Lai, Peichao, et al.
Publicado: (2025)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
por: Xu, Yichen, et al.
Publicado: (2025)
por: Xu, Yichen, et al.
Publicado: (2025)
No Answer Needed: Predicting LLM Answer Accuracy from Question-Only Linear Probes
por: Cencerrado, Iván Vicente Moreno, et al.
Publicado: (2025)
por: Cencerrado, Iván Vicente Moreno, et al.
Publicado: (2025)
The Roles of English in Evaluating Multilingual Language Models
por: Poelman, Wessel, et al.
Publicado: (2024)
por: Poelman, Wessel, et al.
Publicado: (2024)
Evaluating the Limits of Large Language Models in Multilingual Legal Reasoning
por: Ioannou, Antreas, et al.
Publicado: (2025)
por: Ioannou, Antreas, et al.
Publicado: (2025)
Multilingual Collaborative Defense for Large Language Models
por: Li, Hongliang, et al.
Publicado: (2025)
por: Li, Hongliang, et al.
Publicado: (2025)
When Answers Stray from Questions: Hallucination Detection via Question-Answer Orthogonal Decomposition
por: Yao, Siyang, et al.
Publicado: (2026)
por: Yao, Siyang, et al.
Publicado: (2026)
MoZIP: A Multilingual Benchmark to Evaluate Large Language Models in Intellectual Property
por: Ni, Shiwen, et al.
Publicado: (2024)
por: Ni, Shiwen, et al.
Publicado: (2024)
The Heap: A Contamination-Free Multilingual Code Dataset for Evaluating Large Language Models
por: Katzy, Jonathan, et al.
Publicado: (2025)
por: Katzy, Jonathan, et al.
Publicado: (2025)
Hallucination Detection: Robustly Discerning Reliable Answers in Large Language Models
por: Chen, Yuyan, et al.
Publicado: (2024)
por: Chen, Yuyan, et al.
Publicado: (2024)
Ejemplares similares
-
Emotions Where Art Thou: Understanding and Characterizing the Emotional Latent Space of Large Language Models
por: Reichman, Benjamin, et al.
Publicado: (2025) -
Automatic Question & Answer Generation Using Generative Large Language Model (LLM)
por: Ehsan, Md. Alvee, et al.
Publicado: (2025) -
Multilingual Medical Reasoning for Question Answering with Large Language Models
por: Ferrazzi, Pietro, et al.
Publicado: (2025) -
Evaluating Monolingual and Multilingual Large Language Models for Greek Question Answering: The DemosQA Benchmark
por: Mastrokostas, Charalampos, et al.
Publicado: (2026) -
Enhancing Large Language Model Performance To Answer Questions and Extract Information More Accurately
por: Zhang, Liang, et al.
Publicado: (2024)