Enregistré dans:
| Auteurs principaux: | Imamura, Kenji, Ideuchi, Masao, Fujita, Atsushi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2605.29340 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CADEL: A Corpus of Administrative Web Documents for Japanese Entity Linking
par: Higashiyama, Shohei, et autres
Publié: (2026)
par: Higashiyama, Shohei, et autres
Publié: (2026)
ATD-Trans: A Geographically Grounded Japanese-English Travelogue Translation Dataset
par: Higashiyama, Shohei, et autres
Publié: (2026)
par: Higashiyama, Shohei, et autres
Publié: (2026)
AnswerCarefully: A Dataset for Improving the Safety of Japanese LLM Output
par: Suzuki, Hisami, et autres
Publié: (2025)
par: Suzuki, Hisami, et autres
Publié: (2025)
Evaluating and Calibrating LLM Confidence on Questions with Multiple Correct Answers
par: Wang, Yuhan, et autres
Publié: (2026)
par: Wang, Yuhan, et autres
Publié: (2026)
MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks
par: Veuthey, Jaime Raldua, et autres
Publié: (2025)
par: Veuthey, Jaime Raldua, et autres
Publié: (2025)
Focusing on Students, not Machines: Grounded Question Generation and Automated Answer Grading
par: Meyer, Gérôme, et autres
Publié: (2025)
par: Meyer, Gérôme, et autres
Publié: (2025)
Language-free Experience at Expo 2025 Osaka
par: Paul, Michael, et autres
Publié: (2026)
par: Paul, Michael, et autres
Publié: (2026)
BPQA Dataset: Evaluating How Well Language Models Leverage Blood Pressures to Answer Biomedical Questions
par: Hang, Chi, et autres
Publié: (2025)
par: Hang, Chi, et autres
Publié: (2025)
Right Answer, Wrong Score: Uncovering the Inconsistencies of LLM Evaluation in Multiple-Choice Question Answering
par: Molfese, Francesco Maria, et autres
Publié: (2025)
par: Molfese, Francesco Maria, et autres
Publié: (2025)
A Dataset of Open-Domain Question Answering with Multiple-Span Answers
par: Luo, Zhiyi, et autres
Publié: (2024)
par: Luo, Zhiyi, et autres
Publié: (2024)
No Answer Needed: Predicting LLM Answer Accuracy from Question-Only Linear Probes
par: Cencerrado, Iván Vicente Moreno, et autres
Publié: (2025)
par: Cencerrado, Iván Vicente Moreno, et autres
Publié: (2025)
Reverse Question Answering: Can an LLM Write a Question so Hard (or Bad) that it Can't Answer?
par: Balepur, Nishant, et autres
Publié: (2024)
par: Balepur, Nishant, et autres
Publié: (2024)
From Answers to Questions: EQGBench for Evaluating LLMs' Educational Question Generation
par: Zhou, Chengliang, et autres
Publié: (2025)
par: Zhou, Chengliang, et autres
Publié: (2025)
Can LLMs Grade Short-Answer Reading Comprehension Questions : An Empirical Study with a Novel Dataset
par: Henkel, Owen, et autres
Publié: (2023)
par: Henkel, Owen, et autres
Publié: (2023)
EduAdapt: A Question Answer Benchmark Dataset for Evaluating Grade-Level Adaptability in LLMs
par: Naeem, Numaan, et autres
Publié: (2025)
par: Naeem, Numaan, et autres
Publié: (2025)
The Uneven Impact of Post-Training Quantization in Machine Translation
par: Marie, Benjamin, et autres
Publié: (2025)
par: Marie, Benjamin, et autres
Publié: (2025)
MiRAGE: A Multiagent Framework for Generating Multimodal Multihop Question-Answer Dataset for RAG Evaluation
par: Sahu, Chandan Kumar, et autres
Publié: (2026)
par: Sahu, Chandan Kumar, et autres
Publié: (2026)
Consensus or Conflict? Fine-Grained Evaluation of Conflicting Answers in Question-Answering
par: Nachshoni, Eviatar, et autres
Publié: (2025)
par: Nachshoni, Eviatar, et autres
Publié: (2025)
Polyglots or Multitudes? Multilingual LLM Answers to Value-laden Multiple-Choice Questions
par: Labat, Léo, et autres
Publié: (2026)
par: Labat, Léo, et autres
Publié: (2026)
Evaluating Answer Reranking Strategies in Time-sensitive Question Answering
par: Kardan, Mehmet, et autres
Publié: (2025)
par: Kardan, Mehmet, et autres
Publié: (2025)
DEEPAMBIGQA: Ambiguous Multi-hop Questions for Benchmarking LLM Answer Completeness
par: Ji, Jiabao, et autres
Publié: (2025)
par: Ji, Jiabao, et autres
Publié: (2025)
Data-efficient Meta-models for Evaluation of Context-based Questions and Answers in LLMs
par: Belikova, Julia, et autres
Publié: (2025)
par: Belikova, Julia, et autres
Publié: (2025)
Automatic Feedback Generation for Short Answer Questions using Answer Diagnostic Graphs
par: Furuhashi, Momoka, et autres
Publié: (2025)
par: Furuhashi, Momoka, et autres
Publié: (2025)
Evaluation Methodology for Large Language Models for Multilingual Document Question and Answer
par: Kahana, Adar, et autres
Publié: (2024)
par: Kahana, Adar, et autres
Publié: (2024)
QGen Studio: An Adaptive Question-Answer Generation, Training and Evaluation Platform
par: Moses, Movina, et autres
Publié: (2025)
par: Moses, Movina, et autres
Publié: (2025)
Integrated Framework for LLM Evaluation with Answer Generation
par: Lee, Sujeong, et autres
Publié: (2025)
par: Lee, Sujeong, et autres
Publié: (2025)
Automatic Question & Answer Generation Using Generative Large Language Model (LLM)
par: Ehsan, Md. Alvee, et autres
Publié: (2025)
par: Ehsan, Md. Alvee, et autres
Publié: (2025)
Knowledge-Augmented Question Error Correction for Chinese Question Answer System with QuestionRAG
par: Qiu, Longpeng, et autres
Publié: (2025)
par: Qiu, Longpeng, et autres
Publié: (2025)
LLMs Provide Unstable Answers to Legal Questions
par: Blair-Stanek, Andrew, et autres
Publié: (2025)
par: Blair-Stanek, Andrew, et autres
Publié: (2025)
Rehearsing Answers to Probable Questions with Perspective-Taking
par: Shih, Yung-Yu, et autres
Publié: (2024)
par: Shih, Yung-Yu, et autres
Publié: (2024)
Narrowing the Knowledge Evaluation Gap: Open-Domain Question Answering with Multi-Granularity Answers
par: Yona, Gal, et autres
Publié: (2024)
par: Yona, Gal, et autres
Publié: (2024)
A Dataset for Evaluating LLM-based Evaluation Functions for Research Question Extraction Task
par: Fujisaki, Yuya, et autres
Publié: (2024)
par: Fujisaki, Yuya, et autres
Publié: (2024)
When Answers Stray from Questions: Hallucination Detection via Question-Answer Orthogonal Decomposition
par: Yao, Siyang, et autres
Publié: (2026)
par: Yao, Siyang, et autres
Publié: (2026)
Comparative Analysis of 47 Context-Based Question Answer Models Across 8 Diverse Datasets
par: Muneeb, Muhammad, et autres
Publié: (2025)
par: Muneeb, Muhammad, et autres
Publié: (2025)
TARAZ: Persian Short-Answer Question Benchmark for Cultural Evaluation of Language Models
par: Iranmanesh, Reihaneh, et autres
Publié: (2026)
par: Iranmanesh, Reihaneh, et autres
Publié: (2026)
Answer, Assemble, Ace: Understanding How LMs Answer Multiple Choice Questions
par: Wiegreffe, Sarah, et autres
Publié: (2024)
par: Wiegreffe, Sarah, et autres
Publié: (2024)
Decomposed Prompting to Answer Questions on a Course Discussion Board
par: Jaipersaud, Brandon, et autres
Publié: (2024)
par: Jaipersaud, Brandon, et autres
Publié: (2024)
Controllable Decontextualization of Yes/No Question and Answers into Factual Statements
par: Mo, Lingbo, et autres
Publié: (2024)
par: Mo, Lingbo, et autres
Publié: (2024)
Automatic Question-Answer Generation for Long-Tail Knowledge
par: Kumar, Rohan, et autres
Publié: (2024)
par: Kumar, Rohan, et autres
Publié: (2024)
CFMatch: Aligning Automated Answer Equivalence Evaluation with Expert Judgments For Open-Domain Question Answering
par: Li, Zongxia, et autres
Publié: (2024)
par: Li, Zongxia, et autres
Publié: (2024)
Documents similaires
-
CADEL: A Corpus of Administrative Web Documents for Japanese Entity Linking
par: Higashiyama, Shohei, et autres
Publié: (2026) -
ATD-Trans: A Geographically Grounded Japanese-English Travelogue Translation Dataset
par: Higashiyama, Shohei, et autres
Publié: (2026) -
AnswerCarefully: A Dataset for Improving the Safety of Japanese LLM Output
par: Suzuki, Hisami, et autres
Publié: (2025) -
Evaluating and Calibrating LLM Confidence on Questions with Multiple Correct Answers
par: Wang, Yuhan, et autres
Publié: (2026) -
MEQA: A Meta-Evaluation Framework for Question & Answer LLM Benchmarks
par: Veuthey, Jaime Raldua, et autres
Publié: (2025)