RJUA-QA: A Comprehensive QA Dataset for Urology
Fuente:
arXiv
Saved in:
| Main Authors: | Lyu, Shiwei, Chi, Chenfei, Cai, Hongbo, Shi, Lei, Yang, Xiaoyan, Liu, Lei, Chen, Xiang, Zhao, Deng, Zhang, Zhiqiang, Lyu, Xianguo, Zhang, Ming, Li, Fangzhou, Ma, Xiaowei, Shen, Yue, Gu, Jinjie, Xue, Wei, Huang, Yiran |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Towards Automatic Evaluation for LLMs' Clinical Capabilities: Metric, Data, and Algorithm
by: Liu, Lei, et al.
Published: (2024)
by: Liu, Lei, et al.
Published: (2024)
RJUA-MedDQA: A Multimodal Benchmark for Medical Document Question Answering and Clinical Reasoning
by: Jin, Congyun, et al.
Published: (2024)
by: Jin, Congyun, et al.
Published: (2024)
AirQA: A Comprehensive QA Dataset for AI Research with Instance-Level Evaluation
by: Huang, Tiancheng, et al.
Published: (2025)
by: Huang, Tiancheng, et al.
Published: (2025)
AgriQA Dataset
by: Eldem, Ayşe
Published: (2026)
by: Eldem, Ayşe
Published: (2026)
P-RAG: Prompt-Enhanced Parametric RAG with LoRA and Selective CoT for Biomedical and Multi-Hop QA
by: Lyu, Xingda, et al.
Published: (2026)
by: Lyu, Xingda, et al.
Published: (2026)
FunQA: Towards Surprising Video Comprehension
by: Xie, Binzhu, et al.
Published: (2023)
by: Xie, Binzhu, et al.
Published: (2023)
ArabicaQA: A Comprehensive Dataset for Arabic Question Answering
by: Abdallah, Abdelrahman, et al.
Published: (2024)
by: Abdallah, Abdelrahman, et al.
Published: (2024)
BioGraphletQA: Knowledge-Anchored Generation of Complex QA Datasets
by: Jonker, Richard A. A., et al.
Published: (2026)
by: Jonker, Richard A. A., et al.
Published: (2026)
Data-Driven Function Calling Improvements in Large Language Model for Online Financial QA
by: Tang, Xing, et al.
Published: (2026)
by: Tang, Xing, et al.
Published: (2026)
ITFormer: Bridging Time Series and Natural Language for Multi-Modal QA with Large-Scale Multitask Dataset
by: Wang, Yilin, et al.
Published: (2025)
by: Wang, Yilin, et al.
Published: (2025)
MoleculeQA: A Dataset to Evaluate Factual Accuracy in Molecular Comprehension
by: Lu, Xingyu, et al.
Published: (2024)
by: Lu, Xingyu, et al.
Published: (2024)
KnowAgent: Knowledge-Augmented Planning for LLM-Based Agents
by: Zhu, Yuqi, et al.
Published: (2024)
by: Zhu, Yuqi, et al.
Published: (2024)
JBE-QA: Japanese Bar Exam QA Dataset for Assessing Legal Domain Knowledge
by: Cao, Zhihan, et al.
Published: (2025)
by: Cao, Zhihan, et al.
Published: (2025)
HumMusQA: A Human-written Music Understanding QA Benchmark Dataset
by: Weck, Benno, et al.
Published: (2026)
by: Weck, Benno, et al.
Published: (2026)
SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding
by: Cai, Songcheng, et al.
Published: (2026)
by: Cai, Songcheng, et al.
Published: (2026)
LinkQA: Synthesizing Diverse QA from Multiple Seeds Strongly Linked by Knowledge Points
by: Zhang, Xuemiao, et al.
Published: (2025)
by: Zhang, Xuemiao, et al.
Published: (2025)
ClinAlign: Scaling Healthcare Alignment from Clinician Preference
by: Lyu, Shiwei, et al.
Published: (2026)
by: Lyu, Shiwei, et al.
Published: (2026)
ViQA-COVID: COVID-19 Machine Reading Comprehension Dataset for Vietnamese
by: Nguyen-Phung, Hai-Chung, et al.
Published: (2025)
by: Nguyen-Phung, Hai-Chung, et al.
Published: (2025)
QA-LIGN: Aligning LLMs through Constitutionally Decomposed QA
by: Dineen, Jacob, et al.
Published: (2025)
by: Dineen, Jacob, et al.
Published: (2025)
Syn-QA2: Evaluating False Assumptions in Long-tail Questions with Synthetic QA Datasets
by: Daswani, Ashwin, et al.
Published: (2024)
by: Daswani, Ashwin, et al.
Published: (2024)
VoQA: Visual-only Question Answering
by: An, Jianing, et al.
Published: (2025)
by: An, Jianing, et al.
Published: (2025)
Semantic Reformulation Entropy for Robust Hallucination Detection in QA Tasks
by: Tong, Chaodong, et al.
Published: (2025)
by: Tong, Chaodong, et al.
Published: (2025)
SimpleDevQA: Benchmarking Large Language Models on Development Knowledge QA
by: Zhang, Jing, et al.
Published: (2025)
by: Zhang, Jing, et al.
Published: (2025)
PolQA: Polish Question Answering Dataset
by: Rybak, Piotr, et al.
Published: (2022)
by: Rybak, Piotr, et al.
Published: (2022)
KET-QA: A Dataset for Knowledge Enhanced Table Question Answering
by: Hu, Mengkang, et al.
Published: (2024)
by: Hu, Mengkang, et al.
Published: (2024)
VlogQA: Task, Dataset, and Baseline Models for Vietnamese Spoken-Based Machine Reading Comprehension
by: Ngo, Thinh Phuoc, et al.
Published: (2024)
by: Ngo, Thinh Phuoc, et al.
Published: (2024)
SustainableQA: A Comprehensive Question Answering Dataset for Corporate Sustainability and EU Taxonomy Reporting
by: Ali, Mohammed, et al.
Published: (2025)
by: Ali, Mohammed, et al.
Published: (2025)
DeQA-Doc: Adapting DeQA-Score to Document Image Quality Assessment
by: Gao, Junjie, et al.
Published: (2025)
by: Gao, Junjie, et al.
Published: (2025)
PRIV-QA: Privacy-Preserving Question Answering for Cloud Large Language Models
by: Li, Guangwei, et al.
Published: (2025)
by: Li, Guangwei, et al.
Published: (2025)
ASTRA-QA: A Benchmark for Abstract Question Answering over Documents
by: Wang, Shu, et al.
Published: (2026)
by: Wang, Shu, et al.
Published: (2026)
FoQA: A Faroese Question-Answering Dataset
by: Simonsen, Annika, et al.
Published: (2025)
by: Simonsen, Annika, et al.
Published: (2025)
ReasonTabQA: A Comprehensive Benchmark for Table Question Answering from Real World Industrial Scenarios
by: Pan, Changzai, et al.
Published: (2026)
by: Pan, Changzai, et al.
Published: (2026)
Liver Fibrosis Quantification and Analysis: The LiQA Dataset and Baseline Method
by: Liu, Yuanye, et al.
Published: (2025)
by: Liu, Yuanye, et al.
Published: (2025)
SEC-QA: A Systematic Evaluation Corpus for Financial QA
by: Lai, Viet Dac, et al.
Published: (2024)
by: Lai, Viet Dac, et al.
Published: (2024)
ChatQA: Surpassing GPT-4 on Conversational QA and RAG
by: Liu, Zihan, et al.
Published: (2024)
by: Liu, Zihan, et al.
Published: (2024)
Wrong Answers Can Also Be Useful: PlausibleQA -- A Large-Scale QA Dataset with Answer Plausibility Scores
by: Mozafari, Jamshid, et al.
Published: (2025)
by: Mozafari, Jamshid, et al.
Published: (2025)
MedSpeak: A Knowledge Graph-Aided ASR Error Correction Framework for Spoken Medical QA
by: Song, Yutong, et al.
Published: (2026)
by: Song, Yutong, et al.
Published: (2026)
RadarQA: Multi-modal Quality Analysis of Weather Radar Forecasts
by: He, Xuming, et al.
Published: (2025)
by: He, Xuming, et al.
Published: (2025)
TCMD: A Traditional Chinese Medicine QA Dataset for Evaluating Large Language Models
by: Yu, Ping, et al.
Published: (2024)
by: Yu, Ping, et al.
Published: (2024)
LongCite: Enabling LLMs to Generate Fine-grained Citations in Long-context QA
by: Zhang, Jiajie, et al.
Published: (2024)
by: Zhang, Jiajie, et al.
Published: (2024)
Similar Items
-
Towards Automatic Evaluation for LLMs' Clinical Capabilities: Metric, Data, and Algorithm
by: Liu, Lei, et al.
Published: (2024) -
RJUA-MedDQA: A Multimodal Benchmark for Medical Document Question Answering and Clinical Reasoning
by: Jin, Congyun, et al.
Published: (2024) -
AirQA: A Comprehensive QA Dataset for AI Research with Instance-Level Evaluation
by: Huang, Tiancheng, et al.
Published: (2025) -
AgriQA Dataset
by: Eldem, Ayşe
Published: (2026) -
P-RAG: Prompt-Enhanced Parametric RAG with LoRA and Selective CoT for Biomedical and Multi-Hop QA
by: Lyu, Xingda, et al.
Published: (2026)