DebateQA: Evaluating Question Answering on Debatable Knowledge
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Rongwu, Qi, Xuan, Qi, Zehan, Xu, Wei, Guo, Zhijiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Long$^2$RAG: Evaluating Long-Context & Long-Form Retrieval-Augmented Generation with Key Point Recall
di: Qi, Zehan, et al.
Pubblicazione: (2024)
di: Qi, Zehan, et al.
Pubblicazione: (2024)
Knowledge Conflicts for LLMs: A Survey
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
Preemptive Answer "Attacks" on Chain-of-Thought Reasoning
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap
di: Qi, Xuan, et al.
Pubblicazione: (2025)
di: Qi, Xuan, et al.
Pubblicazione: (2025)
RAG-QA Arena: Evaluating Domain Robustness for Long-form Retrieval Augmented Question Answering
di: Han, Rujun, et al.
Pubblicazione: (2024)
di: Han, Rujun, et al.
Pubblicazione: (2024)
Walking in Others' Shoes: How Perspective-Taking Guides Large Language Models in Reducing Toxicity and Bias
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
di: Wang, Yanling, et al.
Pubblicazione: (2025)
di: Wang, Yanling, et al.
Pubblicazione: (2025)
KET-QA: A Dataset for Knowledge Enhanced Table Question Answering
di: Hu, Mengkang, et al.
Pubblicazione: (2024)
di: Hu, Mengkang, et al.
Pubblicazione: (2024)
PASemiQA: Plan-Assisted Agent for Question Answering on Semi-Structured Data with Text and Relational Information
di: Yang, Hansi, et al.
Pubblicazione: (2025)
di: Yang, Hansi, et al.
Pubblicazione: (2025)
Knowledge Dependency Estimation for Reliable Question Answering
di: Tong, Chaodong, et al.
Pubblicazione: (2026)
di: Tong, Chaodong, et al.
Pubblicazione: (2026)
Exploring Chinese Humor Generation: A Study on Two-Part Allegorical Sayings
di: Xu, Rongwu
Pubblicazione: (2024)
di: Xu, Rongwu
Pubblicazione: (2024)
CUS-QA: Local-Knowledge-Oriented Open-Ended Question Answering Dataset
di: Libovický, Jindřich, et al.
Pubblicazione: (2025)
di: Libovický, Jindřich, et al.
Pubblicazione: (2025)
QA-Dragon: Query-Aware Dynamic RAG System for Knowledge-Intensive Visual Question Answering
di: Jiang, Zhuohang, et al.
Pubblicazione: (2025)
di: Jiang, Zhuohang, et al.
Pubblicazione: (2025)
PolQA: Polish Question Answering Dataset
di: Rybak, Piotr, et al.
Pubblicazione: (2022)
di: Rybak, Piotr, et al.
Pubblicazione: (2022)
RetinaQA: A Robust Knowledge Base Question Answering Model for both Answerable and Unanswerable Questions
di: Faldu, Prayushi, et al.
Pubblicazione: (2024)
di: Faldu, Prayushi, et al.
Pubblicazione: (2024)
EffiQA: Efficient Question-Answering with Strategic Multi-Model Collaboration on Knowledge Graphs
di: Dong, Zixuan, et al.
Pubblicazione: (2024)
di: Dong, Zixuan, et al.
Pubblicazione: (2024)
BookAsSumQA: An Evaluation Framework for Aspect-Based Book Summarization via Question Answering
di: Miyazato, Ryuhei, et al.
Pubblicazione: (2025)
di: Miyazato, Ryuhei, et al.
Pubblicazione: (2025)
DisastQA: A Comprehensive Benchmark for Evaluating Question Answering in Disaster Management
di: Chen, Zhitong, et al.
Pubblicazione: (2026)
di: Chen, Zhitong, et al.
Pubblicazione: (2026)
Debatable Intelligence: Benchmarking LLM Judges via Debate Speech Evaluation
di: Sternlicht, Noy, et al.
Pubblicazione: (2025)
di: Sternlicht, Noy, et al.
Pubblicazione: (2025)
RephQA: Evaluating Readability of Large Language Models in Public Health Question Answering
di: Qiu, Weikang, et al.
Pubblicazione: (2025)
di: Qiu, Weikang, et al.
Pubblicazione: (2025)
PRIV-QA: Privacy-Preserving Question Answering for Cloud Large Language Models
di: Li, Guangwei, et al.
Pubblicazione: (2025)
di: Li, Guangwei, et al.
Pubblicazione: (2025)
ScholarChemQA: Unveiling the Power of Language Models in Chemical Research Question Answering
di: Chen, Xiuying, et al.
Pubblicazione: (2024)
di: Chen, Xiuying, et al.
Pubblicazione: (2024)
Memory-QA: Answering Recall Questions Based on Multimodal Memories
di: Jiang, Hongda, et al.
Pubblicazione: (2025)
di: Jiang, Hongda, et al.
Pubblicazione: (2025)
M2QA: Multi-domain Multilingual Question Answering
di: Engländer, Leon, et al.
Pubblicazione: (2024)
di: Engländer, Leon, et al.
Pubblicazione: (2024)
GRS-QA -- Graph Reasoning-Structured Question Answering Dataset
di: Pahilajani, Anish, et al.
Pubblicazione: (2024)
di: Pahilajani, Anish, et al.
Pubblicazione: (2024)
EWEK-QA: Enhanced Web and Efficient Knowledge Graph Retrieval for Citation-based Question Answering Systems
di: Dehghan, Mohammad, et al.
Pubblicazione: (2024)
di: Dehghan, Mohammad, et al.
Pubblicazione: (2024)
KG2QA: Knowledge Graph-enhanced Retrieval-augmented Generation for Communication Standards Question Answering
di: Luo, Zhongze, et al.
Pubblicazione: (2025)
di: Luo, Zhongze, et al.
Pubblicazione: (2025)
MedEthicsQA: A Comprehensive Question Answering Benchmark for Medical Ethics Evaluation of LLMs
di: Wei, Jianhui, et al.
Pubblicazione: (2025)
di: Wei, Jianhui, et al.
Pubblicazione: (2025)
NovelQA: Benchmarking Question Answering on Documents Exceeding 200K Tokens
di: Wang, Cunxiang, et al.
Pubblicazione: (2024)
di: Wang, Cunxiang, et al.
Pubblicazione: (2024)
ReTraceQA: Evaluating Reasoning Traces of Small Language Models in Commonsense Question Answering
di: Molfese, Francesco Maria, et al.
Pubblicazione: (2025)
di: Molfese, Francesco Maria, et al.
Pubblicazione: (2025)
InspireDebate: Multi-Dimensional Subjective-Objective Evaluation-Guided Reasoning and Optimization for Debating
di: Wang, Fuyu, et al.
Pubblicazione: (2025)
di: Wang, Fuyu, et al.
Pubblicazione: (2025)
FoQA: A Faroese Question-Answering Dataset
di: Simonsen, Annika, et al.
Pubblicazione: (2025)
di: Simonsen, Annika, et al.
Pubblicazione: (2025)
Enhancing Food-Domain Question Answering with a Multimodal Knowledge Graph: Hybrid QA Generation and Diversity Analysis
di: B, Srihari K, et al.
Pubblicazione: (2025)
di: B, Srihari K, et al.
Pubblicazione: (2025)
BEnQA: A Question Answering and Reasoning Benchmark for Bengali and English
di: Shafayat, Sheikh, et al.
Pubblicazione: (2024)
di: Shafayat, Sheikh, et al.
Pubblicazione: (2024)
RespondeoQA: a Benchmark for Bilingual Latin-English Question Answering
di: Hudspeth, Marisa, et al.
Pubblicazione: (2026)
di: Hudspeth, Marisa, et al.
Pubblicazione: (2026)
DashboardQA: Benchmarking Multimodal Agents for Question Answering on Interactive Dashboards
di: Kartha, Aaryaman, et al.
Pubblicazione: (2025)
di: Kartha, Aaryaman, et al.
Pubblicazione: (2025)
HistoryBankQA: Multilingual Temporal Question Answering on Historical Events
di: Mandal, Biswadip, et al.
Pubblicazione: (2025)
di: Mandal, Biswadip, et al.
Pubblicazione: (2025)
NeoQA: Evidence-based Question Answering with Generated News Events
di: Glockner, Max, et al.
Pubblicazione: (2025)
di: Glockner, Max, et al.
Pubblicazione: (2025)
Question-guided Knowledge Graph Re-scoring and Injection for Knowledge Graph Question Answering
di: Zhang, Yu, et al.
Pubblicazione: (2024)
di: Zhang, Yu, et al.
Pubblicazione: (2024)
CoTKR: Chain-of-Thought Enhanced Knowledge Rewriting for Complex Knowledge Graph Question Answering
di: Wu, Yike, et al.
Pubblicazione: (2024)
di: Wu, Yike, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Long$^2$RAG: Evaluating Long-Context & Long-Form Retrieval-Augmented Generation with Key Point Recall
di: Qi, Zehan, et al.
Pubblicazione: (2024) -
Knowledge Conflicts for LLMs: A Survey
di: Xu, Rongwu, et al.
Pubblicazione: (2024) -
Preemptive Answer "Attacks" on Chain-of-Thought Reasoning
di: Xu, Rongwu, et al.
Pubblicazione: (2024) -
Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap
di: Qi, Xuan, et al.
Pubblicazione: (2025) -
RAG-QA Arena: Evaluating Domain Robustness for Long-form Retrieval Augmented Question Answering
di: Han, Rujun, et al.
Pubblicazione: (2024)