Salvato in:
| Autori principali: | Glockner, Max, Jiang, Xiang, Ribeiro, Leonardo F. R., Gurevych, Iryna, Dreyer, Markus |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2505.05949 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Grounding Fallacies Misrepresenting Scientific Publications in Evidence
di: Glockner, Max, et al.
Pubblicazione: (2024)
di: Glockner, Max, et al.
Pubblicazione: (2024)
PeerQA: A Scientific Question Answering Dataset from Peer Reviews
di: Baumgärtner, Tim, et al.
Pubblicazione: (2025)
di: Baumgärtner, Tim, et al.
Pubblicazione: (2025)
ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety
di: Bates, Luke, et al.
Pubblicazione: (2025)
di: Bates, Luke, et al.
Pubblicazione: (2025)
Self-Rationalization in the Wild: A Large Scale Out-of-Distribution Evaluation on NLI-related tasks
di: Yang, Jing, et al.
Pubblicazione: (2025)
di: Yang, Jing, et al.
Pubblicazione: (2025)
Missci: Reconstructing Fallacies in Misrepresented Science
di: Glockner, Max, et al.
Pubblicazione: (2024)
di: Glockner, Max, et al.
Pubblicazione: (2024)
M2QA: Multi-domain Multilingual Question Answering
di: Engländer, Leon, et al.
Pubblicazione: (2024)
di: Engländer, Leon, et al.
Pubblicazione: (2024)
Localizing and Mitigating Errors in Long-form Question Answering
di: Sachdeva, Rachneet, et al.
Pubblicazione: (2024)
di: Sachdeva, Rachneet, et al.
Pubblicazione: (2024)
DARA: Decomposition-Alignment-Reasoning Autonomous Language Agent for Question Answering over Knowledge Graphs
di: Fang, Haishuo, et al.
Pubblicazione: (2024)
di: Fang, Haishuo, et al.
Pubblicazione: (2024)
SciCoQA: Quality Assurance for Scientific Paper--Code Alignment
di: Baumgärtner, Tim, et al.
Pubblicazione: (2026)
di: Baumgärtner, Tim, et al.
Pubblicazione: (2026)
Automatic Reviewers Fail to Detect Faulty Reasoning in Research Papers: A New Counterfactual Evaluation Framework
di: Dycke, Nils, et al.
Pubblicazione: (2025)
di: Dycke, Nils, et al.
Pubblicazione: (2025)
Turning Logic Against Itself : Probing Model Defenses Through Contrastive Questions
di: Sachdeva, Rachneet, et al.
Pubblicazione: (2025)
di: Sachdeva, Rachneet, et al.
Pubblicazione: (2025)
Expert Preference-based Evaluation of Automated Related Work Generation
di: Şahinuç, Furkan, et al.
Pubblicazione: (2025)
di: Şahinuç, Furkan, et al.
Pubblicazione: (2025)
HistoryBankQA: Multilingual Temporal Question Answering on Historical Events
di: Mandal, Biswadip, et al.
Pubblicazione: (2025)
di: Mandal, Biswadip, et al.
Pubblicazione: (2025)
Towards Better Question Generation in QA-based Event Extraction
di: Hong, Zijin, et al.
Pubblicazione: (2024)
di: Hong, Zijin, et al.
Pubblicazione: (2024)
Enhancing Depression Detection via Question-wise Modality Fusion
di: Mandal, Aishik, et al.
Pubblicazione: (2025)
di: Mandal, Aishik, et al.
Pubblicazione: (2025)
Citation Failure: Definition, Analysis and Efficient Mitigation
di: Buchmann, Jan, et al.
Pubblicazione: (2025)
di: Buchmann, Jan, et al.
Pubblicazione: (2025)
Like a Good Nearest Neighbor: Practical Content Moderation and Text Classification
di: Bates, Luke, et al.
Pubblicazione: (2023)
di: Bates, Luke, et al.
Pubblicazione: (2023)
IRCoder: Intermediate Representations Make Language Models Robust Multilingual Code Generators
di: Paul, Indraneil, et al.
Pubblicazione: (2024)
di: Paul, Indraneil, et al.
Pubblicazione: (2024)
Dive into the Chasm: Probing the Gap between In- and Cross-Topic Generalization
di: Waldis, Andreas, et al.
Pubblicazione: (2024)
di: Waldis, Andreas, et al.
Pubblicazione: (2024)
PolQA: Polish Question Answering Dataset
di: Rybak, Piotr, et al.
Pubblicazione: (2022)
di: Rybak, Piotr, et al.
Pubblicazione: (2022)
NewsRECON: News article REtrieval for image CONtextualization
di: Tonglet, Jonathan, et al.
Pubblicazione: (2026)
di: Tonglet, Jonathan, et al.
Pubblicazione: (2026)
Measuring Retrieval Complexity in Question Answering Systems
di: Gabburo, Matteo, et al.
Pubblicazione: (2024)
di: Gabburo, Matteo, et al.
Pubblicazione: (2024)
Hierarchical Latent Structures in Data Generation Process Unify Mechanistic Phenomena across Scale
di: Rohweder, Jonas, et al.
Pubblicazione: (2026)
di: Rohweder, Jonas, et al.
Pubblicazione: (2026)
MAGneT: Coordinated Multi-Agent Generation of Synthetic Multi-Turn Mental Health Counseling Sessions
di: Mandal, Aishik, et al.
Pubblicazione: (2025)
di: Mandal, Aishik, et al.
Pubblicazione: (2025)
pdfQA: Diverse, Challenging, and Realistic Question Answering over PDFs
di: Schimanski, Tobias, et al.
Pubblicazione: (2026)
di: Schimanski, Tobias, et al.
Pubblicazione: (2026)
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
di: Muhamed, Aashiq, et al.
Pubblicazione: (2025)
di: Muhamed, Aashiq, et al.
Pubblicazione: (2025)
DOCE: Finding the Sweet Spot for Execution-Based Code Generation
di: Li, Haau-Sing, et al.
Pubblicazione: (2024)
di: Li, Haau-Sing, et al.
Pubblicazione: (2024)
Commitment Checklist: Auditing Author Commitments in Peer Review
di: Chen, Chung-Chi, et al.
Pubblicazione: (2026)
di: Chen, Chung-Chi, et al.
Pubblicazione: (2026)
DebateQA: Evaluating Question Answering on Debatable Knowledge
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
Constrained C-Test Generation via Mixed-Integer Programming
di: Lee, Ji-Ung, et al.
Pubblicazione: (2024)
di: Lee, Ji-Ung, et al.
Pubblicazione: (2024)
JDocQA: Japanese Document Question Answering Dataset for Generative Language Models
di: Onami, Eri, et al.
Pubblicazione: (2024)
di: Onami, Eri, et al.
Pubblicazione: (2024)
Systematic Task Exploration with LLMs: A Study in Citation Text Generation
di: Şahinuç, Furkan, et al.
Pubblicazione: (2024)
di: Şahinuç, Furkan, et al.
Pubblicazione: (2024)
Identifying Aspects in Peer Reviews
di: Lu, Sheng, et al.
Pubblicazione: (2025)
di: Lu, Sheng, et al.
Pubblicazione: (2025)
Token Weighting for Long-Range Language Modeling
di: Helm, Falko, et al.
Pubblicazione: (2025)
di: Helm, Falko, et al.
Pubblicazione: (2025)
COVE: COntext and VEracity prediction for out-of-context images
di: Tonglet, Jonathan, et al.
Pubblicazione: (2025)
di: Tonglet, Jonathan, et al.
Pubblicazione: (2025)
M4FC: a Multimodal, Multilingual, Multicultural, Multitask Real-World Fact-Checking Dataset
di: Geng, Jiahui, et al.
Pubblicazione: (2025)
di: Geng, Jiahui, et al.
Pubblicazione: (2025)
How to Handle Different Types of Out-of-Distribution Scenarios in Computational Argumentation? A Comprehensive and Fine-Grained Field Study
di: Waldis, Andreas, et al.
Pubblicazione: (2023)
di: Waldis, Andreas, et al.
Pubblicazione: (2023)
Robust Utility-Preserving Text Anonymization Based on Large Language Models
di: Yang, Tianyu, et al.
Pubblicazione: (2024)
di: Yang, Tianyu, et al.
Pubblicazione: (2024)
Re3: A Holistic Framework and Dataset for Modeling Collaborative Document Revision
di: Ruan, Qian, et al.
Pubblicazione: (2024)
di: Ruan, Qian, et al.
Pubblicazione: (2024)
Overview of PerpectiveArg2024: The First Shared Task on Perspective Argument Retrieval
di: Falk, Neele, et al.
Pubblicazione: (2024)
di: Falk, Neele, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Grounding Fallacies Misrepresenting Scientific Publications in Evidence
di: Glockner, Max, et al.
Pubblicazione: (2024) -
PeerQA: A Scientific Question Answering Dataset from Peer Reviews
di: Baumgärtner, Tim, et al.
Pubblicazione: (2025) -
ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety
di: Bates, Luke, et al.
Pubblicazione: (2025) -
Self-Rationalization in the Wild: A Large Scale Out-of-Distribution Evaluation on NLI-related tasks
di: Yang, Jing, et al.
Pubblicazione: (2025) -
Missci: Reconstructing Fallacies in Misrepresented Science
di: Glockner, Max, et al.
Pubblicazione: (2024)