SciCoQA: Quality Assurance for Scientific Paper--Code Alignment
Fuente:
arXiv
Salvato in:
| Autori principali: | Baumgärtner, Tim, Gurevych, Iryna |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PeerQA: A Scientific Question Answering Dataset from Peer Reviews
di: Baumgärtner, Tim, et al.
Pubblicazione: (2025)
di: Baumgärtner, Tim, et al.
Pubblicazione: (2025)
The Good, the Bad and the Constructive: Automatically Measuring Peer Review's Utility for Authors
di: Sadallah, Abdelrahman, et al.
Pubblicazione: (2025)
di: Sadallah, Abdelrahman, et al.
Pubblicazione: (2025)
IRCoder: Intermediate Representations Make Language Models Robust Multilingual Code Generators
di: Paul, Indraneil, et al.
Pubblicazione: (2024)
di: Paul, Indraneil, et al.
Pubblicazione: (2024)
DOCE: Finding the Sweet Spot for Execution-Based Code Generation
di: Li, Haau-Sing, et al.
Pubblicazione: (2024)
di: Li, Haau-Sing, et al.
Pubblicazione: (2024)
M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
di: Li, Chuhan, et al.
Pubblicazione: (2024)
di: Li, Chuhan, et al.
Pubblicazione: (2024)
Preemptive Detection and Correction of Misaligned Actions in LLM Agents
di: Fang, Haishuo, et al.
Pubblicazione: (2024)
di: Fang, Haishuo, et al.
Pubblicazione: (2024)
Towards Privacy-aware Mental Health AI Models: Advances, Challenges, and Opportunities
di: Mandal, Aishik, et al.
Pubblicazione: (2025)
di: Mandal, Aishik, et al.
Pubblicazione: (2025)
MAGneT: Coordinated Multi-Agent Generation of Synthetic Multi-Turn Mental Health Counseling Sessions
di: Mandal, Aishik, et al.
Pubblicazione: (2025)
di: Mandal, Aishik, et al.
Pubblicazione: (2025)
ObscuraCoder: Powering Efficient Code LM Pre-Training Via Obfuscation Grounding
di: Paul, Indraneil, et al.
Pubblicazione: (2025)
di: Paul, Indraneil, et al.
Pubblicazione: (2025)
Multimodal Large Language Models to Support Real-World Fact-Checking
di: Geng, Jiahui, et al.
Pubblicazione: (2024)
di: Geng, Jiahui, et al.
Pubblicazione: (2024)
Sensitivity, Performance, Robustness: Deconstructing the Effect of Sociodemographic Prompting
di: Beck, Tilman, et al.
Pubblicazione: (2023)
di: Beck, Tilman, et al.
Pubblicazione: (2023)
Factual Self-Awareness in Language Models: Representation, Robustness, and Scaling
di: Tamoyan, Hovhannes, et al.
Pubblicazione: (2025)
di: Tamoyan, Hovhannes, et al.
Pubblicazione: (2025)
PaperSearchQA: Learning to Search and Reason over Scientific Papers with RLVR
di: Burgess, James, et al.
Pubblicazione: (2026)
di: Burgess, James, et al.
Pubblicazione: (2026)
Overview of the SciHigh Track at FIRE 2025: Research Highlight Generation from Scientific Papers
di: Rehman, Tohida, et al.
Pubblicazione: (2026)
di: Rehman, Tohida, et al.
Pubblicazione: (2026)
From Leaky Thoughts to Private Reasoning: Controlling What LRMs Say to Themselves
di: Puerto, Haritz, et al.
Pubblicazione: (2026)
di: Puerto, Haritz, et al.
Pubblicazione: (2026)
Hypothesis-Driven Feature Manifold Analysis in LLMs via Supervised Multi-Dimensional Scaling
di: Tiblias, Federico, et al.
Pubblicazione: (2025)
di: Tiblias, Federico, et al.
Pubblicazione: (2025)
Advancing Risk and Quality Assurance: A RAG Chatbot for Improved Regulatory Compliance
di: Hillebrand, Lars, et al.
Pubblicazione: (2025)
di: Hillebrand, Lars, et al.
Pubblicazione: (2025)
SciPIP: An LLM-based Scientific Paper Idea Proposer
di: Wang, Wenxiao, et al.
Pubblicazione: (2024)
di: Wang, Wenxiao, et al.
Pubblicazione: (2024)
CORE-T: COherent REtrieval of Tables for Text-to-SQL
di: Soliman, Hassan, et al.
Pubblicazione: (2026)
di: Soliman, Hassan, et al.
Pubblicazione: (2026)
SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision and Reward Modelling
di: Rizvi, Md Imbesat Hassan, et al.
Pubblicazione: (2025)
di: Rizvi, Md Imbesat Hassan, et al.
Pubblicazione: (2025)
SpaRC and SpaRP: Spatial Reasoning Characterization and Path Generation for Understanding Spatial Reasoning Capability of Large Language Models
di: Rizvi, Md Imbesat Hassan, et al.
Pubblicazione: (2024)
di: Rizvi, Md Imbesat Hassan, et al.
Pubblicazione: (2024)
Uncertainty-Aware Decoding with Minimum Bayes Risk
di: Daheim, Nico, et al.
Pubblicazione: (2025)
di: Daheim, Nico, et al.
Pubblicazione: (2025)
A Comprehensive Review of Datasets for Clinical Mental Health AI Systems
di: Mandal, Aishik, et al.
Pubblicazione: (2025)
di: Mandal, Aishik, et al.
Pubblicazione: (2025)
Illusion or Algorithm? Investigating Memorization, Emergence, and Symbolic Processing in In-Context Learning
di: Niu, Jingcheng, et al.
Pubblicazione: (2025)
di: Niu, Jingcheng, et al.
Pubblicazione: (2025)
Towards Automated Error Discovery: A Study in Conversational AI
di: Petrak, Dominic, et al.
Pubblicazione: (2025)
di: Petrak, Dominic, et al.
Pubblicazione: (2025)
A Survey of Confidence Estimation and Calibration in Large Language Models
di: Geng, Jiahui, et al.
Pubblicazione: (2023)
di: Geng, Jiahui, et al.
Pubblicazione: (2023)
From Problem-Solving to Teaching Problem-Solving: Aligning LLMs with Pedagogy using Reinforcement Learning
di: Dinucu-Jianu, David, et al.
Pubblicazione: (2025)
di: Dinucu-Jianu, David, et al.
Pubblicazione: (2025)
Stepwise Verification and Remediation of Student Reasoning Errors with Large Language Model Tutors
di: Daheim, Nico, et al.
Pubblicazione: (2024)
di: Daheim, Nico, et al.
Pubblicazione: (2024)
SciDER: Scientific Data-centric End-to-end Researcher
di: Lin, Ke, et al.
Pubblicazione: (2026)
di: Lin, Ke, et al.
Pubblicazione: (2026)
WildSci: Advancing Scientific Reasoning from In-the-Wild Literature
di: Liu, Tengxiao, et al.
Pubblicazione: (2026)
di: Liu, Tengxiao, et al.
Pubblicazione: (2026)
SciAgent: Tool-augmented Language Models for Scientific Reasoning
di: Ma, Yubo, et al.
Pubblicazione: (2024)
di: Ma, Yubo, et al.
Pubblicazione: (2024)
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
di: Li, Tianhao, et al.
Pubblicazione: (2024)
di: Li, Tianhao, et al.
Pubblicazione: (2024)
SciCode: A Research Coding Benchmark Curated by Scientists
di: Tian, Minyang, et al.
Pubblicazione: (2024)
di: Tian, Minyang, et al.
Pubblicazione: (2024)
DeCode: Decoupling Content and Delivery for Medical QA
di: Ko, Po-Jen, et al.
Pubblicazione: (2026)
di: Ko, Po-Jen, et al.
Pubblicazione: (2026)
SciResearcher: Scaling Deep Research Agents for Frontier Scientific Reasoning
di: Zheng, Tianshi, et al.
Pubblicazione: (2026)
di: Zheng, Tianshi, et al.
Pubblicazione: (2026)
Exploring LLMs for Scientific Information Extraction Using The SciEx Framework
di: Li, Sha, et al.
Pubblicazione: (2025)
di: Li, Sha, et al.
Pubblicazione: (2025)
Q-Mirror: Unlocking the Multi-Modal Potential of Scientific Text-Only QA Pairs
di: Wang, Junying, et al.
Pubblicazione: (2025)
di: Wang, Junying, et al.
Pubblicazione: (2025)
SciEvalKit: An Open-source Evaluation Toolkit for Scientific General Intelligence
di: Wang, Yiheng, et al.
Pubblicazione: (2025)
di: Wang, Yiheng, et al.
Pubblicazione: (2025)
Automatic Reviewers Fail to Detect Faulty Reasoning in Research Papers: A New Counterfactual Evaluation Framework
di: Dycke, Nils, et al.
Pubblicazione: (2025)
di: Dycke, Nils, et al.
Pubblicazione: (2025)
MathTutorBench: A Benchmark for Measuring Open-ended Pedagogical Capabilities of LLM Tutors
di: Macina, Jakub, et al.
Pubblicazione: (2025)
di: Macina, Jakub, et al.
Pubblicazione: (2025)
Documenti analoghi
-
PeerQA: A Scientific Question Answering Dataset from Peer Reviews
di: Baumgärtner, Tim, et al.
Pubblicazione: (2025) -
The Good, the Bad and the Constructive: Automatically Measuring Peer Review's Utility for Authors
di: Sadallah, Abdelrahman, et al.
Pubblicazione: (2025) -
IRCoder: Intermediate Representations Make Language Models Robust Multilingual Code Generators
di: Paul, Indraneil, et al.
Pubblicazione: (2024) -
DOCE: Finding the Sweet Spot for Execution-Based Code Generation
di: Li, Haau-Sing, et al.
Pubblicazione: (2024) -
M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
di: Li, Chuhan, et al.
Pubblicazione: (2024)