AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Yilun, Chen, Weiyuan, Xu, Zhijian, Patwardhan, Manasi, Liu, Yixin, Wang, Chengye, Vig, Lovekesh, Cohan, Arman |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Can LLMs Identify Critical Limitations within Scientific Research? A Systematic Evaluation on AI Research Papers
di: Xu, Zhijian, et al.
Pubblicazione: (2025)
di: Xu, Zhijian, et al.
Pubblicazione: (2025)
IRIS: Interactive Research Ideation System for Accelerating Scientific Discovery
di: Garikaparthi, Aniketh, et al.
Pubblicazione: (2025)
di: Garikaparthi, Aniketh, et al.
Pubblicazione: (2025)
MIR: Methodology Inspiration Retrieval for Scientific Research Problems
di: Garikaparthi, Aniketh, et al.
Pubblicazione: (2025)
di: Garikaparthi, Aniketh, et al.
Pubblicazione: (2025)
SciMDR: Advancing Scientific Multimodal Document Reasoning
di: Chen, Ziyu, et al.
Pubblicazione: (2026)
di: Chen, Ziyu, et al.
Pubblicazione: (2026)
Acceleron: A Tool to Accelerate Research Ideation
di: Nigam, Harshit, et al.
Pubblicazione: (2024)
di: Nigam, Harshit, et al.
Pubblicazione: (2024)
SciRAG: Adaptive, Citation-Aware, and Outline-Guided Retrieval and Synthesis for Scientific Literature
di: Ding, Hang, et al.
Pubblicazione: (2025)
di: Ding, Hang, et al.
Pubblicazione: (2025)
DBRouting: Routing End User Queries to Databases for Answerability
di: Mandal, Priyangshu, et al.
Pubblicazione: (2025)
di: Mandal, Priyangshu, et al.
Pubblicazione: (2025)
SciVer: Evaluating Foundation Models for Multimodal Scientific Claim Verification
di: Wang, Chengye, et al.
Pubblicazione: (2025)
di: Wang, Chengye, et al.
Pubblicazione: (2025)
ResearchCodeAgent: An LLM Multi-Agent System for Automated Codification of Research Methodologies
di: Gandhi, Shubham, et al.
Pubblicazione: (2025)
di: Gandhi, Shubham, et al.
Pubblicazione: (2025)
ResearchGym: Evaluating Language Model Agents on Real-World AI Research
di: Garikaparthi, Aniketh, et al.
Pubblicazione: (2026)
di: Garikaparthi, Aniketh, et al.
Pubblicazione: (2026)
Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers
di: Zhao, Yilun, et al.
Pubblicazione: (2025)
di: Zhao, Yilun, et al.
Pubblicazione: (2025)
BudgetMLAgent: A Cost-Effective LLM Multi-Agent system for Automating Machine Learning Tasks
di: Gandhi, Shubham, et al.
Pubblicazione: (2024)
di: Gandhi, Shubham, et al.
Pubblicazione: (2024)
Can AI Be a Good Peer Reviewer? A Survey of Peer Review Process, Evaluation, and the Future
di: Wu, Sihong, et al.
Pubblicazione: (2026)
di: Wu, Sihong, et al.
Pubblicazione: (2026)
M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
di: Li, Chuhan, et al.
Pubblicazione: (2024)
di: Li, Chuhan, et al.
Pubblicazione: (2024)
Retrieval and Augmentation of Domain Knowledge for Text-to-SQL Semantic Parsing
di: Patwardhan, Manasi, et al.
Pubblicazione: (2025)
di: Patwardhan, Manasi, et al.
Pubblicazione: (2025)
RbtAct: Rebuttal as Supervision for Actionable Review Feedback Generation
di: Wu, Sihong, et al.
Pubblicazione: (2026)
di: Wu, Sihong, et al.
Pubblicazione: (2026)
REVERE: Reflective Evolving Research Engineer for Scientific Workflows
di: Gangireddi, Balaji Dinesh, et al.
Pubblicazione: (2026)
di: Gangireddi, Balaji Dinesh, et al.
Pubblicazione: (2026)
HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation
di: Yu, Zhaojian, et al.
Pubblicazione: (2024)
di: Yu, Zhaojian, et al.
Pubblicazione: (2024)
On Evaluating LLM Alignment by Evaluating LLMs as Judges
di: Liu, Yixin, et al.
Pubblicazione: (2025)
di: Liu, Yixin, et al.
Pubblicazione: (2025)
Teaching Language Models to Forecast Research Success Through Comparative Idea Evaluation
di: Mule, Srujan P, et al.
Pubblicazione: (2026)
di: Mule, Srujan P, et al.
Pubblicazione: (2026)
MSRS: Evaluating Multi-Source Retrieval-Augmented Generation
di: Phanse, Rohan, et al.
Pubblicazione: (2025)
di: Phanse, Rohan, et al.
Pubblicazione: (2025)
FinLFQA: Evaluating Attributed Text Generation of LLMs in Financial Long-Form Question Answering
di: Long, Yitao, et al.
Pubblicazione: (2025)
di: Long, Yitao, et al.
Pubblicazione: (2025)
FinDVer: Explainable Claim Verification over Long and Hybrid-Content Financial Documents
di: Zhao, Yilun, et al.
Pubblicazione: (2024)
di: Zhao, Yilun, et al.
Pubblicazione: (2024)
Translating Across Cultures: LLMs for Intralingual Cultural Adaptation
di: Singh, Pushpdeep, et al.
Pubblicazione: (2024)
di: Singh, Pushpdeep, et al.
Pubblicazione: (2024)
Benchmarking Generation and Evaluation Capabilities of Large Language Models for Instruction Controllable Summarization
di: Liu, Yixin, et al.
Pubblicazione: (2023)
di: Liu, Yixin, et al.
Pubblicazione: (2023)
Investigating Data Contamination in Modern Benchmarks for Large Language Models
di: Deng, Chunyuan, et al.
Pubblicazione: (2023)
di: Deng, Chunyuan, et al.
Pubblicazione: (2023)
FinTrust: A Comprehensive Benchmark of Trustworthiness Evaluation in Finance Domain
di: Hu, Tiansheng, et al.
Pubblicazione: (2025)
di: Hu, Tiansheng, et al.
Pubblicazione: (2025)
Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems
di: Zhao, Yilun, et al.
Pubblicazione: (2026)
di: Zhao, Yilun, et al.
Pubblicazione: (2026)
MCTS-RAG: Enhancing Retrieval-Augmented Generation with Monte Carlo Tree Search
di: Hu, Yunhai, et al.
Pubblicazione: (2025)
di: Hu, Yunhai, et al.
Pubblicazione: (2025)
Demystifying Scientific Problem-Solving in LLMs by Probing Knowledge and Reasoning
di: Li, Alan, et al.
Pubblicazione: (2025)
di: Li, Alan, et al.
Pubblicazione: (2025)
SAGE: Benchmarking and Improving Retrieval for Deep Research Agents
di: Hu, Tiansheng, et al.
Pubblicazione: (2026)
di: Hu, Tiansheng, et al.
Pubblicazione: (2026)
AlphaResearch: Accelerating New Algorithm Discovery with Language Models
di: Yu, Zhaojian, et al.
Pubblicazione: (2025)
di: Yu, Zhaojian, et al.
Pubblicazione: (2025)
SUCEA: Reasoning-Intensive Retrieval for Adversarial Fact-checking through Claim Decomposition and Editing
di: Liu, Hongjun, et al.
Pubblicazione: (2025)
di: Liu, Hongjun, et al.
Pubblicazione: (2025)
Table-R1: Inference-Time Scaling for Table Reasoning
di: Yang, Zheyuan, et al.
Pubblicazione: (2025)
di: Yang, Zheyuan, et al.
Pubblicazione: (2025)
Quantifying Contamination in Evaluating Code Generation Capabilities of Language Models
di: Riddell, Martin, et al.
Pubblicazione: (2024)
di: Riddell, Martin, et al.
Pubblicazione: (2024)
ReIFE: Re-evaluating Instruction-Following Evaluation
di: Liu, Yixin, et al.
Pubblicazione: (2024)
di: Liu, Yixin, et al.
Pubblicazione: (2024)
Routing End User Queries to Enterprise Databases
di: Sudarshan, Saikrishna, et al.
Pubblicazione: (2026)
di: Sudarshan, Saikrishna, et al.
Pubblicazione: (2026)
Understanding Reference Policies in Direct Preference Optimization
di: Liu, Yixin, et al.
Pubblicazione: (2024)
di: Liu, Yixin, et al.
Pubblicazione: (2024)
Calibrating Long-form Generations from Large Language Models
di: Huang, Yukun, et al.
Pubblicazione: (2024)
di: Huang, Yukun, et al.
Pubblicazione: (2024)
DocMath-Eval: Evaluating Math Reasoning Capabilities of LLMs in Understanding Long and Specialized Documents
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Can LLMs Identify Critical Limitations within Scientific Research? A Systematic Evaluation on AI Research Papers
di: Xu, Zhijian, et al.
Pubblicazione: (2025) -
IRIS: Interactive Research Ideation System for Accelerating Scientific Discovery
di: Garikaparthi, Aniketh, et al.
Pubblicazione: (2025) -
MIR: Methodology Inspiration Retrieval for Scientific Research Problems
di: Garikaparthi, Aniketh, et al.
Pubblicazione: (2025) -
SciMDR: Advancing Scientific Multimodal Document Reasoning
di: Chen, Ziyu, et al.
Pubblicazione: (2026) -
Acceleron: A Tool to Accelerate Research Ideation
di: Nigam, Harshit, et al.
Pubblicazione: (2024)