ScholarChemQA: Unveiling the Power of Language Models in Chemical Research Question Answering
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Xiuying, Wang, Tairan, Guo, Taicheng, Guo, Kehan, Zhou, Juexiao, Li, Haoyang, Zhuge, Mingchen, Schmidhuber, Jürgen, Gao, Xin, Zhang, Xiangliang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Evaluating and Mitigating Bias in AI-Based Medical Text Generation
por: Chen, Xiuying, et al.
Publicado: (2025)
por: Chen, Xiuying, et al.
Publicado: (2025)
Rethinking Scientific Summarization Evaluation: Grounding Explainable Metrics on Facet-aware Benchmark
por: Chen, Xiuying, et al.
Publicado: (2024)
por: Chen, Xiuying, et al.
Publicado: (2024)
SceMQA: A Scientific College Entrance Level Multimodal Question Answering Benchmark
por: Liang, Zhenwen, et al.
Publicado: (2024)
por: Liang, Zhenwen, et al.
Publicado: (2024)
Beyond Outlining: Heterogeneous Recursive Planning for Adaptive Long-form Writing with Language Models
por: Xiong, Ruibin, et al.
Publicado: (2025)
por: Xiong, Ruibin, et al.
Publicado: (2025)
ReactionTeam: Teaming Experts for Divergent Thinking Beyond Typical Reaction Patterns
por: Guo, Taicheng, et al.
Publicado: (2023)
por: Guo, Taicheng, et al.
Publicado: (2023)
Language Agents as Optimizable Graphs
por: Zhuge, Mingchen, et al.
Publicado: (2024)
por: Zhuge, Mingchen, et al.
Publicado: (2024)
AutoLLMResearch: Training Research Agents for Automating LLM Experiment Configuration - Learning from Cheap, Optimizing Expensive
por: Guo, Taicheng, et al.
Publicado: (2026)
por: Guo, Taicheng, et al.
Publicado: (2026)
Large Language Model based Multi-Agents: A Survey of Progress and Challenges
por: Guo, Taicheng, et al.
Publicado: (2024)
por: Guo, Taicheng, et al.
Publicado: (2024)
ResearchQA: Evaluating Scholarly Question Answering at Scale Across 75 Fields with Survey-Mined Questions and Rubrics
por: Yifei, Li S., et al.
Publicado: (2025)
por: Yifei, Li S., et al.
Publicado: (2025)
DebateQA: Evaluating Question Answering on Debatable Knowledge
por: Xu, Rongwu, et al.
Publicado: (2024)
por: Xu, Rongwu, et al.
Publicado: (2024)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
por: Wang, Yanling, et al.
Publicado: (2025)
por: Wang, Yanling, et al.
Publicado: (2025)
VideoQA-SC: Adaptive Semantic Communication for Video Question Answering
por: Guo, Jiangyuan, et al.
Publicado: (2024)
por: Guo, Jiangyuan, et al.
Publicado: (2024)
LLM-MedQA: Enhancing Medical Question Answering through Case Studies in Large Language Models
por: Yang, Hang, et al.
Publicado: (2024)
por: Yang, Hang, et al.
Publicado: (2024)
Reliable Control-Point Selection for Steering Reasoning in Large Language Models
por: Zhuang, Haomin, et al.
Publicado: (2026)
por: Zhuang, Haomin, et al.
Publicado: (2026)
Goldfish: Vision-Language Understanding of Arbitrarily Long Videos
por: Ataallah, Kirolos, et al.
Publicado: (2024)
por: Ataallah, Kirolos, et al.
Publicado: (2024)
Knowledge Graph Enhanced Language Agents for Recommendation
por: Guo, Taicheng, et al.
Publicado: (2024)
por: Guo, Taicheng, et al.
Publicado: (2024)
Dissecting Logical Reasoning in LLMs: A Fine-Grained Evaluation and Supervision Study
por: Zhou, Yujun, et al.
Publicado: (2025)
por: Zhou, Yujun, et al.
Publicado: (2025)
Huxley-Gödel Machine: Human-Level Coding Agent Development by an Approximation of the Optimal Self-Improving Machine
por: Wang, Wenyi, et al.
Publicado: (2025)
por: Wang, Wenyi, et al.
Publicado: (2025)
PolQA: Polish Question Answering Dataset
por: Rybak, Piotr, et al.
Publicado: (2022)
por: Rybak, Piotr, et al.
Publicado: (2022)
VoQA: Visual-only Question Answering
por: An, Jianing, et al.
Publicado: (2025)
por: An, Jianing, et al.
Publicado: (2025)
KG20C & KG20C-QA: Scholarly Knowledge Graph Benchmarks for Link Prediction and Question Answering
por: Tran, Hung-Nghiep, et al.
Publicado: (2025)
por: Tran, Hung-Nghiep, et al.
Publicado: (2025)
CoReQA: Uncovering Potentials of Language Models in Code Repository Question Answering
por: Chen, Jialiang, et al.
Publicado: (2025)
por: Chen, Jialiang, et al.
Publicado: (2025)
AggNet: Advancing protein aggregation analysis through deep learning and protein language model
por: Wenjia He, et al.
Publicado: (2025)
por: Wenjia He, et al.
Publicado: (2025)
SenWave: A Fine-Grained Multi-Language Sentiment Analysis Dataset Sourced from COVID-19 Tweets
por: Yang, Qiang, et al.
Publicado: (2025)
por: Yang, Qiang, et al.
Publicado: (2025)
Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language Models
por: Gao, Lang, et al.
Publicado: (2024)
por: Gao, Lang, et al.
Publicado: (2024)
Memory-QA: Answering Recall Questions Based on Multimodal Memories
por: Jiang, Hongda, et al.
Publicado: (2025)
por: Jiang, Hongda, et al.
Publicado: (2025)
NovelQA: Benchmarking Question Answering on Documents Exceeding 200K Tokens
por: Wang, Cunxiang, et al.
Publicado: (2024)
por: Wang, Cunxiang, et al.
Publicado: (2024)
DocTabQA: Answering Questions from Long Documents Using Tables
por: Wang, Haochen, et al.
Publicado: (2024)
por: Wang, Haochen, et al.
Publicado: (2024)
LingoQA: Visual Question Answering for Autonomous Driving
por: Marcu, Ana-Maria, et al.
Publicado: (2023)
por: Marcu, Ana-Maria, et al.
Publicado: (2023)
Answering Questions in Stages: Prompt Chaining for Contract QA
por: Roegiest, Adam, et al.
Publicado: (2024)
por: Roegiest, Adam, et al.
Publicado: (2024)
FoQA: A Faroese Question-Answering Dataset
por: Simonsen, Annika, et al.
Publicado: (2025)
por: Simonsen, Annika, et al.
Publicado: (2025)
Question-Answering (QA) Model for a Personalized Learning Assistant for Arabic Language
por: Sammoudi, Mohammad, et al.
Publicado: (2024)
por: Sammoudi, Mohammad, et al.
Publicado: (2024)
MizanQA: Benchmarking Large Language Models on Moroccan Legal Question Answering
por: Bahaj, Adil, et al.
Publicado: (2025)
por: Bahaj, Adil, et al.
Publicado: (2025)
QA-prompting: Improving Summarization with Large Language Models using Question-Answering
por: Sinha, Neelabh
Publicado: (2025)
por: Sinha, Neelabh
Publicado: (2025)
LittiChoQA: Literary Texts in Indic Languages Chosen for Question Answering
por: Khandelwal, Aarya, et al.
Publicado: (2026)
por: Khandelwal, Aarya, et al.
Publicado: (2026)
PRIV-QA: Privacy-Preserving Question Answering for Cloud Large Language Models
por: Li, Guangwei, et al.
Publicado: (2025)
por: Li, Guangwei, et al.
Publicado: (2025)
JDocQA: Japanese Document Question Answering Dataset for Generative Language Models
por: Onami, Eri, et al.
Publicado: (2024)
por: Onami, Eri, et al.
Publicado: (2024)
MTSQL-R1: Towards Long-Horizon Multi-Turn Text-to-SQL via Agentic Training
por: Guo, Taicheng, et al.
Publicado: (2025)
por: Guo, Taicheng, et al.
Publicado: (2025)
Dual Optimal: Make Your LLM Peer-like with Dignity
por: Wang, Xiangqi, et al.
Publicado: (2026)
por: Wang, Xiangqi, et al.
Publicado: (2026)
ChemOrch: Empowering LLMs with Chemical Intelligence via Synthetic Instructions
por: Huang, Yue, et al.
Publicado: (2025)
por: Huang, Yue, et al.
Publicado: (2025)
Ejemplares similares
-
Evaluating and Mitigating Bias in AI-Based Medical Text Generation
por: Chen, Xiuying, et al.
Publicado: (2025) -
Rethinking Scientific Summarization Evaluation: Grounding Explainable Metrics on Facet-aware Benchmark
por: Chen, Xiuying, et al.
Publicado: (2024) -
SceMQA: A Scientific College Entrance Level Multimodal Question Answering Benchmark
por: Liang, Zhenwen, et al.
Publicado: (2024) -
Beyond Outlining: Heterogeneous Recursive Planning for Adaptive Long-form Writing with Language Models
por: Xiong, Ruibin, et al.
Publicado: (2025) -
ReactionTeam: Teaming Experts for Divergent Thinking Beyond Typical Reaction Patterns
por: Guo, Taicheng, et al.
Publicado: (2023)