MetaBench: A Multi-task Benchmark for Assessing LLMs in Metabolomics
Fuente:
arXiv
Salvato in:
| Autori principali: | Lu, Yuxing, Zhao, Xukai, Tamo, J. Ben, Nnamdi, Micky C., Peng, Rui, Zeng, Shuang, Hu, Xingyu, Wang, Jinzhuo, Wang, May D. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
KARMA: Leveraging Multi-Agent LLMs for Automated Knowledge Graph Enrichment
di: Lu, Yuxing, et al.
Pubblicazione: (2025)
di: Lu, Yuxing, et al.
Pubblicazione: (2025)
Biomedical Knowledge Graph: A Survey of Domains, Tasks, and Real-World Applications
di: Lu, Yuxing, et al.
Pubblicazione: (2025)
di: Lu, Yuxing, et al.
Pubblicazione: (2025)
EvidenceRL: Reinforcing Evidence Consistency for Trustworthy Language Models
di: Tamo, J. Ben, et al.
Pubblicazione: (2026)
di: Tamo, J. Ben, et al.
Pubblicazione: (2026)
DoctorRAG: Medical RAG Fusing Knowledge with Patient Analogy through Textual Gradients
di: Lu, Yuxing, et al.
Pubblicazione: (2025)
di: Lu, Yuxing, et al.
Pubblicazione: (2025)
ClinEnv: An Interactive Multi-Stage Long Horizon EHR Environment for Agents
di: Lu, Yuxing, et al.
Pubblicazione: (2026)
di: Lu, Yuxing, et al.
Pubblicazione: (2026)
Advancing Problem-Based Learning in Biomedical Engineering in the Era of Generative AI
di: Nnamdi, Micky C., et al.
Pubblicazione: (2025)
di: Nnamdi, Micky C., et al.
Pubblicazione: (2025)
Training the Knowledge Base through Evidence Distillation and Write-Back Enrichment
di: Lu, Yuxing, et al.
Pubblicazione: (2026)
di: Lu, Yuxing, et al.
Pubblicazione: (2026)
QuantBench: Benchmarking AI Methods for Quantitative Investment
di: Wang, Saizhuo, et al.
Pubblicazione: (2025)
di: Wang, Saizhuo, et al.
Pubblicazione: (2025)
RobustMedSAM: Degradation-Resilient Medical Image Segmentation via Robust Foundation Model Adaptation
di: Li, Jieru, et al.
Pubblicazione: (2026)
di: Li, Jieru, et al.
Pubblicazione: (2026)
FinBoardBench: Benchmarking Dynamic Wealth Management and Strategic Financial Reasoning of LLMs via Board Game Simulations
di: Hu, Xuesi, et al.
Pubblicazione: (2026)
di: Hu, Xuesi, et al.
Pubblicazione: (2026)
ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition
di: Liu, Yujie, et al.
Pubblicazione: (2025)
di: Liu, Yujie, et al.
Pubblicazione: (2025)
Look-Ahead-Bench: a Standardized Benchmark of Look-ahead Bias in Point-in-Time LLMs for Finance
di: Benhenda, Mostapha
Pubblicazione: (2026)
di: Benhenda, Mostapha
Pubblicazione: (2026)
Leveraging Evidence-Guided LLMs to Enhance Trustworthy Depression Diagnosis
di: Yuan, Yining, et al.
Pubblicazione: (2025)
di: Yuan, Yining, et al.
Pubblicazione: (2025)
BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs
di: Lu, Guilong, et al.
Pubblicazione: (2025)
di: Lu, Guilong, et al.
Pubblicazione: (2025)
RAMIE: Retrieval-Augmented Multi-task Information Extraction with Large Language Models on Dietary Supplements
di: Zhan, Zaifu, et al.
Pubblicazione: (2024)
di: Zhan, Zaifu, et al.
Pubblicazione: (2024)
FinTradeBench: A Financial Reasoning Benchmark for LLMs
di: Agrawal, Yogesh, et al.
Pubblicazione: (2026)
di: Agrawal, Yogesh, et al.
Pubblicazione: (2026)
LLM-as-RNN: A Recurrent Language Model for Memory Updates and Sequence Prediction
di: Lu, Yuxing, et al.
Pubblicazione: (2026)
di: Lu, Yuxing, et al.
Pubblicazione: (2026)
BizCompass: Benchmarking the Reasoning Capabilities of LLMs in Business Knowledge and Applications
di: Hao, Jianing, et al.
Pubblicazione: (2026)
di: Hao, Jianing, et al.
Pubblicazione: (2026)
RoadBench: A Vision-Language Foundation Model and Benchmark for Road Damage Understanding
di: Xiao, Xi, et al.
Pubblicazione: (2025)
di: Xiao, Xi, et al.
Pubblicazione: (2025)
EDINET-Bench: Evaluating LLMs on Complex Financial Tasks using Japanese Financial Statements
di: Sugiura, Issa, et al.
Pubblicazione: (2025)
di: Sugiura, Issa, et al.
Pubblicazione: (2025)
FinReflectKG -- HalluBench: GraphRAG Hallucination Benchmark for Financial Question Answering Systems
di: Kumar, Mahesh, et al.
Pubblicazione: (2026)
di: Kumar, Mahesh, et al.
Pubblicazione: (2026)
Open-FinLLMs: Open Multimodal Large Language Models for Financial Applications
di: Huang, Jimin, et al.
Pubblicazione: (2024)
di: Huang, Jimin, et al.
Pubblicazione: (2024)
LOB-Bench: Benchmarking Generative AI for Finance -- an Application to Limit Order Book Data
di: Nagy, Peer, et al.
Pubblicazione: (2025)
di: Nagy, Peer, et al.
Pubblicazione: (2025)
UCFE: A User-Centric Financial Expertise Benchmark for Large Language Models
di: Yang, Yuzhe, et al.
Pubblicazione: (2024)
di: Yang, Yuzhe, et al.
Pubblicazione: (2024)
Multi-task Meta Label Correction for Time Series Prediction
di: Yang, Luxuan, et al.
Pubblicazione: (2023)
di: Yang, Luxuan, et al.
Pubblicazione: (2023)
FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Information
di: Wang, Yan, et al.
Pubblicazione: (2025)
di: Wang, Yan, et al.
Pubblicazione: (2025)
FinReflectKG -- EvalBench: Benchmarking Financial KG with Multi-Dimensional Evaluation
di: Dimino, Fabrizio, et al.
Pubblicazione: (2025)
di: Dimino, Fabrizio, et al.
Pubblicazione: (2025)
Developing Fairness-Aware Task Decomposition to Improve Equity in Post-Spinal Fusion Complication Prediction
di: Yuan, Yining, et al.
Pubblicazione: (2025)
di: Yuan, Yining, et al.
Pubblicazione: (2025)
Novel Extraction of Discriminative Fine-Grained Feature to Improve Retinal Vessel Segmentation
di: Zeng, Shuang, et al.
Pubblicazione: (2025)
di: Zeng, Shuang, et al.
Pubblicazione: (2025)
Finance Agent Benchmark: Benchmarking LLMs on Real-world Financial Research Tasks
di: Bigeard, Antoine, et al.
Pubblicazione: (2025)
di: Bigeard, Antoine, et al.
Pubblicazione: (2025)
FinAuditing: A Financial Taxonomy-Structured Multi-Document Benchmark for Evaluating LLMs
di: Wang, Yan, et al.
Pubblicazione: (2025)
di: Wang, Yan, et al.
Pubblicazione: (2025)
IdeaBench: Benchmarking Large Language Models for Research Idea Generation
di: Guo, Sikun, et al.
Pubblicazione: (2024)
di: Guo, Sikun, et al.
Pubblicazione: (2024)
AI-Trader: Benchmarking Autonomous Agents in Real-Time Financial Markets
di: Fan, Tianyu, et al.
Pubblicazione: (2025)
di: Fan, Tianyu, et al.
Pubblicazione: (2025)
Assessing Consistency and Reproducibility in the Outputs of Large Language Models: Evidence Across Diverse Finance and Accounting Tasks
di: Wang, Julian Junyan, et al.
Pubblicazione: (2025)
di: Wang, Julian Junyan, et al.
Pubblicazione: (2025)
Internet sentiment exacerbates intraday overtrading, evidence from A-Share market
di: Yifeng, Peng
Pubblicazione: (2024)
di: Yifeng, Peng
Pubblicazione: (2024)
Flow of Knowledge: Federated Fine-Tuning of LLMs in Healthcare under Non-IID Conditions
di: Chen, Zeyu, et al.
Pubblicazione: (2025)
di: Chen, Zeyu, et al.
Pubblicazione: (2025)
INVESTORBENCH: A Benchmark for Financial Decision-Making Tasks with LLM-based Agent
di: Li, Haohang, et al.
Pubblicazione: (2024)
di: Li, Haohang, et al.
Pubblicazione: (2024)
All That Glisters Is Not Gold: A Benchmark for Reference-Free Counterfactual Financial Misinformation Detection
di: Jiang, Yuechen, et al.
Pubblicazione: (2026)
di: Jiang, Yuechen, et al.
Pubblicazione: (2026)
Deep Bellman Hedging
di: Buehler, Hans, et al.
Pubblicazione: (2022)
di: Buehler, Hans, et al.
Pubblicazione: (2022)
Toward Engineering AGI: Benchmarking the Engineering Design Capabilities of LLMs
di: Guo, Xingang, et al.
Pubblicazione: (2025)
di: Guo, Xingang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
KARMA: Leveraging Multi-Agent LLMs for Automated Knowledge Graph Enrichment
di: Lu, Yuxing, et al.
Pubblicazione: (2025) -
Biomedical Knowledge Graph: A Survey of Domains, Tasks, and Real-World Applications
di: Lu, Yuxing, et al.
Pubblicazione: (2025) -
EvidenceRL: Reinforcing Evidence Consistency for Trustworthy Language Models
di: Tamo, J. Ben, et al.
Pubblicazione: (2026) -
DoctorRAG: Medical RAG Fusing Knowledge with Patient Analogy through Textual Gradients
di: Lu, Yuxing, et al.
Pubblicazione: (2025) -
ClinEnv: An Interactive Multi-Stage Long Horizon EHR Environment for Agents
di: Lu, Yuxing, et al.
Pubblicazione: (2026)