Guardado en:
| Autores principales: | Yuan, Jiayi, Zhang, Jiamu, Wen, Andrew, Hu, Xia |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2502.09670 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Federated Fine-tuning of Large Language Models under Heterogeneous Tasks and Client Resources
por: Bai, Jiamu, et al.
Publicado: (2024)
por: Bai, Jiamu, et al.
Publicado: (2024)
DHP Benchmark: Are LLMs Good NLG Evaluators?
por: Wang, Yicheng, et al.
Publicado: (2024)
por: Wang, Yicheng, et al.
Publicado: (2024)
Evaluating Progress in Graph Foundation Models: A Comprehensive Benchmark and New Insights
por: Yu, Xingtong, et al.
Publicado: (2026)
por: Yu, Xingtong, et al.
Publicado: (2026)
An Exploration of Higher Education Course Evaluation by Large Language Models
por: Yuan, Bo, et al.
Publicado: (2024)
por: Yuan, Bo, et al.
Publicado: (2024)
CMMaTH: A Chinese Multi-modal Math Skill Evaluation Benchmark for Foundation Models
por: Li, Zhong-Zhi, et al.
Publicado: (2024)
por: Li, Zhong-Zhi, et al.
Publicado: (2024)
Language Models can Evaluate Themselves via Probability Discrepancy
por: Xia, Tingyu, et al.
Publicado: (2024)
por: Xia, Tingyu, et al.
Publicado: (2024)
Generating Leakage-Free Benchmarks for Robust RAG Evaluation
por: Liu, Jiayi, et al.
Publicado: (2026)
por: Liu, Jiayi, et al.
Publicado: (2026)
Cross-Platform Evaluation of Reasoning Capabilities in Foundation Models
por: de Curtò, J., et al.
Publicado: (2025)
por: de Curtò, J., et al.
Publicado: (2025)
A Few Words Can Distort Graphs: Knowledge Poisoning Attacks on Graph-based Retrieval-Augmented Generation of Large Language Models
por: Wen, Jiayi, et al.
Publicado: (2025)
por: Wen, Jiayi, et al.
Publicado: (2025)
Adapting Large Language Models for Education: Foundational Capabilities, Potentials, and Challenges
por: Li, Qingyao, et al.
Publicado: (2023)
por: Li, Qingyao, et al.
Publicado: (2023)
Leveraging Computerized Adaptive Testing for Cost-effective Evaluation of Large Language Models in Medical Benchmarking
por: Zheng, Tianpeng, et al.
Publicado: (2026)
por: Zheng, Tianpeng, et al.
Publicado: (2026)
MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs
por: Zhang, Mengyuan, et al.
Publicado: (2024)
por: Zhang, Mengyuan, et al.
Publicado: (2024)
Towards Foundation Models for Knowledge Graph Reasoning
por: Galkin, Mikhail, et al.
Publicado: (2023)
por: Galkin, Mikhail, et al.
Publicado: (2023)
DSAEval: Evaluating Data Science Agents on a Wide Range of Real-World Data Science Problems
por: Sun, Maojun, et al.
Publicado: (2026)
por: Sun, Maojun, et al.
Publicado: (2026)
Batched Low-Rank Adaptation of Foundation Models
por: Wen, Yeming, et al.
Publicado: (2023)
por: Wen, Yeming, et al.
Publicado: (2023)
Yi: Open Foundation Models by 01.AI
por: AI, 01., et al.
Publicado: (2024)
por: AI, 01., et al.
Publicado: (2024)
SAMGPT: Text-free Graph Foundation Model for Multi-domain Pre-training and Cross-domain Adaptation
por: Yu, Xingtong, et al.
Publicado: (2025)
por: Yu, Xingtong, et al.
Publicado: (2025)
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
por: Wu, Yao, et al.
Publicado: (2026)
por: Wu, Yao, et al.
Publicado: (2026)
Beyond Completion: A Foundation Model for General Knowledge Graph Reasoning
por: Hua, Yin, et al.
Publicado: (2025)
por: Hua, Yin, et al.
Publicado: (2025)
FAMA: The First Large-Scale Open-Science Speech Foundation Model for English and Italian
por: Papi, Sara, et al.
Publicado: (2025)
por: Papi, Sara, et al.
Publicado: (2025)
Evaluating the Effectiveness of the Foundational Models for Q&A Classification in Mental Health care
por: Alhuzali, Hassan, et al.
Publicado: (2024)
por: Alhuzali, Hassan, et al.
Publicado: (2024)
MMAI Gym for Science: Training Liquid Foundation Models for Drug Discovery
por: Kuznetsov, Maksim, et al.
Publicado: (2026)
por: Kuznetsov, Maksim, et al.
Publicado: (2026)
A Prompt-Based Knowledge Graph Foundation Model for Universal In-Context Reasoning
por: Cui, Yuanning, et al.
Publicado: (2024)
por: Cui, Yuanning, et al.
Publicado: (2024)
Symbol-LLM: Towards Foundational Symbol-centric Interface For Large Language Models
por: Xu, Fangzhi, et al.
Publicado: (2023)
por: Xu, Fangzhi, et al.
Publicado: (2023)
Luna: An Evaluation Foundation Model to Catch Language Model Hallucinations with High Accuracy and Low Cost
por: Belyi, Masha, et al.
Publicado: (2024)
por: Belyi, Masha, et al.
Publicado: (2024)
DARE-bench: Evaluating Modeling and Instruction Fidelity of LLMs in Data Science
por: Shu, Fan, et al.
Publicado: (2026)
por: Shu, Fan, et al.
Publicado: (2026)
Elsevier Arena: Human Evaluation of Chemistry/Biology/Health Foundational Large Language Models
por: Thorne, Camilo, et al.
Publicado: (2024)
por: Thorne, Camilo, et al.
Publicado: (2024)
FedDTRE: Federated Dialogue Generation Models Powered by Trustworthiness Evaluation
por: Lu, Shule, et al.
Publicado: (2025)
por: Lu, Shule, et al.
Publicado: (2025)
Weaver: Foundation Models for Creative Writing
por: Wang, Tiannan, et al.
Publicado: (2024)
por: Wang, Tiannan, et al.
Publicado: (2024)
Shadow-FT: Tuning Instruct Model via Training on Paired Base Model
por: Wu, Taiqiang, et al.
Publicado: (2025)
por: Wu, Taiqiang, et al.
Publicado: (2025)
On Speeding Up Language Model Evaluation
por: Zhou, Jin Peng, et al.
Publicado: (2024)
por: Zhou, Jin Peng, et al.
Publicado: (2024)
CodeApex: A Bilingual Programming Evaluation Benchmark for Large Language Models
por: Fu, Lingyue, et al.
Publicado: (2023)
por: Fu, Lingyue, et al.
Publicado: (2023)
AI-Driven Automation Can Become the Foundation of Next-Era Science of Science Research
por: Chen, Renqi, et al.
Publicado: (2025)
por: Chen, Renqi, et al.
Publicado: (2025)
MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts
por: Lu, Pan, et al.
Publicado: (2023)
por: Lu, Pan, et al.
Publicado: (2023)
A Survey on Multilingual Large Language Models: Corpora, Alignment, and Bias
por: Xu, Yuemei, et al.
Publicado: (2024)
por: Xu, Yuemei, et al.
Publicado: (2024)
LMFlow: An Extensible Toolkit for Finetuning and Inference of Large Foundation Models
por: Diao, Shizhe, et al.
Publicado: (2023)
por: Diao, Shizhe, et al.
Publicado: (2023)
Whispers that Shake Foundations: Analyzing and Mitigating False Premise Hallucinations in Large Language Models
por: Yuan, Hongbang, et al.
Publicado: (2024)
por: Yuan, Hongbang, et al.
Publicado: (2024)
Fine-Grained Benchmark Generation for Comprehensive Evaluation of Foundation Models
por: Islam, Mohammed Saidul, et al.
Publicado: (2026)
por: Islam, Mohammed Saidul, et al.
Publicado: (2026)
Foundation Models to Unlock Real-World Evidence from Nationwide Medical Claims
por: Ma, Fan, et al.
Publicado: (2026)
por: Ma, Fan, et al.
Publicado: (2026)
Me LLaMA: Foundation Large Language Models for Medical Applications
por: Xie, Qianqian, et al.
Publicado: (2024)
por: Xie, Qianqian, et al.
Publicado: (2024)
Ejemplares similares
-
Federated Fine-tuning of Large Language Models under Heterogeneous Tasks and Client Resources
por: Bai, Jiamu, et al.
Publicado: (2024) -
DHP Benchmark: Are LLMs Good NLG Evaluators?
por: Wang, Yicheng, et al.
Publicado: (2024) -
Evaluating Progress in Graph Foundation Models: A Comprehensive Benchmark and New Insights
por: Yu, Xingtong, et al.
Publicado: (2026) -
An Exploration of Higher Education Course Evaluation by Large Language Models
por: Yuan, Bo, et al.
Publicado: (2024) -
CMMaTH: A Chinese Multi-modal Math Skill Evaluation Benchmark for Foundation Models
por: Li, Zhong-Zhi, et al.
Publicado: (2024)