Enregistré dans:
| Auteurs principaux: | Li, Kunning, Guo, Jianbin, Shang, Zhaoyang, Liu, Yiqing, Du, Hongmin, Liu, Lingling, Zhao, Yuping, Dong, Lifeng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2512.02816 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Harder The Better: Maintaining Supervised Fine-tuning Generalization with Less but Harder Data
par: Shang, Zhaoyang, et autres
Publié: (2025)
par: Shang, Zhaoyang, et autres
Publié: (2025)
AIDBench: A benchmark for evaluating the authorship identification capability of large language models
par: Wen, Zichen, et autres
Publié: (2024)
par: Wen, Zichen, et autres
Publié: (2024)
A dataset and benchmark for hospital course summarization with adapted large language models
par: Aali, Asad, et autres
Publié: (2024)
par: Aali, Asad, et autres
Publié: (2024)
MaterialFigBENCH: benchmark dataset with figures for evaluating college-level materials science problem-solving abilities of multimodal large language models
par: Yoshitake, Michiko, et autres
Publié: (2026)
par: Yoshitake, Michiko, et autres
Publié: (2026)
Tgea: An error-annotated dataset and benchmark tasks for text generation from pretrained language models
par: He, Jie, et autres
Publié: (2025)
par: He, Jie, et autres
Publié: (2025)
Collaborative decoding of critical tokens for boosting factuality of large language models
par: Jin, Lifeng, et autres
Publié: (2024)
par: Jin, Lifeng, et autres
Publié: (2024)
FarsEval-PKBETS: A new diverse benchmark for evaluating Persian large language models
par: Shamsfard, Mehrnoush, et autres
Publié: (2025)
par: Shamsfard, Mehrnoush, et autres
Publié: (2025)
A large-scale image-text dataset benchmark for farmland segmentation
par: Tao, Chao, et autres
Publié: (2025)
par: Tao, Chao, et autres
Publié: (2025)
GRASP: A novel benchmark for evaluating language GRounding And Situated Physics understanding in multimodal language models
par: Jassim, Serwan, et autres
Publié: (2023)
par: Jassim, Serwan, et autres
Publié: (2023)
TeleEval-OS: Performance evaluations of large language models for operations scheduling
par: Wang, Yanyan, et autres
Publié: (2025)
par: Wang, Yanyan, et autres
Publié: (2025)
Creativity Benchmark: A benchmark for marketing creativity for large language models
par: Bhat, Ninad, et autres
Publié: (2025)
par: Bhat, Ninad, et autres
Publié: (2025)
Re-evaluating Theory of Mind evaluation in large language models
par: Hu, Jennifer, et autres
Publié: (2025)
par: Hu, Jennifer, et autres
Publié: (2025)
CCI3.0-HQ: a large-scale Chinese dataset of high quality designed for pre-training large language models
par: Wang, Liangdong, et autres
Publié: (2024)
par: Wang, Liangdong, et autres
Publié: (2024)
TAGLAS: An atlas of text-attributed graph datasets in the era of large graph and language models
par: Feng, Jiarui, et autres
Publié: (2024)
par: Feng, Jiarui, et autres
Publié: (2024)
Factual consistency evaluation of summarization in the Era of large language models
par: Luo, Zheheng, et autres
Publié: (2024)
par: Luo, Zheheng, et autres
Publié: (2024)
A benchmark multimodal oro-dental dataset for large vision-language models
par: Lv, Haoxin, et autres
Publié: (2025)
par: Lv, Haoxin, et autres
Publié: (2025)
A thorough benchmark of automatic text classification: From traditional approaches to large language models
par: Cunha, Washington, et autres
Publié: (2025)
par: Cunha, Washington, et autres
Publié: (2025)
Environmental large language model Evaluation (ELLE) dataset: A Benchmark for Evaluating Generative AI applications in Eco-environment Domain
par: Guo, Jing, et autres
Publié: (2025)
par: Guo, Jing, et autres
Publié: (2025)
Retrieval augmentation of large language models for lay language generation
par: Guo, Yue, et autres
Publié: (2022)
par: Guo, Yue, et autres
Publié: (2022)
Long-form factuality in large language models
par: Wei, Jerry, et autres
Publié: (2024)
par: Wei, Jerry, et autres
Publié: (2024)
Dynamic data sampler for cross-language transfer learning in large language models
par: Li, Yudong, et autres
Publié: (2024)
par: Li, Yudong, et autres
Publié: (2024)
Robustness assessment of large audio language models in multiple-choice evaluation
par: López, Fernando, et autres
Publié: (2025)
par: López, Fernando, et autres
Publié: (2025)
COGNET-MD, an evaluation framework and dataset for Large Language Model benchmarks in the medical domain
par: Panagoulias, Dimitrios P., et autres
Publié: (2024)
par: Panagoulias, Dimitrios P., et autres
Publié: (2024)
Anchor function: a type of benchmark functions for studying language models
par: Zhang, Zhongwang, et autres
Publié: (2024)
par: Zhang, Zhongwang, et autres
Publié: (2024)
Leveraging language models for summarizing mental state examinations: A comprehensive evaluation and dataset release
par: Sahu, Nilesh Kumar, et autres
Publié: (2024)
par: Sahu, Nilesh Kumar, et autres
Publié: (2024)
HESEIA: A community-based dataset for evaluating social biases in large language models, co-designed in real school settings in Latin America
par: Ivetta, Guido, et autres
Publié: (2025)
par: Ivetta, Guido, et autres
Publié: (2025)
ECG-LLM -- training and evaluation of domain-specific large language models for electrocardiography
par: Ahrens, Lara, et autres
Publié: (2025)
par: Ahrens, Lara, et autres
Publié: (2025)
The current status of large language models in summarizing radiology report impressions
par: Hu, Danqing, et autres
Publié: (2024)
par: Hu, Danqing, et autres
Publié: (2024)
DongYuan: An LLM-Based Framework for Integrative Chinese and Western Medicine Spleen-Stomach Disorders Diagnosis
par: Li, Hua, et autres
Publié: (2026)
par: Li, Hua, et autres
Publié: (2026)
Are LLM-generated plain language summaries truly understandable? A large-scale crowdsourced evaluation
par: Guo, Yue, et autres
Publié: (2025)
par: Guo, Yue, et autres
Publié: (2025)
Is your multimodal large language model a good science tutor?
par: Liu, Ming, et autres
Publié: (2025)
par: Liu, Ming, et autres
Publié: (2025)
Outraged AI: Large language models prioritise emotion over cost in fairness enforcement
par: Liu, Hao, et autres
Publié: (2025)
par: Liu, Hao, et autres
Publié: (2025)
AlleNoise: large-scale text classification benchmark dataset with real-world label noise
par: Rączkowska, Alicja, et autres
Publié: (2024)
par: Rączkowska, Alicja, et autres
Publié: (2024)
Advancing bioinformatics with large language models: components, applications and perspectives
par: Liu, Jiajia, et autres
Publié: (2024)
par: Liu, Jiajia, et autres
Publié: (2024)
Multilingual large language models leak human stereotypes across language boundaries
par: Cao, Yang Trista, et autres
Publié: (2023)
par: Cao, Yang Trista, et autres
Publié: (2023)
WorldMedQA-V: a multilingual, multimodal medical examination dataset for multimodal language models evaluation
par: Matos, João, et autres
Publié: (2024)
par: Matos, João, et autres
Publié: (2024)
Dissociating language and thought in large language models
par: Mahowald, Kyle, et autres
Publié: (2023)
par: Mahowald, Kyle, et autres
Publié: (2023)
LongTail-Swap: benchmarking language models' abilities on rare words
par: Algayres, Robin, et autres
Publié: (2025)
par: Algayres, Robin, et autres
Publié: (2025)
BabySLM: language-acquisition-friendly benchmark of self-supervised spoken language models
par: Lavechin, Marvin, et autres
Publié: (2023)
par: Lavechin, Marvin, et autres
Publié: (2023)
Bridging vision language model (VLM) evaluation gaps with a framework for scalable and cost-effective benchmark generation
par: Rädsch, Tim, et autres
Publié: (2025)
par: Rädsch, Tim, et autres
Publié: (2025)
Documents similaires
-
The Harder The Better: Maintaining Supervised Fine-tuning Generalization with Less but Harder Data
par: Shang, Zhaoyang, et autres
Publié: (2025) -
AIDBench: A benchmark for evaluating the authorship identification capability of large language models
par: Wen, Zichen, et autres
Publié: (2024) -
A dataset and benchmark for hospital course summarization with adapted large language models
par: Aali, Asad, et autres
Publié: (2024) -
MaterialFigBENCH: benchmark dataset with figures for evaluating college-level materials science problem-solving abilities of multimodal large language models
par: Yoshitake, Michiko, et autres
Publié: (2026) -
Tgea: An error-annotated dataset and benchmark tasks for text generation from pretrained language models
par: He, Jie, et autres
Publié: (2025)