A Systematic Evaluation of Large Language Models for Natural Language Generation Tasks
Fuente:
arXiv
Saved in:
| Main Authors: | Ni, Xuanfan, Li, Piji |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
XL$^2$Bench: A Benchmark for Extremely Long Context Understanding with Long-range Dependencies
by: Ni, Xuanfan, et al.
Published: (2024)
by: Ni, Xuanfan, et al.
Published: (2024)
Temporal Guidance for Large Language Models
by: Zheng, Hong-Kai, et al.
Published: (2026)
by: Zheng, Hong-Kai, et al.
Published: (2026)
Generating Diverse Training Samples for Relation Extraction with Large Language Models
by: Li, Zexuan, et al.
Published: (2025)
by: Li, Zexuan, et al.
Published: (2025)
LEMoE: Advanced Mixture of Experts Adaptor for Lifelong Model Editing of Large Language Models
by: Wang, Renzhi, et al.
Published: (2024)
by: Wang, Renzhi, et al.
Published: (2024)
M-BRe: Discovering Training Samples for Relation Extraction from Unlabeled Texts with Large Language Models
by: Li, Zexuan, et al.
Published: (2025)
by: Li, Zexuan, et al.
Published: (2025)
5W1H Extraction With Large Language Models
by: Cao, Yang, et al.
Published: (2024)
by: Cao, Yang, et al.
Published: (2024)
Characteristic AI Agents via Large Language Models
by: Wang, Xi, et al.
Published: (2024)
by: Wang, Xi, et al.
Published: (2024)
Improve Language Model and Brain Alignment via Associative Memory
by: Yin, Congchi, et al.
Published: (2025)
by: Yin, Congchi, et al.
Published: (2025)
Towards Threshold-Free KV Cache Pruning
by: Ni, Xuanfan, et al.
Published: (2025)
by: Ni, Xuanfan, et al.
Published: (2025)
A Systematic Review on the Evaluation of Large Language Models in Theory of Mind Tasks
by: Sarıtaş, Karahan, et al.
Published: (2025)
by: Sarıtaş, Karahan, et al.
Published: (2025)
Evaluating Large Language Models for Radiology Natural Language Processing
by: Liu, Zhengliang, et al.
Published: (2023)
by: Liu, Zhengliang, et al.
Published: (2023)
MEMoE: Enhancing Model Editing with Mixture of Experts Adaptors
by: Wang, Renzhi, et al.
Published: (2024)
by: Wang, Renzhi, et al.
Published: (2024)
Language Reconstruction with Brain Predictive Coding from fMRI Data
by: Yin, Congchi, et al.
Published: (2024)
by: Yin, Congchi, et al.
Published: (2024)
Marco-Bench-MIF: On Multilingual Instruction-Following Capability of Large Language Models
by: Zeng, Bo, et al.
Published: (2025)
by: Zeng, Bo, et al.
Published: (2025)
Semantic are Beacons: A Semantic Perspective for Unveiling Parameter-Efficient Fine-Tuning in Knowledge Learning
by: Wang, Renzhi, et al.
Published: (2024)
by: Wang, Renzhi, et al.
Published: (2024)
Hallucination Mitigating for Medical Report Generation
by: Zhao, Ruoqing, et al.
Published: (2026)
by: Zhao, Ruoqing, et al.
Published: (2026)
EthioLLM: Multilingual Large Language Models for Ethiopian Languages with Task Evaluation
by: Tonja, Atnafu Lambebo, et al.
Published: (2024)
by: Tonja, Atnafu Lambebo, et al.
Published: (2024)
Evaluating Large Language Models on Spatial Tasks: A Multi-Task Benchmarking Study
by: Xu, Liuchang, et al.
Published: (2024)
by: Xu, Liuchang, et al.
Published: (2024)
SCORE: Systematic COnsistency and Robustness Evaluation for Large Language Models
by: Nalbandyan, Grigor, et al.
Published: (2025)
by: Nalbandyan, Grigor, et al.
Published: (2025)
Exploring the Reliability of Large Language Models as Customized Evaluators for Diverse NLP Tasks
by: Li, Qintong, et al.
Published: (2023)
by: Li, Qintong, et al.
Published: (2023)
Evaluating Large Language Models in Theory of Mind Tasks
by: Kosinski, Michal
Published: (2023)
by: Kosinski, Michal
Published: (2023)
Using Counterfactual Tasks to Evaluate the Generality of Analogical Reasoning in Large Language Models
by: Lewis, Martha, et al.
Published: (2024)
by: Lewis, Martha, et al.
Published: (2024)
Task Calibration: Calibrating Large Language Models on Inference Tasks
by: Li, Yingjie, et al.
Published: (2024)
by: Li, Yingjie, et al.
Published: (2024)
Improving Natural Language Capability of Code Large Language Model
by: Li, Wei, et al.
Published: (2024)
by: Li, Wei, et al.
Published: (2024)
Evaluating Ill-Defined Tasks in Large Language Models
by: Zhou, Yi, et al.
Published: (2026)
by: Zhou, Yi, et al.
Published: (2026)
Genshin: General Shield for Natural Language Processing with Large Language Models
by: Peng, Xiao, et al.
Published: (2024)
by: Peng, Xiao, et al.
Published: (2024)
Quantized Large Language Models in Biomedical Natural Language Processing: Evaluation and Recommendation
by: Zhan, Zaifu, et al.
Published: (2025)
by: Zhan, Zaifu, et al.
Published: (2025)
Evaluating Large Language Models for Abstract Evaluation Tasks: An Empirical Study
by: Liu, Yinuo, et al.
Published: (2026)
by: Liu, Yinuo, et al.
Published: (2026)
The Evolving Landscape of Generative Large Language Models and Traditional Natural Language Processing in Medicine
by: Yang, Rui, et al.
Published: (2025)
by: Yang, Rui, et al.
Published: (2025)
Evaluating Prompting Strategies and Large Language Models in Systematic Literature Review Screening: Relevance and Task-Stage Classification
by: Han, Binglan, et al.
Published: (2025)
by: Han, Binglan, et al.
Published: (2025)
Natural Fingerprints of Large Language Models
by: Suzuki, Teppei, et al.
Published: (2025)
by: Suzuki, Teppei, et al.
Published: (2025)
Embodied Task Planning via Graph-Informed Action Generation with Large Language Models
by: Li, Xiang, et al.
Published: (2026)
by: Li, Xiang, et al.
Published: (2026)
Large Language Models as Biomedical Hypothesis Generators: A Comprehensive Evaluation
by: Qi, Biqing, et al.
Published: (2024)
by: Qi, Biqing, et al.
Published: (2024)
Evaluating Large Language Models for Real-World Engineering Tasks
by: Heesch, Rene, et al.
Published: (2025)
by: Heesch, Rene, et al.
Published: (2025)
S3Eval: A Synthetic, Scalable, Systematic Evaluation Suite for Large Language Models
by: Lei, Fangyu, et al.
Published: (2023)
by: Lei, Fangyu, et al.
Published: (2023)
Systematic Evaluation of Uncertainty Estimation Methods in Large Language Models
by: Hobelsberger, Christian, et al.
Published: (2025)
by: Hobelsberger, Christian, et al.
Published: (2025)
Evaluating the Impact of Compression Techniques on Task-Specific Performance of Large Language Models
by: Khanal, Bishwash, et al.
Published: (2024)
by: Khanal, Bishwash, et al.
Published: (2024)
Evaluating the Effectiveness of Cost-Efficient Large Language Models in Benchmark Biomedical Tasks
by: Jahan, Israt, et al.
Published: (2025)
by: Jahan, Israt, et al.
Published: (2025)
Generative Linguistics, Large Language Models, and the Social Nature of Scientific Success
by: Hao, Sophie
Published: (2025)
by: Hao, Sophie
Published: (2025)
Evaluating the Generation Capabilities of Large Chinese Language Models
by: Zeng, Hui, et al.
Published: (2023)
by: Zeng, Hui, et al.
Published: (2023)
Similar Items
-
XL$^2$Bench: A Benchmark for Extremely Long Context Understanding with Long-range Dependencies
by: Ni, Xuanfan, et al.
Published: (2024) -
Temporal Guidance for Large Language Models
by: Zheng, Hong-Kai, et al.
Published: (2026) -
Generating Diverse Training Samples for Relation Extraction with Large Language Models
by: Li, Zexuan, et al.
Published: (2025) -
LEMoE: Advanced Mixture of Experts Adaptor for Lifelong Model Editing of Large Language Models
by: Wang, Renzhi, et al.
Published: (2024) -
M-BRe: Discovering Training Samples for Relation Extraction from Unlabeled Texts with Large Language Models
by: Li, Zexuan, et al.
Published: (2025)