Salvato in:
| Autori principali: | Xia, Yinghui, Chen, Yuyan, Shi, Tianyu, Wang, Jun, Yang, Jinsong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2406.04712 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Is Your AI-Generated Code Really Safe? Evaluating Large Language Models on Secure Code Generation with CodeSecEval
di: Wang, Jiexin, et al.
Pubblicazione: (2024)
di: Wang, Jiexin, et al.
Pubblicazione: (2024)
CMAT: A Multi-Agent Collaboration Tuning Framework for Enhancing Small Language Models
di: Liang, Xuechen, et al.
Pubblicazione: (2024)
di: Liang, Xuechen, et al.
Pubblicazione: (2024)
ConCodeEval: Evaluating Large Language Models for Code Constraints in Domain-Specific Languages
di: Kammakomati, Mehant, et al.
Pubblicazione: (2024)
di: Kammakomati, Mehant, et al.
Pubblicazione: (2024)
FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
di: Guo, Xin, et al.
Pubblicazione: (2023)
di: Guo, Xin, et al.
Pubblicazione: (2023)
ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation
di: Chen, Yeheng, et al.
Pubblicazione: (2026)
di: Chen, Yeheng, et al.
Pubblicazione: (2026)
VHDL-Eval: A Framework for Evaluating Large Language Models in VHDL Code Generation
di: Vijayaraghavan, Prashanth, et al.
Pubblicazione: (2024)
di: Vijayaraghavan, Prashanth, et al.
Pubblicazione: (2024)
LanguaShrink: Reducing Token Overhead with Psycholinguistics
di: Liang, Xuechen, et al.
Pubblicazione: (2024)
di: Liang, Xuechen, et al.
Pubblicazione: (2024)
FinEval-KR: A Financial Domain Evaluation Framework for Large Language Models' Knowledge and Reasoning
di: Dou, Shaoyu, et al.
Pubblicazione: (2025)
di: Dou, Shaoyu, et al.
Pubblicazione: (2025)
Recent Advancement of Emotion Cognition in Large Language Models
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
Reflective Human-Machine Co-adaptation for Enhanced Text-to-Image Generation Dialogue System
di: Feng, Yuheng, et al.
Pubblicazione: (2024)
di: Feng, Yuheng, et al.
Pubblicazione: (2024)
mHumanEval -- A Multilingual Benchmark to Evaluate Large Language Models for Code Generation
di: Raihan, Nishat, et al.
Pubblicazione: (2024)
di: Raihan, Nishat, et al.
Pubblicazione: (2024)
MetaGPT: Merging Large Language Models Using Model Exclusive Task Arithmetic
di: Zhou, Yuyan, et al.
Pubblicazione: (2024)
di: Zhou, Yuyan, et al.
Pubblicazione: (2024)
R-Eval: A Unified Toolkit for Evaluating Domain Knowledge of Retrieval Augmented Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
di: Tu, Shangqing, et al.
Pubblicazione: (2024)
SocialEval: Evaluating Social Intelligence of Large Language Models
di: Zhou, Jinfeng, et al.
Pubblicazione: (2025)
di: Zhou, Jinfeng, et al.
Pubblicazione: (2025)
AdaptEval: Evaluating Large Language Models on Domain Adaptation for Text Summarization
di: Afzal, Anum, et al.
Pubblicazione: (2024)
di: Afzal, Anum, et al.
Pubblicazione: (2024)
CT-Eval: Benchmarking Chinese Text-to-Table Performance in Large Language Models
di: Shi, Haoxiang, et al.
Pubblicazione: (2024)
di: Shi, Haoxiang, et al.
Pubblicazione: (2024)
Improving Natural Language Capability of Code Large Language Model
di: Li, Wei, et al.
Pubblicazione: (2024)
di: Li, Wei, et al.
Pubblicazione: (2024)
EVM-QuestBench: An Execution-Grounded Benchmark for Natural-Language Transaction Code Generation
di: Yang, Pei, et al.
Pubblicazione: (2026)
di: Yang, Pei, et al.
Pubblicazione: (2026)
SparseEval: Efficient Evaluation of Large Language Models by Sparse Optimization
di: Zhang, Taolin, et al.
Pubblicazione: (2026)
di: Zhang, Taolin, et al.
Pubblicazione: (2026)
CodeJudge-Eval: Can Large Language Models be Good Judges in Code Understanding?
di: Zhao, Yuwei, et al.
Pubblicazione: (2024)
di: Zhao, Yuwei, et al.
Pubblicazione: (2024)
LalaEval: A Holistic Human Evaluation Framework for Domain-Specific Large Language Models
di: Sun, Chongyan, et al.
Pubblicazione: (2024)
di: Sun, Chongyan, et al.
Pubblicazione: (2024)
Leveraging Print Debugging to Improve Code Generation in Large Language Models
di: Hu, Xueyu, et al.
Pubblicazione: (2024)
di: Hu, Xueyu, et al.
Pubblicazione: (2024)
HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation
di: Yu, Zhaojian, et al.
Pubblicazione: (2024)
di: Yu, Zhaojian, et al.
Pubblicazione: (2024)
LongProc: Benchmarking Long-Context Language Models on Long Procedural Generation
di: Ye, Xi, et al.
Pubblicazione: (2025)
di: Ye, Xi, et al.
Pubblicazione: (2025)
AI Safety in Generative AI Large Language Models: A Survey
di: Chua, Jaymari, et al.
Pubblicazione: (2024)
di: Chua, Jaymari, et al.
Pubblicazione: (2024)
Improving Retrieval Augmented Language Model with Self-Reasoning
di: Xia, Yuan, et al.
Pubblicazione: (2024)
di: Xia, Yuan, et al.
Pubblicazione: (2024)
Self-evolving Agents with reflective and memory-augmented abilities
di: Liang, Xuechen, et al.
Pubblicazione: (2024)
di: Liang, Xuechen, et al.
Pubblicazione: (2024)
OJBench: A Competition Level Code Benchmark For Large Language Models
di: Wang, Zhexu, et al.
Pubblicazione: (2025)
di: Wang, Zhexu, et al.
Pubblicazione: (2025)
ESC-Eval: Evaluating Emotion Support Conversations in Large Language Models
di: Zhao, Haiquan, et al.
Pubblicazione: (2024)
di: Zhao, Haiquan, et al.
Pubblicazione: (2024)
CriticEval: Evaluating Large Language Model as Critic
di: Lan, Tian, et al.
Pubblicazione: (2024)
di: Lan, Tian, et al.
Pubblicazione: (2024)
OpenHuEval: Evaluating Large Language Model on Hungarian Specifics
di: Yang, Haote, et al.
Pubblicazione: (2025)
di: Yang, Haote, et al.
Pubblicazione: (2025)
VisEval: A Benchmark for Data Visualization in the Era of Large Language Models
di: Chen, Nan, et al.
Pubblicazione: (2024)
di: Chen, Nan, et al.
Pubblicazione: (2024)
Embracing Ambiguity: Improving Similarity-oriented Tasks with Contextual Synonym Knowledge
di: Li, Yangning, et al.
Pubblicazione: (2022)
di: Li, Yangning, et al.
Pubblicazione: (2022)
LogEval: A Comprehensive Benchmark Suite for Large Language Models In Log Analysis
di: Cui, Tianyu, et al.
Pubblicazione: (2024)
di: Cui, Tianyu, et al.
Pubblicazione: (2024)
MdEval: Massively Multilingual Code Debugging
di: Liu, Shukai, et al.
Pubblicazione: (2024)
di: Liu, Shukai, et al.
Pubblicazione: (2024)
OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models
di: Huang, Siming, et al.
Pubblicazione: (2024)
di: Huang, Siming, et al.
Pubblicazione: (2024)
S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models
di: Yuan, Xiaohan, et al.
Pubblicazione: (2024)
di: Yuan, Xiaohan, et al.
Pubblicazione: (2024)
Large Language Model for Multi-Domain Translation: Benchmarking and Domain CoT Fine-tuning
di: Hu, Tianxiang, et al.
Pubblicazione: (2024)
di: Hu, Tianxiang, et al.
Pubblicazione: (2024)
CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models
di: Shi, Ling, et al.
Pubblicazione: (2024)
di: Shi, Ling, et al.
Pubblicazione: (2024)
UCoder: Unsupervised Code Generation by Internal Probing of Large Language Models
di: Wu, Jiajun, et al.
Pubblicazione: (2025)
di: Wu, Jiajun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Is Your AI-Generated Code Really Safe? Evaluating Large Language Models on Secure Code Generation with CodeSecEval
di: Wang, Jiexin, et al.
Pubblicazione: (2024) -
CMAT: A Multi-Agent Collaboration Tuning Framework for Enhancing Small Language Models
di: Liang, Xuechen, et al.
Pubblicazione: (2024) -
ConCodeEval: Evaluating Large Language Models for Code Constraints in Domain-Specific Languages
di: Kammakomati, Mehant, et al.
Pubblicazione: (2024) -
FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models
di: Guo, Xin, et al.
Pubblicazione: (2023) -
ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation
di: Chen, Yeheng, et al.
Pubblicazione: (2026)