Enregistré dans:
| Auteurs principaux: | Tong, Xin, Jin, Bo, Lin, Zhi, Wang, Binjun, Yu, Ting, Cheng, Qiang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2402.07234 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HAVE: Head-Adaptive Gating and ValuE Calibration for Hallucination Mitigation in Large Language Models
par: Tong, Xin, et autres
Publié: (2025)
par: Tong, Xin, et autres
Publié: (2025)
MEUV: Achieving Fine-Grained Capability Activation in Large Language Models via Mutually Exclusive Unlock Vectors
par: Tong, Xin, et autres
Publié: (2025)
par: Tong, Xin, et autres
Publié: (2025)
InsQABench: Benchmarking Chinese Insurance Domain Question Answering with Large Language Models
par: Ding, Jing, et autres
Publié: (2025)
par: Ding, Jing, et autres
Publié: (2025)
TCMBench: A Comprehensive Benchmark for Evaluating Large Language Models in Traditional Chinese Medicine
par: Yue, Wenjing, et autres
Publié: (2024)
par: Yue, Wenjing, et autres
Publié: (2024)
CMMaTH: A Chinese Multi-modal Math Skill Evaluation Benchmark for Foundation Models
par: Li, Zhong-Zhi, et autres
Publié: (2024)
par: Li, Zhong-Zhi, et autres
Publié: (2024)
Chinese Labor Law Large Language Model Benchmark
par: Lan, Zixun, et autres
Publié: (2026)
par: Lan, Zixun, et autres
Publié: (2026)
CMoralEval: A Moral Evaluation Benchmark for Chinese Large Language Models
par: Yu, Linhao, et autres
Publié: (2024)
par: Yu, Linhao, et autres
Publié: (2024)
Benchmarking Reasoning Robustness in Large Language Models
par: Yu, Tong, et autres
Publié: (2025)
par: Yu, Tong, et autres
Publié: (2025)
ANGO: A Next-Level Evaluation Benchmark For Generation-Oriented Language Models In Chinese Domain
par: Wang, Bingchao
Publié: (2024)
par: Wang, Bingchao
Publié: (2024)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
par: Liu, Mianxin, et autres
Publié: (2024)
par: Liu, Mianxin, et autres
Publié: (2024)
FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models
par: Liu, Yan, et autres
Publié: (2024)
par: Liu, Yan, et autres
Publié: (2024)
JailBench: A Comprehensive Chinese Security Assessment Benchmark for Large Language Models
par: Liu, Shuyi, et autres
Publié: (2025)
par: Liu, Shuyi, et autres
Publié: (2025)
Dynamic Guided and Domain Applicable Safeguards for Enhanced Security in Large Language Models
par: Luo, Weidi, et autres
Publié: (2024)
par: Luo, Weidi, et autres
Publié: (2024)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
par: Zhou, Chengfeng, et autres
Publié: (2025)
par: Zhou, Chengfeng, et autres
Publié: (2025)
LawGPT: A Chinese Legal Knowledge-Enhanced Large Language Model
par: Zhou, Zhi, et autres
Publié: (2024)
par: Zhou, Zhi, et autres
Publié: (2024)
CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models
par: LI, Yizhi, et autres
Publié: (2024)
par: LI, Yizhi, et autres
Publié: (2024)
Large Language Models for Classical Chinese Poetry Translation: Benchmarking, Evaluating, and Improving
par: Chen, Andong, et autres
Publié: (2024)
par: Chen, Andong, et autres
Publié: (2024)
Revolutionizing Database Q&A with Large Language Models: Comprehensive Benchmark and Evaluation
par: Zheng, Yihang, et autres
Publié: (2024)
par: Zheng, Yihang, et autres
Publié: (2024)
DVD: A Robust Method for Detecting Variant Contamination in Large Language Model Evaluation
par: Liang, Renzhao, et autres
Publié: (2026)
par: Liang, Renzhao, et autres
Publié: (2026)
Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation Dataset
par: Zhu, Jie, et autres
Publié: (2024)
par: Zhu, Jie, et autres
Publié: (2024)
AlignBench: Benchmarking Chinese Alignment of Large Language Models
par: Liu, Xiao, et autres
Publié: (2023)
par: Liu, Xiao, et autres
Publié: (2023)
MSDiagnosis: A Benchmark for Evaluating Large Language Models in Multi-Step Clinical Diagnosis
par: Hou, Ruihui, et autres
Publié: (2024)
par: Hou, Ruihui, et autres
Publié: (2024)
UrbanPlanBench: A Comprehensive Urban Planning Benchmark for Evaluating Large Language Models
par: Zheng, Yu, et autres
Publié: (2025)
par: Zheng, Yu, et autres
Publié: (2025)
Enterprise Large Language Model Evaluation Benchmark
par: Wang, Liya, et autres
Publié: (2025)
par: Wang, Liya, et autres
Publié: (2025)
DeepMath-Creative: A Benchmark for Evaluating Mathematical Creativity of Large Language Models
par: Chen, Xiaoyang, et autres
Publié: (2025)
par: Chen, Xiaoyang, et autres
Publié: (2025)
MedGo: A Chinese Medical Large Language Model
par: Zhang, Haitao, et autres
Publié: (2024)
par: Zhang, Haitao, et autres
Publié: (2024)
SafeRAG: Benchmarking Security in Retrieval-Augmented Generation of Large Language Model
par: Liang, Xun, et autres
Publié: (2025)
par: Liang, Xun, et autres
Publié: (2025)
EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education
par: Ma, Guoqing, et autres
Publié: (2025)
par: Ma, Guoqing, et autres
Publié: (2025)
Benchmarking Multi-Step Legal Reasoning and Analyzing Chain-of-Thought Effects in Large Language Models
par: Yu, Wenhan, et autres
Publié: (2025)
par: Yu, Wenhan, et autres
Publié: (2025)
Large Language Models for Cyber Security: A Systematic Literature Review
par: Xu, Hanxiang, et autres
Publié: (2024)
par: Xu, Hanxiang, et autres
Publié: (2024)
NewsBench: A Systematic Evaluation Framework for Assessing Editorial Capabilities of Large Language Models in Chinese Journalism
par: Li, Miao, et autres
Publié: (2024)
par: Li, Miao, et autres
Publié: (2024)
AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation
par: Zhang, Tanghaoran, et autres
Publié: (2026)
par: Zhang, Tanghaoran, et autres
Publié: (2026)
A Survey on Data Security in Large Language Models
par: Chen, Kang, et autres
Publié: (2025)
par: Chen, Kang, et autres
Publié: (2025)
Designing Domain-Specific Large Language Models: The Critical Role of Fine-Tuning in Public Opinion Simulation
par: Lin, Haocheng
Publié: (2024)
par: Lin, Haocheng
Publié: (2024)
DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
par: Chung, Tsz Ting, et autres
Publié: (2025)
par: Chung, Tsz Ting, et autres
Publié: (2025)
HSKBenchmark: Modeling and Benchmarking Chinese Second Language Acquisition in Large Language Models through Curriculum Tuning
par: Yang, Qihao, et autres
Publié: (2025)
par: Yang, Qihao, et autres
Publié: (2025)
Evaluating and Enhancing Large Language Models Performance in Domain-specific Medicine: Osteoarthritis Management with DocOA
par: Chen, Xi, et autres
Publié: (2024)
par: Chen, Xi, et autres
Publié: (2024)
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
par: Tan, Yingshui, et autres
Publié: (2024)
par: Tan, Yingshui, et autres
Publié: (2024)
KGPA: Robustness Evaluation for Large Language Models via Cross-Domain Knowledge Graphs
par: Pei, Aihua, et autres
Publié: (2024)
par: Pei, Aihua, et autres
Publié: (2024)
Chinese Metaphor Recognition Using a Multi-stage Prompting Large Language Model
par: Wang, Jie, et autres
Publié: (2024)
par: Wang, Jie, et autres
Publié: (2024)
Documents similaires
-
HAVE: Head-Adaptive Gating and ValuE Calibration for Hallucination Mitigation in Large Language Models
par: Tong, Xin, et autres
Publié: (2025) -
MEUV: Achieving Fine-Grained Capability Activation in Large Language Models via Mutually Exclusive Unlock Vectors
par: Tong, Xin, et autres
Publié: (2025) -
InsQABench: Benchmarking Chinese Insurance Domain Question Answering with Large Language Models
par: Ding, Jing, et autres
Publié: (2025) -
TCMBench: A Comprehensive Benchmark for Evaluating Large Language Models in Traditional Chinese Medicine
par: Yue, Wenjing, et autres
Publié: (2024) -
CMMaTH: A Chinese Multi-modal Math Skill Evaluation Benchmark for Foundation Models
par: Li, Zhong-Zhi, et autres
Publié: (2024)