Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels
Fuente:
arXiv
Salvato in:
| Autori principali: | Yan, Jianhao, Yan, Pingchuan, Chen, Yulong, Li, Jing, Zhu, Xianchao, Zhang, Yue |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GPT-4 vs. Human Translators: A Comprehensive Evaluation of Translation Quality Across Languages, Domains, and Expertise Levels
di: Yan, Jianhao, et al.
Pubblicazione: (2024)
di: Yan, Jianhao, et al.
Pubblicazione: (2024)
RefuteBench: Evaluating Refuting Instruction-Following for Large Language Models
di: Yan, Jianhao, et al.
Pubblicazione: (2024)
di: Yan, Jianhao, et al.
Pubblicazione: (2024)
DiscoX: Benchmarking Discourse-Level Translation task in Expert Domains
di: Zhao, Xiying, et al.
Pubblicazione: (2025)
di: Zhao, Xiying, et al.
Pubblicazione: (2025)
BAGEL: Benchmarking Animal Knowledge Expertise in Language Models
di: Shen, Jiacheng, et al.
Pubblicazione: (2026)
di: Shen, Jiacheng, et al.
Pubblicazione: (2026)
TCMBench: A Comprehensive Benchmark for Evaluating Large Language Models in Traditional Chinese Medicine
di: Yue, Wenjing, et al.
Pubblicazione: (2024)
di: Yue, Wenjing, et al.
Pubblicazione: (2024)
Evaluating the Translation Performance of Large Language Models Based on Euas-20
di: Huang, Yan, et al.
Pubblicazione: (2024)
di: Huang, Yan, et al.
Pubblicazione: (2024)
Fine-Tuning Medical Language Models for Enhanced Long-Contextual Understanding and Domain Expertise
di: Yang, Qimin, et al.
Pubblicazione: (2024)
di: Yang, Qimin, et al.
Pubblicazione: (2024)
Potential and Challenges of Model Editing for Social Debiasing
di: Yan, Jianhao, et al.
Pubblicazione: (2024)
di: Yan, Jianhao, et al.
Pubblicazione: (2024)
ANGO: A Next-Level Evaluation Benchmark For Generation-Oriented Language Models In Chinese Domain
di: Wang, Bingchao
Pubblicazione: (2024)
di: Wang, Bingchao
Pubblicazione: (2024)
Putting GPT-4o to the Sword: A Comprehensive Evaluation of Language, Vision, Speech, and Multimodal Proficiency
di: Shahriar, Sakib, et al.
Pubblicazione: (2024)
di: Shahriar, Sakib, et al.
Pubblicazione: (2024)
Large Language Models for Classical Chinese Poetry Translation: Benchmarking, Evaluating, and Improving
di: Chen, Andong, et al.
Pubblicazione: (2024)
di: Chen, Andong, et al.
Pubblicazione: (2024)
From Physician Expertise to Clinical Agents: Preserving, Standardizing, and Scaling Physicians' Medical Expertise with Lightweight LLM
di: Luo, Chanyong, et al.
Pubblicazione: (2026)
di: Luo, Chanyong, et al.
Pubblicazione: (2026)
Detecting RLVR Training Data via Structural Convergence of Reasoning
di: Zhang, Hongbo, et al.
Pubblicazione: (2026)
di: Zhang, Hongbo, et al.
Pubblicazione: (2026)
Detecting the Machine: A Comprehensive Benchmark of AI-Generated Text Detectors Across Architectures, Domains, and Adversarial Conditions
di: Baidya, Madhav S., et al.
Pubblicazione: (2026)
di: Baidya, Madhav S., et al.
Pubblicazione: (2026)
Sentiment Analysis Across Languages: Evaluation Before and After Machine Translation to English
di: Kathunia, Aekansh, et al.
Pubblicazione: (2024)
di: Kathunia, Aekansh, et al.
Pubblicazione: (2024)
Convergences and Divergences between Automatic Assessment and Human Evaluation: Insights from Comparing ChatGPT-Generated Translation and Neural Machine Translation
di: Jiang, Zhaokun, et al.
Pubblicazione: (2024)
di: Jiang, Zhaokun, et al.
Pubblicazione: (2024)
Do Language Models Reason Across Languages?
di: Meng, Yan, et al.
Pubblicazione: (2026)
di: Meng, Yan, et al.
Pubblicazione: (2026)
Comparative Evaluation of ChatGPT and DeepSeek Across Key NLP Tasks: Strengths, Weaknesses, and Domain-Specific Performance
di: Etaiwi, Wael, et al.
Pubblicazione: (2025)
di: Etaiwi, Wael, et al.
Pubblicazione: (2025)
BEADs: Bias Evaluation Across Domains
di: Raza, Shaina, et al.
Pubblicazione: (2024)
di: Raza, Shaina, et al.
Pubblicazione: (2024)
UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models
di: Xu, Xin, et al.
Pubblicazione: (2025)
di: Xu, Xin, et al.
Pubblicazione: (2025)
Leveraging Professional Radiologists' Expertise to Enhance LLMs' Evaluation for Radiology Reports
di: Zhu, Qingqing, et al.
Pubblicazione: (2024)
di: Zhu, Qingqing, et al.
Pubblicazione: (2024)
A Functionality-Grounded Benchmark for Evaluating Web Agents in E-commerce Domains
di: Zhang, Xianren, et al.
Pubblicazione: (2025)
di: Zhang, Xianren, et al.
Pubblicazione: (2025)
Integrating Large Language Models with Human Expertise for Disease Detection in Electronic Health Records
di: Pan, Jie, et al.
Pubblicazione: (2025)
di: Pan, Jie, et al.
Pubblicazione: (2025)
PharmaGPT: Domain-Specific Large Language Models for Bio-Pharmaceutical and Chemistry
di: Chen, Linqing, et al.
Pubblicazione: (2024)
di: Chen, Linqing, et al.
Pubblicazione: (2024)
Evaluating ChatGPT on Nuclear Domain-Specific Data
di: Anwar, Muhammad, et al.
Pubblicazione: (2024)
di: Anwar, Muhammad, et al.
Pubblicazione: (2024)
OpenToM: A Comprehensive Benchmark for Evaluating Theory-of-Mind Reasoning Capabilities of Large Language Models
di: Xu, Hainiu, et al.
Pubblicazione: (2024)
di: Xu, Hainiu, et al.
Pubblicazione: (2024)
ChatLog: Carefully Evaluating the Evolution of ChatGPT Across Time
di: Tu, Shangqing, et al.
Pubblicazione: (2023)
di: Tu, Shangqing, et al.
Pubblicazione: (2023)
Pay Attention to Real World Perturbations! Natural Robustness Evaluation in Machine Reading Comprehension
di: Wu, Yulong, et al.
Pubblicazione: (2025)
di: Wu, Yulong, et al.
Pubblicazione: (2025)
EmotionQueen: A Benchmark for Evaluating Empathy of Large Language Models
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
di: Chen, Yuyan, et al.
Pubblicazione: (2024)
Evaluating LLMs Across Multi-Cognitive Levels: From Medical Knowledge Mastery to Scenario-Based Problem Solving
di: Zhou, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhou, Yuxuan, et al.
Pubblicazione: (2025)
MIMIR: A Streamlined Platform for Personalized Agent Tuning in Domain Expertise
di: Deng, Chunyuan, et al.
Pubblicazione: (2024)
di: Deng, Chunyuan, et al.
Pubblicazione: (2024)
Span-Level Machine Translation Meta-Evaluation
di: Perrella, Stefano, et al.
Pubblicazione: (2026)
di: Perrella, Stefano, et al.
Pubblicazione: (2026)
EasyDistill: A Comprehensive Toolkit for Effective Knowledge Distillation of Large Language Models
di: Wang, Chengyu, et al.
Pubblicazione: (2025)
di: Wang, Chengyu, et al.
Pubblicazione: (2025)
Beyond SELECT: A Comprehensive Taxonomy-Guided Benchmark for Real-World Text-to-SQL Translation
di: Wang, Hao, et al.
Pubblicazione: (2025)
di: Wang, Hao, et al.
Pubblicazione: (2025)
Self-Specialization: Uncovering Latent Expertise within Large Language Models
di: Kang, Junmo, et al.
Pubblicazione: (2023)
di: Kang, Junmo, et al.
Pubblicazione: (2023)
FinTral: A Family of GPT-4 Level Multimodal Financial Large Language Models
di: Bhatia, Gagan, et al.
Pubblicazione: (2024)
di: Bhatia, Gagan, et al.
Pubblicazione: (2024)
From General Reasoning to Domain Expertise: Uncovering the Limits of Generalization in Large Language Models
di: Alsagheer, Dana, et al.
Pubblicazione: (2025)
di: Alsagheer, Dana, et al.
Pubblicazione: (2025)
MILPaC: A Novel Benchmark for Evaluating Translation of Legal Text to Indian Languages
di: Mahapatra, Sayan, et al.
Pubblicazione: (2023)
di: Mahapatra, Sayan, et al.
Pubblicazione: (2023)
LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models
di: Ning, Zhiyuan, et al.
Pubblicazione: (2025)
di: Ning, Zhiyuan, et al.
Pubblicazione: (2025)
Benchmarking Concept-Spilling Across Languages in LLMs
di: Badanin, Ilia, et al.
Pubblicazione: (2026)
di: Badanin, Ilia, et al.
Pubblicazione: (2026)
Documenti analoghi
-
GPT-4 vs. Human Translators: A Comprehensive Evaluation of Translation Quality Across Languages, Domains, and Expertise Levels
di: Yan, Jianhao, et al.
Pubblicazione: (2024) -
RefuteBench: Evaluating Refuting Instruction-Following for Large Language Models
di: Yan, Jianhao, et al.
Pubblicazione: (2024) -
DiscoX: Benchmarking Discourse-Level Translation task in Expert Domains
di: Zhao, Xiying, et al.
Pubblicazione: (2025) -
BAGEL: Benchmarking Animal Knowledge Expertise in Language Models
di: Shen, Jiacheng, et al.
Pubblicazione: (2026) -
TCMBench: A Comprehensive Benchmark for Evaluating Large Language Models in Traditional Chinese Medicine
di: Yue, Wenjing, et al.
Pubblicazione: (2024)