EssayBench: Evaluating Large Language Models in Multi-Genre Chinese Essay Writing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gao, Fan, Li, Dongyuan, Xia, Ding, Mi, Fei, Wang, Yasheng, Shang, Lifeng, Wang, Baojun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evaluating Austrian A-Level German Essays with Large Language Models for Automated Essay Scoring
par: Kubesch, Jonas, et autres
Publié: (2026)
par: Kubesch, Jonas, et autres
Publié: (2026)
Data Management For Training Large Language Models: A Survey
par: Wang, Zige, et autres
Publié: (2023)
par: Wang, Zige, et autres
Publié: (2023)
EssayJudge: A Multi-Granular Benchmark for Assessing Automated Essay Scoring Capabilities of Multimodal Large Language Models
par: Su, Jiamin, et autres
Publié: (2025)
par: Su, Jiamin, et autres
Publié: (2025)
YODA: Teacher-Student Progressive Learning for Language Models
par: Lu, Jianqiao, et autres
Publié: (2024)
par: Lu, Jianqiao, et autres
Publié: (2024)
Rank-Then-Score: Enhancing Large Language Models for Automated Essay Scoring
par: Cai, Yida, et autres
Publié: (2025)
par: Cai, Yida, et autres
Publié: (2025)
Are Large Language Models Good Essay Graders?
par: Kundu, Anindita, et autres
Publié: (2024)
par: Kundu, Anindita, et autres
Publié: (2024)
Chinese Essay Rhetoric Recognition Using LoRA, In-context Learning and Model Ensemble
par: Lai, Yuxuan, et autres
Publié: (2026)
par: Lai, Yuxuan, et autres
Publié: (2026)
DREsS: Dataset for Rubric-based Essay Scoring on EFL Writing
par: Yoo, Haneul, et autres
Publié: (2024)
par: Yoo, Haneul, et autres
Publié: (2024)
Can Large Language Models Automatically Score Proficiency of Written Essays?
par: Mansour, Watheq, et autres
Publié: (2024)
par: Mansour, Watheq, et autres
Publié: (2024)
ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction
par: Zeng, Xingshan, et autres
Publié: (2025)
par: Zeng, Xingshan, et autres
Publié: (2025)
Decision-Level Ordinal Modeling for Multimodal Essay Scoring with Large Language Models
par: Zhang, Han, et autres
Publié: (2026)
par: Zhang, Han, et autres
Publié: (2026)
MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models
par: Liu, Mianxin, et autres
Publié: (2024)
par: Liu, Mianxin, et autres
Publié: (2024)
eRevise+RF: A Writing Evaluation System for Assessing Student Essay Revisions and Providing Formative Feedback
par: Liu, Zhexiong, et autres
Publié: (2025)
par: Liu, Zhexiong, et autres
Publié: (2025)
Effects of Varying LLM Access on Essay Writing Behavior
par: Christenson, Julia, et autres
Publié: (2026)
par: Christenson, Julia, et autres
Publié: (2026)
PROXYQA: An Alternative Framework for Evaluating Long-Form Text Generation with Large Language Models
par: Tan, Haochen, et autres
Publié: (2024)
par: Tan, Haochen, et autres
Publié: (2024)
Evaluating the External and Parametric Knowledge Fusion of Large Language Models
par: Zhang, Hao, et autres
Publié: (2024)
par: Zhang, Hao, et autres
Publié: (2024)
Rationale Behind Essay Scores: Enhancing S-LLM's Multi-Trait Essay Scoring with Rationale Generated by LLMs
par: Chu, SeongYeub, et autres
Publié: (2024)
par: Chu, SeongYeub, et autres
Publié: (2024)
Automatic Essay Multi-dimensional Scoring with Fine-tuning and Multiple Regression
par: Sun, Kun, et autres
Publié: (2024)
par: Sun, Kun, et autres
Publié: (2024)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
par: Zhou, Chengfeng, et autres
Publié: (2025)
par: Zhou, Chengfeng, et autres
Publié: (2025)
Hey AI Can You Grade My Essay?: Automatic Essay Grading
par: Maliha, Maisha, et autres
Publié: (2024)
par: Maliha, Maisha, et autres
Publié: (2024)
CoSafe: Evaluating Large Language Model Safety in Multi-Turn Dialogue Coreference
par: Yu, Erxin, et autres
Publié: (2024)
par: Yu, Erxin, et autres
Publié: (2024)
Large Language Models as Partners in Student Essay Evaluation
par: Ishida, Toru, et autres
Publié: (2024)
par: Ishida, Toru, et autres
Publié: (2024)
Autoregressive Score Generation for Multi-trait Essay Scoring
par: Do, Heejin, et autres
Publié: (2024)
par: Do, Heejin, et autres
Publié: (2024)
CAFES: A Collaborative Multi-Agent Framework for Multi-Granular Multimodal Essay Scoring
par: Su, Jiamin, et autres
Publié: (2025)
par: Su, Jiamin, et autres
Publié: (2025)
FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models
par: Jiang, Yuxin, et autres
Publié: (2023)
par: Jiang, Yuxin, et autres
Publié: (2023)
Modifying AI, Enhancing Essays: How Active Engagement with Generative AI Boosts Writing Quality
par: Yang, Kaixun, et autres
Publié: (2024)
par: Yang, Kaixun, et autres
Publié: (2024)
JailBench: A Comprehensive Chinese Security Assessment Benchmark for Large Language Models
par: Liu, Shuyi, et autres
Publié: (2025)
par: Liu, Shuyi, et autres
Publié: (2025)
LCES: Zero-shot Automated Essay Scoring via Pairwise Comparisons Using Large Language Models
par: Shibata, Takumi, et autres
Publié: (2025)
par: Shibata, Takumi, et autres
Publié: (2025)
SELF: Self-Evolution with Language Feedback
par: Lu, Jianqiao, et autres
Publié: (2023)
par: Lu, Jianqiao, et autres
Publié: (2023)
KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning
par: Xu, Hongling, et autres
Publié: (2025)
par: Xu, Hongling, et autres
Publié: (2025)
Automatic Essay Scoring and Feedback Generation in Basque Language Learning
par: Azurmendi, Ekhi, et autres
Publié: (2025)
par: Azurmendi, Ekhi, et autres
Publié: (2025)
DAST: Difficulty-Aware Self-Training on Large Language Models
par: Xue, Boyang, et autres
Publié: (2025)
par: Xue, Boyang, et autres
Publié: (2025)
FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models
par: Li, Wei, et autres
Publié: (2024)
par: Li, Wei, et autres
Publié: (2024)
Teaching Large Reasoning Models Effective Reflection
par: Wang, Hanbin, et autres
Publié: (2026)
par: Wang, Hanbin, et autres
Publié: (2026)
ReliableMath: Benchmark of Reliable Mathematical Reasoning on Large Language Models
par: Xue, Boyang, et autres
Publié: (2025)
par: Xue, Boyang, et autres
Publié: (2025)
Hidding the Ghostwriters: An Adversarial Evaluation of AI-Generated Student Essay Detection
par: Peng, Xinlin, et autres
Publié: (2024)
par: Peng, Xinlin, et autres
Publié: (2024)
Activations as Features: Probing LLMs for Generalizable Essay Scoring Representations
par: Chi, Jinwei, et autres
Publié: (2025)
par: Chi, Jinwei, et autres
Publié: (2025)
Safe: Enhancing Mathematical Reasoning in Large Language Models via Retrospective Step-aware Formal Verification
par: Liu, Chengwu, et autres
Publié: (2025)
par: Liu, Chengwu, et autres
Publié: (2025)
CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models
par: LI, Yizhi, et autres
Publié: (2024)
par: LI, Yizhi, et autres
Publié: (2024)
Empirical Study of Large Language Models as Automated Essay Scoring Tools in English Composition__Taking TOEFL Independent Writing Task for Example
par: Xia, Wei, et autres
Publié: (2024)
par: Xia, Wei, et autres
Publié: (2024)
Documents similaires
-
Evaluating Austrian A-Level German Essays with Large Language Models for Automated Essay Scoring
par: Kubesch, Jonas, et autres
Publié: (2026) -
Data Management For Training Large Language Models: A Survey
par: Wang, Zige, et autres
Publié: (2023) -
EssayJudge: A Multi-Granular Benchmark for Assessing Automated Essay Scoring Capabilities of Multimodal Large Language Models
par: Su, Jiamin, et autres
Publié: (2025) -
YODA: Teacher-Student Progressive Learning for Language Models
par: Lu, Jianqiao, et autres
Publié: (2024) -
Rank-Then-Score: Enhancing Large Language Models for Automated Essay Scoring
par: Cai, Yida, et autres
Publié: (2025)