Can Language Models Evaluate Human Written Text? Case Study on Korean Student Writing for Education
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Seungyoon, Kim, Seungone |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Can Code-Switched Texts Activate a Knowledge Switch in LLMs? A Case Study on English-Korean Code-Switching
par: Kim, Seoyeon, et autres
Publié: (2024)
par: Kim, Seoyeon, et autres
Publié: (2024)
KMMLU: Measuring Massive Multitask Language Understanding in Korean
par: Son, Guijin, et autres
Publié: (2024)
par: Son, Guijin, et autres
Publié: (2024)
Multi-Task Inference: Can Large Language Models Follow Multiple Instructions at Once?
par: Son, Guijin, et autres
Publié: (2024)
par: Son, Guijin, et autres
Publié: (2024)
Prometheus-Vision: Vision-Language Model as a Judge for Fine-Grained Evaluation
par: Lee, Seongyun, et autres
Publié: (2024)
par: Lee, Seongyun, et autres
Publié: (2024)
HAE-RAE Bench: Evaluation of Korean Knowledge in Language Models
par: Son, Guijin, et autres
Publié: (2023)
par: Son, Guijin, et autres
Publié: (2023)
Self-Explore: Enhancing Mathematical Reasoning in Language Models with Fine-grained Rewards
par: Hwang, Hyeonbin, et autres
Publié: (2024)
par: Hwang, Hyeonbin, et autres
Publié: (2024)
LLM-as-a-tutor in EFL Writing Education: Focusing on Evaluation of Student-LLM Interaction
par: Han, Jieun, et autres
Publié: (2023)
par: Han, Jieun, et autres
Publié: (2023)
FLASK: Fine-grained Language Model Evaluation based on Alignment Skill Sets
par: Ye, Seonghyeon, et autres
Publié: (2023)
par: Ye, Seonghyeon, et autres
Publié: (2023)
LLM-as-a-Coauthor: Can Mixed Human-Written and Machine-Generated Text Be Detected?
par: Zhang, Qihui, et autres
Publié: (2024)
par: Zhang, Qihui, et autres
Publié: (2024)
Evaluating Multimodal Generative AI with Korean Educational Standards
par: Park, Sanghee, et autres
Publié: (2025)
par: Park, Sanghee, et autres
Publié: (2025)
Evaluating Multimodal Large Language Models on Vertically Written Japanese Text
par: Sasagawa, Keito, et autres
Publié: (2025)
par: Sasagawa, Keito, et autres
Publié: (2025)
Optimizing Language Augmentation for Multilingual Large Language Models: A Case Study on Korean
par: Choi, ChangSu, et autres
Publié: (2024)
par: Choi, ChangSu, et autres
Publié: (2024)
Measuring Sycophancy of Language Models in Multi-turn Dialogues
par: Hong, Jiseung, et autres
Publié: (2025)
par: Hong, Jiseung, et autres
Publié: (2025)
Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 Benchmark
par: Park, Chanjun, et autres
Publié: (2024)
par: Park, Chanjun, et autres
Publié: (2024)
LLM-as-an-Interviewer: Beyond Static Testing Through Dynamic LLM Evaluation
par: Kim, Eunsu, et autres
Publié: (2024)
par: Kim, Eunsu, et autres
Publié: (2024)
K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts
par: Lee, Nahyun, et autres
Publié: (2026)
par: Lee, Nahyun, et autres
Publié: (2026)
RefineBench: Evaluating Refinement Capability of Language Models via Checklists
par: Lee, Young-Jun, et autres
Publié: (2025)
par: Lee, Young-Jun, et autres
Publié: (2025)
Evaluating Language Models as Synthetic Data Generators
par: Kim, Seungone, et autres
Publié: (2024)
par: Kim, Seungone, et autres
Publié: (2024)
GECKO: Generative Language Model for English, Code and Korean
par: Oh, Sungwoo, et autres
Publié: (2024)
par: Oh, Sungwoo, et autres
Publié: (2024)
KOFFVQA: An Objectively Evaluated Free-form VQA Benchmark for Large Vision-Language Models in the Korean Language
par: Kim, Yoonshik, et autres
Publié: (2025)
par: Kim, Yoonshik, et autres
Publié: (2025)
VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models
par: Ju, Jeongho, et autres
Publié: (2024)
par: Ju, Jeongho, et autres
Publié: (2024)
FLEX: A Benchmark for Evaluating Robustness of Fairness in Large Language Models
par: Jung, Dahyun, et autres
Publié: (2025)
par: Jung, Dahyun, et autres
Publié: (2025)
UKTA: Unified Korean Text Analyzer
par: Ahn, Seokho, et autres
Publié: (2025)
par: Ahn, Seokho, et autres
Publié: (2025)
Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models
par: Kim, Seungone, et autres
Publié: (2024)
par: Kim, Seungone, et autres
Publié: (2024)
Expanding Foundational Language Capabilities in Open-Source LLMs through a Korean Case Study
par: Lim, Junghwan, et autres
Publié: (2025)
par: Lim, Junghwan, et autres
Publié: (2025)
Chain-of-MetaWriting: Linguistic and Textual Analysis of How Small Language Models Write Young Students Texts
par: Buhnila, Ioana, et autres
Publié: (2024)
par: Buhnila, Ioana, et autres
Publié: (2024)
Language Models as Compilers: Simulating Pseudocode Execution Improves Algorithmic Reasoning in Language Models
par: Chae, Hyungjoo, et autres
Publié: (2024)
par: Chae, Hyungjoo, et autres
Publié: (2024)
KITE: A Benchmark for Evaluating Korean Instruction-Following Abilities in Large Language Models
par: Kim, Dongjun, et autres
Publié: (2025)
par: Kim, Dongjun, et autres
Publié: (2025)
Does Incomplete Syntax Influence Korean Language Model? Focusing on Word Order and Case Markers
par: Kim, Jong Myoung, et autres
Publié: (2024)
par: Kim, Jong Myoung, et autres
Publié: (2024)
Prometheus: Inducing Fine-grained Evaluation Capability in Language Models
par: Kim, Seungone, et autres
Publié: (2023)
par: Kim, Seungone, et autres
Publié: (2023)
Building Resource-Constrained Language Agents: A Korean Case Study on Chemical Toxicity Information
par: Cho, Hojun, et autres
Publié: (2025)
par: Cho, Hojun, et autres
Publié: (2025)
ChEDDAR: Student-ChatGPT Dialogue in EFL Writing Education
par: Han, Jieun, et autres
Publié: (2023)
par: Han, Jieun, et autres
Publié: (2023)
Can Large Language Models Automatically Score Proficiency of Written Essays?
par: Mansour, Watheq, et autres
Publié: (2024)
par: Mansour, Watheq, et autres
Publié: (2024)
Theme-Explanation Structure for Table Summarization using Large Language Models: A Case Study on Korean Tabular Data
par: Kwack, TaeYoon, et autres
Publié: (2025)
par: Kwack, TaeYoon, et autres
Publié: (2025)
Linguistically Informed Graph Model and Semantic Contrastive Learning for Korean Short Text Classification
par: Yoo, JaeGeon, et autres
Publié: (2026)
par: Yoo, JaeGeon, et autres
Publié: (2026)
Your Language Model Can Secretly Write Like Humans: Contrastive Paraphrase Attacks on LLM-Generated Text Detectors
par: Fang, Hao, et autres
Publié: (2025)
par: Fang, Hao, et autres
Publié: (2025)
Human-AI Collaborative Taxonomy Construction: A Case Study in Profession-Specific Writing Assistants
par: Lee, Minhwa, et autres
Publié: (2024)
par: Lee, Minhwa, et autres
Publié: (2024)
Measuring Human Involvement in AI-Generated Text: A Case Study on Academic Writing
par: Guo, Yuchen, et autres
Publié: (2025)
par: Guo, Yuchen, et autres
Publié: (2025)
Optimizing Korean-Centric LLMs via Token Pruning
par: Kim, Hoyeol, et autres
Publié: (2026)
par: Kim, Hoyeol, et autres
Publié: (2026)
Low-Resource NMT: A Case Study on the Written and Spoken Languages in Hong Kong
par: Mak, Hei Yi, et autres
Publié: (2025)
par: Mak, Hei Yi, et autres
Publié: (2025)
Documents similaires
-
Can Code-Switched Texts Activate a Knowledge Switch in LLMs? A Case Study on English-Korean Code-Switching
par: Kim, Seoyeon, et autres
Publié: (2024) -
KMMLU: Measuring Massive Multitask Language Understanding in Korean
par: Son, Guijin, et autres
Publié: (2024) -
Multi-Task Inference: Can Large Language Models Follow Multiple Instructions at Once?
par: Son, Guijin, et autres
Publié: (2024) -
Prometheus-Vision: Vision-Language Model as a Judge for Fine-Grained Evaluation
par: Lee, Seongyun, et autres
Publié: (2024) -
HAE-RAE Bench: Evaluation of Korean Knowledge in Language Models
par: Son, Guijin, et autres
Publié: (2023)