Learnable Assessment Skills for LLM-based Automated Scoring: Rubric Construction via Iterative Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Yun, Xia, Xin, Wu, Xuansheng, Zhai, Xiaoming, Liu, Ninghao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BRIDGE the Gap: Mitigating Bias Amplification in Automated Scoring of English Language Learners via Inter-group Data Augmentation
par: Wang, Yun, et autres
Publié: (2026)
par: Wang, Yun, et autres
Publié: (2026)
AutoSCORE: Enhancing Automated Scoring with Multi-Agent Large Language Models via Structured Component Recognition
par: Wang, Yun, et autres
Publié: (2025)
par: Wang, Yun, et autres
Publié: (2025)
Self-Regularization with Sparse Autoencoders for Controllable LLM-based Classification
par: Wu, Xuansheng, et autres
Publié: (2025)
par: Wu, Xuansheng, et autres
Publié: (2025)
Applying Large Language Models and Chain-of-Thought for Automatic Scoring
par: Lee, Gyeong-Geon, et autres
Publié: (2023)
par: Lee, Gyeong-Geon, et autres
Publié: (2023)
Unveiling Scoring Processes: Dissecting the Differences between LLMs and Human Graders in Automatic Scoring
par: Wu, Xuansheng, et autres
Publié: (2024)
par: Wu, Xuansheng, et autres
Publié: (2024)
Interpreting and Steering LLMs with Mutual Information-based Explanations on Sparse Autoencoders
par: Wu, Xuansheng, et autres
Publié: (2025)
par: Wu, Xuansheng, et autres
Publié: (2025)
Artificial Intelligence Bias on English Language Learners in Automatic Scoring
par: Guo, Shuchen, et autres
Publié: (2025)
par: Guo, Shuchen, et autres
Publié: (2025)
Confusion-Aware Rubric Optimization for LLM-based Automated Grading
par: Chu, Yucheng, et autres
Publié: (2026)
par: Chu, Yucheng, et autres
Publié: (2026)
Usable XAI: 10 Strategies Towards Exploiting Explainability in the LLM Era
par: Wu, Xuansheng, et autres
Publié: (2024)
par: Wu, Xuansheng, et autres
Publié: (2024)
Knowledge Distillation of LLM for Automatic Scoring of Science Education Assessments
par: Latif, Ehsan, et autres
Publié: (2023)
par: Latif, Ehsan, et autres
Publié: (2023)
Beyond Input Activations: Identifying Influential Latents by Gradient Sparse Autoencoders
par: Shu, Dong, et autres
Publié: (2025)
par: Shu, Dong, et autres
Publié: (2025)
Investigating CoT Monitorability in Large Reasoning Models
par: Yang, Shu, et autres
Publié: (2025)
par: Yang, Shu, et autres
Publié: (2025)
Automated Refinement of Essay Scoring Rubrics for Language Models via Reflect-and-Revise
par: Harada, Keno, et autres
Publié: (2025)
par: Harada, Keno, et autres
Publié: (2025)
Using Learning Progressions to Guide AI Feedback for Science Learning
par: Xia, Xin, et autres
Publié: (2026)
par: Xia, Xin, et autres
Publié: (2026)
Denoising Concept Vectors with Sparse Autoencoders for Improved Language Model Steering
par: Zhao, Haiyan, et autres
Publié: (2025)
par: Zhao, Haiyan, et autres
Publié: (2025)
ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning
par: Li, Xiaoyuan, et autres
Publié: (2026)
par: Li, Xiaoyuan, et autres
Publié: (2026)
Designing Reliable LLM-Assisted Rubric Scoring for Constructed Responses: Evidence from Physics Exams
par: Tang, Xiuxiu, et autres
Publié: (2026)
par: Tang, Xiuxiu, et autres
Publié: (2026)
Retrieval-enhanced Knowledge Editing in Language Models for Multi-Hop Question Answering
par: Shi, Yucheng, et autres
Publié: (2024)
par: Shi, Yucheng, et autres
Publié: (2024)
LASER: An LLM-based ASR Scoring and Evaluation Rubric
par: Parulekar, Amruta, et autres
Publié: (2025)
par: Parulekar, Amruta, et autres
Publié: (2025)
From Language Modeling to Instruction Following: Understanding the Behavior Shift in LLMs after Instruction Tuning
par: Wu, Xuansheng, et autres
Publié: (2023)
par: Wu, Xuansheng, et autres
Publié: (2023)
Could Small Language Models Serve as Recommenders? Towards Data-centric Cold-start Recommendations
par: Wu, Xuansheng, et autres
Publié: (2023)
par: Wu, Xuansheng, et autres
Publié: (2023)
ScoreFlow: Mastering LLM Agent Workflows via Score-based Preference Optimization
par: Wang, Yinjie, et autres
Publié: (2025)
par: Wang, Yinjie, et autres
Publié: (2025)
A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models
par: Shu, Dong, et autres
Publié: (2025)
par: Shu, Dong, et autres
Publié: (2025)
Efficient Multi-Task Inferencing with a Shared Backbone and Lightweight Task-Specific Adapters for Automatic Scoring
par: Latif, Ehsan, et autres
Publié: (2024)
par: Latif, Ehsan, et autres
Publié: (2024)
Foundation Models for Low-Resource Language Education (Vision Paper)
par: Ding, Zhaojun, et autres
Publié: (2024)
par: Ding, Zhaojun, et autres
Publié: (2024)
OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
par: Liu, Tianci, et autres
Publié: (2025)
par: Liu, Tianci, et autres
Publié: (2025)
DREsS: Dataset for Rubric-based Essay Scoring on EFL Writing
par: Yoo, Haneul, et autres
Publié: (2024)
par: Yoo, Haneul, et autres
Publié: (2024)
Do We Need a Detailed Rubric for Automated Essay Scoring using Large Language Models?
par: Yoshida, Lui
Publié: (2025)
par: Yoshida, Lui
Publié: (2025)
LLM Essay Scoring Under Holistic and Analytic Rubrics: Prompt Effects and Bias
par: Kucia, Filip J., et autres
Publié: (2026)
par: Kucia, Filip J., et autres
Publié: (2026)
Autorubric: Unifying Rubric-based LLM Evaluation
par: Rao, Delip, et autres
Publié: (2026)
par: Rao, Delip, et autres
Publié: (2026)
Soundness-Aware Level: A Microscopic Signature that Predicts LLM Reasoning Potential
par: Wu, Xuansheng, et autres
Publié: (2025)
par: Wu, Xuansheng, et autres
Publié: (2025)
EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation
par: Guan, Xin, et autres
Publié: (2026)
par: Guan, Xin, et autres
Publié: (2026)
Next Token Perception Score: Analytical Assessment of your LLM Perception Skills
par: Cheng, Yu-Ang, et autres
Publié: (2025)
par: Cheng, Yu-Ang, et autres
Publié: (2025)
From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges
par: Hong, Yihan, et autres
Publié: (2026)
par: Hong, Yihan, et autres
Publié: (2026)
Using GPT-4 to Augment Unbalanced Data for Automatic Scoring
par: Fang, Luyang, et autres
Publié: (2023)
par: Fang, Luyang, et autres
Publié: (2023)
TRATES: Trait-Specific Rubric-Assisted Cross-Prompt Essay Scoring
par: Eltanbouly, Sohaila, et autres
Publié: (2025)
par: Eltanbouly, Sohaila, et autres
Publié: (2025)
Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
par: Yuan, Youliang, et autres
Publié: (2025)
par: Yuan, Youliang, et autres
Publié: (2025)
EffiSkill: Agent Skill Based Automated Code Efficiency Optimization
par: Wang, Zimu, et autres
Publié: (2026)
par: Wang, Zimu, et autres
Publié: (2026)
Enriching the Korean Learner Corpus with Multi-reference Annotations and Rubric-Based Scoring
par: Song, Jayoung, et autres
Publié: (2025)
par: Song, Jayoung, et autres
Publié: (2025)
ImpScore: A Learnable Metric For Quantifying The Implicitness Level of Sentence
par: Wang, Yuxin, et autres
Publié: (2024)
par: Wang, Yuxin, et autres
Publié: (2024)
Documents similaires
-
BRIDGE the Gap: Mitigating Bias Amplification in Automated Scoring of English Language Learners via Inter-group Data Augmentation
par: Wang, Yun, et autres
Publié: (2026) -
AutoSCORE: Enhancing Automated Scoring with Multi-Agent Large Language Models via Structured Component Recognition
par: Wang, Yun, et autres
Publié: (2025) -
Self-Regularization with Sparse Autoencoders for Controllable LLM-based Classification
par: Wu, Xuansheng, et autres
Publié: (2025) -
Applying Large Language Models and Chain-of-Thought for Automatic Scoring
par: Lee, Gyeong-Geon, et autres
Publié: (2023) -
Unveiling Scoring Processes: Dissecting the Differences between LLMs and Human Graders in Automatic Scoring
par: Wu, Xuansheng, et autres
Publié: (2024)