Are Expert-Level Language Models Expert-Level Annotators?
Fuente:
arXiv
Saved in:
| Main Authors: | Tseng, Yu-Min, Chen, Wei-Lin, Chen, Chung-Chi, Chen, Hsin-Hsi |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Evaluating Large Language Models as Expert Annotators
by: Tseng, Yu-Min, et al.
Published: (2025)
by: Tseng, Yu-Min, et al.
Published: (2025)
Modeling Professionalism in Expert Questioning through Linguistic Differentiation
by: D'Agostino, Giulia, et al.
Published: (2025)
by: D'Agostino, Giulia, et al.
Published: (2025)
Automating Expert-Level Medical Reasoning Evaluation of Large Language Models
by: Zhou, Shuang, et al.
Published: (2025)
by: Zhou, Shuang, et al.
Published: (2025)
ExpertLongBench: Benchmarking Language Models on Expert-Level Long-Form Generation Tasks with Structured Checklists
by: Ruan, Jie, et al.
Published: (2025)
by: Ruan, Jie, et al.
Published: (2025)
The Expert Strikes Back: Interpreting Mixture-of-Experts Language Models at Expert Level
by: Herbst, Jeremy, et al.
Published: (2026)
by: Herbst, Jeremy, et al.
Published: (2026)
Cross-Cultural Expert-Level Art Critique Evaluation with Vision-Language Models
by: Yu, Haorui, et al.
Published: (2026)
by: Yu, Haorui, et al.
Published: (2026)
Strategy-Induct: Task-Level Strategy Induction for Instruction Generation
by: Chen, Po-Chun, et al.
Published: (2026)
by: Chen, Po-Chun, et al.
Published: (2026)
Enhancing Financial Sentiment Analysis with Expert-Designed Hint
by: Chen, Chung-Chi, et al.
Published: (2024)
by: Chen, Chung-Chi, et al.
Published: (2024)
Diagnosing Model Editing via Knowledge Spectrum
by: Pan, Tsung-Hsuan, et al.
Published: (2025)
by: Pan, Tsung-Hsuan, et al.
Published: (2025)
Professional Agents -- Evolving Large Language Models into Autonomous Experts with Human-Level Competencies
by: Chu, Zhixuan, et al.
Published: (2024)
by: Chu, Zhixuan, et al.
Published: (2024)
"Why" Has the Least Side Effect on Model Editing
by: Pan, Tsung-Hsuan, et al.
Published: (2024)
by: Pan, Tsung-Hsuan, et al.
Published: (2024)
When Are Experts Misrouted? Counterfactual Routing Analysis in Mixture-of-Experts Language Models
by: Yoon, Youngsik, et al.
Published: (2026)
by: Yoon, Youngsik, et al.
Published: (2026)
Why Expert Alignment Is Hard: Evidence from Subjective Evaluation
by: Lin, Tzu-Mi, et al.
Published: (2026)
by: Lin, Tzu-Mi, et al.
Published: (2026)
Fleming-R1: Toward Expert-Level Medical Reasoning via Reinforcement Learning
by: Liu, Chi, et al.
Published: (2025)
by: Liu, Chi, et al.
Published: (2025)
Co-Trained Retriever-Generator Framework for Question Generation in Earnings Calls
by: Juan, Yining, et al.
Published: (2024)
by: Juan, Yining, et al.
Published: (2024)
MaskMoE: Boosting Token-Level Learning via Routing Mask in Mixture-of-Experts
by: Su, Zhenpeng, et al.
Published: (2024)
by: Su, Zhenpeng, et al.
Published: (2024)
LexGenius: An Expert-Level Benchmark for Large Language Models in Legal General Intelligence
by: Liu, Wenjin, et al.
Published: (2025)
by: Liu, Wenjin, et al.
Published: (2025)
Selective Annotation via Data Allocation: These Data Should Be Triaged to Experts for Annotation Rather Than the Model
by: Huang, Chen, et al.
Published: (2024)
by: Huang, Chen, et al.
Published: (2024)
Beyond Turing Test: Can GPT-4 Sway Experts' Decisions?
by: Takayanagi, Takehiro, et al.
Published: (2024)
by: Takayanagi, Takehiro, et al.
Published: (2024)
ACORD: An Expert-Annotated Retrieval Dataset for Legal Contract Drafting
by: Wang, Steven H., et al.
Published: (2025)
by: Wang, Steven H., et al.
Published: (2025)
Pre-Finetuning with Impact Duration Awareness for Stock Movement Prediction
by: Chiu, Chr-Jr, et al.
Published: (2024)
by: Chiu, Chr-Jr, et al.
Published: (2024)
GADFA: Generator-Assisted Decision-Focused Approach for Opinion Expressing Timing Identification
by: Chen, Chung-Chi, et al.
Published: (2024)
by: Chen, Chung-Chi, et al.
Published: (2024)
MMVU: Measuring Expert-Level Multi-Discipline Video Understanding
by: Zhao, Yilun, et al.
Published: (2025)
by: Zhao, Yilun, et al.
Published: (2025)
Mind2Report: A Cognitive Deep Research Agent for Expert-Level Commercial Report Synthesis
by: Cheng, Mingyue, et al.
Published: (2026)
by: Cheng, Mingyue, et al.
Published: (2026)
An Effective Mixture-Of-Experts Approach For Code-Switching Speech Recognition Leveraging Encoder Disentanglement
by: Yang, Tzu-Ting, et al.
Published: (2024)
by: Yang, Tzu-Ting, et al.
Published: (2024)
Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation
by: Liu, Xue, et al.
Published: (2026)
by: Liu, Xue, et al.
Published: (2026)
Hearing the Order: Investigating Position Bias in Large Audio-Language Models
by: Lin, Yu-Xiang, et al.
Published: (2025)
by: Lin, Yu-Xiang, et al.
Published: (2025)
GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs
by: Deng, Jianing, et al.
Published: (2026)
by: Deng, Jianing, et al.
Published: (2026)
Unveiling Super Experts in Mixture-of-Experts Large Language Models
by: Su, Zunhai, et al.
Published: (2025)
by: Su, Zunhai, et al.
Published: (2025)
MedVAL: Toward Expert-Level Medical Text Validation with Language Models
by: Aali, Asad, et al.
Published: (2025)
by: Aali, Asad, et al.
Published: (2025)
SciDFM: A Large Language Model with Mixture-of-Experts for Science
by: Sun, Liangtai, et al.
Published: (2024)
by: Sun, Liangtai, et al.
Published: (2024)
Geo-Expert: Towards Expert-Level Geological Reasoning via Parameter-Efficient Fine-Tuning
by: Guo, Chenyou, et al.
Published: (2026)
by: Guo, Chenyou, et al.
Published: (2026)
ExpertPrompting: Instructing Large Language Models to be Distinguished Experts
by: Xu, Benfeng, et al.
Published: (2023)
by: Xu, Benfeng, et al.
Published: (2023)
Knowledge Graph-Driven Expert-Level Reasoning for Neuroscience
by: Stephen, Jake, et al.
Published: (2026)
by: Stephen, Jake, et al.
Published: (2026)
$\texttt{MoE-RBench}$: Towards Building Reliable Language Models with Sparse Mixture-of-Experts
by: Chen, Guanjie, et al.
Published: (2024)
by: Chen, Guanjie, et al.
Published: (2024)
Discovering Expert-Level Nash Equilibrium Algorithms with Large Language Models
by: Li, Hanyu, et al.
Published: (2025)
by: Li, Hanyu, et al.
Published: (2025)
TCM-Eval: An Expert-Level Dynamic and Extensible Benchmark for Traditional Chinese Medicine
by: Cheng, Zihao, et al.
Published: (2025)
by: Cheng, Zihao, et al.
Published: (2025)
DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models
by: Dai, Damai, et al.
Published: (2024)
by: Dai, Damai, et al.
Published: (2024)
DiscoX: Benchmarking Discourse-Level Translation task in Expert Domains
by: Zhao, Xiying, et al.
Published: (2025)
by: Zhao, Xiying, et al.
Published: (2025)
MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
by: Zuo, Yuxin, et al.
Published: (2025)
by: Zuo, Yuxin, et al.
Published: (2025)
Similar Items
-
Evaluating Large Language Models as Expert Annotators
by: Tseng, Yu-Min, et al.
Published: (2025) -
Modeling Professionalism in Expert Questioning through Linguistic Differentiation
by: D'Agostino, Giulia, et al.
Published: (2025) -
Automating Expert-Level Medical Reasoning Evaluation of Large Language Models
by: Zhou, Shuang, et al.
Published: (2025) -
ExpertLongBench: Benchmarking Language Models on Expert-Level Long-Form Generation Tasks with Structured Checklists
by: Ruan, Jie, et al.
Published: (2025) -
The Expert Strikes Back: Interpreting Mixture-of-Experts Language Models at Expert Level
by: Herbst, Jeremy, et al.
Published: (2026)