Toward Trustworthy Difficulty Assessments: Large Language Models as Judges in Programming and Synthetic Tasks
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Tabib, H. M. Shadman, Deedar, Jaber Ahmed |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
End-to-End Bangla AI for Solving Math Olympiad Problem Benchmark: Leveraging Large Language Model Using Integrated Approach
von: Tabib, H. M. Shadman, et al.
Veröffentlicht: (2025)
von: Tabib, H. M. Shadman, et al.
Veröffentlicht: (2025)
Study on Locomotive Epidemic Dynamics in a Stochastic Spatio-Temporal Simulation Model on a Multiplex Network
von: Tabib, H. M. Shadman, et al.
Veröffentlicht: (2025)
von: Tabib, H. M. Shadman, et al.
Veröffentlicht: (2025)
From Chat to Checkup: Can Large Language Models Assist in Diabetes Prediction?
von: Sakib, Shadman, et al.
Veröffentlicht: (2025)
von: Sakib, Shadman, et al.
Veröffentlicht: (2025)
Towards Trustworthy Retrieval Augmented Generation for Large Language Models: A Survey
von: Ni, Bo, et al.
Veröffentlicht: (2025)
von: Ni, Bo, et al.
Veröffentlicht: (2025)
XTRUST: On the Multilingual Trustworthiness of Large Language Models
von: Li, Yahan, et al.
Veröffentlicht: (2024)
von: Li, Yahan, et al.
Veröffentlicht: (2024)
TrustLLM: Trustworthiness in Large Language Models
von: Huang, Yue, et al.
Veröffentlicht: (2024)
von: Huang, Yue, et al.
Veröffentlicht: (2024)
Spectral Forensics of Diffusion Attention Graphs for Copy-Move Forgery Detection
von: Tabib, H. M. Shadman, et al.
Veröffentlicht: (2026)
von: Tabib, H. M. Shadman, et al.
Veröffentlicht: (2026)
Orthographic Constraint Satisfaction and Human Difficulty Alignment in Large Language Models
von: Tuck, Bryan E., et al.
Veröffentlicht: (2025)
von: Tuck, Bryan E., et al.
Veröffentlicht: (2025)
Language Models and Logic Programs for Trustworthy Tax Reasoning
von: Jurayj, William, et al.
Veröffentlicht: (2025)
von: Jurayj, William, et al.
Veröffentlicht: (2025)
DAST: Difficulty-Aware Self-Training on Large Language Models
von: Xue, Boyang, et al.
Veröffentlicht: (2025)
von: Xue, Boyang, et al.
Veröffentlicht: (2025)
RightNow-Arabic-0.5B-Turbo: An Open Sub-1B Arabic Language Model via Vocabulary Injection and Edge-First Deployment
von: Jaber, Jaber, et al.
Veröffentlicht: (2026)
von: Jaber, Jaber, et al.
Veröffentlicht: (2026)
Probing the Difficulty Perception Mechanism of Large Language Models
von: Lee, Sunbowen, et al.
Veröffentlicht: (2025)
von: Lee, Sunbowen, et al.
Veröffentlicht: (2025)
Towards Tracing Trustworthiness Dynamics: Revisiting Pre-training Period of Large Language Models
von: Qian, Chen, et al.
Veröffentlicht: (2024)
von: Qian, Chen, et al.
Veröffentlicht: (2024)
Judging the Judges: Can Large Vision-Language Models Fairly Evaluate Chart Comprehension and Reasoning?
von: Laskar, Md Tahmid Rahman, et al.
Veröffentlicht: (2025)
von: Laskar, Md Tahmid Rahman, et al.
Veröffentlicht: (2025)
Predicting Disagreement with Human Raters in LLM-as-a-Judge Difficulty Assessment without Using Generation-Time Probability Signals
von: Ehara, Yo
Veröffentlicht: (2026)
von: Ehara, Yo
Veröffentlicht: (2026)
Exploring the Trade-Offs: Quantization Methods, Task Difficulty, and Model Size in Large Language Models From Edge to Giant
von: Lee, Jemin, et al.
Veröffentlicht: (2024)
von: Lee, Jemin, et al.
Veröffentlicht: (2024)
Judge as A Judge: Improving the Evaluation of Retrieval-Augmented Generation through the Judge-Consistency of Large Language Models
von: Liu, Shuliang, et al.
Veröffentlicht: (2025)
von: Liu, Shuliang, et al.
Veröffentlicht: (2025)
FedJudge: Federated Legal Large Language Model
von: Yue, Linan, et al.
Veröffentlicht: (2023)
von: Yue, Linan, et al.
Veröffentlicht: (2023)
Distortions in Judged Spatial Relations in Large Language Models
von: Fulman, Nir, et al.
Veröffentlicht: (2024)
von: Fulman, Nir, et al.
Veröffentlicht: (2024)
JudgeLM: Fine-tuned Large Language Models are Scalable Judges
von: Zhu, Lianghui, et al.
Veröffentlicht: (2023)
von: Zhu, Lianghui, et al.
Veröffentlicht: (2023)
Assessing Large Language Models for Medical QA: Zero-Shot and LLM-as-a-Judge Evaluation
von: Adib, Shefayat E Shams, et al.
Veröffentlicht: (2026)
von: Adib, Shefayat E Shams, et al.
Veröffentlicht: (2026)
Advancing Object Detection in Transportation with Multimodal Large Language Models (MLLMs): A Comprehensive Review and Empirical Testing
von: Ashqar, Huthaifa I., et al.
Veröffentlicht: (2024)
von: Ashqar, Huthaifa I., et al.
Veröffentlicht: (2024)
LExT: Towards Evaluating Trustworthiness of Natural Language Explanations
von: Shailya, Krithi, et al.
Veröffentlicht: (2025)
von: Shailya, Krithi, et al.
Veröffentlicht: (2025)
BIRD: A Trustworthy Bayesian Inference Framework for Large Language Models
von: Feng, Yu, et al.
Veröffentlicht: (2024)
von: Feng, Yu, et al.
Veröffentlicht: (2024)
Implicit Grading Bias in Large Language Models: How Writing Style Affects Automated Assessment Across Math, Programming, and Essay Tasks
von: Jadhav, Rudra, et al.
Veröffentlicht: (2026)
von: Jadhav, Rudra, et al.
Veröffentlicht: (2026)
A Comprehensive Survey on the Trustworthiness of Large Language Models in Healthcare
von: Aljohani, Manar, et al.
Veröffentlicht: (2025)
von: Aljohani, Manar, et al.
Veröffentlicht: (2025)
TIDE: Token-Informed Depth Execution for Per-Token Early Exit in LLM Inference
von: Jaber, Jaber, et al.
Veröffentlicht: (2026)
von: Jaber, Jaber, et al.
Veröffentlicht: (2026)
ZPD Detector: Data Selection via Capability-Difficulty Alignment for Large Language Models
von: Yang, Bo, et al.
Veröffentlicht: (2026)
von: Yang, Bo, et al.
Veröffentlicht: (2026)
Exploring the Potential of Large Language Models for Estimating the Reading Comprehension Question Difficulty
von: Jain, Yoshee, et al.
Veröffentlicht: (2025)
von: Jain, Yoshee, et al.
Veröffentlicht: (2025)
Explainability of Large Language Models: Opportunities and Challenges toward Generating Trustworthy Explanations
von: Atakishiyev, Shahin, et al.
Veröffentlicht: (2025)
von: Atakishiyev, Shahin, et al.
Veröffentlicht: (2025)
Trustworthy Alignment of Retrieval-Augmented Large Language Models via Reinforcement Learning
von: Zhang, Zongmeng, et al.
Veröffentlicht: (2024)
von: Zhang, Zongmeng, et al.
Veröffentlicht: (2024)
A Systematic Study of Training-Free Methods for Trustworthy Large Language Models
von: Si, Wai Man, et al.
Veröffentlicht: (2026)
von: Si, Wai Man, et al.
Veröffentlicht: (2026)
EPT Benchmark: Evaluation of Persian Trustworthiness in Large Language Models
von: Mirbagheri, Mohammad Reza, et al.
Veröffentlicht: (2025)
von: Mirbagheri, Mohammad Reza, et al.
Veröffentlicht: (2025)
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
von: Zhang, Yichi, et al.
Veröffentlicht: (2024)
von: Zhang, Yichi, et al.
Veröffentlicht: (2024)
mucAI at BAREC Shared Task 2025: Towards Uncertainty Aware Arabic Readability Assessment
von: Abdou, Ahmed
Veröffentlicht: (2025)
von: Abdou, Ahmed
Veröffentlicht: (2025)
CodeJudge-Eval: Can Large Language Models be Good Judges in Code Understanding?
von: Zhao, Yuwei, et al.
Veröffentlicht: (2024)
von: Zhao, Yuwei, et al.
Veröffentlicht: (2024)
Do Large Language Models Judge Error Severity Like Humans?
von: Sun, Diege, et al.
Veröffentlicht: (2025)
von: Sun, Diege, et al.
Veröffentlicht: (2025)
When Large Language Models are Reliable for Judging Empathic Communication
von: Kumar, Aakriti, et al.
Veröffentlicht: (2025)
von: Kumar, Aakriti, et al.
Veröffentlicht: (2025)
Zero-Shot Scene Understanding with Multimodal Large Language Models for Automated Vehicles
von: Elhenawy, Mohammed, et al.
Veröffentlicht: (2025)
von: Elhenawy, Mohammed, et al.
Veröffentlicht: (2025)
TUBench: Benchmarking Large Vision-Language Models on Trustworthiness with Unanswerable Questions
von: He, Xingwei, et al.
Veröffentlicht: (2024)
von: He, Xingwei, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
End-to-End Bangla AI for Solving Math Olympiad Problem Benchmark: Leveraging Large Language Model Using Integrated Approach
von: Tabib, H. M. Shadman, et al.
Veröffentlicht: (2025) -
Study on Locomotive Epidemic Dynamics in a Stochastic Spatio-Temporal Simulation Model on a Multiplex Network
von: Tabib, H. M. Shadman, et al.
Veröffentlicht: (2025) -
From Chat to Checkup: Can Large Language Models Assist in Diabetes Prediction?
von: Sakib, Shadman, et al.
Veröffentlicht: (2025) -
Towards Trustworthy Retrieval Augmented Generation for Large Language Models: A Survey
von: Ni, Bo, et al.
Veröffentlicht: (2025) -
XTRUST: On the Multilingual Trustworthiness of Large Language Models
von: Li, Yahan, et al.
Veröffentlicht: (2024)