Human-in-the-Loop Benchmarking of Heterogeneous LLMs for Automated Competency Assessment in Secondary Level Mathematics
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bhusal, Jatin, Mahatha, Nancy, Acharya, Aayush, Regmi, Raunak |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Automated Bug Triaging using Instruction-Tuned Large Language Models
par: Kiashemshaki, Kiana, et autres
Publié: (2025)
par: Kiashemshaki, Kiana, et autres
Publié: (2025)
TerraFormer: Automated Infrastructure-as-Code with LLMs Fine-Tuned via Policy-Guided Verifier Feedback
par: Jana, Prithwish, et autres
Publié: (2026)
par: Jana, Prithwish, et autres
Publié: (2026)
LLMs as Architects and Critics for Multi-Source Opinion Summarization
par: Attri, Anuj, et autres
Publié: (2025)
par: Attri, Anuj, et autres
Publié: (2025)
PARNESS: A Paper Harness for End-to-End Automated Scientific Research with Dynamic Workflows, Full-Text Indexing, and Cross-Run Knowledge Accumulation
par: Wang, Yuchen, et autres
Publié: (2026)
par: Wang, Yuchen, et autres
Publié: (2026)
CIDR: A Large-Scale Industrial Source Code Dataset for Software Engineering Research
par: Savenkov, Vladislav
Publié: (2026)
par: Savenkov, Vladislav
Publié: (2026)
ContractBench: Can LLM Agents Preserve Observation Contracts?
par: Wang, Jicheng, et autres
Publié: (2026)
par: Wang, Jicheng, et autres
Publié: (2026)
IntelliCode: A Multi-Agent LLM Tutoring System with Centralized Learner Modeling
par: David, Jones, et autres
Publié: (2025)
par: David, Jones, et autres
Publié: (2025)
Why We Feel What We Feel: Joint Detection of Emotions and Their Opinion Triggers in E-commerce
par: Attri, Arnav, et autres
Publié: (2025)
par: Attri, Arnav, et autres
Publié: (2025)
UrduBench: An Urdu Reasoning Benchmark using Contextually Ensembled Translations with Human-in-the-Loop
par: Shafique, Muhammad Ali, et autres
Publié: (2026)
par: Shafique, Muhammad Ali, et autres
Publié: (2026)
LLMCup: Ranking-Enhanced Comment Updating with LLMs
par: Ge, Hua, et autres
Publié: (2025)
par: Ge, Hua, et autres
Publié: (2025)
Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark
par: Bayram, M. Ali, et autres
Publié: (2025)
par: Bayram, M. Ali, et autres
Publié: (2025)
Software Defined Vehicle Code Generation: A Few-Shot Prompting Approach
par: Nguyen, Quang-Dung, et autres
Publié: (2025)
par: Nguyen, Quang-Dung, et autres
Publié: (2025)
The Single-File Test: A Longitudinal Public-Interface Evaluation of First-Output LLM Web Generation with Social Reach Tracking
par: Palacios, Diego Cabezas
Publié: (2026)
par: Palacios, Diego Cabezas
Publié: (2026)
AuditRepairBench: A Paired-Execution Trace Corpus for Evaluator-Channel Ranking Instability in Agent Repair
par: Hu, Yuelin, et autres
Publié: (2026)
par: Hu, Yuelin, et autres
Publié: (2026)
MOCHA: Multi-Objective Chebyshev Annealing for Agent Skill Optimization
par: Tanjim, Md Mehrab, et autres
Publié: (2026)
par: Tanjim, Md Mehrab, et autres
Publié: (2026)
Tool-Genesis: A Task-Driven Tool Creation Benchmark for Self-Evolving Language Agent
par: Xia, Bowei, et autres
Publié: (2026)
par: Xia, Bowei, et autres
Publié: (2026)
The Syntactic Acceptability Dataset (Preview): A Resource for Machine Learning and Linguistic Analysis of English
par: Juzek, Tom S
Publié: (2025)
par: Juzek, Tom S
Publié: (2025)
Tokens with Meaning: A Hybrid Tokenization Approach for Turkish
par: Bayram, M. Ali, et autres
Publié: (2025)
par: Bayram, M. Ali, et autres
Publié: (2025)
Thinking Machines: Mathematical Reasoning in the Age of LLMs
par: Asperti, Andrea, et autres
Publié: (2025)
par: Asperti, Andrea, et autres
Publié: (2025)
EyeLayer: Integrating Human Attention Patterns into LLM-Based Code Summarization
par: Zhang, Jiahao, et autres
Publié: (2026)
par: Zhang, Jiahao, et autres
Publié: (2026)
Do Small Language Models Know When They're Wrong? Confidence-Based Cascade Scoring for Educational Assessment
par: Burleigh, Tyler
Publié: (2026)
par: Burleigh, Tyler
Publié: (2026)
Predictive Analytics for Collaborators Answers, Code Quality, and Dropout on Stack Overflow
par: Zolduoarrati, Elijah, et autres
Publié: (2025)
par: Zolduoarrati, Elijah, et autres
Publié: (2025)
Layer-Aware Embedding Fusion for LLMs in Text Classifications
par: Gwak, Jiho, et autres
Publié: (2025)
par: Gwak, Jiho, et autres
Publié: (2025)
SiliconMind-V1: Multi-Agent Distillation and Debug-Reasoning Workflows for Verilog Code Generation
par: Chen, Mu-Chi, et autres
Publié: (2026)
par: Chen, Mu-Chi, et autres
Publié: (2026)
Automated Circuit Interpretation via Probe Prompting
par: Birardi, Giuseppe
Publié: (2025)
par: Birardi, Giuseppe
Publié: (2025)
Can AI Read Between The Lines? Benchmarking LLMs On Financial Nuance
par: Kubica, Dominick, et autres
Publié: (2025)
par: Kubica, Dominick, et autres
Publié: (2025)
LLM-Rubric: A Multidimensional, Calibrated Approach to Automated Evaluation of Natural Language Texts
par: Hashemi, Helia, et autres
Publié: (2024)
par: Hashemi, Helia, et autres
Publié: (2024)
Character-Level Transformer for Tajik-Persian Transliteration with a Parallel Lexical Corpus
par: Arabov, Mullosharaf K.
Publié: (2026)
par: Arabov, Mullosharaf K.
Publié: (2026)
Instruction-Level Weight Shaping: A Framework for Self-Improving AI Agents
par: Costa, Rimom
Publié: (2025)
par: Costa, Rimom
Publié: (2025)
5C Prompt Contracts: A Minimalist, Creative-Friendly, Token-Efficient Design Framework for Individual and SME LLM Usage
par: Ari, Ugur
Publié: (2025)
par: Ari, Ugur
Publié: (2025)
Latent Instruction Representation Alignment: defending against jailbreaks, backdoors and undesired knowledge in LLMs
par: Easley, Eric, et autres
Publié: (2026)
par: Easley, Eric, et autres
Publié: (2026)
Mitigating Cross-Lingual Cultural Inconsistencies in LLMs via Consensus-Driven Preference Optimisation
par: Resck, Lucas, et autres
Publié: (2026)
par: Resck, Lucas, et autres
Publié: (2026)
Automated CAD Modeling Sequence Generation from Text Descriptions via Transformer-Based Large Language Models
par: Liao, Jianxing, et autres
Publié: (2025)
par: Liao, Jianxing, et autres
Publié: (2025)
Quantization Undoes Alignment: Bias Emergence in Compressed LLMs Across Models and Precision Levels
par: Rath, Plawan Kumar, et autres
Publié: (2026)
par: Rath, Plawan Kumar, et autres
Publié: (2026)
Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models
par: Fadli, Samih
Publié: (2025)
par: Fadli, Samih
Publié: (2025)
Natural Language Summarization Enables Multi-Repository Bug Localization by LLMs in Microservice Architectures
par: Oskooei, Amirkia Rafiei, et autres
Publié: (2025)
par: Oskooei, Amirkia Rafiei, et autres
Publié: (2025)
EdgeJury: Cross-Reviewed Small-Model Ensembles for Truthful Question Answering on Serverless Edge Inference
par: Kumar, Aayush
Publié: (2025)
par: Kumar, Aayush
Publié: (2025)
TwinVoice: A Multi-dimensional Benchmark Towards Digital Twins via LLM Persona Simulation
par: Du, Bangde, et autres
Publié: (2025)
par: Du, Bangde, et autres
Publié: (2025)
AgentAtlas: Beyond Outcome Leaderboards for LLM Agents
par: Mazaheri, Parsa, et autres
Publié: (2026)
par: Mazaheri, Parsa, et autres
Publié: (2026)
GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning
par: Agrawal, Lakshya A, et autres
Publié: (2025)
par: Agrawal, Lakshya A, et autres
Publié: (2025)
Documents similaires
-
Automated Bug Triaging using Instruction-Tuned Large Language Models
par: Kiashemshaki, Kiana, et autres
Publié: (2025) -
TerraFormer: Automated Infrastructure-as-Code with LLMs Fine-Tuned via Policy-Guided Verifier Feedback
par: Jana, Prithwish, et autres
Publié: (2026) -
LLMs as Architects and Critics for Multi-Source Opinion Summarization
par: Attri, Anuj, et autres
Publié: (2025) -
PARNESS: A Paper Harness for End-to-End Automated Scientific Research with Dynamic Workflows, Full-Text Indexing, and Cross-Run Knowledge Accumulation
par: Wang, Yuchen, et autres
Publié: (2026) -
CIDR: A Large-Scale Industrial Source Code Dataset for Software Engineering Research
par: Savenkov, Vladislav
Publié: (2026)