EvalQReason: A Framework for Step-Level Reasoning Evaluation in Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Freja, Shaima Ahmad, Catak, Ferhat Ozgur, Yurdem, Betul, Rong, Chunming |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Logit-Level Uncertainty Quantification in Vision-Language Models for Histopathology Image Analysis
par: Yurdem, Betul, et autres
Publié: (2026)
par: Yurdem, Betul, et autres
Publié: (2026)
Understanding Federated Learning from IID to Non-IID dataset: An Experimental Study
par: Seo, Jungwon, et autres
Publié: (2025)
par: Seo, Jungwon, et autres
Publié: (2025)
Federated Inference: Toward Privacy-Preserving Collaborative and Incentivized Model Serving
par: Seo, Jungwon, et autres
Publié: (2026)
par: Seo, Jungwon, et autres
Publié: (2026)
GC-Fed: Gradient Centralized Federated Learning with Partial Client Participation
par: Seo, Jungwon, et autres
Publié: (2025)
par: Seo, Jungwon, et autres
Publié: (2025)
Uncertainty Quantification in Large Language Models Through Convex Hull Analysis
par: Catak, Ferhat Ozgur, et autres
Publié: (2024)
par: Catak, Ferhat Ozgur, et autres
Publié: (2024)
Quantum Key Distribution Secured Federated Learning for Channel Estimation and Radar Spectrum Sensing in 6G Networks
par: Catak, Ferhat Ozgur, et autres
Publié: (2026)
par: Catak, Ferhat Ozgur, et autres
Publié: (2026)
DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
par: Chung, Tsz Ting, et autres
Publié: (2025)
par: Chung, Tsz Ting, et autres
Publié: (2025)
Improving Medical Diagnostics with Vision-Language Models: Convex Hull-Based Uncertainty Analysis
par: Catak, Ferhat Ozgur, et autres
Publié: (2024)
par: Catak, Ferhat Ozgur, et autres
Publié: (2024)
Building Trust in Healthcare with Privacy Techniques: Blockchain in the Cloud
par: Catak, Ferhat Ozgur, et autres
Publié: (2025)
par: Catak, Ferhat Ozgur, et autres
Publié: (2025)
ChemEval: A Comprehensive Multi-Level Chemical Evaluation for Large Language Models
par: Huang, Yuqing, et autres
Publié: (2024)
par: Huang, Yuqing, et autres
Publié: (2024)
BERT4MIMO: A Foundation Model using BERT Architecture for Massive MIMO Channel State Information Prediction
par: Catak, Ferhat Ozgur, et autres
Publié: (2025)
par: Catak, Ferhat Ozgur, et autres
Publié: (2025)
CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models
par: Bhatt, Manish, et autres
Publié: (2024)
par: Bhatt, Manish, et autres
Publié: (2024)
SparseEval: Efficient Evaluation of Large Language Models by Sparse Optimization
par: Zhang, Taolin, et autres
Publié: (2026)
par: Zhang, Taolin, et autres
Publié: (2026)
Trustworthy Quantum Machine Learning: A Roadmap for Reliability, Robustness, and Security in the NISQ Era
par: Catak, Ferhat Ozgur, et autres
Publié: (2025)
par: Catak, Ferhat Ozgur, et autres
Publié: (2025)
Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models
par: Gu, Xiaojie, et autres
Publié: (2026)
par: Gu, Xiaojie, et autres
Publié: (2026)
Comparative Analysis of Attention Mechanisms for Automatic Modulation Classification in Radio Frequency Signals
par: Catak, Ferhat Ozgur, et autres
Publié: (2025)
par: Catak, Ferhat Ozgur, et autres
Publié: (2025)
Eval Factsheets: A Structured Framework for Documenting AI Evaluations
par: Bordes, Florian, et autres
Publié: (2025)
par: Bordes, Florian, et autres
Publié: (2025)
Multi-Step Reasoning with Large Language Models, a Survey
par: Plaat, Aske, et autres
Publié: (2024)
par: Plaat, Aske, et autres
Publié: (2024)
Step-Level Sparse Autoencoder for Reasoning Process Interpretation
par: Yang, Xuan, et autres
Publié: (2026)
par: Yang, Xuan, et autres
Publié: (2026)
Benchmarking Large Language Models for Math Reasoning Tasks
par: Seßler, Kathrin, et autres
Publié: (2024)
par: Seßler, Kathrin, et autres
Publié: (2024)
FedShift: Robust Federated Learning Aggregation Scheme in Resource Constrained Environment via Weight Shifting
par: Seo, Jungwon, et autres
Publié: (2024)
par: Seo, Jungwon, et autres
Publié: (2024)
Enhancing Spatial Reasoning in Large Language Models for Metal-Organic Frameworks Structure Prediction
par: Pan, Mianzhi, et autres
Publié: (2026)
par: Pan, Mianzhi, et autres
Publié: (2026)
SelfCheck-Eval: A Multi-Module Framework for Zero-Resource Hallucination Detection in Large Language Models
par: Muhammed, Diyana, et autres
Publié: (2025)
par: Muhammed, Diyana, et autres
Publié: (2025)
Graph Elicitation for Guiding Multi-Step Reasoning in Large Language Models
par: Park, Jinyoung, et autres
Publié: (2023)
par: Park, Jinyoung, et autres
Publié: (2023)
StructEval: Deepen and Broaden Large Language Model Assessment via Structured Evaluation
par: Cao, Boxi, et autres
Publié: (2024)
par: Cao, Boxi, et autres
Publié: (2024)
RxEval: A Prescription-Level Benchmark for Evaluating LLM Medication Recommendation
par: Chen, Shuhao, et autres
Publié: (2026)
par: Chen, Shuhao, et autres
Publié: (2026)
DART-Eval: A Comprehensive DNA Language Model Evaluation Benchmark on Regulatory DNA
par: Patel, Aman, et autres
Publié: (2024)
par: Patel, Aman, et autres
Publié: (2024)
GraphEval: A Lightweight Graph-Based LLM Framework for Idea Evaluation
par: Feng, Tao, et autres
Publié: (2025)
par: Feng, Tao, et autres
Publié: (2025)
FedEval-LLM: Federated Evaluation of Large Language Models on Downstream Tasks with Collective Wisdom
par: He, Yuanqin, et autres
Publié: (2024)
par: He, Yuanqin, et autres
Publié: (2024)
Stabilizing Efficient Reasoning with Step-Level Advantage Selection
par: Wang, Han, et autres
Publié: (2026)
par: Wang, Han, et autres
Publié: (2026)
NPHardEval: Dynamic Benchmark on Reasoning Ability of Large Language Models via Complexity Classes
par: Fan, Lizhou, et autres
Publié: (2023)
par: Fan, Lizhou, et autres
Publié: (2023)
Evaluating Mathematical Reasoning Across Large Language Models: A Fine-Grained Approach
par: Jahin, Afrar, et autres
Publié: (2025)
par: Jahin, Afrar, et autres
Publié: (2025)
Confidence Geometry Reveals Trace-Level Correctness in Large Language Model Reasoning
par: Liu, Shuo, et autres
Publié: (2026)
par: Liu, Shuo, et autres
Publié: (2026)
Spark-LLM-Eval: A Distributed Framework for Statistically Rigorous Large Language Model Evaluation
par: Mitra, Subhadip
Publié: (2026)
par: Mitra, Subhadip
Publié: (2026)
Revisiting Service Level Objectives and System Level Metrics in Large Language Model Serving
par: Wang, Zhibin, et autres
Publié: (2024)
par: Wang, Zhibin, et autres
Publié: (2024)
Take a Step Back: Evoking Reasoning via Abstraction in Large Language Models
par: Zheng, Huaixiu Steven, et autres
Publié: (2023)
par: Zheng, Huaixiu Steven, et autres
Publié: (2023)
DEVAL: A Framework for Evaluating and Improving the Derivation Capability of Large Language Models
par: Li, Yifan, et autres
Publié: (2025)
par: Li, Yifan, et autres
Publié: (2025)
Masked Thought: Simply Masking Partial Reasoning Steps Can Improve Mathematical Reasoning Learning of Language Models
par: Chen, Changyu, et autres
Publié: (2024)
par: Chen, Changyu, et autres
Publié: (2024)
FlagEval Findings Report: A Preliminary Evaluation of Large Reasoning Models on Automatically Verifiable Textual and Visual Questions
par: Qin, Bowen, et autres
Publié: (2025)
par: Qin, Bowen, et autres
Publié: (2025)
ProToken: Token-Level Attribution for Federated Large Language Models
par: Gill, Waris, et autres
Publié: (2026)
par: Gill, Waris, et autres
Publié: (2026)
Documents similaires
-
Logit-Level Uncertainty Quantification in Vision-Language Models for Histopathology Image Analysis
par: Yurdem, Betul, et autres
Publié: (2026) -
Understanding Federated Learning from IID to Non-IID dataset: An Experimental Study
par: Seo, Jungwon, et autres
Publié: (2025) -
Federated Inference: Toward Privacy-Preserving Collaborative and Incentivized Model Serving
par: Seo, Jungwon, et autres
Publié: (2026) -
GC-Fed: Gradient Centralized Federated Learning with Partial Client Participation
par: Seo, Jungwon, et autres
Publié: (2025) -
Uncertainty Quantification in Large Language Models Through Convex Hull Analysis
par: Catak, Ferhat Ozgur, et autres
Publié: (2024)