ConfProBench: A Confidence Evaluation Benchmark for MLLM-Based Process Judges
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Yue, Chang, Yi, Wu, Yuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Single-File Test: A Longitudinal Public-Interface Evaluation of First-Output LLM Web Generation with Social Reach Tracking
di: Palacios, Diego Cabezas
Pubblicazione: (2026)
di: Palacios, Diego Cabezas
Pubblicazione: (2026)
Survey Transfer Learning: Recycling Data with Silicon Responses
di: Amini, Ali
Pubblicazione: (2025)
di: Amini, Ali
Pubblicazione: (2025)
Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation
di: Koc, Vincent
Pubblicazione: (2025)
di: Koc, Vincent
Pubblicazione: (2025)
Predictive Analytics for Collaborators Answers, Code Quality, and Dropout on Stack Overflow
di: Zolduoarrati, Elijah, et al.
Pubblicazione: (2025)
di: Zolduoarrati, Elijah, et al.
Pubblicazione: (2025)
SCULPT: Constraint-Guided Pruned MCTS that Carves Efficient Paths for Mathematical Reasoning
di: Fang, Qitong, et al.
Pubblicazione: (2026)
di: Fang, Qitong, et al.
Pubblicazione: (2026)
On the Limits of Learned Importance Scoring for KV Cache Compression
di: Steele, Brady
Pubblicazione: (2026)
di: Steele, Brady
Pubblicazione: (2026)
Scaling Trends for Multi-Hop Contextual Reasoning in Mid-Scale Language Models
di: Steele, Brady, et al.
Pubblicazione: (2026)
di: Steele, Brady, et al.
Pubblicazione: (2026)
The Reasoning-Creativity Trade-off: Toward Creativity-Driven Problem Solving
di: Luyten, Max Ruiz, et al.
Pubblicazione: (2026)
di: Luyten, Max Ruiz, et al.
Pubblicazione: (2026)
Evo-DKD: Dual-Knowledge Decoding for Autonomous Ontology Evolution in Large Language Models
di: Raman, Vishal, et al.
Pubblicazione: (2025)
di: Raman, Vishal, et al.
Pubblicazione: (2025)
Merge-Bench: Resolve Merge Conflicts with Large Language Models
di: Schesch, Benedikt, et al.
Pubblicazione: (2026)
di: Schesch, Benedikt, et al.
Pubblicazione: (2026)
Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy
di: He, Langzhou, et al.
Pubblicazione: (2026)
di: He, Langzhou, et al.
Pubblicazione: (2026)
Learning, Fast and Slow: Towards LLMs That Adapt Continually
di: Tiwari, Rishabh, et al.
Pubblicazione: (2026)
di: Tiwari, Rishabh, et al.
Pubblicazione: (2026)
Learning Natural Language Constraints for Safe Reinforcement Learning of Language Agents
di: Chua, Jaymari, et al.
Pubblicazione: (2025)
di: Chua, Jaymari, et al.
Pubblicazione: (2025)
AI and Machine Learning Approaches for Predicting Nanoparticles Toxicity The Critical Role of Physiochemical Properties
di: Yousaf, Iqra
Pubblicazione: (2024)
di: Yousaf, Iqra
Pubblicazione: (2024)
ReaGeo: Reasoning-Enhanced End-to-End Geocoding with LLMs
di: Cui, Jian, et al.
Pubblicazione: (2026)
di: Cui, Jian, et al.
Pubblicazione: (2026)
Feedback-Normalized Developer Memory for Reinforcement-Learning Coding Agents: A Safety-Gated MCP Architecture
di: Iscan, Mehmet
Pubblicazione: (2026)
di: Iscan, Mehmet
Pubblicazione: (2026)
Dynamic Policy Induction for Adaptive Prompt Optimization: Bridging the Efficiency-Accuracy Gap via Lightweight Reinforcement Learning
di: Xu, Jiexi
Pubblicazione: (2025)
di: Xu, Jiexi
Pubblicazione: (2025)
Aligning LLMs on a Budget: Inference-Time Alignment with Heuristic Reward Models
di: Nakamura, Mason, et al.
Pubblicazione: (2025)
di: Nakamura, Mason, et al.
Pubblicazione: (2025)
XAutoLM: Efficient Fine-Tuning of Language Models via Meta-Learning and AutoML
di: Estevanell-Valladares, Ernesto L., et al.
Pubblicazione: (2025)
di: Estevanell-Valladares, Ernesto L., et al.
Pubblicazione: (2025)
Mixup Model Merge: Enhancing Model Merging Performance through Randomized Linear Interpolation
di: Zhou, Yue, et al.
Pubblicazione: (2025)
di: Zhou, Yue, et al.
Pubblicazione: (2025)
GraphEval36K: Benchmarking Coding and Reasoning Capabilities of Large Language Models on Graph Datasets
di: Wu, Qiming, et al.
Pubblicazione: (2024)
di: Wu, Qiming, et al.
Pubblicazione: (2024)
PilotBench: A Benchmark for General Aviation Agents with Safety Constraints
di: Wu, Yalun, et al.
Pubblicazione: (2026)
di: Wu, Yalun, et al.
Pubblicazione: (2026)
Dynamics of COVID-19 Misinformation: An Analysis of Conspiracy Theories, Fake Remedies, and False Reports
di: Thakur, Nirmalya, et al.
Pubblicazione: (2025)
di: Thakur, Nirmalya, et al.
Pubblicazione: (2025)
Automated Bug Triaging using Instruction-Tuned Large Language Models
di: Kiashemshaki, Kiana, et al.
Pubblicazione: (2025)
di: Kiashemshaki, Kiana, et al.
Pubblicazione: (2025)
MOCHA: Multi-Objective Chebyshev Annealing for Agent Skill Optimization
di: Tanjim, Md Mehrab, et al.
Pubblicazione: (2026)
di: Tanjim, Md Mehrab, et al.
Pubblicazione: (2026)
When Gradients Collide: Failure Modes of Multi-Objective Prompt Optimization for LLM Judges
di: Darshan, Parth, et al.
Pubblicazione: (2026)
di: Darshan, Parth, et al.
Pubblicazione: (2026)
TML-Bench: Benchmark for Data Science Agents on Tabular ML Tasks
di: Pinchuk, Mykola
Pubblicazione: (2026)
di: Pinchuk, Mykola
Pubblicazione: (2026)
Foundational Requirements for Artificial General Intelligence: A Falsifiable Framework Based on Signal Prediction
di: Šprogar, Matej
Pubblicazione: (2025)
di: Šprogar, Matej
Pubblicazione: (2025)
Systematic Classification of Studies Investigating Social Media Conversations about Long COVID Using a Novel Zero-Shot Transformer Framework
di: Thakur, Nirmalya, et al.
Pubblicazione: (2025)
di: Thakur, Nirmalya, et al.
Pubblicazione: (2025)
OODEval: Evaluating Large Language Models on Object-Oriented Design
di: Xiao, Bingxu, et al.
Pubblicazione: (2026)
di: Xiao, Bingxu, et al.
Pubblicazione: (2026)
An Aircraft Upset Recovery System with Reinforcement Learning
di: Demir, Mahir, et al.
Pubblicazione: (2026)
di: Demir, Mahir, et al.
Pubblicazione: (2026)
CoupleEvo: Evolving Heuristics for Coupled Optimization Problems Using Large Language Models
di: Bömer, Thomas, et al.
Pubblicazione: (2026)
di: Bömer, Thomas, et al.
Pubblicazione: (2026)
Deployment-Time Reliability of Learned Robot Policies
di: Agia, Christopher
Pubblicazione: (2026)
di: Agia, Christopher
Pubblicazione: (2026)
GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning
di: Agrawal, Lakshya A, et al.
Pubblicazione: (2025)
di: Agrawal, Lakshya A, et al.
Pubblicazione: (2025)
Calibrated Confidence Estimation for Tabular Question Answering
di: Voss, Lukas
Pubblicazione: (2026)
di: Voss, Lukas
Pubblicazione: (2026)
Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models
di: Fadli, Samih
Pubblicazione: (2025)
di: Fadli, Samih
Pubblicazione: (2025)
Procedural Game Level Design with Deep Reinforcement Learning
di: Özkan, Miraç Buğra
Pubblicazione: (2025)
di: Özkan, Miraç Buğra
Pubblicazione: (2025)
PillagerBench: Benchmarking LLM-Based Agents in Competitive Minecraft Team Environments
di: Schipper, Olivier, et al.
Pubblicazione: (2025)
di: Schipper, Olivier, et al.
Pubblicazione: (2025)
Retrieval Augmented Thought Process for Private Data Handling in Healthcare
di: Pouplin, Thomas, et al.
Pubblicazione: (2024)
di: Pouplin, Thomas, et al.
Pubblicazione: (2024)
Generative AI and the Transformation of Software Development Practices
di: Acharya, Vivek
Pubblicazione: (2025)
di: Acharya, Vivek
Pubblicazione: (2025)
Documenti analoghi
-
The Single-File Test: A Longitudinal Public-Interface Evaluation of First-Output LLM Web Generation with Social Reach Tracking
di: Palacios, Diego Cabezas
Pubblicazione: (2026) -
Survey Transfer Learning: Recycling Data with Silicon Responses
di: Amini, Ali
Pubblicazione: (2025) -
Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation
di: Koc, Vincent
Pubblicazione: (2025) -
Predictive Analytics for Collaborators Answers, Code Quality, and Dropout on Stack Overflow
di: Zolduoarrati, Elijah, et al.
Pubblicazione: (2025) -
SCULPT: Constraint-Guided Pruned MCTS that Carves Efficient Paths for Mathematical Reasoning
di: Fang, Qitong, et al.
Pubblicazione: (2026)