ProEval: Proactive Failure Discovery and Efficient Performance Estimation for Generative AI Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Yizheng, Zeng, Wenjun, Kumaresan, Aditi, Wang, Zi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ProRL: Effective Reinforcement Learning for Proactive Recommendation via Rectified Policy Gradient Estimation
par: Hou, Hongru, et autres
Publié: (2026)
par: Hou, Hongru, et autres
Publié: (2026)
Proactive Agents for Multi-Turn Text-to-Image Generation Under Uncertainty
par: Hahn, Meera, et autres
Publié: (2024)
par: Hahn, Meera, et autres
Publié: (2024)
KALAVAI: Predicting When Independent Specialist Fusion Works -- A Quantitative Model for Post-Hoc Cooperative LLM Training
par: Kumaresan, Ramchand
Publié: (2026)
par: Kumaresan, Ramchand
Publié: (2026)
ACAR: Adaptive Complexity Routing for Multi-Model Ensembles with Auditable Decision Traces
par: Kumaresan, Ramchand
Publié: (2026)
par: Kumaresan, Ramchand
Publié: (2026)
Proactive Depot Discovery: A Generative Framework for Flexible Location-Routing
par: Qu, Site, et autres
Publié: (2025)
par: Qu, Site, et autres
Publié: (2025)
ProPACT: A Proactive AI-Driven Adaptive Collaborative Tutor for Pair Programming
par: Golrang, Anahita, et autres
Publié: (2026)
par: Golrang, Anahita, et autres
Publié: (2026)
ProAgent: Building Proactive Cooperative Agents with Large Language Models
par: Zhang, Ceyao, et autres
Publié: (2023)
par: Zhang, Ceyao, et autres
Publié: (2023)
Cer-Eval: Certifiable and Cost-Efficient Evaluation Framework for LLMs
par: Wang, Ganghua, et autres
Publié: (2025)
par: Wang, Ganghua, et autres
Publié: (2025)
AlphaEval: A Comprehensive and Efficient Evaluation Framework for Formula Alpha Mining
par: Ding, Hongjun, et autres
Publié: (2025)
par: Ding, Hongjun, et autres
Publié: (2025)
Proactive Agent Research Environment: Simulating Active Users to Evaluate Proactive Assistants
par: Nathani, Deepak, et autres
Publié: (2026)
par: Nathani, Deepak, et autres
Publié: (2026)
ULTHO: Ultra-Lightweight yet Efficient Hyperparameter Optimization in Deep Reinforcement Learning
par: Yuan, Mingqi, et autres
Publié: (2025)
par: Yuan, Mingqi, et autres
Publié: (2025)
Exploring ChatGPT for Next-generation Information Retrieval: Opportunities and Challenges
par: Huang, Yizheng, et autres
Publié: (2024)
par: Huang, Yizheng, et autres
Publié: (2024)
HypoEval: Hypothesis-Guided Evaluation for Natural Language Generation
par: Li, Mingxuan, et autres
Publié: (2025)
par: Li, Mingxuan, et autres
Publié: (2025)
RxEval: A Prescription-Level Benchmark for Evaluating LLM Medication Recommendation
par: Chen, Shuhao, et autres
Publié: (2026)
par: Chen, Shuhao, et autres
Publié: (2026)
MMCircuitEval: A Comprehensive Multimodal Circuit-Focused Benchmark for Evaluating LLMs
par: Zhao, Chenchen, et autres
Publié: (2025)
par: Zhao, Chenchen, et autres
Publié: (2025)
Towards Scientific Discovery with Generative AI: Progress, Opportunities, and Challenges
par: Reddy, Chandan K, et autres
Publié: (2024)
par: Reddy, Chandan K, et autres
Publié: (2024)
LiCoEval: Evaluating LLMs on License Compliance in Code Generation
par: Xu, Weiwei, et autres
Publié: (2024)
par: Xu, Weiwei, et autres
Publié: (2024)
Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection
par: Zhou, Enshen, et autres
Publié: (2024)
par: Zhou, Enshen, et autres
Publié: (2024)
Pro-ZD: A Transferable Graph Neural Network Approach for Proactive Zero-Day Threats Mitigation
par: Basta, Nardine, et autres
Publié: (2026)
par: Basta, Nardine, et autres
Publié: (2026)
AI and Generative AI for Research Discovery and Summarization
par: Glickman, Mark, et autres
Publié: (2024)
par: Glickman, Mark, et autres
Publié: (2024)
AnalogFed: Federated Discovery of Analog Circuit Topologies with Generative AI
par: Li, Qiufeng, et autres
Publié: (2025)
par: Li, Qiufeng, et autres
Publié: (2025)
ProCause: Generating Counterfactual Outcomes to Evaluate Prescriptive Process Monitoring Methods
par: De Moor, Jakob, et autres
Publié: (2025)
par: De Moor, Jakob, et autres
Publié: (2025)
Symmetric Equilibrium Propagation for Thermodynamic Diffusion Training
par: De, Aditi
Publié: (2026)
par: De, Aditi
Publié: (2026)
Thermodynamic Diffusion Inference with Minimal Digital Conditioning
par: De, Aditi
Publié: (2026)
par: De, Aditi
Publié: (2026)
Revolutionizing Biomarker Discovery: Leveraging Generative AI for Bio-Knowledge-Embedded Continuous Space Exploration
par: Ying, Wangyang, et autres
Publié: (2024)
par: Ying, Wangyang, et autres
Publié: (2024)
Possibility for Proactive Anomaly Detection
par: Jeon, Jinsung, et autres
Publié: (2025)
par: Jeon, Jinsung, et autres
Publié: (2025)
PLAN: Proactive Low-Rank Allocation for Continual Learning
par: Wang, Xiequn, et autres
Publié: (2025)
par: Wang, Xiequn, et autres
Publié: (2025)
Toward an Evaluation Science for Generative AI Systems
par: Weidinger, Laura, et autres
Publié: (2025)
par: Weidinger, Laura, et autres
Publié: (2025)
QualEval: Qualitative Evaluation for Model Improvement
par: Murahari, Vishvak, et autres
Publié: (2023)
par: Murahari, Vishvak, et autres
Publié: (2023)
On the Provable Performance Guarantee of Efficient Reasoning Models
par: Zeng, Hao, et autres
Publié: (2025)
par: Zeng, Hao, et autres
Publié: (2025)
Evaluation-driven Scaling for Scientific Discovery
par: Ye, Haotian, et autres
Publié: (2026)
par: Ye, Haotian, et autres
Publié: (2026)
Graph Federated Learning Based Proactive Content Caching in Edge Computing
par: Wang, Rui
Publié: (2025)
par: Wang, Rui
Publié: (2025)
Generating Expressive and Customizable Evals for Timeseries Data Analysis Agents with AgentFuel
par: Maddi, Aadyaa, et autres
Publié: (2026)
par: Maddi, Aadyaa, et autres
Publié: (2026)
BoxingGym: Benchmarking Progress in Automated Experimental Design and Model Discovery
par: Gandhi, Kanishk, et autres
Publié: (2025)
par: Gandhi, Kanishk, et autres
Publié: (2025)
Relative Policy-Transition Optimization for Fast Policy Transfer
par: Xu, Jiawei, et autres
Publié: (2022)
par: Xu, Jiawei, et autres
Publié: (2022)
ScholarEval: Research Idea Evaluation Grounded in Literature
par: Moussa, Hanane Nour, et autres
Publié: (2025)
par: Moussa, Hanane Nour, et autres
Publié: (2025)
ProVox: Personalization and Proactive Planning for Situated Human-Robot Collaboration
par: Grannen, Jennifer, et autres
Publié: (2025)
par: Grannen, Jennifer, et autres
Publié: (2025)
Generalized Category Discovery in Federated Graph Learning
par: Yuan, Zhongzheng, et autres
Publié: (2026)
par: Yuan, Zhongzheng, et autres
Publié: (2026)
The Use of AI-Robotic Systems for Scientific Discovery
par: Gower, Alexander H., et autres
Publié: (2024)
par: Gower, Alexander H., et autres
Publié: (2024)
Model-Based Proactive Cost Generation for Learning Safe Policies Offline with Limited Violation Data
par: Xue, Ruiqi, et autres
Publié: (2026)
par: Xue, Ruiqi, et autres
Publié: (2026)
Documents similaires
-
ProRL: Effective Reinforcement Learning for Proactive Recommendation via Rectified Policy Gradient Estimation
par: Hou, Hongru, et autres
Publié: (2026) -
Proactive Agents for Multi-Turn Text-to-Image Generation Under Uncertainty
par: Hahn, Meera, et autres
Publié: (2024) -
KALAVAI: Predicting When Independent Specialist Fusion Works -- A Quantitative Model for Post-Hoc Cooperative LLM Training
par: Kumaresan, Ramchand
Publié: (2026) -
ACAR: Adaptive Complexity Routing for Multi-Model Ensembles with Auditable Decision Traces
par: Kumaresan, Ramchand
Publié: (2026) -
Proactive Depot Discovery: A Generative Framework for Flexible Location-Routing
par: Qu, Site, et autres
Publié: (2025)