AutoEvoEval: An Automated Framework for Evolving Close-Ended LLM Evaluation Data
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, JiaRu, Liu, Mingwei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory
par: Wei, Tianxin, et autres
Publié: (2025)
par: Wei, Tianxin, et autres
Publié: (2025)
AutoEval Done Right: Using Synthetic Data for Model Evaluation
par: Boyeau, Pierre, et autres
Publié: (2024)
par: Boyeau, Pierre, et autres
Publié: (2024)
AutoAgent: A Fully-Automated and Zero-Code Framework for LLM Agents
par: Tang, Jiabin, et autres
Publié: (2025)
par: Tang, Jiabin, et autres
Publié: (2025)
Transparent Reference-free Automated Evaluation of Open-Ended User Survey Responses
par: An, Subin, et autres
Publié: (2025)
par: An, Subin, et autres
Publié: (2025)
MIRROR: A Novel Approach for the Automated Evaluation of Open-Ended Question Generation
par: Deroy, Aniket, et autres
Publié: (2024)
par: Deroy, Aniket, et autres
Publié: (2024)
ZeroSumEval: An Extensible Framework For Scaling LLM Evaluation with Inter-Model Competition
par: Alyahya, Hisham A., et autres
Publié: (2025)
par: Alyahya, Hisham A., et autres
Publié: (2025)
MATEval: A Multi-Agent Discussion Framework for Advancing Open-Ended Text Evaluation
par: Li, Yu, et autres
Publié: (2024)
par: Li, Yu, et autres
Publié: (2024)
AHP-Powered LLM Reasoning for Multi-Criteria Evaluation of Open-Ended Responses
par: Lu, Xiaotian, et autres
Publié: (2024)
par: Lu, Xiaotian, et autres
Publié: (2024)
EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
EvoP: Robust LLM Inference via Evolutionary Pruning
par: Wu, Shangyu, et autres
Publié: (2025)
par: Wu, Shangyu, et autres
Publié: (2025)
EvoSpec: Evolving Speculative Decoding via Real-Time Vocabulary and Parameter Adaptation
par: Zhang, Shuyu, et autres
Publié: (2026)
par: Zhang, Shuyu, et autres
Publié: (2026)
LecEval: An Automated Metric for Multimodal Knowledge Acquisition in Multimedia Learning
par: Yin, Joy Lim Jia, et autres
Publié: (2025)
par: Yin, Joy Lim Jia, et autres
Publié: (2025)
ReviewEval: An Evaluation Framework for AI-Generated Reviews
par: Garg, Madhav Krishan, et autres
Publié: (2025)
par: Garg, Madhav Krishan, et autres
Publié: (2025)
EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective
par: Wang, Yuyao, et autres
Publié: (2026)
par: Wang, Yuyao, et autres
Publié: (2026)
TruthEval: A Dataset to Evaluate LLM Truthfulness and Reliability
par: Khatun, Aisha, et autres
Publié: (2024)
par: Khatun, Aisha, et autres
Publié: (2024)
AEL: Agent Evolving Learning for Open-Ended Environments
par: Xu, Wujiang, et autres
Publié: (2026)
par: Xu, Wujiang, et autres
Publié: (2026)
Evaluate Summarization in Fine-Granularity: Auto Evaluation with LLM
par: Yuan, Dong, et autres
Publié: (2024)
par: Yuan, Dong, et autres
Publié: (2024)
AutoQual: An LLM Agent for Automated Discovery of Interpretable Features for Review Quality Assessment
par: Lan, Xiaochong, et autres
Publié: (2025)
par: Lan, Xiaochong, et autres
Publié: (2025)
AutoPureData: Automated Filtering of Undesirable Web Data to Update LLM Knowledge
par: Vadlapati, Praneeth
Publié: (2024)
par: Vadlapati, Praneeth
Publié: (2024)
GraphEval: A Knowledge-Graph Based LLM Hallucination Evaluation Framework
par: Sansford, Hannah, et autres
Publié: (2024)
par: Sansford, Hannah, et autres
Publié: (2024)
Way to Specialist: Closing Loop Between Specialized LLM and Evolving Domain Knowledge Graph
par: Zhang, Yutong, et autres
Publié: (2024)
par: Zhang, Yutong, et autres
Publié: (2024)
ZeroSumEval: Scaling LLM Evaluation with Inter-Model Competition
par: Khan, Haidar, et autres
Publié: (2025)
par: Khan, Haidar, et autres
Publié: (2025)
SurveyEval: Towards Comprehensive Evaluation of LLM-Generated Academic Surveys
par: Zhao, Jiahao, et autres
Publié: (2025)
par: Zhao, Jiahao, et autres
Publié: (2025)
AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research
par: Li, Yishan, et autres
Publié: (2026)
par: Li, Yishan, et autres
Publié: (2026)
Assessing Bias in Metric Models for LLM Open-Ended Generation Bias Benchmarks
par: Demchak, Nathaniel, et autres
Publié: (2024)
par: Demchak, Nathaniel, et autres
Publié: (2024)
EvalCards: A Framework for Standardized Evaluation Reporting
par: Dhar, Ruchira, et autres
Publié: (2025)
par: Dhar, Ruchira, et autres
Publié: (2025)
Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models
par: Jiang, Chaoya, et autres
Publié: (2024)
par: Jiang, Chaoya, et autres
Publié: (2024)
NOTAM-Evolve: A Knowledge-Guided Self-Evolving Optimization Framework with LLMs for NOTAM Interpretation
par: Liu, Maoqi, et autres
Publié: (2025)
par: Liu, Maoqi, et autres
Publié: (2025)
Dynamic Alignment for Collective Agency: Toward a Scalable Self-Improving Framework for Open-Ended LLM Alignment
par: Anantaprayoon, Panatchakorn, et autres
Publié: (2025)
par: Anantaprayoon, Panatchakorn, et autres
Publié: (2025)
ClashEval: Quantifying the tug-of-war between an LLM's internal prior and external evidence
par: Wu, Kevin, et autres
Publié: (2024)
par: Wu, Kevin, et autres
Publié: (2024)
ProactiveEval: A Unified Evaluation Framework for Proactive Dialogue Agents
par: Liu, Tianjian, et autres
Publié: (2025)
par: Liu, Tianjian, et autres
Publié: (2025)
ViLLM-Eval: A Comprehensive Evaluation Suite for Vietnamese Large Language Models
par: Nguyen, Trong-Hieu, et autres
Publié: (2024)
par: Nguyen, Trong-Hieu, et autres
Publié: (2024)
D$^2$Evo: Dual Difficulty-Aware Self-Evolution for Data-Efficient Reinforcement Learning
par: Zhang, Ru, et autres
Publié: (2026)
par: Zhang, Ru, et autres
Publié: (2026)
Fusion-Eval: Integrating Assistant Evaluators with LLMs
par: Shu, Lei, et autres
Publié: (2023)
par: Shu, Lei, et autres
Publié: (2023)
AutoLibra: Agent Metric Induction from Open-Ended Human Feedback
par: Zhu, Hao, et autres
Publié: (2025)
par: Zhu, Hao, et autres
Publié: (2025)
Structure-BiEval: A Self-Supervised, Dual-Track Framework for Decoupling Structure and Content in LLM Evaluation for Web Information Systems
par: Zhao, Boxiang, et autres
Publié: (2026)
par: Zhao, Boxiang, et autres
Publié: (2026)
Generation Space Size: Understanding and Calibrating Open-Endedness of LLM Generations
par: Yu, Sunny, et autres
Publié: (2025)
par: Yu, Sunny, et autres
Publié: (2025)
EvoConfig: Self-Evolving Multi-Agent Systems for Efficient Autonomous Environment Configuration
par: Guo, Xinshuai, et autres
Publié: (2026)
par: Guo, Xinshuai, et autres
Publié: (2026)
EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle
par: Wu, Rong, et autres
Publié: (2025)
par: Wu, Rong, et autres
Publié: (2025)
IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation
par: Tran, Khanh-Tung, et autres
Publié: (2025)
par: Tran, Khanh-Tung, et autres
Publié: (2025)
Documents similaires
-
Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory
par: Wei, Tianxin, et autres
Publié: (2025) -
AutoEval Done Right: Using Synthetic Data for Model Evaluation
par: Boyeau, Pierre, et autres
Publié: (2024) -
AutoAgent: A Fully-Automated and Zero-Code Framework for LLM Agents
par: Tang, Jiabin, et autres
Publié: (2025) -
Transparent Reference-free Automated Evaluation of Open-Ended User Survey Responses
par: An, Subin, et autres
Publié: (2025) -
MIRROR: A Novel Approach for the Automated Evaluation of Open-Ended Question Generation
par: Deroy, Aniket, et autres
Publié: (2024)