DeepEval/DeepEval: Artifacts Associated with the Paper Under Review in TOSEM
Fuente:
Zenodo
Saved in:
| Main Authors: | Xiangyue, Ma, Xiaoting, Du, Chenglong, Li, Xiaoke, Fang, Wenjie, Ding, Zheng, Zheng, Jiangtao, Meng |
|---|---|
| Format: | Recurso digital |
| Published: |
Zenodo
2026
|
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Artifact for TOSEM paper: Exploring Development Methods for Reactive Synthesis Specifications
by: Ma'ayan, Dor, et al.
Published: (2025)
by: Ma'ayan, Dor, et al.
Published: (2025)
Deep Researcher Agent: An Autonomous Framework for 24/7 Deep Learning Experimentation with Zero-Cost Monitoring
by: Zhang, Xiangyue
Published: (2026)
by: Zhang, Xiangyue
Published: (2026)
DeepSynth-Eval: Objectively Evaluating Information Consolidation in Deep Survey Writing
by: Zhang, Hongzhi, et al.
Published: (2026)
by: Zhang, Hongzhi, et al.
Published: (2026)
DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation
by: Xie, Qianqian, et al.
Published: (2026)
by: Xie, Qianqian, et al.
Published: (2026)
DeepResearchEval: An Automated Framework for Deep Research Task Construction and Agentic Evaluation
by: Wang, Yibo, et al.
Published: (2026)
by: Wang, Yibo, et al.
Published: (2026)
MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome
by: Ye, Fangda, et al.
Published: (2026)
by: Ye, Fangda, et al.
Published: (2026)
DevEval: Evaluating Code Generation in Practical Software Projects
by: Li, Jia, et al.
Published: (2024)
by: Li, Jia, et al.
Published: (2024)
DeepSlide: From Artifacts to Presentation Delivery
by: Yang, Ming, et al.
Published: (2026)
by: Yang, Ming, et al.
Published: (2026)
ReviewEval: An Evaluation Framework for AI-Generated Reviews
by: Garg, Madhav Krishan, et al.
Published: (2025)
by: Garg, Madhav Krishan, et al.
Published: (2025)
SciClaimEval: Cross-modal Claim Verification in Scientific Papers
by: Ho, Xanh, et al.
Published: (2026)
by: Ho, Xanh, et al.
Published: (2026)
ContractEval: Benchmarking LLMs for Clause-Level Legal Risk Identification in Commercial Contracts
by: Liu, Shuang, et al.
Published: (2025)
by: Liu, Shuang, et al.
Published: (2025)
On Randomness in Agentic Evals
by: Bjarnason, Bjarni Haukur, et al.
Published: (2026)
by: Bjarnason, Bjarni Haukur, et al.
Published: (2026)
AlphaEval: Evaluating Agents in Production
by: Lu, Pengrui, et al.
Published: (2026)
by: Lu, Pengrui, et al.
Published: (2026)
DependEval: Benchmarking LLMs for Repository Dependency Understanding
by: Du, Junjia, et al.
Published: (2025)
by: Du, Junjia, et al.
Published: (2025)
MarineEval: Assessing the Marine Intelligence of Vision-Language Models
by: Wong, YuK-Kwan, et al.
Published: (2025)
by: Wong, YuK-Kwan, et al.
Published: (2025)
Fusion-Eval: Integrating Assistant Evaluators with LLMs
by: Shu, Lei, et al.
Published: (2023)
by: Shu, Lei, et al.
Published: (2023)
LatEval: An Interactive LLMs Evaluation Benchmark with Incomplete Information from Lateral Thinking Puzzles
by: Huang, Shulin, et al.
Published: (2023)
by: Huang, Shulin, et al.
Published: (2023)
AmbiGraph-Eval: Can LLMs Effectively Handle Ambiguous Graph Queries?
by: Tian, Yuchen, et al.
Published: (2025)
by: Tian, Yuchen, et al.
Published: (2025)
T-Eval: Evaluating the Tool Utilization Capability of Large Language Models Step by Step
by: Chen, Zehui, et al.
Published: (2023)
by: Chen, Zehui, et al.
Published: (2023)
EvolMathEval: Towards Evolvable Benchmarks for Mathematical Reasoning via Evolutionary Testing
by: Wang, Shengbo, et al.
Published: (2025)
by: Wang, Shengbo, et al.
Published: (2025)
QuantEval: A Benchmark for Financial Quantitative Tasks in Large Language Models
by: Kang, Zhaolu, et al.
Published: (2026)
by: Kang, Zhaolu, et al.
Published: (2026)
DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories
by: Li, Jia, et al.
Published: (2024)
by: Li, Jia, et al.
Published: (2024)
HumanEval on Latest GPT Models -- 2024
by: Li, Daniel, et al.
Published: (2024)
by: Li, Daniel, et al.
Published: (2024)
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
by: Li, Tianhao, et al.
Published: (2024)
by: Li, Tianhao, et al.
Published: (2024)
VideoGen-Eval: Agent-based System for Video Generation Evaluation
by: Yang, Yuhang, et al.
Published: (2025)
by: Yang, Yuhang, et al.
Published: (2025)
FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation
by: He, Zheqi, et al.
Published: (2025)
by: He, Zheqi, et al.
Published: (2025)
StreamingEval: A Unified Evaluation Protocol towards Realistic Streaming Video Understanding
by: Tang, Guowei, et al.
Published: (2026)
by: Tang, Guowei, et al.
Published: (2026)
RepEval: Effective Text Evaluation with LLM Representation
by: Sheng, Shuqian, et al.
Published: (2024)
by: Sheng, Shuqian, et al.
Published: (2024)
Sentiment Analysis in SemEval: A Review of Sentiment Identification Approaches
by: Haddaoui, Bousselham El, et al.
Published: (2025)
by: Haddaoui, Bousselham El, et al.
Published: (2025)
SceneJailEval: A Scenario-Adaptive Multi-Dimensional Framework for Jailbreak Evaluation
by: Jiang, Lai, et al.
Published: (2025)
by: Jiang, Lai, et al.
Published: (2025)
CloudEval-YAML: A Practical Benchmark for Cloud Configuration Generation
by: Xu, Yifei, et al.
Published: (2023)
by: Xu, Yifei, et al.
Published: (2023)
HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment
by: Yang, Langqi, et al.
Published: (2025)
by: Yang, Langqi, et al.
Published: (2025)
Physion-Eval: Evaluating Physical Realism in Generated Video via Human Reasoning
by: Zhang, Qin, et al.
Published: (2026)
by: Zhang, Qin, et al.
Published: (2026)
SuiteEval: Simplifying Retrieval Benchmarks
by: Parry, Andrew, et al.
Published: (2026)
by: Parry, Andrew, et al.
Published: (2026)
PodEval: A Multimodal Evaluation Framework for Podcast Audio Generation
by: Xiao, Yujia, et al.
Published: (2025)
by: Xiao, Yujia, et al.
Published: (2025)
RadEval: A framework for radiology text evaluation
by: Xu, Justin, et al.
Published: (2025)
by: Xu, Justin, et al.
Published: (2025)
mattwilliamson13/MonEval: Update
by: tylercreech, et al.
Published: (2025)
by: tylercreech, et al.
Published: (2025)
SycEval: Evaluating LLM Sycophancy
by: Fanous, Aaron, et al.
Published: (2025)
by: Fanous, Aaron, et al.
Published: (2025)
Measuring all the noises of LLM Evals
by: Wang, Sida
Published: (2025)
by: Wang, Sida
Published: (2025)
McEval: Massively Multilingual Code Evaluation
by: Chai, Linzheng, et al.
Published: (2024)
by: Chai, Linzheng, et al.
Published: (2024)
Similar Items
-
Artifact for TOSEM paper: Exploring Development Methods for Reactive Synthesis Specifications
by: Ma'ayan, Dor, et al.
Published: (2025) -
Deep Researcher Agent: An Autonomous Framework for 24/7 Deep Learning Experimentation with Zero-Cost Monitoring
by: Zhang, Xiangyue
Published: (2026) -
DeepSynth-Eval: Objectively Evaluating Information Consolidation in Deep Survey Writing
by: Zhang, Hongzhi, et al.
Published: (2026) -
DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation
by: Xie, Qianqian, et al.
Published: (2026) -
DeepResearchEval: An Automated Framework for Deep Research Task Construction and Agentic Evaluation
by: Wang, Yibo, et al.
Published: (2026)