Enregistré dans:
| Auteurs principaux: | Xiangyue, Ma, Xiaoting, Du, Chenglong, Li, Xiaoke, Fang, Wenjie, Ding, Zheng, Zheng, Jiangtao, Meng |
|---|---|
| Format: | Recurso digital |
| Langue: | |
| Publié: |
Zenodo
2026
|
| Accès en ligne: | https://doi.org/10.5281/zenodo.18978041 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Artifact for TOSEM paper: Exploring Development Methods for Reactive Synthesis Specifications
par: Ma'ayan, Dor, et autres
Publié: (2025)
par: Ma'ayan, Dor, et autres
Publié: (2025)
Deep Researcher Agent: An Autonomous Framework for 24/7 Deep Learning Experimentation with Zero-Cost Monitoring
par: Zhang, Xiangyue
Publié: (2026)
par: Zhang, Xiangyue
Publié: (2026)
DeepSynth-Eval: Objectively Evaluating Information Consolidation in Deep Survey Writing
par: Zhang, Hongzhi, et autres
Publié: (2026)
par: Zhang, Hongzhi, et autres
Publié: (2026)
DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation
par: Xie, Qianqian, et autres
Publié: (2026)
par: Xie, Qianqian, et autres
Publié: (2026)
DeepResearchEval: An Automated Framework for Deep Research Task Construction and Agentic Evaluation
par: Wang, Yibo, et autres
Publié: (2026)
par: Wang, Yibo, et autres
Publié: (2026)
MiroEval: Benchmarking Multimodal Deep Research Agents in Process and Outcome
par: Ye, Fangda, et autres
Publié: (2026)
par: Ye, Fangda, et autres
Publié: (2026)
DevEval: Evaluating Code Generation in Practical Software Projects
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
DeepSlide: From Artifacts to Presentation Delivery
par: Yang, Ming, et autres
Publié: (2026)
par: Yang, Ming, et autres
Publié: (2026)
ReviewEval: An Evaluation Framework for AI-Generated Reviews
par: Garg, Madhav Krishan, et autres
Publié: (2025)
par: Garg, Madhav Krishan, et autres
Publié: (2025)
SciClaimEval: Cross-modal Claim Verification in Scientific Papers
par: Ho, Xanh, et autres
Publié: (2026)
par: Ho, Xanh, et autres
Publié: (2026)
ContractEval: Benchmarking LLMs for Clause-Level Legal Risk Identification in Commercial Contracts
par: Liu, Shuang, et autres
Publié: (2025)
par: Liu, Shuang, et autres
Publié: (2025)
AlphaEval: Evaluating Agents in Production
par: Lu, Pengrui, et autres
Publié: (2026)
par: Lu, Pengrui, et autres
Publié: (2026)
On Randomness in Agentic Evals
par: Bjarnason, Bjarni Haukur, et autres
Publié: (2026)
par: Bjarnason, Bjarni Haukur, et autres
Publié: (2026)
MarineEval: Assessing the Marine Intelligence of Vision-Language Models
par: Wong, YuK-Kwan, et autres
Publié: (2025)
par: Wong, YuK-Kwan, et autres
Publié: (2025)
DependEval: Benchmarking LLMs for Repository Dependency Understanding
par: Du, Junjia, et autres
Publié: (2025)
par: Du, Junjia, et autres
Publié: (2025)
LatEval: An Interactive LLMs Evaluation Benchmark with Incomplete Information from Lateral Thinking Puzzles
par: Huang, Shulin, et autres
Publié: (2023)
par: Huang, Shulin, et autres
Publié: (2023)
Fusion-Eval: Integrating Assistant Evaluators with LLMs
par: Shu, Lei, et autres
Publié: (2023)
par: Shu, Lei, et autres
Publié: (2023)
AmbiGraph-Eval: Can LLMs Effectively Handle Ambiguous Graph Queries?
par: Tian, Yuchen, et autres
Publié: (2025)
par: Tian, Yuchen, et autres
Publié: (2025)
T-Eval: Evaluating the Tool Utilization Capability of Large Language Models Step by Step
par: Chen, Zehui, et autres
Publié: (2023)
par: Chen, Zehui, et autres
Publié: (2023)
QuantEval: A Benchmark for Financial Quantitative Tasks in Large Language Models
par: Kang, Zhaolu, et autres
Publié: (2026)
par: Kang, Zhaolu, et autres
Publié: (2026)
EvolMathEval: Towards Evolvable Benchmarks for Mathematical Reasoning via Evolutionary Testing
par: Wang, Shengbo, et autres
Publié: (2025)
par: Wang, Shengbo, et autres
Publié: (2025)
DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories
par: Li, Jia, et autres
Publié: (2024)
par: Li, Jia, et autres
Publié: (2024)
SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks
par: Li, Tianhao, et autres
Publié: (2024)
par: Li, Tianhao, et autres
Publié: (2024)
VideoGen-Eval: Agent-based System for Video Generation Evaluation
par: Yang, Yuhang, et autres
Publié: (2025)
par: Yang, Yuhang, et autres
Publié: (2025)
HumanEval on Latest GPT Models -- 2024
par: Li, Daniel, et autres
Publié: (2024)
par: Li, Daniel, et autres
Publié: (2024)
Evaluación de efectos de sumersión en la estabilidad de taludes
par: Xiangyue Li
Publié: (2011)
par: Xiangyue Li
Publié: (2011)
Consideración de fuerzas de filtración en el análisis de estabilidad de taludes granulares
par: Xiangyue Li
Publié: (2010)
par: Xiangyue Li
Publié: (2010)
FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation
par: He, Zheqi, et autres
Publié: (2025)
par: He, Zheqi, et autres
Publié: (2025)
Physion-Eval: Evaluating Physical Realism in Generated Video via Human Reasoning
par: Zhang, Qin, et autres
Publié: (2026)
par: Zhang, Qin, et autres
Publié: (2026)
StreamingEval: A Unified Evaluation Protocol towards Realistic Streaming Video Understanding
par: Tang, Guowei, et autres
Publié: (2026)
par: Tang, Guowei, et autres
Publié: (2026)
CloudEval-YAML: A Practical Benchmark for Cloud Configuration Generation
par: Xu, Yifei, et autres
Publié: (2023)
par: Xu, Yifei, et autres
Publié: (2023)
RepEval: Effective Text Evaluation with LLM Representation
par: Sheng, Shuqian, et autres
Publié: (2024)
par: Sheng, Shuqian, et autres
Publié: (2024)
HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment
par: Yang, Langqi, et autres
Publié: (2025)
par: Yang, Langqi, et autres
Publié: (2025)
SceneJailEval: A Scenario-Adaptive Multi-Dimensional Framework for Jailbreak Evaluation
par: Jiang, Lai, et autres
Publié: (2025)
par: Jiang, Lai, et autres
Publié: (2025)
PodEval: A Multimodal Evaluation Framework for Podcast Audio Generation
par: Xiao, Yujia, et autres
Publié: (2025)
par: Xiao, Yujia, et autres
Publié: (2025)
Sentiment Analysis in SemEval: A Review of Sentiment Identification Approaches
par: Haddaoui, Bousselham El, et autres
Publié: (2025)
par: Haddaoui, Bousselham El, et autres
Publié: (2025)
RadEval: A framework for radiology text evaluation
par: Xu, Justin, et autres
Publié: (2025)
par: Xu, Justin, et autres
Publié: (2025)
SuiteEval: Simplifying Retrieval Benchmarks
par: Parry, Andrew, et autres
Publié: (2026)
par: Parry, Andrew, et autres
Publié: (2026)
mattwilliamson13/MonEval: Update
par: tylercreech, et autres
Publié: (2025)
par: tylercreech, et autres
Publié: (2025)
SycEval: Evaluating LLM Sycophancy
par: Fanous, Aaron, et autres
Publié: (2025)
par: Fanous, Aaron, et autres
Publié: (2025)
Documents similaires
-
Artifact for TOSEM paper: Exploring Development Methods for Reactive Synthesis Specifications
par: Ma'ayan, Dor, et autres
Publié: (2025) -
Deep Researcher Agent: An Autonomous Framework for 24/7 Deep Learning Experimentation with Zero-Cost Monitoring
par: Zhang, Xiangyue
Publié: (2026) -
DeepSynth-Eval: Objectively Evaluating Information Consolidation in Deep Survey Writing
par: Zhang, Hongzhi, et autres
Publié: (2026) -
DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation
par: Xie, Qianqian, et autres
Publié: (2026) -
DeepResearchEval: An Automated Framework for Deep Research Task Construction and Agentic Evaluation
par: Wang, Yibo, et autres
Publié: (2026)