CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Alexander, Dong, Marcus, Liu, Jiaheng, Zhang, Wei, Wang, Yejie, Yang, Jian, Zhang, Ge, Liu, Tianyu, Peng, Zhongyuan, Tan, Yingshui, Zhang, Yuanxing, Wang, Zhexu, Wang, Weixun, He, Yancheng, Deng, Ken, Zhou, Wangchunshu, Huang, Wenhao, Zhang, Zhaoxiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
IFEvalCode: Controlled Code Generation
di: Yang, Jian, et al.
Pubblicazione: (2025)
di: Yang, Jian, et al.
Pubblicazione: (2025)
Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning?
di: He, Yancheng, et al.
Pubblicazione: (2025)
di: He, Yancheng, et al.
Pubblicazione: (2025)
ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
di: Li, Yuhang, et al.
Pubblicazione: (2025)
di: Li, Yuhang, et al.
Pubblicazione: (2025)
OJBench: A Competition Level Code Benchmark For Large Language Models
di: Wang, Zhexu, et al.
Pubblicazione: (2025)
di: Wang, Zhexu, et al.
Pubblicazione: (2025)
MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language Models
di: Wang, Pei, et al.
Pubblicazione: (2024)
di: Wang, Pei, et al.
Pubblicazione: (2024)
FeatureBench: Benchmarking Agentic Coding for Complex Feature Development
di: Zhou, Qixing, et al.
Pubblicazione: (2026)
di: Zhou, Qixing, et al.
Pubblicazione: (2026)
MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
di: Pan, Yaning, et al.
Pubblicazione: (2025)
di: Pan, Yaning, et al.
Pubblicazione: (2025)
R2C2-Coder: Enhancing and Benchmarking Real-world Repository-level Code Completion Abilities of Code Large Language Models
di: Deng, Ken, et al.
Pubblicazione: (2024)
di: Deng, Ken, et al.
Pubblicazione: (2024)
A Lightweight Framework for Adaptive Retrieval In Code Completion With Critique Model
di: Zhang, Wenrui, et al.
Pubblicazione: (2024)
di: Zhang, Wenrui, et al.
Pubblicazione: (2024)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
di: Ma, David, et al.
Pubblicazione: (2025)
di: Ma, David, et al.
Pubblicazione: (2025)
MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents
di: Li, Shilong, et al.
Pubblicazione: (2025)
di: Li, Shilong, et al.
Pubblicazione: (2025)
EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories
di: Li, Jia, et al.
Pubblicazione: (2024)
di: Li, Jia, et al.
Pubblicazione: (2024)
MIO: A Foundation Model on Multimodal Tokens
di: Wang, Zekun, et al.
Pubblicazione: (2024)
di: Wang, Zekun, et al.
Pubblicazione: (2024)
VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
di: Chen, Xinlong, et al.
Pubblicazione: (2025)
GIEBench: Towards Holistic Evaluation of Group Identity-based Empathy for Large Language Models
di: Wang, Leyan, et al.
Pubblicazione: (2024)
di: Wang, Leyan, et al.
Pubblicazione: (2024)
HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models
di: Que, Haoran, et al.
Pubblicazione: (2024)
di: Que, Haoran, et al.
Pubblicazione: (2024)
How Do Your Code LLMs Perform? Empowering Code Instruction Tuning with High-Quality Data
di: Wang, Yejie, et al.
Pubblicazione: (2024)
di: Wang, Yejie, et al.
Pubblicazione: (2024)
CodeTracer: Towards Traceable Agent States
di: Li, Han, et al.
Pubblicazione: (2026)
di: Li, Han, et al.
Pubblicazione: (2026)
Think-J: Learning to Think for Generative LLM-as-a-Judge
di: Huang, Hui, et al.
Pubblicazione: (2025)
di: Huang, Hui, et al.
Pubblicazione: (2025)
LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
di: Jain, Naman, et al.
Pubblicazione: (2024)
di: Jain, Naman, et al.
Pubblicazione: (2024)
Code-Style In-Context Learning for Knowledge-Based Question Answering
di: Nie, Zhijie, et al.
Pubblicazione: (2023)
di: Nie, Zhijie, et al.
Pubblicazione: (2023)
KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks
di: Ma, Kaijing, et al.
Pubblicazione: (2024)
di: Ma, Kaijing, et al.
Pubblicazione: (2024)
ArtifactsBench: Bridging the Visual-Interactive Gap in LLM Code Generation Evaluation
di: Zhang, Chenchen, et al.
Pubblicazione: (2025)
di: Zhang, Chenchen, et al.
Pubblicazione: (2025)
Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models
di: Zheng, Baihui, et al.
Pubblicazione: (2025)
di: Zheng, Baihui, et al.
Pubblicazione: (2025)
CriticLean: Critic-Guided Reinforcement Learning for Mathematical Formalization
di: Peng, Zhongyuan, et al.
Pubblicazione: (2025)
di: Peng, Zhongyuan, et al.
Pubblicazione: (2025)
AACR-Bench: Evaluating Automatic Code Review with Holistic Repository-Level Context
di: Zhang, Lei, et al.
Pubblicazione: (2026)
di: Zhang, Lei, et al.
Pubblicazione: (2026)
Multilingual Multimodal Software Developer for Code Generation
di: Chai, Linzheng, et al.
Pubblicazione: (2025)
di: Chai, Linzheng, et al.
Pubblicazione: (2025)
CriticBench: Benchmarking LLMs for Critique-Correct Reasoning
di: Lin, Zicheng, et al.
Pubblicazione: (2024)
di: Lin, Zicheng, et al.
Pubblicazione: (2024)
CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation
di: Wang, Sizhe, et al.
Pubblicazione: (2025)
di: Wang, Sizhe, et al.
Pubblicazione: (2025)
Code2Bench: Scaling Source and Rigor for Dynamic Benchmark Construction
di: Zhang, Zhe, et al.
Pubblicazione: (2025)
di: Zhang, Zhe, et al.
Pubblicazione: (2025)
EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations
di: Li, Jia, et al.
Pubblicazione: (2024)
di: Li, Jia, et al.
Pubblicazione: (2024)
Top General Performance = Top Domain Performance? DomainCodeBench: A Multi-domain Code Generation Benchmark
di: Zheng, Dewu, et al.
Pubblicazione: (2024)
di: Zheng, Dewu, et al.
Pubblicazione: (2024)
AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators
di: Chou, Jason, et al.
Pubblicazione: (2025)
di: Chou, Jason, et al.
Pubblicazione: (2025)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
di: Guo, Jiawei, et al.
Pubblicazione: (2024)
di: Guo, Jiawei, et al.
Pubblicazione: (2024)
DynaCode: A Dynamic Complexity-Aware Code Benchmark for Evaluating Large Language Models in Code Generation
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
Vibe AIGC: A New Paradigm for Content Generation via Agentic Orchestration
di: Liu, Jiaheng, et al.
Pubblicazione: (2026)
di: Liu, Jiaheng, et al.
Pubblicazione: (2026)
ExecRepoBench: Multi-level Executable Code Completion Evaluation
di: Yang, Jian, et al.
Pubblicazione: (2024)
di: Yang, Jian, et al.
Pubblicazione: (2024)
EvoCodeBench: A Human-Performance Benchmark for Self-Evolving LLM-Driven Coding Systems
di: Zhang, Wentao, et al.
Pubblicazione: (2026)
di: Zhang, Wentao, et al.
Pubblicazione: (2026)
RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices
di: Li, Jia, et al.
Pubblicazione: (2026)
di: Li, Jia, et al.
Pubblicazione: (2026)
AInsteinBench: Benchmarking Coding Agents on Scientific Repositories
di: Duston, Titouan, et al.
Pubblicazione: (2025)
di: Duston, Titouan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
IFEvalCode: Controlled Code Generation
di: Yang, Jian, et al.
Pubblicazione: (2025) -
Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning?
di: He, Yancheng, et al.
Pubblicazione: (2025) -
ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding
di: Li, Yuhang, et al.
Pubblicazione: (2025) -
OJBench: A Competition Level Code Benchmark For Large Language Models
di: Wang, Zhexu, et al.
Pubblicazione: (2025) -
MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language Models
di: Wang, Pei, et al.
Pubblicazione: (2024)