How Many Code and Test Cases Are Enough? Evaluating Test Cases Generation from a Binary-Matrix Perspective
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Luo, Xianzhen, Huang, Jinyang, Zheng, Wenzhen, Zhu, Qingfu, Xu, Mingzheng, Xu, Yiheng, Fan, Yuantao, Che, Wanxiang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Scaling Laws for Code: A More Data-Hungry Regime
par: Luo, Xianzhen, et autres
Publié: (2025)
par: Luo, Xianzhen, et autres
Publié: (2025)
Success is in the Details: Evaluate and Enhance Details Sensitivity of Code LLMs through Counterfactuals
par: Luo, Xianzhen, et autres
Publié: (2025)
par: Luo, Xianzhen, et autres
Publié: (2025)
Semi-Instruct: Bridging Natural-Instruct and Self-Instruct for Code Large Language Models
par: Luo, Xianzhen, et autres
Publié: (2024)
par: Luo, Xianzhen, et autres
Publié: (2024)
Automated Snippet-Alignment Data Augmentation for Code Translation
par: Zhang, Zhiming, et autres
Publié: (2025)
par: Zhang, Zhiming, et autres
Publié: (2025)
Advancing Tool-Augmented Large Language Models via Meta-Verification and Reflection Learning
par: Ma, Zhiyuan, et autres
Publié: (2025)
par: Ma, Zhiyuan, et autres
Publié: (2025)
Is Compression Really Linear with Code Intelligence?
par: Xuyang, Shijie, et autres
Publié: (2025)
par: Xuyang, Shijie, et autres
Publié: (2025)
Seer Self-Consistency: Advance Budget Estimation for Adaptive Test-Time Scaling
par: Ji, Shiyu, et autres
Publié: (2025)
par: Ji, Shiyu, et autres
Publié: (2025)
Python is Not Always the Best Choice: Embracing Multilingual Program of Thoughts
par: Luo, Xianzhen, et autres
Publié: (2024)
par: Luo, Xianzhen, et autres
Publié: (2024)
How Do Language Models Understand Tables? A Mechanistic Analysis of Cell Location
par: Zhang, Xuanliang, et autres
Publié: (2026)
par: Zhang, Xuanliang, et autres
Publié: (2026)
CRVQ: Channel-Relaxed Vector Quantization for Extreme Compression of LLMs
par: Xu, Yuzhuang, et autres
Publié: (2024)
par: Xu, Yuzhuang, et autres
Publié: (2024)
Make Some Noise: Unlocking Language Model Parallel Inference Capability through Noisy Training
par: Wang, Yixuan, et autres
Publié: (2024)
par: Wang, Yixuan, et autres
Publié: (2024)
Fitting Is Not Enough: Smoothness in Extremely Quantized LLMs
par: Xu, Yuzhuang, et autres
Publié: (2026)
par: Xu, Yuzhuang, et autres
Publié: (2026)
Learning-to-Context Slope: Evaluating In-Context Learning Effectiveness Beyond Performance Illusions
par: Wang, Dingzriui, et autres
Publié: (2025)
par: Wang, Dingzriui, et autres
Publié: (2025)
Scaling Laws for Agent Harnesses via Effective Feedback Compute
par: Zhang, Xuanliang, et autres
Publié: (2026)
par: Zhang, Xuanliang, et autres
Publié: (2026)
Abacus-SQL: A Text-to-SQL System Empowering Cross-Domain and Open-Domain Database Retrieval
par: Xu, Keyan, et autres
Publié: (2025)
par: Xu, Keyan, et autres
Publié: (2025)
RoT: Enhancing Table Reasoning with Iterative Row-Wise Traversals
par: Zhang, Xuanliang, et autres
Publié: (2025)
par: Zhang, Xuanliang, et autres
Publié: (2025)
MULTITAT: Benchmarking Multilingual Table-and-Text Question Answering
par: Zhang, Xuanliang, et autres
Publié: (2025)
par: Zhang, Xuanliang, et autres
Publié: (2025)
CAMERA: Multi-Matrix Joint Compression for MoE Models via Micro-Expert Redundancy Analysis
par: Xu, Yuzhuang, et autres
Publié: (2025)
par: Xu, Yuzhuang, et autres
Publié: (2025)
ChartREG++: Towards Benchmarking and Improving Chart Referring Expression Grounding under Diverse referring clues and Multi-Target Referring
par: Niu, Tianhao, et autres
Publié: (2026)
par: Niu, Tianhao, et autres
Publié: (2026)
ArcLight: A Lightweight LLM Inference Architecture for Many-Core CPUs
par: Xu, Yuzhuang, et autres
Publié: (2026)
par: Xu, Yuzhuang, et autres
Publié: (2026)
AlignEvoSkill: Towards Knowledge-Aware and Task-Aligned Agent Skill Evolution
par: Wang, Dingzirui, et autres
Publié: (2025)
par: Wang, Dingzirui, et autres
Publié: (2025)
When Does Context Help? Error Dynamics of Contextual Information in Large Language Models
par: Wang, Dingzirui, et autres
Publié: (2026)
par: Wang, Dingzirui, et autres
Publié: (2026)
Multi-Layer Attention is the Amplifier of Demonstration Effectiveness
par: Wang, Dingzirui, et autres
Publié: (2025)
par: Wang, Dingzirui, et autres
Publié: (2025)
Bounds of Chain-of-Thought Robustness: Reasoning Steps, Embed Norms, and Beyond
par: Wang, Dingzirui, et autres
Publié: (2025)
par: Wang, Dingzirui, et autres
Publié: (2025)
Klear-CodeTest: Scalable Test Case Generation for Code Reinforcement Learning
par: Fu, Jia, et autres
Publié: (2025)
par: Fu, Jia, et autres
Publié: (2025)
Think Before You Accept: Semantic Reflective Verification for Faster Speculative Decoding
par: Wang, Yixuan, et autres
Publié: (2025)
par: Wang, Yixuan, et autres
Publié: (2025)
Lookahead Q-Cache: Achieving More Consistent KV Cache Eviction via Pseudo Query
par: Wang, Yixuan, et autres
Publié: (2025)
par: Wang, Yixuan, et autres
Publié: (2025)
Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction
par: Liu, Yijun, et autres
Publié: (2025)
par: Liu, Yijun, et autres
Publié: (2025)
Improving Demonstration Diversity by Human-Free Fusing for Text-to-SQL
par: Wang, Dingzirui, et autres
Publié: (2024)
par: Wang, Dingzirui, et autres
Publié: (2024)
CommonKV: Compressing KV Cache with Cross-layer Parameter Sharing
par: Wang, Yixuan, et autres
Publié: (2025)
par: Wang, Yixuan, et autres
Publié: (2025)
EchoKV: Efficient KV Cache Compression via Similarity-Based Reconstruction
par: Ji, Shiyu, et autres
Publié: (2026)
par: Ji, Shiyu, et autres
Publié: (2026)
Enhancing Numerical Reasoning with the Guidance of Reliable Reasoning Processes
par: Wang, Dingzirui, et autres
Publié: (2024)
par: Wang, Dingzirui, et autres
Publié: (2024)
DAC: Decomposed Automation Correction for Text-to-SQL
par: Wang, Dingzirui, et autres
Publié: (2024)
par: Wang, Dingzirui, et autres
Publié: (2024)
MURRE: Multi-Hop Table Retrieval with Removal for Open-Domain Text-to-SQL
par: Zhang, Xuanliang, et autres
Publié: (2024)
par: Zhang, Xuanliang, et autres
Publié: (2024)
ReF Decompile: Relabeling and Function Call Enhanced Decompile
par: Feng, Yunlong, et autres
Publié: (2025)
par: Feng, Yunlong, et autres
Publié: (2025)
A Survey of Table Reasoning with Large Language Models
par: Zhang, Xuanliang, et autres
Publié: (2024)
par: Zhang, Xuanliang, et autres
Publié: (2024)
HardTests: Synthesizing High-Quality Test Cases for LLM Coding
par: He, Zhongmou, et autres
Publié: (2025)
par: He, Zhongmou, et autres
Publié: (2025)
Format-Adapter: Improving Reasoning Capability of LLMs by Adapting Suitable Format
par: Wang, Dingzirui, et autres
Publié: (2025)
par: Wang, Dingzirui, et autres
Publié: (2025)
Wit-HW: Bug Localization in Hardware Design Code via Witness Test Case Generation
par: Ma, Ruiyang, et autres
Publié: (2025)
par: Ma, Ruiyang, et autres
Publié: (2025)
How Many Pinching Antennas Are Enough?
par: Tyrovolas, Dimitrios, et autres
Publié: (2025)
par: Tyrovolas, Dimitrios, et autres
Publié: (2025)
Documents similaires
-
Scaling Laws for Code: A More Data-Hungry Regime
par: Luo, Xianzhen, et autres
Publié: (2025) -
Success is in the Details: Evaluate and Enhance Details Sensitivity of Code LLMs through Counterfactuals
par: Luo, Xianzhen, et autres
Publié: (2025) -
Semi-Instruct: Bridging Natural-Instruct and Self-Instruct for Code Large Language Models
par: Luo, Xianzhen, et autres
Publié: (2024) -
Automated Snippet-Alignment Data Augmentation for Code Translation
par: Zhang, Zhiming, et autres
Publié: (2025) -
Advancing Tool-Augmented Large Language Models via Meta-Verification and Reflection Learning
par: Ma, Zhiyuan, et autres
Publié: (2025)