Enregistré dans:
| Auteurs principaux: | Yang, Jian, Zhang, Wei, Li, Yizhi, Guo, Shawn, Wang, Haowen, Liu, Aishan, Zhang, Ge, Wang, Zili, Li, Zhoujun, Liu, Xianglong, Lv, Weifeng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2512.19424 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Scaling Laws for Code: Every Programming Language Matters
par: Yang, Jian, et autres
Publié: (2025)
par: Yang, Jian, et autres
Publié: (2025)
M2G-Eval: Enhancing and Evaluating Multi-granularity Multilingual Code Generation
par: Xu, Fanglin, et autres
Publié: (2025)
par: Xu, Fanglin, et autres
Publié: (2025)
InCoder-32B: Code Foundation Model for Industrial Scenarios
par: Yang, Jian, et autres
Publié: (2026)
par: Yang, Jian, et autres
Publié: (2026)
CodeChemist: Functional Knowledge Transfer for Low-Resource Code Generation via Test-Time Scaling
par: Wang, Kaixin, et autres
Publié: (2025)
par: Wang, Kaixin, et autres
Publié: (2025)
UCoder: Unsupervised Code Generation by Internal Probing of Large Language Models
par: Wu, Jiajun, et autres
Publié: (2025)
par: Wu, Jiajun, et autres
Publié: (2025)
UniCoder: Scaling Code Large Language Model via Universal Code
par: Sun, Tao, et autres
Publié: (2024)
par: Sun, Tao, et autres
Publié: (2024)
SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models
par: Cheng, Xianfu, et autres
Publié: (2025)
par: Cheng, Xianfu, et autres
Publié: (2025)
Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models
par: Cao, Meng, et autres
Publié: (2025)
par: Cao, Meng, et autres
Publié: (2025)
Software Development Life Cycle Perspective: A Survey of Benchmarks for Code Large Language Models and Agents
par: Wang, Kaixin, et autres
Publié: (2025)
par: Wang, Kaixin, et autres
Publié: (2025)
From Context to Intent: Reasoning-Guided Function-Level Code Completion
par: Li, Yanzhou, et autres
Publié: (2025)
par: Li, Yanzhou, et autres
Publié: (2025)
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
par: He, Yancheng, et autres
Publié: (2024)
par: He, Yancheng, et autres
Publié: (2024)
InCoder-32B-Thinking: Industrial Code World Model for Thinking
par: Yang, Jian, et autres
Publié: (2026)
par: Yang, Jian, et autres
Publié: (2026)
IFEvalCode: Controlled Code Generation
par: Yang, Jian, et autres
Publié: (2025)
par: Yang, Jian, et autres
Publié: (2025)
CodeIF: Benchmarking the Instruction-Following Capabilities of Large Language Models for Code Generation
par: Yan, Kaiwen, et autres
Publié: (2025)
par: Yan, Kaiwen, et autres
Publié: (2025)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
par: Guo, Jiawei, et autres
Publié: (2024)
par: Guo, Jiawei, et autres
Publié: (2024)
Uncovering Strategic Egoism Behaviors in Large Language Models
par: Zhang, Yaoyuan, et autres
Publié: (2025)
par: Zhang, Yaoyuan, et autres
Publié: (2025)
SimpleDevQA: Benchmarking Large Language Models on Development Knowledge QA
par: Zhang, Jing, et autres
Publié: (2025)
par: Zhang, Jing, et autres
Publié: (2025)
Fairness Mediator: Neutralize Stereotype Associations to Mitigate Bias in Large Language Models
par: Xiao, Yisong, et autres
Publié: (2025)
par: Xiao, Yisong, et autres
Publié: (2025)
Code2Bench: Scaling Source and Rigor for Dynamic Benchmark Construction
par: Zhang, Zhe, et autres
Publié: (2025)
par: Zhang, Zhe, et autres
Publié: (2025)
Multilingual Multimodal Software Developer for Code Generation
par: Chai, Linzheng, et autres
Publié: (2025)
par: Chai, Linzheng, et autres
Publié: (2025)
From Code Foundation Models to Agents and Applications: A Comprehensive Survey and Practical Guide to Code Intelligence
par: Yang, Jian, et autres
Publié: (2025)
par: Yang, Jian, et autres
Publié: (2025)
SLMQuant:Benchmarking Small Language Model Quantization for Practical Deployment
par: Wang, Jiacheng, et autres
Publié: (2025)
par: Wang, Jiacheng, et autres
Publié: (2025)
Latent Imitator: Generating Natural Individual Discriminatory Instances for Black-Box Fairness Testing
par: Xiao, Yisong, et autres
Publié: (2023)
par: Xiao, Yisong, et autres
Publié: (2023)
RedStone: Curating General, Code, Math, and QA Data for Large Language Models
par: Chang, Yaoyao, et autres
Publié: (2024)
par: Chang, Yaoyao, et autres
Publié: (2024)
LLMCBench: Benchmarking Large Language Model Compression for Efficient Deployment
par: Yang, Ge, et autres
Publié: (2024)
par: Yang, Ge, et autres
Publié: (2024)
Turning the Tide: Repository-based Code Reflection
par: Zhang, Wei, et autres
Publié: (2025)
par: Zhang, Wei, et autres
Publié: (2025)
CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models
par: Zhang, Alexander, et autres
Publié: (2025)
par: Zhang, Alexander, et autres
Publié: (2025)
Evolving Deception: When Agents Evolve, Deception Wins
par: Ying, Zonghao, et autres
Publié: (2026)
par: Ying, Zonghao, et autres
Publié: (2026)
CodeReviewQA: The Code Review Comprehension Assessment for Large Language Models
par: Lin, Hong Yi, et autres
Publié: (2025)
par: Lin, Hong Yi, et autres
Publié: (2025)
Detoxifying Large Language Models via Autoregressive Reward Guided Representation Editing
par: Xiao, Yisong, et autres
Publié: (2025)
par: Xiao, Yisong, et autres
Publié: (2025)
Towards Robust Physical-world Backdoor Attacks on Lane Detection
par: Zhang, Xinwei, et autres
Publié: (2024)
par: Zhang, Xinwei, et autres
Publié: (2024)
Ensemble-Based Uncertainty Estimation for Code Correctness Estimation
par: Wei, Yunxiang, et autres
Publié: (2026)
par: Wei, Yunxiang, et autres
Publié: (2026)
McEval: Massively Multilingual Code Evaluation
par: Chai, Linzheng, et autres
Publié: (2024)
par: Chai, Linzheng, et autres
Publié: (2024)
AFTER: Mitigating the Object Hallucination of LVLM via Adaptive Factual-Guided Activation Editing
par: Wang, Tianbo, et autres
Publié: (2026)
par: Wang, Tianbo, et autres
Publié: (2026)
MdEval: Massively Multilingual Code Debugging
par: Liu, Shukai, et autres
Publié: (2024)
par: Liu, Shukai, et autres
Publié: (2024)
SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models
par: Ying, Zonghao, et autres
Publié: (2024)
par: Ying, Zonghao, et autres
Publié: (2024)
OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models
par: Huang, Siming, et autres
Publié: (2024)
par: Huang, Siming, et autres
Publié: (2024)
Unveiling the Safety of GPT-4o: An Empirical Study using Jailbreak Attacks
par: Ying, Zonghao, et autres
Publié: (2024)
par: Ying, Zonghao, et autres
Publié: (2024)
Investigating Training Data Detection in AI Coders
par: Li, Tianlin, et autres
Publié: (2025)
par: Li, Tianlin, et autres
Publié: (2025)
ADC: Enhancing Function Calling Via Adversarial Datasets and Code Line-Level Feedback
par: Zhang, Wei, et autres
Publié: (2024)
par: Zhang, Wei, et autres
Publié: (2024)
Documents similaires
-
Scaling Laws for Code: Every Programming Language Matters
par: Yang, Jian, et autres
Publié: (2025) -
M2G-Eval: Enhancing and Evaluating Multi-granularity Multilingual Code Generation
par: Xu, Fanglin, et autres
Publié: (2025) -
InCoder-32B: Code Foundation Model for Industrial Scenarios
par: Yang, Jian, et autres
Publié: (2026) -
CodeChemist: Functional Knowledge Transfer for Low-Resource Code Generation via Test-Time Scaling
par: Wang, Kaixin, et autres
Publié: (2025) -
UCoder: Unsupervised Code Generation by Internal Probing of Large Language Models
par: Wu, Jiajun, et autres
Publié: (2025)