Evaluating and Aligning CodeLLMs on Human Preference
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Jian, Yang, Jiaxi, Jin, Ke, Miao, Yibo, Zhang, Lei, Yang, Liqun, Cui, Zeyu, Zhang, Yichang, Hui, Binyuan, Lin, Junyang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Aligning CodeLLMs with Direct Preference Optimization
di: Miao, Yibo, et al.
Pubblicazione: (2024)
di: Miao, Yibo, et al.
Pubblicazione: (2024)
ExecRepoBench: Multi-level Executable Code Completion Evaluation
di: Yang, Jian, et al.
Pubblicazione: (2024)
di: Yang, Jian, et al.
Pubblicazione: (2024)
CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings
di: Quan, Shanghaoran, et al.
Pubblicazione: (2025)
di: Quan, Shanghaoran, et al.
Pubblicazione: (2025)
Multi-Agent Collaboration for Multilingual Code Instruction Tuning
di: Yang, Jian, et al.
Pubblicazione: (2025)
di: Yang, Jian, et al.
Pubblicazione: (2025)
Evaluating and Achieving Controllable Code Completion in Code LLM
di: Zhang, Jiajun, et al.
Pubblicazione: (2026)
di: Zhang, Jiajun, et al.
Pubblicazione: (2026)
Synthesizing Text-to-SQL Data from Weak and Strong LLMs
di: Yang, Jiaxi, et al.
Pubblicazione: (2024)
di: Yang, Jiaxi, et al.
Pubblicazione: (2024)
SWE-Flow: Synthesizing Software Engineering Data in a Test-Driven Manner
di: Zhang, Lei, et al.
Pubblicazione: (2025)
di: Zhang, Lei, et al.
Pubblicazione: (2025)
PlotCraft: Pushing the Limits of LLMs for Complex and Interactive Data Visualization
di: Zhang, Jiajun, et al.
Pubblicazione: (2025)
di: Zhang, Jiajun, et al.
Pubblicazione: (2025)
Turning the Tide: Repository-based Code Reflection
di: Zhang, Wei, et al.
Pubblicazione: (2025)
di: Zhang, Wei, et al.
Pubblicazione: (2025)
Parallel Scaling Law for Language Models
di: Chen, Mouxiang, et al.
Pubblicazione: (2025)
di: Chen, Mouxiang, et al.
Pubblicazione: (2025)
From Completion to Editing: Unlocking Context-Aware Code Infilling via Search-and-Replace Instruction Tuning
di: Zhang, Jiajun, et al.
Pubblicazione: (2026)
di: Zhang, Jiajun, et al.
Pubblicazione: (2026)
Scaling Agentic Verifier for Competitive Coding
di: Ma, Zeyao, et al.
Pubblicazione: (2026)
di: Ma, Zeyao, et al.
Pubblicazione: (2026)
Qwen2.5-Coder Technical Report
di: Hui, Binyuan, et al.
Pubblicazione: (2024)
di: Hui, Binyuan, et al.
Pubblicazione: (2024)
Confidence v.s. Critique: A Decomposition of Self-Correction Capability for LLMs
di: Yang, Zhe, et al.
Pubblicazione: (2024)
di: Yang, Zhe, et al.
Pubblicazione: (2024)
Evaluating and Aligning Human Economic Risk Preferences in LLMs
di: Liu, Jiaxin, et al.
Pubblicazione: (2025)
di: Liu, Jiaxin, et al.
Pubblicazione: (2025)
SWE-RM: Execution-free Feedback For Software Engineering Agents
di: Shum, KaShun, et al.
Pubblicazione: (2025)
di: Shum, KaShun, et al.
Pubblicazione: (2025)
Understanding How CodeLLMs (Mis)Predict Types with Activation Steering
di: Lucchetti, Francesca, et al.
Pubblicazione: (2024)
di: Lucchetti, Francesca, et al.
Pubblicazione: (2024)
IFEvalCode: Controlled Code Generation
di: Yang, Jian, et al.
Pubblicazione: (2025)
di: Yang, Jian, et al.
Pubblicazione: (2025)
Can Large Language Models Always Solve Easy Problems if They Can Solve Harder Ones?
di: Yang, Zhe, et al.
Pubblicazione: (2024)
di: Yang, Zhe, et al.
Pubblicazione: (2024)
START: Self-taught Reasoner with Tools
di: Li, Chengpeng, et al.
Pubblicazione: (2025)
di: Li, Chengpeng, et al.
Pubblicazione: (2025)
WorldPM: Scaling Human Preference Modeling
di: Wang, Binghai, et al.
Pubblicazione: (2025)
di: Wang, Binghai, et al.
Pubblicazione: (2025)
A Probabilistic Inference Scaling Theory for LLM Self-Correction
di: Yang, Zhe, et al.
Pubblicazione: (2025)
di: Yang, Zhe, et al.
Pubblicazione: (2025)
Localizing Malicious Outputs from CodeLLM
di: Borana, Mayukh, et al.
Pubblicazione: (2025)
di: Borana, Mayukh, et al.
Pubblicazione: (2025)
LLMs Judge Themselves: A Game-Theoretic Framework for Human-Aligned Evaluation
di: Yang, Gao, et al.
Pubblicazione: (2025)
di: Yang, Gao, et al.
Pubblicazione: (2025)
Vibe Checker: Aligning Code Evaluation with Human Preference
di: Zhong, Ming, et al.
Pubblicazione: (2025)
di: Zhong, Ming, et al.
Pubblicazione: (2025)
HellaSwag-Pro: A Large-Scale Bilingual Benchmark for Evaluating the Robustness of LLMs in Commonsense Reasoning
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
Hierarchical Context Pruning: Optimizing Real-World Code Completion with Repository-Level Pretrained Code LLMs
di: Zhang, Lei, et al.
Pubblicazione: (2024)
di: Zhang, Lei, et al.
Pubblicazione: (2024)
RMTBench: Benchmarking LLMs Through Multi-Turn User-Centric Role-Playing
di: Xiang, Hao, et al.
Pubblicazione: (2025)
di: Xiang, Hao, et al.
Pubblicazione: (2025)
Latent Preference Coding: Aligning Large Language Models via Discrete Latent Codes
di: Gong, Zhuocheng, et al.
Pubblicazione: (2025)
di: Gong, Zhuocheng, et al.
Pubblicazione: (2025)
Do LLMs Recognize Your Preferences? Evaluating Personalized Preference Following in LLMs
di: Zhao, Siyan, et al.
Pubblicazione: (2025)
di: Zhao, Siyan, et al.
Pubblicazione: (2025)
Iterative Forward Tuning Boosts In-Context Learning in Language Models
di: Yang, Jiaxi, et al.
Pubblicazione: (2023)
di: Yang, Jiaxi, et al.
Pubblicazione: (2023)
Towards Better Correctness and Efficiency in Code Generation
di: Feng, Yunlong, et al.
Pubblicazione: (2025)
di: Feng, Yunlong, et al.
Pubblicazione: (2025)
EVALALIGN: Supervised Fine-Tuning Multimodal LLMs with Human-Aligned Data for Evaluating Text-to-Image Models
di: Tan, Zhiyu, et al.
Pubblicazione: (2024)
di: Tan, Zhiyu, et al.
Pubblicazione: (2024)
Qwen3-Coder-Next Technical Report
di: Cao, Ruisheng, et al.
Pubblicazione: (2026)
di: Cao, Ruisheng, et al.
Pubblicazione: (2026)
AlignSum: Data Pyramid Hierarchical Fine-tuning for Aligning with Human Summarization Preference
di: Han, Yang, et al.
Pubblicazione: (2024)
di: Han, Yang, et al.
Pubblicazione: (2024)
StoryLens: Preference-Aligned Story Rewriting via Context-Aware Narrative Enrichment
di: Cui, Hanwen, et al.
Pubblicazione: (2026)
di: Cui, Hanwen, et al.
Pubblicazione: (2026)
Sentence-level Reward Model can Generalize Better for Aligning LLM from Human Preference
di: Qiu, Wenjie, et al.
Pubblicazione: (2025)
di: Qiu, Wenjie, et al.
Pubblicazione: (2025)
Efficient Preference-based Reinforcement Learning via Aligned Experience Estimation
di: Bai, Fengshuo, et al.
Pubblicazione: (2024)
di: Bai, Fengshuo, et al.
Pubblicazione: (2024)
SpeechAlign: Aligning Speech Generation to Human Preferences
di: Zhang, Dong, et al.
Pubblicazione: (2024)
di: Zhang, Dong, et al.
Pubblicazione: (2024)
McEval: Massively Multilingual Code Evaluation
di: Chai, Linzheng, et al.
Pubblicazione: (2024)
di: Chai, Linzheng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Aligning CodeLLMs with Direct Preference Optimization
di: Miao, Yibo, et al.
Pubblicazione: (2024) -
ExecRepoBench: Multi-level Executable Code Completion Evaluation
di: Yang, Jian, et al.
Pubblicazione: (2024) -
CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings
di: Quan, Shanghaoran, et al.
Pubblicazione: (2025) -
Multi-Agent Collaboration for Multilingual Code Instruction Tuning
di: Yang, Jian, et al.
Pubblicazione: (2025) -
Evaluating and Achieving Controllable Code Completion in Code LLM
di: Zhang, Jiajun, et al.
Pubblicazione: (2026)