Primal Generation, Dual Judgment: Self-Training from Test-Time Scaling
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiao, Yizhu, Zhang, Ruixiang, Bai, Richard, Han, Jiawei, Collobert, Ronan, Zhang, Yizhe |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SelfCodeAlign: Self-Alignment for Code Generation
di: Wei, Yuxiang, et al.
Pubblicazione: (2024)
di: Wei, Yuxiang, et al.
Pubblicazione: (2024)
Scaling Test-Time Compute for Agentic Coding
di: Kim, Joongwon, et al.
Pubblicazione: (2026)
di: Kim, Joongwon, et al.
Pubblicazione: (2026)
CoCoST: Automatic Complex Code Generation with Online Searching and Correctness Testing
di: He, Xinyi, et al.
Pubblicazione: (2024)
di: He, Xinyi, et al.
Pubblicazione: (2024)
Optimizing Case-Based Reasoning System for Functional Test Script Generation with Large Language Models
di: Guo, Siyuan, et al.
Pubblicazione: (2025)
di: Guo, Siyuan, et al.
Pubblicazione: (2025)
Evaluating Language Models for Efficient Code Generation
di: Liu, Jiawei, et al.
Pubblicazione: (2024)
di: Liu, Jiawei, et al.
Pubblicazione: (2024)
Absorber LLM: Harnessing Causal Synchronization for Test-Time Training
di: Zhang, Zhixin, et al.
Pubblicazione: (2026)
di: Zhang, Zhixin, et al.
Pubblicazione: (2026)
HE-SNR: Uncovering Latent Logic via Entropy for Guiding Mid-Training on SWE-bench
di: Wang, Yueyang, et al.
Pubblicazione: (2026)
di: Wang, Yueyang, et al.
Pubblicazione: (2026)
Hybrid-Gym: Training Coding Agents to Generalize Across Tasks
di: Xie, Yiqing, et al.
Pubblicazione: (2026)
di: Xie, Yiqing, et al.
Pubblicazione: (2026)
Comparative Separation: Evaluating Separation on Comparative Judgment Test Data
di: Xi, Xiaoyin, et al.
Pubblicazione: (2026)
di: Xi, Xiaoyin, et al.
Pubblicazione: (2026)
Test Code Generation for Telecom Software Systems using Two-Stage Generative Model
di: Nabeel, Mohamad, et al.
Pubblicazione: (2024)
di: Nabeel, Mohamad, et al.
Pubblicazione: (2024)
Toward Training Superintelligent Software Agents through Self-Play SWE-RL
di: Wei, Yuxiang, et al.
Pubblicazione: (2025)
di: Wei, Yuxiang, et al.
Pubblicazione: (2025)
ReflexiCoder: Teaching Large Language Models to Self-Reflect on Generated Code and Self-Correct It via Reinforcement Learning
di: Jiang, Juyong, et al.
Pubblicazione: (2026)
di: Jiang, Juyong, et al.
Pubblicazione: (2026)
TDD-Bench Verified: Can LLMs Generate Tests for Issues Before They Get Resolved?
di: Ahmed, Toufique, et al.
Pubblicazione: (2024)
di: Ahmed, Toufique, et al.
Pubblicazione: (2024)
WhiteFox: White-Box Compiler Fuzzing Empowered by Large Language Models
di: Yang, Chenyuan, et al.
Pubblicazione: (2023)
di: Yang, Chenyuan, et al.
Pubblicazione: (2023)
CodeJudge: Evaluating Code Generation with Large Language Models
di: Tong, Weixi, et al.
Pubblicazione: (2024)
di: Tong, Weixi, et al.
Pubblicazione: (2024)
SEVerA: Verified Synthesis of Self-Evolving Agents
di: Banerjee, Debangshu, et al.
Pubblicazione: (2026)
di: Banerjee, Debangshu, et al.
Pubblicazione: (2026)
VeriScale: Adversarial Test-Suite Scaling for Verifiable Code Generation
di: Bai, Yifan, et al.
Pubblicazione: (2026)
di: Bai, Yifan, et al.
Pubblicazione: (2026)
EVALOOOP: A Self-Consistency-Centered Framework for Assessing Large Language Model Robustness in Programming
di: Fang, Sen, et al.
Pubblicazione: (2025)
di: Fang, Sen, et al.
Pubblicazione: (2025)
Code Generation by Differential Test Time Scaling
di: He, Yifeng, et al.
Pubblicazione: (2026)
di: He, Yifeng, et al.
Pubblicazione: (2026)
TAROT: Test-driven and Capability-adaptive Curriculum Reinforcement Fine-tuning for Code Generation with Large Language Models
di: Park, Chansung, et al.
Pubblicazione: (2026)
di: Park, Chansung, et al.
Pubblicazione: (2026)
GLLM: Self-Corrective G-Code Generation using Large Language Models with User Feedback
di: Abdelaal, Mohamed, et al.
Pubblicazione: (2025)
di: Abdelaal, Mohamed, et al.
Pubblicazione: (2025)
Embarrassingly Simple Self-Distillation Improves Code Generation
di: Zhang, Ruixiang, et al.
Pubblicazione: (2026)
di: Zhang, Ruixiang, et al.
Pubblicazione: (2026)
REFLEX: Reference-Free Evaluation of Log Summarization via Large Language Model Judgment
di: Mudgal, Priyanka
Pubblicazione: (2025)
di: Mudgal, Priyanka
Pubblicazione: (2025)
RepoQA: Evaluating Long Context Code Understanding
di: Liu, Jiawei, et al.
Pubblicazione: (2024)
di: Liu, Jiawei, et al.
Pubblicazione: (2024)
Neuron Patching: Semantic-based Neuron-level Language Model Repair for Code Generation
di: Gu, Jian, et al.
Pubblicazione: (2023)
di: Gu, Jian, et al.
Pubblicazione: (2023)
A Semantic-based Optimization Approach for Repairing LLMs: Case Study on Code Generation
di: Gu, Jian, et al.
Pubblicazione: (2025)
di: Gu, Jian, et al.
Pubblicazione: (2025)
FlakyGuard: Automatically Fixing Flaky Tests at Industry Scale
di: Li, Chengpeng, et al.
Pubblicazione: (2025)
di: Li, Chengpeng, et al.
Pubblicazione: (2025)
Detecting Buggy Contracts via Smart Testing
di: Wang, Sally Junsong, et al.
Pubblicazione: (2024)
di: Wang, Sally Junsong, et al.
Pubblicazione: (2024)
SWE-Replay: Efficient Test-Time Scaling for Software Engineering Agents
di: Ding, Yifeng, et al.
Pubblicazione: (2026)
di: Ding, Yifeng, et al.
Pubblicazione: (2026)
Automatically Testing Functional Properties of Code Translation Models
di: Eniser, Hasan Ferit, et al.
Pubblicazione: (2023)
di: Eniser, Hasan Ferit, et al.
Pubblicazione: (2023)
SceneGenAgent: Precise Industrial Scene Generation with Coding Agent
di: Xia, Xiao, et al.
Pubblicazione: (2024)
di: Xia, Xiao, et al.
Pubblicazione: (2024)
Learning to Generate Unit Tests for Automated Debugging
di: Prasad, Archiki, et al.
Pubblicazione: (2025)
di: Prasad, Archiki, et al.
Pubblicazione: (2025)
Training Long-Context, Multi-Turn Software Engineering Agents with Reinforcement Learning
di: Golubev, Alexander, et al.
Pubblicazione: (2025)
di: Golubev, Alexander, et al.
Pubblicazione: (2025)
Learning Code Preference via Synthetic Evolution
di: Liu, Jiawei, et al.
Pubblicazione: (2024)
di: Liu, Jiawei, et al.
Pubblicazione: (2024)
LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs
di: Xia, Yunhui, et al.
Pubblicazione: (2025)
di: Xia, Yunhui, et al.
Pubblicazione: (2025)
Improving Code Generation by Training with Natural Language Feedback
di: Chen, Angelica, et al.
Pubblicazione: (2023)
di: Chen, Angelica, et al.
Pubblicazione: (2023)
LLMEffiChecker: Understanding and Testing Efficiency Degradation of Large Language Models
di: Feng, Xiaoning, et al.
Pubblicazione: (2022)
di: Feng, Xiaoning, et al.
Pubblicazione: (2022)
R2E-Gym: Procedural Environments and Hybrid Verifiers for Scaling Open-Weights SWE Agents
di: Jain, Naman, et al.
Pubblicazione: (2025)
di: Jain, Naman, et al.
Pubblicazione: (2025)
XFT: Unlocking the Power of Code Instruction Tuning by Simply Merging Upcycled Mixture-of-Experts
di: Ding, Yifeng, et al.
Pubblicazione: (2024)
di: Ding, Yifeng, et al.
Pubblicazione: (2024)
ReVeal: Self-Evolving Code Agents via Reliable Self-Verification
di: Jin, Yiyang, et al.
Pubblicazione: (2025)
di: Jin, Yiyang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
SelfCodeAlign: Self-Alignment for Code Generation
di: Wei, Yuxiang, et al.
Pubblicazione: (2024) -
Scaling Test-Time Compute for Agentic Coding
di: Kim, Joongwon, et al.
Pubblicazione: (2026) -
CoCoST: Automatic Complex Code Generation with Online Searching and Correctness Testing
di: He, Xinyi, et al.
Pubblicazione: (2024) -
Optimizing Case-Based Reasoning System for Functional Test Script Generation with Large Language Models
di: Guo, Siyuan, et al.
Pubblicazione: (2025) -
Evaluating Language Models for Efficient Code Generation
di: Liu, Jiawei, et al.
Pubblicazione: (2024)