Embarrassingly Simple Self-Distillation Improves Code Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Ruixiang, Bai, Richard He, Zheng, Huangjie, Jaitly, Navdeep, Collobert, Ronan, Zhang, Yizhe |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation
par: Gong, Shansan, et autres
Publié: (2025)
par: Gong, Shansan, et autres
Publié: (2025)
Primal Generation, Dual Judgment: Self-Training from Test-Time Scaling
par: Jiao, Yizhu, et autres
Publié: (2026)
par: Jiao, Yizhu, et autres
Publié: (2026)
SAGE: Steering Dialog Generation with Future-Aware State-Action Augmentation
par: Zhang, Yizhe, et autres
Publié: (2025)
par: Zhang, Yizhe, et autres
Publié: (2025)
Revisiting ASR Error Correction with Specialized Models
par: Gu, Zijin, et autres
Publié: (2024)
par: Gu, Zijin, et autres
Publié: (2024)
dMel: Speech Tokenization made Simple
par: Bai, Richard He, et autres
Publié: (2024)
par: Bai, Richard He, et autres
Publié: (2024)
ChipChat: Low-Latency Cascaded Conversational Agent in MLX
par: Likhomanenko, Tatiana, et autres
Publié: (2025)
par: Likhomanenko, Tatiana, et autres
Publié: (2025)
Flexible Language Modeling in Continuous Space with Transformer-based Autoregressive Flows
par: Zhang, Ruixiang, et autres
Publié: (2025)
par: Zhang, Ruixiang, et autres
Publié: (2025)
How Far Are We from Intelligent Visual Deductive Reasoning?
par: Zhang, Yizhe, et autres
Publié: (2024)
par: Zhang, Yizhe, et autres
Publié: (2024)
CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning
par: He, Jie, et autres
Publié: (2025)
par: He, Jie, et autres
Publié: (2025)
Probing the Multi-turn Planning Capabilities of LLMs via 20 Question Games
par: Zhang, Yizhe, et autres
Publié: (2023)
par: Zhang, Yizhe, et autres
Publié: (2023)
Divide-or-Conquer? Which Part Should You Distill Your LLM?
par: Wu, Zhuofeng, et autres
Publié: (2024)
par: Wu, Zhuofeng, et autres
Publié: (2024)
What Makes the Preferred Thinking Direction for LLMs in Multiple-choice Questions?
par: Zhang, Yizhe, et autres
Publié: (2025)
par: Zhang, Yizhe, et autres
Publié: (2025)
Rephrasing the Web: A Recipe for Compute and Data-Efficient Language Modeling
par: Maini, Pratyush, et autres
Publié: (2024)
par: Maini, Pratyush, et autres
Publié: (2024)
KGLens: Towards Efficient and Effective Knowledge Probing of Large Language Models with Knowledge Graphs
par: Zheng, Shangshang, et autres
Publié: (2023)
par: Zheng, Shangshang, et autres
Publié: (2023)
PLANNER: Generating Diversified Paragraph via Latent Language Diffusion Model
par: Zhang, Yizhe, et autres
Publié: (2023)
par: Zhang, Yizhe, et autres
Publié: (2023)
Continuously Augmented Discrete Diffusion model for Categorical Generative Modeling
par: Zheng, Huangjie, et autres
Publié: (2025)
par: Zheng, Huangjie, et autres
Publié: (2025)
SpeakStream: Streaming Text-to-Speech with Interleaved Data
par: Bai, Richard He, et autres
Publié: (2025)
par: Bai, Richard He, et autres
Publié: (2025)
Improving GFlowNets for Text-to-Image Diffusion Alignment
par: Zhang, Dinghuai, et autres
Publié: (2024)
par: Zhang, Dinghuai, et autres
Publié: (2024)
Training Software Engineering Agents and Verifiers with SWE-Gym
par: Pan, Jiayi, et autres
Publié: (2024)
par: Pan, Jiayi, et autres
Publié: (2024)
Unsupervised ASR via Cross-Lingual Pseudo-Labeling
par: Likhomanenko, Tatiana, et autres
Publié: (2023)
par: Likhomanenko, Tatiana, et autres
Publié: (2023)
Just CHOP: Embarrassingly Simple LLM Compression
par: Jha, Ananya Harsh, et autres
Publié: (2023)
par: Jha, Ananya Harsh, et autres
Publié: (2023)
Eliciting In-context Retrieval and Reasoning for Long-context Large Language Models
par: Qiu, Yifu, et autres
Publié: (2025)
par: Qiu, Yifu, et autres
Publié: (2025)
No Need to Talk: Asynchronous Mixture of Language Models
par: Filippova, Anastasiia, et autres
Publié: (2024)
par: Filippova, Anastasiia, et autres
Publié: (2024)
TypeScore: A Text Fidelity Metric for Text-to-Image Generative Models
par: Sampaio, Georgia Gabriela, et autres
Publié: (2024)
par: Sampaio, Georgia Gabriela, et autres
Publié: (2024)
An Embarrassingly Simple Approach for LLM with Strong ASR Capacity
par: Ma, Ziyang, et autres
Publié: (2024)
par: Ma, Ziyang, et autres
Publié: (2024)
LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning
par: Kang, Haoqiang, et autres
Publié: (2025)
par: Kang, Haoqiang, et autres
Publié: (2025)
Embarrassingly Simple Unsupervised Aspect Based Sentiment Tuple Extraction
par: Scaria, Kevin, et autres
Publié: (2024)
par: Scaria, Kevin, et autres
Publié: (2024)
TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch
par: Song, Xingchen, et autres
Publié: (2024)
par: Song, Xingchen, et autres
Publié: (2024)
Omni-Router: Sharing Routing Decisions in Sparse Mixture-of-Experts for Speech Recognition
par: Gu, Zijin, et autres
Publié: (2025)
par: Gu, Zijin, et autres
Publié: (2025)
Guided Score identity Distillation for Data-Free One-Step Text-to-Image Generation
par: Zhou, Mingyuan, et autres
Publié: (2024)
par: Zhou, Mingyuan, et autres
Publié: (2024)
An Embarrassingly Simple Defense Against LLM Abliteration Attacks
par: Shairah, Harethah Abu, et autres
Publié: (2025)
par: Shairah, Harethah Abu, et autres
Publié: (2025)
Normalizing Flows are Capable Generative Models
par: Zhai, Shuangfei, et autres
Publié: (2024)
par: Zhai, Shuangfei, et autres
Publié: (2024)
Kaleido Diffusion: Improving Conditional Diffusion Models with Autoregressive Latent Modeling
par: Gu, Jiatao, et autres
Publié: (2024)
par: Gu, Jiatao, et autres
Publié: (2024)
Matryoshka Diffusion Models
par: Gu, Jiatao, et autres
Publié: (2023)
par: Gu, Jiatao, et autres
Publié: (2023)
Closing the Gap Between Text and Speech Understanding in LLMs
par: Cuervo, Santiago, et autres
Publié: (2025)
par: Cuervo, Santiago, et autres
Publié: (2025)
Self-Infilling Code Generation
par: Zheng, Lin, et autres
Publié: (2023)
par: Zheng, Lin, et autres
Publié: (2023)
Target Concrete Score Matching: A Holistic Framework for Discrete Diffusion
par: Zhang, Ruixiang, et autres
Publié: (2025)
par: Zhang, Ruixiang, et autres
Publié: (2025)
DART: Denoising Autoregressive Transformer for Scalable Text-to-Image Generation
par: Gu, Jiatao, et autres
Publié: (2024)
par: Gu, Jiatao, et autres
Publié: (2024)
Score Distillation of Flow Matching Models
par: Zhou, Mingyuan, et autres
Publié: (2025)
par: Zhou, Mingyuan, et autres
Publié: (2025)
Reasoning Distillation and Structural Alignment for Improved Code Generation
par: Jalilifard, Amir, et autres
Publié: (2025)
par: Jalilifard, Amir, et autres
Publié: (2025)
Documents similaires
-
DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation
par: Gong, Shansan, et autres
Publié: (2025) -
Primal Generation, Dual Judgment: Self-Training from Test-Time Scaling
par: Jiao, Yizhu, et autres
Publié: (2026) -
SAGE: Steering Dialog Generation with Future-Aware State-Action Augmentation
par: Zhang, Yizhe, et autres
Publié: (2025) -
Revisiting ASR Error Correction with Specialized Models
par: Gu, Zijin, et autres
Publié: (2024) -
dMel: Speech Tokenization made Simple
par: Bai, Richard He, et autres
Publié: (2024)