Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Yinghui, Kaur, Simran, Bhaskar, Adithya, Yang, Yongjin, Liu, Jiarui, Ri, Narutatsu, Fowl, Liam, Panigrahi, Abhishek, Chen, Danqi, Arora, Sanjeev |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AdaptMI: Adaptive Skill-based In-context Math Instruction for Small Language Models
di: He, Yinghui, et al.
Pubblicazione: (2025)
di: He, Yinghui, et al.
Pubblicazione: (2025)
Skill-Targeted Adaptive Training
di: He, Yinghui, et al.
Pubblicazione: (2025)
di: He, Yinghui, et al.
Pubblicazione: (2025)
Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization
di: Razin, Noam, et al.
Pubblicazione: (2024)
di: Razin, Noam, et al.
Pubblicazione: (2024)
How Does RL Post-training Induce Skill Composition? A Case Study on Countdown
di: Park, Simon, et al.
Pubblicazione: (2025)
di: Park, Simon, et al.
Pubblicazione: (2025)
On the Power of Context-Enhanced Learning in LLMs
di: Zhu, Xingyu, et al.
Pubblicazione: (2025)
di: Zhu, Xingyu, et al.
Pubblicazione: (2025)
The Heuristic Core: Understanding Subnetwork Generalization in Pretrained Language Models
di: Bhaskar, Adithya, et al.
Pubblicazione: (2024)
di: Bhaskar, Adithya, et al.
Pubblicazione: (2024)
Language Models that Think, Chat Better
di: Bhaskar, Adithya, et al.
Pubblicazione: (2025)
di: Bhaskar, Adithya, et al.
Pubblicazione: (2025)
MixSD: Mixed Contextual Self-Distillation for Knowledge Injection
di: Liu, Jiarui, et al.
Pubblicazione: (2026)
di: Liu, Jiarui, et al.
Pubblicazione: (2026)
The unregulated plant‐based ‘milk’ industry: A threat to nutrition, health and safety?
di: Simran Kaur Arora
Pubblicazione: (2024)
di: Simran Kaur Arora
Pubblicazione: (2024)
Escaping the Cognitive Well: Efficient Competition Math with Off-the-Shelf Models
di: Dang, Xingyu, et al.
Pubblicazione: (2026)
di: Dang, Xingyu, et al.
Pubblicazione: (2026)
Instruct-SkillMix: A Powerful Pipeline for LLM Instruction Tuning
di: Kaur, Simran, et al.
Pubblicazione: (2024)
di: Kaur, Simran, et al.
Pubblicazione: (2024)
Trainable Transformer in Transformer
di: Panigrahi, Abhishek, et al.
Pubblicazione: (2023)
di: Panigrahi, Abhishek, et al.
Pubblicazione: (2023)
On the SDEs and Scaling Rules for Adaptive Gradient Algorithms
di: Malladi, Sadhika, et al.
Pubblicazione: (2022)
di: Malladi, Sadhika, et al.
Pubblicazione: (2022)
Representing Rule-based Chatbots with Transformers
di: Friedman, Dan, et al.
Pubblicazione: (2024)
di: Friedman, Dan, et al.
Pubblicazione: (2024)
Reranking-based Generation for Unbiased Perspective Summarization
di: Ri, Narutatsu, et al.
Pubblicazione: (2025)
di: Ri, Narutatsu, et al.
Pubblicazione: (2025)
Finding Transformer Circuits with Edge Pruning
di: Bhaskar, Adithya, et al.
Pubblicazione: (2024)
di: Bhaskar, Adithya, et al.
Pubblicazione: (2024)
Improving Language Understanding from Screenshots
di: Gao, Tianyu, et al.
Pubblicazione: (2024)
di: Gao, Tianyu, et al.
Pubblicazione: (2024)
Extracting Rule-based Descriptions of Attention Features in Transformers
di: Friedman, Dan, et al.
Pubblicazione: (2025)
di: Friedman, Dan, et al.
Pubblicazione: (2025)
Why is Your Language Model a Poor Implicit Reward Model?
di: Razin, Noam, et al.
Pubblicazione: (2025)
di: Razin, Noam, et al.
Pubblicazione: (2025)
Can Models Learn Skill Composition from Examples?
di: Zhao, Haoyu, et al.
Pubblicazione: (2024)
di: Zhao, Haoyu, et al.
Pubblicazione: (2024)
3D Gaussian Splatting with Normal Information for Mesh Extraction and Improved Rendering
di: Krishnan, Meenakshi, et al.
Pubblicazione: (2025)
di: Krishnan, Meenakshi, et al.
Pubblicazione: (2025)
Speak Easy: Eliciting Harmful Jailbreaks from LLMs with Simple Interactions
di: Chan, Yik Siu, et al.
Pubblicazione: (2025)
di: Chan, Yik Siu, et al.
Pubblicazione: (2025)
Continual Memorization of Factoids in Language Models
di: Chen, Howard, et al.
Pubblicazione: (2024)
di: Chen, Howard, et al.
Pubblicazione: (2024)
Cache Me If You Can: How Many KVs Do You Need for Effective Long-Context LMs?
di: Bhaskar, Adithya, et al.
Pubblicazione: (2025)
di: Bhaskar, Adithya, et al.
Pubblicazione: (2025)
Zero-shot Active Learning Using Self Supervised Learning
di: Sinha, Abhishek, et al.
Pubblicazione: (2024)
di: Sinha, Abhishek, et al.
Pubblicazione: (2024)
CEC-Zero: Zero-Supervision Character Error Correction with Self-Generated Rewards
di: Lin, Zhiming, et al.
Pubblicazione: (2025)
di: Lin, Zhiming, et al.
Pubblicazione: (2025)
To See the Unseen: on the Generalization Ability of Transformers in Symbolic Reasoning
di: Lazić, Nevena, et al.
Pubblicazione: (2026)
di: Lazić, Nevena, et al.
Pubblicazione: (2026)
Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?
di: Park, Simon, et al.
Pubblicazione: (2025)
di: Park, Simon, et al.
Pubblicazione: (2025)
Late Time Acceleration with Observational Constraints in Modified Theories of Gravity
di: Arora, Simran
Pubblicazione: (2023)
di: Arora, Simran
Pubblicazione: (2023)
Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation
di: Wang, Longwen, et al.
Pubblicazione: (2026)
di: Wang, Longwen, et al.
Pubblicazione: (2026)
Embedding Generalized CP Symmetry in One Zero Texture Neutrino Mass Models
di: Priya, et al.
Pubblicazione: (2025)
di: Priya, et al.
Pubblicazione: (2025)
GenVC: Self-Supervised Zero-Shot Voice Conversion
di: Cai, Zexin, et al.
Pubblicazione: (2025)
di: Cai, Zexin, et al.
Pubblicazione: (2025)
LESS: Selecting Influential Data for Targeted Instruction Tuning
di: Xia, Mengzhou, et al.
Pubblicazione: (2024)
di: Xia, Mengzhou, et al.
Pubblicazione: (2024)
On the Impossibility of Retrain Equivalence in Machine Unlearning
di: Yu, Jiatong, et al.
Pubblicazione: (2025)
di: Yu, Jiatong, et al.
Pubblicazione: (2025)
Metacognitive Reuse: Turning Recurring LLM Reasoning Into Concise Behaviors
di: Didolkar, Aniket, et al.
Pubblicazione: (2025)
di: Didolkar, Aniket, et al.
Pubblicazione: (2025)
Occlusion-Aware Self-Supervised Monocular Depth Estimation for Weak-Texture Endoscopic Images
di: Huang, Zebo, et al.
Pubblicazione: (2025)
di: Huang, Zebo, et al.
Pubblicazione: (2025)
Tailoring Self-Rationalizers with Multi-Reward Distillation
di: Ramnath, Sahana, et al.
Pubblicazione: (2023)
di: Ramnath, Sahana, et al.
Pubblicazione: (2023)
Power Distribution Bridges Sampling, Self-Reward RL, and Self-Distillation
di: Tomihari, Akiyoshi, et al.
Pubblicazione: (2026)
di: Tomihari, Akiyoshi, et al.
Pubblicazione: (2026)
p-(001)NiO/n-(0001)ZnO heterostructures grown by pulsed laser deposition technique
di: Sahu, Bhabani Prasad, et al.
Pubblicazione: (2024)
di: Sahu, Bhabani Prasad, et al.
Pubblicazione: (2024)
Self-Distillation of Hidden Layers for Self-Supervised Representation Learning
di: Lowe, Scott C., et al.
Pubblicazione: (2026)
di: Lowe, Scott C., et al.
Pubblicazione: (2026)
Documenti analoghi
-
AdaptMI: Adaptive Skill-based In-context Math Instruction for Small Language Models
di: He, Yinghui, et al.
Pubblicazione: (2025) -
Skill-Targeted Adaptive Training
di: He, Yinghui, et al.
Pubblicazione: (2025) -
Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization
di: Razin, Noam, et al.
Pubblicazione: (2024) -
How Does RL Post-training Induce Skill Composition? A Case Study on Countdown
di: Park, Simon, et al.
Pubblicazione: (2025) -
On the Power of Context-Enhanced Learning in LLMs
di: Zhu, Xingyu, et al.
Pubblicazione: (2025)