EDGE-OPD: Internalizing Privileged Context with Evidence Guided On-Policy Distillation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lazaridis, Aristotelis, Bates, Dylan, Sharma, Aman, King, Brian, Lu, Vincent, FitzGerald, Jack |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Measuring and Eliminating Refusals in Military Large Language Models
par: FitzGerald, Jack, et autres
Publié: (2026)
par: FitzGerald, Jack, et autres
Publié: (2026)
EdgeRunner 20B: Military Task Parity with GPT-5 while Running on the Edge
par: FitzGerald, Jack, et autres
Publié: (2025)
par: FitzGerald, Jack, et autres
Publié: (2025)
PHLoRA: data-free Post-hoc Low-Rank Adapter extraction from full-rank checkpoint
par: Vasani, Bhoomit, et autres
Publié: (2025)
par: Vasani, Bhoomit, et autres
Publié: (2025)
The Twin Purposes of Guided Inquiry: Guiding Student Inquiry and Evidence-Based Practice
par: FitzGerald, Lee
Publié: (2010)
par: FitzGerald, Lee
Publié: (2010)
MATTER: Memory-Augmented Transformer Using Heterogeneous Knowledge Sources
par: Lee, Dongkyu, et autres
Publié: (2024)
par: Lee, Dongkyu, et autres
Publié: (2024)
OPD+: Rethinking the Advantage Design for On-Policy Distillation
par: Zhao, Hanyang, et autres
Publié: (2026)
par: Zhao, Hanyang, et autres
Publié: (2026)
Impossible Things in the Age of Reformations
par: Brian FitzGerald
Publié: (2025)
par: Brian FitzGerald
Publié: (2025)
Flow-OPD: On-Policy Distillation for Flow Matching Models
par: Fang, Zhen, et autres
Publié: (2026)
par: Fang, Zhen, et autres
Publié: (2026)
Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning
par: Yang, Zhicheng, et autres
Publié: (2026)
par: Yang, Zhicheng, et autres
Publié: (2026)
DP-OPD: Differentially Private On-Policy Distillation for Language Models
par: Khadem, Fatemeh, et autres
Publié: (2026)
par: Khadem, Fatemeh, et autres
Publié: (2026)
HDPO: Hybrid Distillation Policy Optimization via Privileged Self-Distillation
par: Ding, Ken
Publié: (2026)
par: Ding, Ken
Publié: (2026)
$\boldsymbol{f}$-OPD: Stabilizing Long-Horizon On-Policy Distillation with Freshness-Aware Control
par: Chen, Xianwei, et autres
Publié: (2026)
par: Chen, Xianwei, et autres
Publié: (2026)
Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation
par: Wu, Yecheng, et autres
Publié: (2026)
par: Wu, Yecheng, et autres
Publié: (2026)
MAD-OPD: Breaking the Ceiling in On-Policy Distillation via Multi-Agent Debate
par: Wang, Jianze, et autres
Publié: (2026)
par: Wang, Jianze, et autres
Publié: (2026)
X-OPD: Cross-Modal On-Policy Distillation for Capability Alignment in Speech LLMs
par: Cao, Di, et autres
Publié: (2026)
par: Cao, Di, et autres
Publié: (2026)
Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation
par: Yuan, Qianhao, et autres
Publié: (2026)
par: Yuan, Qianhao, et autres
Publié: (2026)
Privileged Information Distillation for Language Models
par: Penaloza, Emiliano, et autres
Publié: (2026)
par: Penaloza, Emiliano, et autres
Publié: (2026)
QSTToolkit: A Python Library for Deep Learning Powered Quantum State Tomography
par: FitzGerald, George, et autres
Publié: (2025)
par: FitzGerald, George, et autres
Publié: (2025)
Catherine Vézina, Diplomacia migratoria: una historia transnacional del Programa Bracero, 1947-1952, México, Centro de Investigación y Docencia Económicas, 2017, 404 pp. ISBN 978-607-446-102-2
par: David Scott FitzGerald
Publié: (2020)
par: David Scott FitzGerald
Publié: (2020)
Erika Pani, Para pertenecer a la gran familia mexicana: procesos de naturalización en el siglo xix, México, El Colegio de México, 2015, 204 pp. ISBN 978-607-462-713-8
par: David Scott FitzGerald
Publié: (2016)
par: David Scott FitzGerald
Publié: (2016)
EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity
par: Zhang, Xingjian, et autres
Publié: (2025)
par: Zhang, Xingjian, et autres
Publié: (2025)
Distilling Privileged Information for Dubins Traveling Salesman Problems with Neighborhoods
par: Shin, Min Kyu, et autres
Publié: (2024)
par: Shin, Min Kyu, et autres
Publié: (2024)
Same Evidence, Different Answers: Canonical-Context On-Policy Distillation for Multi-Turn Language Models
par: Lin, Zizhuo, et autres
Publié: (2026)
par: Lin, Zizhuo, et autres
Publié: (2026)
CAPF: Guiding Search-Agent Rollouts with Credit-Attenuated Privileged Feedback
par: Chen, Bin, et autres
Publié: (2026)
par: Chen, Bin, et autres
Publié: (2026)
Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation
par: Zhao, Anhao, et autres
Publié: (2026)
par: Zhao, Anhao, et autres
Publié: (2026)
OISD: On-Policy Internal Self-Distillation of Language Models
par: Liu, Xinyu, et autres
Publié: (2026)
par: Liu, Xinyu, et autres
Publié: (2026)
Distilling Privileged Multimodal Information for Expression Recognition using Optimal Transport
par: Aslam, Muhammad Haseeb, et autres
Publié: (2024)
par: Aslam, Muhammad Haseeb, et autres
Publié: (2024)
"Just Let Me Go at It": Exploring Students' Use and Perceptions of Guided Inquiry
par: Garrison, Kasey L., et autres
Publié: (2018)
par: Garrison, Kasey L., et autres
Publié: (2018)
OPSDL: On-Policy Self-Distillation for Long-Context Language Models
par: Zhang, Xinsen, et autres
Publié: (2026)
par: Zhang, Xinsen, et autres
Publié: (2026)
Depth-Guided Self-Supervised Human Keypoint Detection via Cross-Modal Distillation
par: Anand, Aman, et autres
Publié: (2024)
par: Anand, Aman, et autres
Publié: (2024)
Random walks in Weyl chambers
par: Denisov, Denis, et autres
Publié: (2025)
par: Denisov, Denis, et autres
Publié: (2025)
Critique de la méthode de distinction entre poissons anadromes et dulcicoles de la même espèce par la teneur en strontium de leurs écailles
par: Castonguay, M., FitzGerald, G. J
Publié: (1982)
par: Castonguay, M., FitzGerald, G. J
Publié: (1982)
Ordered random walks and the Airy line ensemble
par: Denisov, Denis, et autres
Publié: (2024)
par: Denisov, Denis, et autres
Publié: (2024)
Library Signage: Applications for the Apple Macintosh and MacPaint.
par: Diskin, Jill A., et autres
Publié: (1984)
par: Diskin, Jill A., et autres
Publié: (1984)
EDGE: Enhanced Grounded GUI Understanding with Enriched Multi-Granularity Synthetic Data
par: Chen, Xuetian, et autres
Publié: (2024)
par: Chen, Xuetian, et autres
Publié: (2024)
Evidence-backed Fact Checking using RAG and Few-Shot In-Context Learning with LLMs
par: Singhal, Ronit, et autres
Publié: (2024)
par: Singhal, Ronit, et autres
Publié: (2024)
ProteinOPD: Towards Effective and Efficient Preference Alignment for Protein Design
par: Zhang, Yulin, et autres
Publié: (2026)
par: Zhang, Yulin, et autres
Publié: (2026)
The Many Faces of On-Policy Distillation: Pitfalls, Mechanisms, and Fixes
par: Zhu, Siqi, et autres
Publié: (2026)
par: Zhu, Siqi, et autres
Publié: (2026)
AVSD: Adaptive-View Self-Distillation by Balancing Consensus and Teacher-Specific Privileged Signals
par: Nguyen, Duy, et autres
Publié: (2026)
par: Nguyen, Duy, et autres
Publié: (2026)
EDGE: A Theoretical Framework for Misconception-Aware Adaptive Learning
par: Verma, Ananda Prakash
Publié: (2025)
par: Verma, Ananda Prakash
Publié: (2025)
Documents similaires
-
Measuring and Eliminating Refusals in Military Large Language Models
par: FitzGerald, Jack, et autres
Publié: (2026) -
EdgeRunner 20B: Military Task Parity with GPT-5 while Running on the Edge
par: FitzGerald, Jack, et autres
Publié: (2025) -
PHLoRA: data-free Post-hoc Low-Rank Adapter extraction from full-rank checkpoint
par: Vasani, Bhoomit, et autres
Publié: (2025) -
The Twin Purposes of Guided Inquiry: Guiding Student Inquiry and Evidence-Based Practice
par: FitzGerald, Lee
Publié: (2010) -
MATTER: Memory-Augmented Transformer Using Heterogeneous Knowledge Sources
par: Lee, Dongkyu, et autres
Publié: (2024)