SODA: Semi On-Policy Black-Box Distillation for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Xiwen, Wang, Jingjing, Zhu, Wenhui, Qiu, Peijie, Dong, Xuanzhao, Sang, Hejian, Wang, Zhipeng, Geramifard, Alborz, Luo, Feng |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
TIP: Token Importance in On-Policy Distillation
by: Xu, Yuanda, et al.
Published: (2026)
by: Xu, Yuanda, et al.
Published: (2026)
Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training
by: Xu, Yuanda, et al.
Published: (2026)
by: Xu, Yuanda, et al.
Published: (2026)
AriadneMem: Threading the Maze of Lifelong Memory for LLM Agents
by: Zhu, Wenhui, et al.
Published: (2026)
by: Zhu, Wenhui, et al.
Published: (2026)
Talk Before You Retrieve: Agent-Led Discussions for Better RAG in Medical QA
by: Dong, Xuanzhao, et al.
Published: (2025)
by: Dong, Xuanzhao, et al.
Published: (2025)
AHA: Aligning Large Audio-Language Models for Reasoning Hallucinations via Counterfactual Hard Negatives
by: Chen, Yanxi, et al.
Published: (2025)
by: Chen, Yanxi, et al.
Published: (2025)
Your Agent is More Brittle Than You Think: Uncovering Indirect Injection Vulnerabilities in Agentic LLMs
by: Zhu, Wenhui, et al.
Published: (2026)
by: Zhu, Wenhui, et al.
Published: (2026)
LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding
by: Dong, Xuanzhao, et al.
Published: (2025)
by: Dong, Xuanzhao, et al.
Published: (2025)
Sequential Decision-Making for Inline Text Autocomplete
by: Chitnis, Rohan, et al.
Published: (2024)
by: Chitnis, Rohan, et al.
Published: (2024)
Toward Effective Reinforcement Learning Fine-Tuning for Medical VQA in Vision-Language Models
by: Zhu, Wenhui, et al.
Published: (2025)
by: Zhu, Wenhui, et al.
Published: (2025)
EVTP-IVS: Effective Visual Token Pruning For Unifying Instruction Visual Segmentation In Multi-Modal Large Language Models
by: Zhu, Wenhui, et al.
Published: (2025)
by: Zhu, Wenhui, et al.
Published: (2025)
Black-Box On-Policy Distillation of Large Language Models
by: Ye, Tianzhu, et al.
Published: (2025)
by: Ye, Tianzhu, et al.
Published: (2025)
DRA-GRPO: Your GRPO Needs to Know Diverse Reasoning Paths for Mathematical Reasoning
by: Chen, Xiwen, et al.
Published: (2025)
by: Chen, Xiwen, et al.
Published: (2025)
RetinalGPT: A Retinal Clinical Preference Conversational Assistant Powered by Large Vision-Language Models
by: Zhu, Wenhui, et al.
Published: (2025)
by: Zhu, Wenhui, et al.
Published: (2025)
Context Pruning for Coding Agents via Multi-Rubric Latent Reasoning
by: Wang, Jingjing, et al.
Published: (2026)
by: Wang, Jingjing, et al.
Published: (2026)
Planner-R1: Reward Shaping Enables Efficient Agentic RL with Smaller LLMs
by: Zhu, Siyu, et al.
Published: (2025)
by: Zhu, Siyu, et al.
Published: (2025)
STA-Unet: Rethink the semantic redundant for Medical Imaging Segmentation
by: Vasa, Vamsi Krishna, et al.
Published: (2024)
by: Vasa, Vamsi Krishna, et al.
Published: (2024)
PACED: Distillation and On-Policy Self-Distillation at the Frontier of Student Competence
by: Xu, Yuanda, et al.
Published: (2026)
by: Xu, Yuanda, et al.
Published: (2026)
OphIn-500K: Curating Web-Scale Visual Instructions for Scaling Ophthalmic Multimodal Large Language Models
by: Dong, Xuanzhao, et al.
Published: (2026)
by: Dong, Xuanzhao, et al.
Published: (2026)
Distilling the Essence: Efficient Reasoning Distillation via Sequence Truncation
by: Chen, Wei-Rui, et al.
Published: (2025)
by: Chen, Wei-Rui, et al.
Published: (2025)
Knowledge Distillation of Black-Box Large Language Models
by: Chen, Hongzhan, et al.
Published: (2024)
by: Chen, Hongzhan, et al.
Published: (2024)
Prompt-OT: An Optimal Transport Regularization Paradigm for Knowledge Preservation in Vision-Language Model Adaptation
by: Chen, Xiwen, et al.
Published: (2025)
by: Chen, Xiwen, et al.
Published: (2025)
CRISP: Compressed Reasoning via Iterative Self-Policy Distillation
by: Sang, Hejian, et al.
Published: (2026)
by: Sang, Hejian, et al.
Published: (2026)
Agentic Reinforcement Learning for Real-World Code Repair
by: Zhu, Siyu, et al.
Published: (2025)
by: Zhu, Siyu, et al.
Published: (2025)
Imaging Signal Recovery Using Neural Network Priors Under Uncertain Forward Model Parameters
by: Chen, Xiwen, et al.
Published: (2024)
by: Chen, Xiwen, et al.
Published: (2024)
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
by: Wang, Sudong, et al.
Published: (2026)
by: Wang, Sudong, et al.
Published: (2026)
OTPrune: Distribution-Aligned Visual Token Pruning via Optimal Transport
by: Chen, Xiwen, et al.
Published: (2026)
by: Chen, Xiwen, et al.
Published: (2026)
Black-Box Prompt Optimization: Aligning Large Language Models without Model Training
by: Cheng, Jiale, et al.
Published: (2023)
by: Cheng, Jiale, et al.
Published: (2023)
MiniLLM: On-Policy Distillation of Large Language Models
by: Gu, Yuxian, et al.
Published: (2023)
by: Gu, Yuxian, et al.
Published: (2023)
Reflective Personalization Optimization: A Post-hoc Rewriting Framework for Black-Box Large Language Models
by: Hao, Teqi, et al.
Published: (2025)
by: Hao, Teqi, et al.
Published: (2025)
Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL
by: Lin, Xiaofeng, et al.
Published: (2026)
by: Lin, Xiaofeng, et al.
Published: (2026)
PDL: Regularizing Multiple Instance Learning with Progressive Dropout Layers
by: Zhu, Wenhui, et al.
Published: (2023)
by: Zhu, Wenhui, et al.
Published: (2023)
CUNSB-RFIE: Context-aware Unpaired Neural Schrödinger Bridge in Retinal Fundus Image Enhancement
by: Dong, Xuanzhao, et al.
Published: (2024)
by: Dong, Xuanzhao, et al.
Published: (2024)
Cracking Instance Jigsaw Puzzles: An Alternative to Multiple Instance Learning for Whole Slide Image Analysis
by: Chen, Xiwen, et al.
Published: (2025)
by: Chen, Xiwen, et al.
Published: (2025)
Bounded Behavioral Indistinguishability for Black-Box LLM Distillation
by: Hasan, Munawar
Published: (2026)
by: Hasan, Munawar
Published: (2026)
Test-time Backdoor Mitigation for Black-Box Large Language Models with Defensive Demonstrations
by: Mo, Wenjie, et al.
Published: (2023)
by: Mo, Wenjie, et al.
Published: (2023)
On-Policy Context Distillation for Language Models
by: Ye, Tianzhu, et al.
Published: (2026)
by: Ye, Tianzhu, et al.
Published: (2026)
AJF: Adaptive Jailbreak Framework Based on the Comprehension Ability of Black-Box Large Language Models
by: Yu, Mingyu, et al.
Published: (2025)
by: Yu, Mingyu, et al.
Published: (2025)
RPM: Reasoning-Level Personalization for Black-Box Large Language Models
by: Kim, Jieyong, et al.
Published: (2025)
by: Kim, Jieyong, et al.
Published: (2025)
Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning
by: Dong, Xuanzhao, et al.
Published: (2026)
by: Dong, Xuanzhao, et al.
Published: (2026)
FedDTPT: Federated Discrete and Transferable Prompt Tuning for Black-Box Large Language Models
by: Wu, Jiaqi, et al.
Published: (2024)
by: Wu, Jiaqi, et al.
Published: (2024)
Similar Items
-
TIP: Token Importance in On-Policy Distillation
by: Xu, Yuanda, et al.
Published: (2026) -
Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training
by: Xu, Yuanda, et al.
Published: (2026) -
AriadneMem: Threading the Maze of Lifelong Memory for LLM Agents
by: Zhu, Wenhui, et al.
Published: (2026) -
Talk Before You Retrieve: Agent-Led Discussions for Better RAG in Medical QA
by: Dong, Xuanzhao, et al.
Published: (2025) -
AHA: Aligning Large Audio-Language Models for Reasoning Hallucinations via Counterfactual Hard Negatives
by: Chen, Yanxi, et al.
Published: (2025)