Black-Box On-Policy Distillation of Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ye, Tianzhu, Dong, Li, Chi, Zewen, Wu, Xun, Huang, Shaohan, Wei, Furu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
On-Policy Context Distillation for Language Models
par: Ye, Tianzhu, et autres
Publié: (2026)
par: Ye, Tianzhu, et autres
Publié: (2026)
The Era of Agentic Organization: Learning to Organize with Language Models
par: Chi, Zewen, et autres
Publié: (2025)
par: Chi, Zewen, et autres
Publié: (2025)
Textual Aesthetics in Large Language Models
par: Jiang, Lingjie, et autres
Publié: (2024)
par: Jiang, Lingjie, et autres
Publié: (2024)
MiniLLM: On-Policy Distillation of Large Language Models
par: Gu, Yuxian, et autres
Publié: (2023)
par: Gu, Yuxian, et autres
Publié: (2023)
Online Experiential Learning for Language Models
par: Ye, Tianzhu, et autres
Publié: (2026)
par: Ye, Tianzhu, et autres
Publié: (2026)
Multi-Head Mixture-of-Experts
par: Wu, Xun, et autres
Publié: (2024)
par: Wu, Xun, et autres
Publié: (2024)
On-Policy RL with Optimal Reward Baseline
par: Hao, Yaru, et autres
Publié: (2025)
par: Hao, Yaru, et autres
Publié: (2025)
VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
par: Jiang, Lingjie, et autres
Publié: (2025)
par: Jiang, Lingjie, et autres
Publié: (2025)
Reward Reasoning Model
par: Guo, Jiaxin, et autres
Publié: (2025)
par: Guo, Jiaxin, et autres
Publié: (2025)
Self-Boosting Large Language Models with Synthetic Preference Data
par: Dong, Qingxiu, et autres
Publié: (2024)
par: Dong, Qingxiu, et autres
Publié: (2024)
Think Only When You Need with Large Hybrid-Reasoning Models
par: Jiang, Lingjie, et autres
Publié: (2025)
par: Jiang, Lingjie, et autres
Publié: (2025)
Opening the Black Box: A Survey on the Mechanisms of Multi-Step Reasoning in Large Language Models
par: Pan, Liangming, et autres
Publié: (2026)
par: Pan, Liangming, et autres
Publié: (2026)
K-Level Reasoning: Establishing Higher Order Beliefs in Large Language Models for Strategic Reasoning
par: Zhang, Yadong, et autres
Publié: (2024)
par: Zhang, Yadong, et autres
Publié: (2024)
BBox-Adapter: Lightweight Adapting for Black-Box Large Language Models
par: Sun, Haotian, et autres
Publié: (2024)
par: Sun, Haotian, et autres
Publié: (2024)
Adapting Large Language Models to Domains via Reading Comprehension
par: Cheng, Daixuan, et autres
Publié: (2023)
par: Cheng, Daixuan, et autres
Publié: (2023)
Universal YOCO for Efficient Depth Scaling
par: Sun, Yutao, et autres
Publié: (2026)
par: Sun, Yutao, et autres
Publié: (2026)
In-context Autoencoder for Context Compression in a Large Language Model
par: Ge, Tao, et autres
Publié: (2023)
par: Ge, Tao, et autres
Publié: (2023)
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
par: Wang, Sudong, et autres
Publié: (2026)
par: Wang, Sudong, et autres
Publié: (2026)
Mixture of LoRA Experts
par: Wu, Xun, et autres
Publié: (2024)
par: Wu, Xun, et autres
Publié: (2024)
You've Changed: Detecting Modification of Black-Box Large Language Models
par: Dima, Alden, et autres
Publié: (2025)
par: Dima, Alden, et autres
Publié: (2025)
Inference-Aware Prompt Optimization for Aligning Black-Box Large Language Models
par: Mahmud, Saaduddin, et autres
Publié: (2025)
par: Mahmud, Saaduddin, et autres
Publié: (2025)
BitNet Distillation
par: Wu, Xun, et autres
Publié: (2025)
par: Wu, Xun, et autres
Publié: (2025)
Structured Agent Distillation for Large Language Model
par: Liu, Jun, et autres
Publié: (2025)
par: Liu, Jun, et autres
Publié: (2025)
LongReasonArena: A Long Reasoning Benchmark for Large Language Models
par: Ding, Jiayu, et autres
Publié: (2025)
par: Ding, Jiayu, et autres
Publié: (2025)
Computer Environments Elicit General Agentic Intelligence in LLMs
par: Cheng, Daixuan, et autres
Publié: (2026)
par: Cheng, Daixuan, et autres
Publié: (2026)
Black-Box Opinion Manipulation Attacks to Retrieval-Augmented Generation of Large Language Models
par: Chen, Zhuo, et autres
Publié: (2024)
par: Chen, Zhuo, et autres
Publié: (2024)
Shorten After You're Right: Lazy Length Penalties for Reasoning RL
par: Yuan, Danlong, et autres
Publié: (2025)
par: Yuan, Danlong, et autres
Publié: (2025)
QCRD: Quality-guided Contrastive Rationale Distillation for Large Language Models
par: Wang, Wei, et autres
Publié: (2024)
par: Wang, Wei, et autres
Publié: (2024)
Unleashing the Emergent Cognitive Synergy in Large Language Models: A Task-Solving Agent through Multi-Persona Self-Collaboration
par: Wang, Zhenhailong, et autres
Publié: (2023)
par: Wang, Zhenhailong, et autres
Publié: (2023)
Large Language Model Confidence Estimation via Black-Box Access
par: Pedapati, Tejaswini, et autres
Publié: (2024)
par: Pedapati, Tejaswini, et autres
Publié: (2024)
SeSE: Black-Box Uncertainty Quantification for Large Language Models Based on Structural Information Theory
par: Zhao, Xingtao, et autres
Publié: (2025)
par: Zhao, Xingtao, et autres
Publié: (2025)
MH-MoE: Multi-Head Mixture-of-Experts
par: Huang, Shaohan, et autres
Publié: (2024)
par: Huang, Shaohan, et autres
Publié: (2024)
Language Models as Inductive Reasoners
par: Yang, Zonglin, et autres
Publié: (2022)
par: Yang, Zonglin, et autres
Publié: (2022)
ResLoRA: Identity Residual Mapping in Low-Rank Adaption
par: Shi, Shuhua, et autres
Publié: (2024)
par: Shi, Shuhua, et autres
Publié: (2024)
EasyDistill: A Comprehensive Toolkit for Effective Knowledge Distillation of Large Language Models
par: Wang, Chengyu, et autres
Publié: (2025)
par: Wang, Chengyu, et autres
Publié: (2025)
Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
par: Li, Yaxuan, et autres
Publié: (2026)
par: Li, Yaxuan, et autres
Publié: (2026)
ReAD: Reinforcement-Guided Capability Distillation for Large Language Models
par: Cheng, Xueqi, et autres
Publié: (2026)
par: Cheng, Xueqi, et autres
Publié: (2026)
Your Inference Request Will Become a Black Box: Confidential Inference for Cloud-based Large Language Models
par: Huang, Chung-ju, et autres
Publié: (2026)
par: Huang, Chung-ju, et autres
Publié: (2026)
Playing Language Game with LLMs Leads to Jailbreaking
par: Peng, Yu, et autres
Publié: (2024)
par: Peng, Yu, et autres
Publié: (2024)
Context-DPO: Aligning Language Models for Context-Faithfulness
par: Bi, Baolong, et autres
Publié: (2024)
par: Bi, Baolong, et autres
Publié: (2024)
Documents similaires
-
On-Policy Context Distillation for Language Models
par: Ye, Tianzhu, et autres
Publié: (2026) -
The Era of Agentic Organization: Learning to Organize with Language Models
par: Chi, Zewen, et autres
Publié: (2025) -
Textual Aesthetics in Large Language Models
par: Jiang, Lingjie, et autres
Publié: (2024) -
MiniLLM: On-Policy Distillation of Large Language Models
par: Gu, Yuxian, et autres
Publié: (2023) -
Online Experiential Learning for Language Models
par: Ye, Tianzhu, et autres
Publié: (2026)