OVD: On-policy Verbal Distillation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xiong, Jing, Shen, Hui, Gong, Shansan, Cheng, Yuxin, Shen, Jianghan, Tao, Chaofan, Tan, Haochen, Bai, Haoli, Shang, Lifeng, Wong, Ngai |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ATTS: Asynchronous Test-Time Scaling via Conformal Prediction
par: Xiong, Jing, et autres
Publié: (2025)
par: Xiong, Jing, et autres
Publié: (2025)
From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation
par: Jiang, Yuxin, et autres
Publié: (2026)
par: Jiang, Yuxin, et autres
Publié: (2026)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
par: Ye, Jiacheng, et autres
Publié: (2025)
par: Ye, Jiacheng, et autres
Publié: (2025)
UNComp: Can Matrix Entropy Uncover Sparsity? -- A Compressor Design from an Uncertainty-Aware Perspective
par: Xiong, Jing, et autres
Publié: (2024)
par: Xiong, Jing, et autres
Publié: (2024)
CktFormalizer: Autoformalization of Natural Language into Circuit Representations
par: Xiong, Jing, et autres
Publié: (2026)
par: Xiong, Jing, et autres
Publié: (2026)
Rethinking Kullback-Leibler Divergence in Knowledge Distillation for Large Language Models
par: Wu, Taiqiang, et autres
Publié: (2024)
par: Wu, Taiqiang, et autres
Publié: (2024)
ParallelComp: Parallel Long-Context Compressor for Length Extrapolation
par: Xiong, Jing, et autres
Publié: (2025)
par: Xiong, Jing, et autres
Publié: (2025)
MMFormalizer: Multimodal Autoformalization in the Wild
par: Xiong, Jing, et autres
Publié: (2026)
par: Xiong, Jing, et autres
Publié: (2026)
LongEmotion: Measuring Emotional Intelligence of Large Language Models in Long-Context Interaction
par: Liu, Weichu, et autres
Publié: (2025)
par: Liu, Weichu, et autres
Publié: (2025)
Find Your Optimal Teacher: Personalized Data Synthesis via Router-Guided Multi-Teacher Distillation
par: Zhang, Hengyuan, et autres
Publié: (2025)
par: Zhang, Hengyuan, et autres
Publié: (2025)
DoPE: Denoising Rotary Position Embedding
par: Xiong, Jing, et autres
Publié: (2025)
par: Xiong, Jing, et autres
Publié: (2025)
SWE-Lego: Pushing the Limits of Supervised Fine-tuning for Software Issue Resolving
par: Tao, Chaofan, et autres
Publié: (2026)
par: Tao, Chaofan, et autres
Publié: (2026)
The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs
par: Chen, Jierun, et autres
Publié: (2025)
par: Chen, Jierun, et autres
Publié: (2025)
CodeComp: Structural KV Cache Compression for Agentic Coding
par: Chen, Qiujiang, et autres
Publié: (2026)
par: Chen, Qiujiang, et autres
Publié: (2026)
Memory-T1: Reinforcement Learning for Temporal Reasoning in Multi-session Agents
par: Du, Yiming, et autres
Publié: (2025)
par: Du, Yiming, et autres
Publié: (2025)
Gradually Excavating External Knowledge for Implicit Complex Question Answering
par: Liu, Chang, et autres
Publié: (2026)
par: Liu, Chang, et autres
Publié: (2026)
GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models
par: Li, Mukai, et autres
Publié: (2024)
par: Li, Mukai, et autres
Publié: (2024)
Weight-Inherited Distillation for Task-Agnostic BERT Compression
par: Wu, Taiqiang, et autres
Publié: (2023)
par: Wu, Taiqiang, et autres
Publié: (2023)
Scaling Laws with Vocabulary: Larger Models Deserve Larger Vocabularies
par: Tao, Chaofan, et autres
Publié: (2024)
par: Tao, Chaofan, et autres
Publié: (2024)
MEIT: Multimodal Electrocardiogram Instruction Tuning on Large Language Models for Report Generation
par: Wan, Zhongwei, et autres
Publié: (2024)
par: Wan, Zhongwei, et autres
Publié: (2024)
DSDR: Dual-Scale Diversity Regularization for Exploration in LLM Reasoning
par: Wan, Zhongwei, et autres
Publié: (2026)
par: Wan, Zhongwei, et autres
Publié: (2026)
Autoregressive Models in Vision: A Survey
par: Xiong, Jing, et autres
Publié: (2024)
par: Xiong, Jing, et autres
Publié: (2024)
Enhancing Test-Time Scaling of Large Language Models with Hierarchical Retrieval-Augmented MCTS
par: Dou, Alex ZH, et autres
Publié: (2025)
par: Dou, Alex ZH, et autres
Publié: (2025)
SwingArena: Competitive Programming Arena for Long-context GitHub Issue Solving
par: Xu, Wendong, et autres
Publié: (2025)
par: Xu, Wendong, et autres
Publié: (2025)
A Survey on Knowledge Distillation of Large Language Models
par: Xu, Xiaohan, et autres
Publié: (2024)
par: Xu, Xiaohan, et autres
Publié: (2024)
SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning
par: Wan, Zhongwei, et autres
Publié: (2025)
par: Wan, Zhongwei, et autres
Publié: (2025)
Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning
par: Chen, Liang, et autres
Publié: (2025)
par: Chen, Liang, et autres
Publié: (2025)
Can We Trust LLMs on Memristors? Diving into Reasoning Ability under Non-Ideality
par: Wu, Taiqiang, et autres
Publié: (2026)
par: Wu, Taiqiang, et autres
Publié: (2026)
Training-Free Long-Context Scaling of Large Language Models
par: An, Chenxin, et autres
Publié: (2024)
par: An, Chenxin, et autres
Publié: (2024)
NAACL: Noise-AwAre Verbal Confidence Calibration for Robust LLMs in RAG Systems
par: Liu, Jiayu, et autres
Publié: (2026)
par: Liu, Jiayu, et autres
Publié: (2026)
TreeKV: Smooth Key-Value Cache Compression with Tree Structures
par: He, Ziwei, et autres
Publié: (2025)
par: He, Ziwei, et autres
Publié: (2025)
WeightedKV: Attention Scores Weighted Key-Value Cache Merging for Large Language Models
par: Yuan, Jian, et autres
Publié: (2025)
par: Yuan, Jian, et autres
Publié: (2025)
DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation
par: Gong, Shansan, et autres
Publié: (2025)
par: Gong, Shansan, et autres
Publié: (2025)
Beyond Outliers: A Data-Free Layer-wise Mixed-Precision Quantization Approach Driven by Numerical and Structural Dual-Sensitivity
par: Zhang, Hengyuan, et autres
Publié: (2026)
par: Zhang, Hengyuan, et autres
Publié: (2026)
Adam: Dense Retrieval Distillation with Adaptive Dark Examples
par: Tao, Chongyang, et autres
Publié: (2022)
par: Tao, Chongyang, et autres
Publié: (2022)
DeepDiver: Adaptive Search Intensity Scaling via Open-Web Reinforcement Learning
par: Shi, Wenxuan, et autres
Publié: (2025)
par: Shi, Wenxuan, et autres
Publié: (2025)
Towards Goal-oriented Prompt Engineering for Large Language Models: A Survey
par: Li, Haochen, et autres
Publié: (2024)
par: Li, Haochen, et autres
Publié: (2024)
Revisiting Knowledge Distillation for Autoregressive Language Models
par: Zhong, Qihuang, et autres
Publié: (2024)
par: Zhong, Qihuang, et autres
Publié: (2024)
Visually Guided Generative Text-Layout Pre-training for Document Intelligence
par: Mao, Zhiming, et autres
Publié: (2024)
par: Mao, Zhiming, et autres
Publié: (2024)
Why Does the Effective Context Length of LLMs Fall Short?
par: An, Chenxin, et autres
Publié: (2024)
par: An, Chenxin, et autres
Publié: (2024)
Documents similaires
-
ATTS: Asynchronous Test-Time Scaling via Conformal Prediction
par: Xiong, Jing, et autres
Publié: (2025) -
From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation
par: Jiang, Yuxin, et autres
Publié: (2026) -
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
par: Ye, Jiacheng, et autres
Publié: (2025) -
UNComp: Can Matrix Entropy Uncover Sparsity? -- A Compressor Design from an Uncertainty-Aware Perspective
par: Xiong, Jing, et autres
Publié: (2024) -
CktFormalizer: Autoformalization of Natural Language into Circuit Representations
par: Xiong, Jing, et autres
Publié: (2026)