Distribution Corrected Offline Data Distillation for Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Yumeng, Yang, Zhengbang, Goonatilake, Yevin Nikhel, Zhu, Zhuangdi |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Removing the Watermark Is Not Enough: Forensic Stealth in Generative-AI Watermark Removal
by: Goonatilake, Yevin Nikhel, et al.
Published: (2026)
by: Goonatilake, Yevin Nikhel, et al.
Published: (2026)
Hierarchical Federated Unlearning for Large Language Models
by: Zhong, Yisheng, et al.
Published: (2025)
by: Zhong, Yisheng, et al.
Published: (2025)
CATNIP: LLM Unlearning via Calibrated and Tokenized Negative Preference Alignment
by: Yang, Zhengbang, et al.
Published: (2026)
by: Yang, Zhengbang, et al.
Published: (2026)
Sports Intelligence: Assessing the Sports Understanding Capabilities of Language Models through Question Answering from Text to Video
by: Yang, Zhengbang, et al.
Published: (2024)
by: Yang, Zhengbang, et al.
Published: (2024)
The Coding Limits of Robust Watermarking for Generative Models
by: Francati, Danilo, et al.
Published: (2025)
by: Francati, Danilo, et al.
Published: (2025)
ChatWise: A Strategy-Guided Chatbot for Enhancing Cognitive Support in Older Adults
by: Yang, Zhengbang, et al.
Published: (2025)
by: Yang, Zhengbang, et al.
Published: (2025)
DUET: Distilled LLM Unlearning from an Efficiently Contextualized Teacher
by: Zhong, Yisheng, et al.
Published: (2026)
by: Zhong, Yisheng, et al.
Published: (2026)
Language and Multimodal Models in Sports: A Survey of Datasets and Applications
by: Xia, Haotian, et al.
Published: (2024)
by: Xia, Haotian, et al.
Published: (2024)
O3D: Offline Data-driven Discovery and Distillation for Sequential Decision-Making with Large Language Models
by: Xiao, Yuchen, et al.
Published: (2023)
by: Xiao, Yuchen, et al.
Published: (2023)
SportQA: A Benchmark for Sports Understanding in Large Language Models
by: Xia, Haotian, et al.
Published: (2024)
by: Xia, Haotian, et al.
Published: (2024)
EmoDistill: Offline Emotion Skill Distillation for Language Model Agents in Adversarial Negotiation
by: Long, Yunbo, et al.
Published: (2026)
by: Long, Yunbo, et al.
Published: (2026)
Self-Distillation Bridges Distribution Gap in Language Model Fine-Tuning
by: Yang, Zhaorui, et al.
Published: (2024)
by: Yang, Zhaorui, et al.
Published: (2024)
Enhancing Knowledge Distillation of Large Language Models through Efficient Multi-Modal Distribution Alignment
by: Peng, Tianyu, et al.
Published: (2024)
by: Peng, Tianyu, et al.
Published: (2024)
Distilling Empathy from Large Language Models
by: Xie, Henry J., et al.
Published: (2025)
by: Xie, Henry J., et al.
Published: (2025)
From Correction to Mastery: Reinforced Distillation of Large Language Model Agents
by: Lyu, Yuanjie, et al.
Published: (2025)
by: Lyu, Yuanjie, et al.
Published: (2025)
Using Large Language Models to Generate Clinical Trial Tables and Figures
by: Yang, Yumeng, et al.
Published: (2024)
by: Yang, Yumeng, et al.
Published: (2024)
Quantification of Large Language Model Distillation
by: Lee, Sunbowen, et al.
Published: (2025)
by: Lee, Sunbowen, et al.
Published: (2025)
Unveiling the Generalization Power of Fine-Tuned Large Language Models
by: Yang, Haoran, et al.
Published: (2024)
by: Yang, Haoran, et al.
Published: (2024)
Distilling Rule-based Knowledge into Large Language Models
by: Yang, Wenkai, et al.
Published: (2023)
by: Yang, Wenkai, et al.
Published: (2023)
Chengyu-Bench: Benchmarking Large Language Models for Chinese Idiom Understanding and Use
by: Fu, Yicheng, et al.
Published: (2025)
by: Fu, Yicheng, et al.
Published: (2025)
TAIA: Large Language Models are Out-of-Distribution Data Learners
by: Jiang, Shuyang, et al.
Published: (2024)
by: Jiang, Shuyang, et al.
Published: (2024)
Domain Specific Specialization in Low-Resource Settings: The Efficacy of Offline Response-Based Knowledge Distillation in Large Language Models
by: Aslan, Erdem, et al.
Published: (2026)
by: Aslan, Erdem, et al.
Published: (2026)
CLEAN-EVAL: Clean Evaluation on Contaminated Large Language Models
by: Zhu, Wenhong, et al.
Published: (2023)
by: Zhu, Wenhong, et al.
Published: (2023)
Knowledge Distillation of Black-Box Large Language Models
by: Chen, Hongzhan, et al.
Published: (2024)
by: Chen, Hongzhan, et al.
Published: (2024)
Self-Correction Distillation for Structured Data Question Answering
by: Zhu, Yushan, et al.
Published: (2025)
by: Zhu, Yushan, et al.
Published: (2025)
DDK: Distilling Domain Knowledge for Efficient Large Language Models
by: Liu, Jiaheng, et al.
Published: (2024)
by: Liu, Jiaheng, et al.
Published: (2024)
Exploring and Enhancing the Transfer of Distribution in Knowledge Distillation for Autoregressive Language Models
by: Rao, Jun, et al.
Published: (2024)
by: Rao, Jun, et al.
Published: (2024)
GOLD: Generalized Knowledge Distillation via Out-of-Distribution-Guided Language Data Generation
by: Gholami, Mohsen, et al.
Published: (2024)
by: Gholami, Mohsen, et al.
Published: (2024)
Arrows of Math Reasoning Data Synthesis for Large Language Models: Diversity, Complexity and Correctness
by: Chen, Sirui, et al.
Published: (2025)
by: Chen, Sirui, et al.
Published: (2025)
Boosting Large Language Models for Mental Manipulation Detection via Data Augmentation and Distillation
by: Gao, Yuansheng, et al.
Published: (2025)
by: Gao, Yuansheng, et al.
Published: (2025)
CIRF: Tokenizing Chain-of-Thoughts into Reusable Functional Units for Efficient Latent Reasoning in Large Language Models
by: Lee, Yukyung, et al.
Published: (2026)
by: Lee, Yukyung, et al.
Published: (2026)
Does Knowledge Distillation Matter for Large Language Model based Bundle Generation?
by: Feng, Kaidong, et al.
Published: (2025)
by: Feng, Kaidong, et al.
Published: (2025)
Knowledgeable Agents by Offline Reinforcement Learning from Large Language Model Rollouts
by: Pang, Jing-Cheng, et al.
Published: (2024)
by: Pang, Jing-Cheng, et al.
Published: (2024)
Survey on Knowledge Distillation for Large Language Models: Methods, Evaluation, and Application
by: Yang, Chuanpeng, et al.
Published: (2024)
by: Yang, Chuanpeng, et al.
Published: (2024)
Self-Data Distillation for Recovering Quality in Pruned Large Language Models
by: Thangarasa, Vithursan, et al.
Published: (2024)
by: Thangarasa, Vithursan, et al.
Published: (2024)
Dual-Space Knowledge Distillation for Large Language Models
by: Zhang, Songming, et al.
Published: (2024)
by: Zhang, Songming, et al.
Published: (2024)
Multi-Granularity Semantic Revision for Large Language Model Distillation
by: Liu, Xiaoyu, et al.
Published: (2024)
by: Liu, Xiaoyu, et al.
Published: (2024)
Enhancing Multilingual Capabilities of Large Language Models through Self-Distillation from Resource-Rich Languages
by: Zhang, Yuanchi, et al.
Published: (2024)
by: Zhang, Yuanchi, et al.
Published: (2024)
ParetoHqD: Fast Offline Multiobjective Alignment of Large Language Models using Pareto High-quality Data
by: Gu, Haoran, et al.
Published: (2025)
by: Gu, Haoran, et al.
Published: (2025)
Knowledge Distillation and Dataset Distillation of Large Language Models: Emerging Trends, Challenges, and Future Directions
by: Fang, Luyang, et al.
Published: (2025)
by: Fang, Luyang, et al.
Published: (2025)
Similar Items
-
Removing the Watermark Is Not Enough: Forensic Stealth in Generative-AI Watermark Removal
by: Goonatilake, Yevin Nikhel, et al.
Published: (2026) -
Hierarchical Federated Unlearning for Large Language Models
by: Zhong, Yisheng, et al.
Published: (2025) -
CATNIP: LLM Unlearning via Calibrated and Tokenized Negative Preference Alignment
by: Yang, Zhengbang, et al.
Published: (2026) -
Sports Intelligence: Assessing the Sports Understanding Capabilities of Language Models through Question Answering from Text to Video
by: Yang, Zhengbang, et al.
Published: (2024) -
The Coding Limits of Robust Watermarking for Generative Models
by: Francati, Danilo, et al.
Published: (2025)