BitNet Distillation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wu, Xun, Huang, Shaohan, Wang, Wenhui, Song, Ting, Dong, Li, Xia, Yan, Wei, Furu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
BitNet b1.58 2B4T Technical Report
von: Ma, Shuming, et al.
Veröffentlicht: (2025)
von: Ma, Shuming, et al.
Veröffentlicht: (2025)
BitNet a4.8: 4-bit Activations for 1-bit LLMs
von: Wang, Hongyu, et al.
Veröffentlicht: (2024)
von: Wang, Hongyu, et al.
Veröffentlicht: (2024)
BitNet v2: Native 4-bit Activations with Hadamard Transformation for 1-bit LLMs
von: Wang, Hongyu, et al.
Veröffentlicht: (2025)
von: Wang, Hongyu, et al.
Veröffentlicht: (2025)
Sparse-BitNet: 1.58-bit LLMs are Naturally Friendly to Semi-Structured Sparsity
von: Zhang, Di, et al.
Veröffentlicht: (2026)
von: Zhang, Di, et al.
Veröffentlicht: (2026)
Multi-Head Mixture-of-Experts
von: Wu, Xun, et al.
Veröffentlicht: (2024)
von: Wu, Xun, et al.
Veröffentlicht: (2024)
Mixture of LoRA Experts
von: Wu, Xun, et al.
Veröffentlicht: (2024)
von: Wu, Xun, et al.
Veröffentlicht: (2024)
The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits
von: Ma, Shuming, et al.
Veröffentlicht: (2024)
von: Ma, Shuming, et al.
Veröffentlicht: (2024)
Textual Aesthetics in Large Language Models
von: Jiang, Lingjie, et al.
Veröffentlicht: (2024)
von: Jiang, Lingjie, et al.
Veröffentlicht: (2024)
On-Policy RL with Optimal Reward Baseline
von: Hao, Yaru, et al.
Veröffentlicht: (2025)
von: Hao, Yaru, et al.
Veröffentlicht: (2025)
1-bit AI Infra: Part 1.1, Fast and Lossless BitNet b1.58 Inference on CPUs
von: Wang, Jinheng, et al.
Veröffentlicht: (2024)
von: Wang, Jinheng, et al.
Veröffentlicht: (2024)
When are 1.58 bits enough? A Bottom-up Exploration of BitNet Quantization
von: Nielsen, Jacob, et al.
Veröffentlicht: (2024)
von: Nielsen, Jacob, et al.
Veröffentlicht: (2024)
Thinking Augmented Pre-training
von: Wang, Liang, et al.
Veröffentlicht: (2025)
von: Wang, Liang, et al.
Veröffentlicht: (2025)
On-Policy Context Distillation for Language Models
von: Ye, Tianzhu, et al.
Veröffentlicht: (2026)
von: Ye, Tianzhu, et al.
Veröffentlicht: (2026)
BitNet b1.58 Reloaded: State-of-the-art Performance Also on Smaller Networks
von: Nielsen, Jacob, et al.
Veröffentlicht: (2024)
von: Nielsen, Jacob, et al.
Veröffentlicht: (2024)
Towards Stable and Effective Reinforcement Learning for Mixture-of-Experts
von: Zhang, Di, et al.
Veröffentlicht: (2025)
von: Zhang, Di, et al.
Veröffentlicht: (2025)
Multimodal Latent Language Modeling with Next-Token Diffusion
von: Sun, Yutao, et al.
Veröffentlicht: (2024)
von: Sun, Yutao, et al.
Veröffentlicht: (2024)
Black-Box On-Policy Distillation of Large Language Models
von: Ye, Tianzhu, et al.
Veröffentlicht: (2025)
von: Ye, Tianzhu, et al.
Veröffentlicht: (2025)
Breaking Training Bottlenecks: Effective and Stable Reinforcement Learning for Coding Models
von: Li, Zongqian, et al.
Veröffentlicht: (2026)
von: Li, Zongqian, et al.
Veröffentlicht: (2026)
MH-MoE: Multi-Head Mixture-of-Experts
von: Huang, Shaohan, et al.
Veröffentlicht: (2024)
von: Huang, Shaohan, et al.
Veröffentlicht: (2024)
MoRA: High-Rank Updating for Parameter-Efficient Fine-Tuning
von: Jiang, Ting, et al.
Veröffentlicht: (2024)
von: Jiang, Ting, et al.
Veröffentlicht: (2024)
Online Experiential Learning for Language Models
von: Ye, Tianzhu, et al.
Veröffentlicht: (2026)
von: Ye, Tianzhu, et al.
Veröffentlicht: (2026)
Differential Transformer
von: Ye, Tianzhu, et al.
Veröffentlicht: (2024)
von: Ye, Tianzhu, et al.
Veröffentlicht: (2024)
Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs
von: Wang, Qibin, et al.
Veröffentlicht: (2025)
von: Wang, Qibin, et al.
Veröffentlicht: (2025)
Text Diffusion with Reinforced Conditioning
von: Liu, Yuxuan, et al.
Veröffentlicht: (2024)
von: Liu, Yuxuan, et al.
Veröffentlicht: (2024)
Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
von: Li, Chengzu, et al.
Veröffentlicht: (2025)
von: Li, Chengzu, et al.
Veröffentlicht: (2025)
LongEmbed: Extending Embedding Models for Long Context Retrieval
von: Zhu, Dawei, et al.
Veröffentlicht: (2024)
von: Zhu, Dawei, et al.
Veröffentlicht: (2024)
PoSE: Efficient Context Window Extension of LLMs via Positional Skip-wise Training
von: Zhu, Dawei, et al.
Veröffentlicht: (2023)
von: Zhu, Dawei, et al.
Veröffentlicht: (2023)
Reward Reasoning Model
von: Guo, Jiaxin, et al.
Veröffentlicht: (2025)
von: Guo, Jiaxin, et al.
Veröffentlicht: (2025)
Scaling Optimal LR Across Token Horizons
von: Bjorck, Johan, et al.
Veröffentlicht: (2024)
von: Bjorck, Johan, et al.
Veröffentlicht: (2024)
BitDelta: Your Fine-Tune May Only Be Worth One Bit
von: Liu, James, et al.
Veröffentlicht: (2024)
von: Liu, James, et al.
Veröffentlicht: (2024)
Bitnet.cpp: Efficient Edge Inference for Ternary LLMs
von: Wang, Jinheng, et al.
Veröffentlicht: (2025)
von: Wang, Jinheng, et al.
Veröffentlicht: (2025)
SODA: Semi On-Policy Black-Box Distillation for Large Language Models
von: Chen, Xiwen, et al.
Veröffentlicht: (2026)
von: Chen, Xiwen, et al.
Veröffentlicht: (2026)
Q-Sparse: All Large Language Models can be Fully Sparsely-Activated
von: Wang, Hongyu, et al.
Veröffentlicht: (2024)
von: Wang, Hongyu, et al.
Veröffentlicht: (2024)
STBLLM: Breaking the 1-Bit Barrier with Structured Binary LLMs
von: Dong, Peijie, et al.
Veröffentlicht: (2024)
von: Dong, Peijie, et al.
Veröffentlicht: (2024)
MAGNET: Autonomous Expert Model Generation via Decentralized Autoresearch and BitNet Training
von: Kim, Yongwan, et al.
Veröffentlicht: (2026)
von: Kim, Yongwan, et al.
Veröffentlicht: (2026)
Scaling Data Difficulty: Improving Coding Models via Reinforcement Learning on Fresh and Challenging Problems
von: Li, Zongqian, et al.
Veröffentlicht: (2026)
von: Li, Zongqian, et al.
Veröffentlicht: (2026)
Adapting Large Language Models to Domains via Reading Comprehension
von: Cheng, Daixuan, et al.
Veröffentlicht: (2023)
von: Cheng, Daixuan, et al.
Veröffentlicht: (2023)
In-context Autoencoder for Context Compression in a Large Language Model
von: Ge, Tao, et al.
Veröffentlicht: (2023)
von: Ge, Tao, et al.
Veröffentlicht: (2023)
The Era of Agentic Organization: Learning to Organize with Language Models
von: Chi, Zewen, et al.
Veröffentlicht: (2025)
von: Chi, Zewen, et al.
Veröffentlicht: (2025)
MiniDisc: Minimal Distillation Schedule for Language Model Compression
von: Zhang, Chen, et al.
Veröffentlicht: (2022)
von: Zhang, Chen, et al.
Veröffentlicht: (2022)
Ähnliche Einträge
-
BitNet b1.58 2B4T Technical Report
von: Ma, Shuming, et al.
Veröffentlicht: (2025) -
BitNet a4.8: 4-bit Activations for 1-bit LLMs
von: Wang, Hongyu, et al.
Veröffentlicht: (2024) -
BitNet v2: Native 4-bit Activations with Hadamard Transformation for 1-bit LLMs
von: Wang, Hongyu, et al.
Veröffentlicht: (2025) -
Sparse-BitNet: 1.58-bit LLMs are Naturally Friendly to Semi-Structured Sparsity
von: Zhang, Di, et al.
Veröffentlicht: (2026) -
Multi-Head Mixture-of-Experts
von: Wu, Xun, et al.
Veröffentlicht: (2024)