BitNet b1.58 2B4T Technical Report
Fuente:
arXiv
Salvato in:
| Autori principali: | Ma, Shuming, Wang, Hongyu, Huang, Shaohan, Zhang, Xingxing, Hu, Ying, Song, Ting, Xia, Yan, Wei, Furu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
1-bit AI Infra: Part 1.1, Fast and Lossless BitNet b1.58 Inference on CPUs
di: Wang, Jinheng, et al.
Pubblicazione: (2024)
di: Wang, Jinheng, et al.
Pubblicazione: (2024)
BitNet Distillation
di: Wu, Xun, et al.
Pubblicazione: (2025)
di: Wu, Xun, et al.
Pubblicazione: (2025)
BitNet a4.8: 4-bit Activations for 1-bit LLMs
di: Wang, Hongyu, et al.
Pubblicazione: (2024)
di: Wang, Hongyu, et al.
Pubblicazione: (2024)
BitNet v2: Native 4-bit Activations with Hadamard Transformation for 1-bit LLMs
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
Sparse-BitNet: 1.58-bit LLMs are Naturally Friendly to Semi-Structured Sparsity
di: Zhang, Di, et al.
Pubblicazione: (2026)
di: Zhang, Di, et al.
Pubblicazione: (2026)
The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits
di: Ma, Shuming, et al.
Pubblicazione: (2024)
di: Ma, Shuming, et al.
Pubblicazione: (2024)
BitNet b1.58 Reloaded: State-of-the-art Performance Also on Smaller Networks
di: Nielsen, Jacob, et al.
Pubblicazione: (2024)
di: Nielsen, Jacob, et al.
Pubblicazione: (2024)
When are 1.58 bits enough? A Bottom-up Exploration of BitNet Quantization
di: Nielsen, Jacob, et al.
Pubblicazione: (2024)
di: Nielsen, Jacob, et al.
Pubblicazione: (2024)
MH-MoE: Multi-Head Mixture-of-Experts
di: Huang, Shaohan, et al.
Pubblicazione: (2024)
di: Huang, Shaohan, et al.
Pubblicazione: (2024)
Q-Sparse: All Large Language Models can be Fully Sparsely-Activated
di: Wang, Hongyu, et al.
Pubblicazione: (2024)
di: Wang, Hongyu, et al.
Pubblicazione: (2024)
Adapting Large Language Models to Domains via Reading Comprehension
di: Cheng, Daixuan, et al.
Pubblicazione: (2023)
di: Cheng, Daixuan, et al.
Pubblicazione: (2023)
Mixture of LoRA Experts
di: Wu, Xun, et al.
Pubblicazione: (2024)
di: Wu, Xun, et al.
Pubblicazione: (2024)
VibeVoice Technical Report
di: Peng, Zhiliang, et al.
Pubblicazione: (2025)
di: Peng, Zhiliang, et al.
Pubblicazione: (2025)
Bitnet.cpp: Efficient Edge Inference for Ternary LLMs
di: Wang, Jinheng, et al.
Pubblicazione: (2025)
di: Wang, Jinheng, et al.
Pubblicazione: (2025)
Auto-ICL: In-Context Learning without Human Supervision
di: Yang, Jinghan, et al.
Pubblicazione: (2023)
di: Yang, Jinghan, et al.
Pubblicazione: (2023)
You Only Cache Once: Decoder-Decoder Architectures for Language Models
di: Sun, Yutao, et al.
Pubblicazione: (2024)
di: Sun, Yutao, et al.
Pubblicazione: (2024)
Textual Aesthetics in Large Language Models
di: Jiang, Lingjie, et al.
Pubblicazione: (2024)
di: Jiang, Lingjie, et al.
Pubblicazione: (2024)
Multi-Head Mixture-of-Experts
di: Wu, Xun, et al.
Pubblicazione: (2024)
di: Wu, Xun, et al.
Pubblicazione: (2024)
Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning
di: Yang, Wenkai, et al.
Pubblicazione: (2025)
di: Yang, Wenkai, et al.
Pubblicazione: (2025)
On-Policy Context Distillation for Language Models
di: Ye, Tianzhu, et al.
Pubblicazione: (2026)
di: Ye, Tianzhu, et al.
Pubblicazione: (2026)
RedStone: Curating General, Code, Math, and QA Data for Large Language Models
di: Chang, Yaoyao, et al.
Pubblicazione: (2024)
di: Chang, Yaoyao, et al.
Pubblicazione: (2024)
Continual Quantization-Aware Pre-Training: When to transition from 16-bit to 1.58-bit pre-training for BitNet language models?
di: Nielsen, Jacob, et al.
Pubblicazione: (2025)
di: Nielsen, Jacob, et al.
Pubblicazione: (2025)
Thinking Augmented Pre-training
di: Wang, Liang, et al.
Pubblicazione: (2025)
di: Wang, Liang, et al.
Pubblicazione: (2025)
Instruction Pre-Training: Language Models are Supervised Multitask Learners
di: Cheng, Daixuan, et al.
Pubblicazione: (2024)
di: Cheng, Daixuan, et al.
Pubblicazione: (2024)
Multilingual E5 Text Embeddings: A Technical Report
di: Wang, Liang, et al.
Pubblicazione: (2024)
di: Wang, Liang, et al.
Pubblicazione: (2024)
An Extra RMSNorm is All You Need for Fine Tuning to 1.58 Bits
di: Steinmetz, Cody, et al.
Pubblicazione: (2025)
di: Steinmetz, Cody, et al.
Pubblicazione: (2025)
LongReasonArena: A Long Reasoning Benchmark for Large Language Models
di: Ding, Jiayu, et al.
Pubblicazione: (2025)
di: Ding, Jiayu, et al.
Pubblicazione: (2025)
Online Experiential Learning for Language Models
di: Ye, Tianzhu, et al.
Pubblicazione: (2026)
di: Ye, Tianzhu, et al.
Pubblicazione: (2026)
Universal YOCO for Efficient Depth Scaling
di: Sun, Yutao, et al.
Pubblicazione: (2026)
di: Sun, Yutao, et al.
Pubblicazione: (2026)
QueST: Incentivizing LLMs to Generate Difficult Problems
di: Hu, Hanxu, et al.
Pubblicazione: (2025)
di: Hu, Hanxu, et al.
Pubblicazione: (2025)
Think Only When You Need with Large Hybrid-Reasoning Models
di: Jiang, Lingjie, et al.
Pubblicazione: (2025)
di: Jiang, Lingjie, et al.
Pubblicazione: (2025)
Black-Box On-Policy Distillation of Large Language Models
di: Ye, Tianzhu, et al.
Pubblicazione: (2025)
di: Ye, Tianzhu, et al.
Pubblicazione: (2025)
On-Policy RL with Optimal Reward Baseline
di: Hao, Yaru, et al.
Pubblicazione: (2025)
di: Hao, Yaru, et al.
Pubblicazione: (2025)
Bootstrap Your Own Context Length
di: Wang, Liang, et al.
Pubblicazione: (2024)
di: Wang, Liang, et al.
Pubblicazione: (2024)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
di: Pan, Xichen, et al.
Pubblicazione: (2023)
di: Pan, Xichen, et al.
Pubblicazione: (2023)
Reward Reasoning Model
di: Guo, Jiaxin, et al.
Pubblicazione: (2025)
di: Guo, Jiaxin, et al.
Pubblicazione: (2025)
VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
di: Jiang, Lingjie, et al.
Pubblicazione: (2025)
di: Jiang, Lingjie, et al.
Pubblicazione: (2025)
MathScale: Scaling Instruction Tuning for Mathematical Reasoning
di: Tang, Zhengyang, et al.
Pubblicazione: (2024)
di: Tang, Zhengyang, et al.
Pubblicazione: (2024)
MAGNET: Autonomous Expert Model Generation via Decentralized Autoresearch and BitNet Training
di: Kim, Yongwan, et al.
Pubblicazione: (2026)
di: Kim, Yongwan, et al.
Pubblicazione: (2026)
Code Aesthetics with Agentic Reward Feedback
di: Xiao, Bang, et al.
Pubblicazione: (2025)
di: Xiao, Bang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
1-bit AI Infra: Part 1.1, Fast and Lossless BitNet b1.58 Inference on CPUs
di: Wang, Jinheng, et al.
Pubblicazione: (2024) -
BitNet Distillation
di: Wu, Xun, et al.
Pubblicazione: (2025) -
BitNet a4.8: 4-bit Activations for 1-bit LLMs
di: Wang, Hongyu, et al.
Pubblicazione: (2024) -
BitNet v2: Native 4-bit Activations with Hadamard Transformation for 1-bit LLMs
di: Wang, Hongyu, et al.
Pubblicazione: (2025) -
Sparse-BitNet: 1.58-bit LLMs are Naturally Friendly to Semi-Structured Sparsity
di: Zhang, Di, et al.
Pubblicazione: (2026)