Salvato in:
| Autori principali: | Ma, Shuming, Wang, Hongyu, Ma, Lingxiao, Wang, Lei, Wang, Wenhui, Huang, Shaohan, Dong, Li, Wang, Ruiping, Xue, Jilong, Wei, Furu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2402.17764 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
BitNet a4.8: 4-bit Activations for 1-bit LLMs
di: Wang, Hongyu, et al.
Pubblicazione: (2024)
di: Wang, Hongyu, et al.
Pubblicazione: (2024)
BitNet v2: Native 4-bit Activations with Hadamard Transformation for 1-bit LLMs
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
BitNet b1.58 2B4T Technical Report
di: Ma, Shuming, et al.
Pubblicazione: (2025)
di: Ma, Shuming, et al.
Pubblicazione: (2025)
Q-Sparse: All Large Language Models can be Fully Sparsely-Activated
di: Wang, Hongyu, et al.
Pubblicazione: (2024)
di: Wang, Hongyu, et al.
Pubblicazione: (2024)
1-bit AI Infra: Part 1.1, Fast and Lossless BitNet b1.58 Inference on CPUs
di: Wang, Jinheng, et al.
Pubblicazione: (2024)
di: Wang, Jinheng, et al.
Pubblicazione: (2024)
Sparse-BitNet: 1.58-bit LLMs are Naturally Friendly to Semi-Structured Sparsity
di: Zhang, Di, et al.
Pubblicazione: (2026)
di: Zhang, Di, et al.
Pubblicazione: (2026)
BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
di: Wang, Hongyu, et al.
Pubblicazione: (2025)
BitNet Distillation
di: Wu, Xun, et al.
Pubblicazione: (2025)
di: Wu, Xun, et al.
Pubblicazione: (2025)
You Only Cache Once: Decoder-Decoder Architectures for Language Models
di: Sun, Yutao, et al.
Pubblicazione: (2024)
di: Sun, Yutao, et al.
Pubblicazione: (2024)
MH-MoE: Multi-Head Mixture-of-Experts
di: Huang, Shaohan, et al.
Pubblicazione: (2024)
di: Huang, Shaohan, et al.
Pubblicazione: (2024)
Multi-Head Mixture-of-Experts
di: Wu, Xun, et al.
Pubblicazione: (2024)
di: Wu, Xun, et al.
Pubblicazione: (2024)
ViT-1.58b: Mobile Vision Transformers in the 1-bit Era
di: Yuan, Zhengqing, et al.
Pubblicazione: (2024)
di: Yuan, Zhengqing, et al.
Pubblicazione: (2024)
Adapting Large Language Models to Domains via Reading Comprehension
di: Cheng, Daixuan, et al.
Pubblicazione: (2023)
di: Cheng, Daixuan, et al.
Pubblicazione: (2023)
Multimodal Latent Language Modeling with Next-Token Diffusion
di: Sun, Yutao, et al.
Pubblicazione: (2024)
di: Sun, Yutao, et al.
Pubblicazione: (2024)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
di: Wu, Xun, et al.
Pubblicazione: (2024)
di: Wu, Xun, et al.
Pubblicazione: (2024)
The Era of Agentic Organization: Learning to Organize with Language Models
di: Chi, Zewen, et al.
Pubblicazione: (2025)
di: Chi, Zewen, et al.
Pubblicazione: (2025)
RedStone: Curating General, Code, Math, and QA Data for Large Language Models
di: Chang, Yaoyao, et al.
Pubblicazione: (2024)
di: Chang, Yaoyao, et al.
Pubblicazione: (2024)
1.58-bit FLUX
di: Yang, Chenglin, et al.
Pubblicazione: (2024)
di: Yang, Chenglin, et al.
Pubblicazione: (2024)
LongReasonArena: A Long Reasoning Benchmark for Large Language Models
di: Ding, Jiayu, et al.
Pubblicazione: (2025)
di: Ding, Jiayu, et al.
Pubblicazione: (2025)
Textual Aesthetics in Large Language Models
di: Jiang, Lingjie, et al.
Pubblicazione: (2024)
di: Jiang, Lingjie, et al.
Pubblicazione: (2024)
When are 1.58 bits enough? A Bottom-up Exploration of BitNet Quantization
di: Nielsen, Jacob, et al.
Pubblicazione: (2024)
di: Nielsen, Jacob, et al.
Pubblicazione: (2024)
Bitnet.cpp: Efficient Edge Inference for Ternary LLMs
di: Wang, Jinheng, et al.
Pubblicazione: (2025)
di: Wang, Jinheng, et al.
Pubblicazione: (2025)
LUT Tensor Core: A Software-Hardware Co-Design for LUT-Based Low-Bit LLM Inference
di: Mo, Zhiwen, et al.
Pubblicazione: (2024)
di: Mo, Zhiwen, et al.
Pubblicazione: (2024)
Large Search Model: Redefining Search Stack in the Era of LLMs
di: Wang, Liang, et al.
Pubblicazione: (2023)
di: Wang, Liang, et al.
Pubblicazione: (2023)
Thinking Augmented Pre-training
di: Wang, Liang, et al.
Pubblicazione: (2025)
di: Wang, Liang, et al.
Pubblicazione: (2025)
Auto-ICL: In-Context Learning without Human Supervision
di: Yang, Jinghan, et al.
Pubblicazione: (2023)
di: Yang, Jinghan, et al.
Pubblicazione: (2023)
BitTTS: Highly Compact Text-to-Speech Using 1.58-bit Quantization and Weight Indexing
di: Kawamura, Masaya, et al.
Pubblicazione: (2025)
di: Kawamura, Masaya, et al.
Pubblicazione: (2025)
Black-Box On-Policy Distillation of Large Language Models
di: Ye, Tianzhu, et al.
Pubblicazione: (2025)
di: Ye, Tianzhu, et al.
Pubblicazione: (2025)
An Extra RMSNorm is All You Need for Fine Tuning to 1.58 Bits
di: Steinmetz, Cody, et al.
Pubblicazione: (2025)
di: Steinmetz, Cody, et al.
Pubblicazione: (2025)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
di: Pan, Xichen, et al.
Pubblicazione: (2023)
di: Pan, Xichen, et al.
Pubblicazione: (2023)
KOSMOS-2.5: A Multimodal Literate Model
di: Lv, Tengchao, et al.
Pubblicazione: (2023)
di: Lv, Tengchao, et al.
Pubblicazione: (2023)
On-Policy Context Distillation for Language Models
di: Ye, Tianzhu, et al.
Pubblicazione: (2026)
di: Ye, Tianzhu, et al.
Pubblicazione: (2026)
WaferLLM: Large Language Model Inference at Wafer Scale
di: He, Congjie, et al.
Pubblicazione: (2025)
di: He, Congjie, et al.
Pubblicazione: (2025)
Mixture of LoRA Experts
di: Wu, Xun, et al.
Pubblicazione: (2024)
di: Wu, Xun, et al.
Pubblicazione: (2024)
Continual Quantization-Aware Pre-Training: When to transition from 16-bit to 1.58-bit pre-training for BitNet language models?
di: Nielsen, Jacob, et al.
Pubblicazione: (2025)
di: Nielsen, Jacob, et al.
Pubblicazione: (2025)
Online Experiential Learning for Language Models
di: Ye, Tianzhu, et al.
Pubblicazione: (2026)
di: Ye, Tianzhu, et al.
Pubblicazione: (2026)
Universal YOCO for Efficient Depth Scaling
di: Sun, Yutao, et al.
Pubblicazione: (2026)
di: Sun, Yutao, et al.
Pubblicazione: (2026)
BitROM: Weight Reload-Free CiROM Architecture Towards Billion-Parameter 1.58-bit LLM Inference
di: Zhang, Wenlun, et al.
Pubblicazione: (2025)
di: Zhang, Wenlun, et al.
Pubblicazione: (2025)
Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning
di: Yang, Wenkai, et al.
Pubblicazione: (2025)
di: Yang, Wenkai, et al.
Pubblicazione: (2025)
Next Block Prediction: Video Generation via Semi-Autoregressive Modeling
di: Ren, Shuhuai, et al.
Pubblicazione: (2025)
di: Ren, Shuhuai, et al.
Pubblicazione: (2025)
Documenti analoghi
-
BitNet a4.8: 4-bit Activations for 1-bit LLMs
di: Wang, Hongyu, et al.
Pubblicazione: (2024) -
BitNet v2: Native 4-bit Activations with Hadamard Transformation for 1-bit LLMs
di: Wang, Hongyu, et al.
Pubblicazione: (2025) -
BitNet b1.58 2B4T Technical Report
di: Ma, Shuming, et al.
Pubblicazione: (2025) -
Q-Sparse: All Large Language Models can be Fully Sparsely-Activated
di: Wang, Hongyu, et al.
Pubblicazione: (2024) -
1-bit AI Infra: Part 1.1, Fast and Lossless BitNet b1.58 Inference on CPUs
di: Wang, Jinheng, et al.
Pubblicazione: (2024)