Enregistré dans:
| Auteurs principaux: | Ma, Shuming, Wang, Hongyu, Ma, Lingxiao, Wang, Lei, Wang, Wenhui, Huang, Shaohan, Dong, Li, Wang, Ruiping, Xue, Jilong, Wei, Furu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2402.17764 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BitNet a4.8: 4-bit Activations for 1-bit LLMs
par: Wang, Hongyu, et autres
Publié: (2024)
par: Wang, Hongyu, et autres
Publié: (2024)
BitNet v2: Native 4-bit Activations with Hadamard Transformation for 1-bit LLMs
par: Wang, Hongyu, et autres
Publié: (2025)
par: Wang, Hongyu, et autres
Publié: (2025)
BitNet b1.58 2B4T Technical Report
par: Ma, Shuming, et autres
Publié: (2025)
par: Ma, Shuming, et autres
Publié: (2025)
Q-Sparse: All Large Language Models can be Fully Sparsely-Activated
par: Wang, Hongyu, et autres
Publié: (2024)
par: Wang, Hongyu, et autres
Publié: (2024)
1-bit AI Infra: Part 1.1, Fast and Lossless BitNet b1.58 Inference on CPUs
par: Wang, Jinheng, et autres
Publié: (2024)
par: Wang, Jinheng, et autres
Publié: (2024)
Sparse-BitNet: 1.58-bit LLMs are Naturally Friendly to Semi-Structured Sparsity
par: Zhang, Di, et autres
Publié: (2026)
par: Zhang, Di, et autres
Publié: (2026)
BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
par: Wang, Hongyu, et autres
Publié: (2025)
par: Wang, Hongyu, et autres
Publié: (2025)
BitNet Distillation
par: Wu, Xun, et autres
Publié: (2025)
par: Wu, Xun, et autres
Publié: (2025)
You Only Cache Once: Decoder-Decoder Architectures for Language Models
par: Sun, Yutao, et autres
Publié: (2024)
par: Sun, Yutao, et autres
Publié: (2024)
MH-MoE: Multi-Head Mixture-of-Experts
par: Huang, Shaohan, et autres
Publié: (2024)
par: Huang, Shaohan, et autres
Publié: (2024)
Multi-Head Mixture-of-Experts
par: Wu, Xun, et autres
Publié: (2024)
par: Wu, Xun, et autres
Publié: (2024)
ViT-1.58b: Mobile Vision Transformers in the 1-bit Era
par: Yuan, Zhengqing, et autres
Publié: (2024)
par: Yuan, Zhengqing, et autres
Publié: (2024)
Adapting Large Language Models to Domains via Reading Comprehension
par: Cheng, Daixuan, et autres
Publié: (2023)
par: Cheng, Daixuan, et autres
Publié: (2023)
Multimodal Latent Language Modeling with Next-Token Diffusion
par: Sun, Yutao, et autres
Publié: (2024)
par: Sun, Yutao, et autres
Publié: (2024)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
par: Wu, Xun, et autres
Publié: (2024)
par: Wu, Xun, et autres
Publié: (2024)
The Era of Agentic Organization: Learning to Organize with Language Models
par: Chi, Zewen, et autres
Publié: (2025)
par: Chi, Zewen, et autres
Publié: (2025)
RedStone: Curating General, Code, Math, and QA Data for Large Language Models
par: Chang, Yaoyao, et autres
Publié: (2024)
par: Chang, Yaoyao, et autres
Publié: (2024)
1.58-bit FLUX
par: Yang, Chenglin, et autres
Publié: (2024)
par: Yang, Chenglin, et autres
Publié: (2024)
LongReasonArena: A Long Reasoning Benchmark for Large Language Models
par: Ding, Jiayu, et autres
Publié: (2025)
par: Ding, Jiayu, et autres
Publié: (2025)
Textual Aesthetics in Large Language Models
par: Jiang, Lingjie, et autres
Publié: (2024)
par: Jiang, Lingjie, et autres
Publié: (2024)
When are 1.58 bits enough? A Bottom-up Exploration of BitNet Quantization
par: Nielsen, Jacob, et autres
Publié: (2024)
par: Nielsen, Jacob, et autres
Publié: (2024)
Bitnet.cpp: Efficient Edge Inference for Ternary LLMs
par: Wang, Jinheng, et autres
Publié: (2025)
par: Wang, Jinheng, et autres
Publié: (2025)
LUT Tensor Core: A Software-Hardware Co-Design for LUT-Based Low-Bit LLM Inference
par: Mo, Zhiwen, et autres
Publié: (2024)
par: Mo, Zhiwen, et autres
Publié: (2024)
Large Search Model: Redefining Search Stack in the Era of LLMs
par: Wang, Liang, et autres
Publié: (2023)
par: Wang, Liang, et autres
Publié: (2023)
Thinking Augmented Pre-training
par: Wang, Liang, et autres
Publié: (2025)
par: Wang, Liang, et autres
Publié: (2025)
Auto-ICL: In-Context Learning without Human Supervision
par: Yang, Jinghan, et autres
Publié: (2023)
par: Yang, Jinghan, et autres
Publié: (2023)
BitTTS: Highly Compact Text-to-Speech Using 1.58-bit Quantization and Weight Indexing
par: Kawamura, Masaya, et autres
Publié: (2025)
par: Kawamura, Masaya, et autres
Publié: (2025)
Black-Box On-Policy Distillation of Large Language Models
par: Ye, Tianzhu, et autres
Publié: (2025)
par: Ye, Tianzhu, et autres
Publié: (2025)
An Extra RMSNorm is All You Need for Fine Tuning to 1.58 Bits
par: Steinmetz, Cody, et autres
Publié: (2025)
par: Steinmetz, Cody, et autres
Publié: (2025)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
par: Pan, Xichen, et autres
Publié: (2023)
par: Pan, Xichen, et autres
Publié: (2023)
KOSMOS-2.5: A Multimodal Literate Model
par: Lv, Tengchao, et autres
Publié: (2023)
par: Lv, Tengchao, et autres
Publié: (2023)
On-Policy Context Distillation for Language Models
par: Ye, Tianzhu, et autres
Publié: (2026)
par: Ye, Tianzhu, et autres
Publié: (2026)
WaferLLM: Large Language Model Inference at Wafer Scale
par: He, Congjie, et autres
Publié: (2025)
par: He, Congjie, et autres
Publié: (2025)
Mixture of LoRA Experts
par: Wu, Xun, et autres
Publié: (2024)
par: Wu, Xun, et autres
Publié: (2024)
Continual Quantization-Aware Pre-Training: When to transition from 16-bit to 1.58-bit pre-training for BitNet language models?
par: Nielsen, Jacob, et autres
Publié: (2025)
par: Nielsen, Jacob, et autres
Publié: (2025)
Online Experiential Learning for Language Models
par: Ye, Tianzhu, et autres
Publié: (2026)
par: Ye, Tianzhu, et autres
Publié: (2026)
Universal YOCO for Efficient Depth Scaling
par: Sun, Yutao, et autres
Publié: (2026)
par: Sun, Yutao, et autres
Publié: (2026)
BitROM: Weight Reload-Free CiROM Architecture Towards Billion-Parameter 1.58-bit LLM Inference
par: Zhang, Wenlun, et autres
Publié: (2025)
par: Zhang, Wenlun, et autres
Publié: (2025)
Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning
par: Yang, Wenkai, et autres
Publié: (2025)
par: Yang, Wenkai, et autres
Publié: (2025)
Next Block Prediction: Video Generation via Semi-Autoregressive Modeling
par: Ren, Shuhuai, et autres
Publié: (2025)
par: Ren, Shuhuai, et autres
Publié: (2025)
Documents similaires
-
BitNet a4.8: 4-bit Activations for 1-bit LLMs
par: Wang, Hongyu, et autres
Publié: (2024) -
BitNet v2: Native 4-bit Activations with Hadamard Transformation for 1-bit LLMs
par: Wang, Hongyu, et autres
Publié: (2025) -
BitNet b1.58 2B4T Technical Report
par: Ma, Shuming, et autres
Publié: (2025) -
Q-Sparse: All Large Language Models can be Fully Sparsely-Activated
par: Wang, Hongyu, et autres
Publié: (2024) -
1-bit AI Infra: Part 1.1, Fast and Lossless BitNet b1.58 Inference on CPUs
par: Wang, Jinheng, et autres
Publié: (2024)