FairyFuse: Multiplication-Free LLM Inference on CPUs via Fused Ternary Kernels
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zuo, Fei, Xi, Xiaoyan, Zeng, Quanyi, Wang, Feiyu, Leung, Ho Fai |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RateQuant: Optimal Mixed-Precision KV Cache Quantization via Rate-Distortion Theory
par: Zuo, Fei, et autres
Publié: (2026)
par: Zuo, Fei, et autres
Publié: (2026)
Highly Optimized Kernels and Fine-Grained Codebooks for LLM Inference on Arm CPUs
par: Gope, Dibakar, et autres
Publié: (2024)
par: Gope, Dibakar, et autres
Publié: (2024)
AndroidControl-Curated: Revealing the True Potential of GUI Agents through Benchmark Purification
par: Leung, Ho Fai, et autres
Publié: (2025)
par: Leung, Ho Fai, et autres
Publié: (2025)
Fusing Reward and Dueling Feedback in Stochastic Bandits
par: Wang, Xuchuang, et autres
Publié: (2025)
par: Wang, Xuchuang, et autres
Publié: (2025)
When Kernels Multiply, Clusters Unify: Fusing Embeddings with the Kronecker Product
par: Wu, Youqi, et autres
Publié: (2025)
par: Wu, Youqi, et autres
Publié: (2025)
Fast and Compact Tsetlin Machine Inference on CPUs Using Instruction-Level Optimization
par: Zeng, Yefan, et autres
Publié: (2025)
par: Zeng, Yefan, et autres
Publié: (2025)
Fusing Individualized Treatment Rules Using Secondary Outcomes
par: Gao, Daiqi, et autres
Publié: (2024)
par: Gao, Daiqi, et autres
Publié: (2024)
iFairy: the First 2-bit Complex LLM with All Parameters in $\{\pm1, \pm i\}$
par: Wang, Feiyu, et autres
Publié: (2025)
par: Wang, Feiyu, et autres
Publié: (2025)
Open-TQ-Metal: Fused Compressed-Domain Attention for Long-Context LLM Inference on Apple Silicon
par: Vegasena, Sai
Publié: (2026)
par: Vegasena, Sai
Publié: (2026)
FusionFactory: Fusing LLM Capabilities with Multi-LLM Log Data
par: Feng, Tao, et autres
Publié: (2025)
par: Feng, Tao, et autres
Publié: (2025)
Fusing Models with Complementary Expertise
par: Wang, Hongyi, et autres
Publié: (2023)
par: Wang, Hongyi, et autres
Publié: (2023)
FuseSampleAgg: Fused Neighbor Sampling and Aggregation for Mini-batch GNNs
par: Stanković, Aleksandar
Publié: (2025)
par: Stanković, Aleksandar
Publié: (2025)
Challenging GPU Dominance: When CPUs Outperform for On-Device LLM Inference
par: Zhang, Haolin, et autres
Publié: (2025)
par: Zhang, Haolin, et autres
Publié: (2025)
FuseMoE: Mixture-of-Experts Transformers for Fleximodal Fusion
par: Han, Xing, et autres
Publié: (2024)
par: Han, Xing, et autres
Publié: (2024)
Fuse It or Lose It: Deep Fusion for Multimodal Simulation-Based Inference
par: Schmitt, Marvin, et autres
Publié: (2023)
par: Schmitt, Marvin, et autres
Publié: (2023)
Scaling DoRA: High-Rank Adaptation via Factored Norms and Fused Kernels
par: Zelenin, Alexandra, et autres
Publié: (2026)
par: Zelenin, Alexandra, et autres
Publié: (2026)
IceFormer: Accelerated Inference with Long-Sequence Transformers on CPUs
par: Mao, Yuzhen, et autres
Publié: (2024)
par: Mao, Yuzhen, et autres
Publié: (2024)
Fused Partial Gromov-Wasserstein for Structured Objects
par: Bai, Yikun, et autres
Publié: (2025)
par: Bai, Yikun, et autres
Publié: (2025)
Low-Cost FlashAttention with Fused Exponential and Multiplication Hardware Operators
par: Alexandridis, Kosmas, et autres
Publié: (2025)
par: Alexandridis, Kosmas, et autres
Publié: (2025)
FusedInf: Efficient Swapping of DNN Models for On-Demand Serverless Inference Services on the Edge
par: Taki, Sifat Ut, et autres
Publié: (2024)
par: Taki, Sifat Ut, et autres
Publié: (2024)
An LLM-Tool Compiler for Fused Parallel Function Calling
par: Singh, Simranjit, et autres
Publié: (2024)
par: Singh, Simranjit, et autres
Publié: (2024)
Fused Lasso Improves Accuracy of Co-occurrence Network Inference in Grouped Samples
par: Agyapong, Daniel, et autres
Publié: (2025)
par: Agyapong, Daniel, et autres
Publié: (2025)
Spacing Test for Fused Lasso
par: Tasaka, Rieko, et autres
Publié: (2025)
par: Tasaka, Rieko, et autres
Publié: (2025)
Fairy2i: Training Complex LLMs from Real LLMs with All Parameters in $\{\pm 1, \pm i\}$
par: Wang, Feiyu, et autres
Publié: (2025)
par: Wang, Feiyu, et autres
Publié: (2025)
PAK-UCB Contextual Bandit: An Online Learning Approach to Prompt-Aware Selection of Generative Models and LLMs
par: Hu, Xiaoyan, et autres
Publié: (2024)
par: Hu, Xiaoyan, et autres
Publié: (2024)
A Multi-Armed Bandit Approach to Online Selection and Evaluation of Generative Models
par: Hu, Xiaoyan, et autres
Publié: (2024)
par: Hu, Xiaoyan, et autres
Publié: (2024)
An Information Theoretic Approach to Interaction-Grounded Learning
par: Hu, Xiaoyan, et autres
Publié: (2024)
par: Hu, Xiaoyan, et autres
Publié: (2024)
NoMAD-Attention: Efficient LLM Inference on CPUs Through Multiply-add-free Attention
par: Zhang, Tianyi, et autres
Publié: (2024)
par: Zhang, Tianyi, et autres
Publié: (2024)
NeuralFuse: Learning to Recover the Accuracy of Access-Limited Neural Network Inference in Low-Voltage Regimes
par: Sun, Hao-Lun, et autres
Publié: (2023)
par: Sun, Hao-Lun, et autres
Publié: (2023)
Fusing CFD and measurement data using transfer learning
par: Barklage, Alexander, et autres
Publié: (2025)
par: Barklage, Alexander, et autres
Publié: (2025)
Learning in Multiple Spaces: Few-Shot Network Attack Detection with Metric-Fused Prototypical Networks
par: Martinez-Lopez, Fernando, et autres
Publié: (2024)
par: Martinez-Lopez, Fernando, et autres
Publié: (2024)
Road Maps as Free Geometric Priors: Weather-Invariant Drone Geo-Localization with GeoFuse
par: Fang, Yunsong, et autres
Publié: (2026)
par: Fang, Yunsong, et autres
Publié: (2026)
Hyperspectral Anomaly Detection Fused Unified Nonconvex Tensor Ring Factors Regularization
par: Qin, Wenjin, et autres
Publié: (2025)
par: Qin, Wenjin, et autres
Publié: (2025)
THESAURUS: Contrastive Graph Clustering by Swapping Fused Gromov-Wasserstein Couplings
par: Deng, Bowen, et autres
Publié: (2024)
par: Deng, Bowen, et autres
Publié: (2024)
Semantic-Fused Multi-Granularity Cross-City Traffic Prediction
par: Chen, Kehua, et autres
Publié: (2023)
par: Chen, Kehua, et autres
Publié: (2023)
Pave Your Own Path: Graph Gradual Domain Adaptation on Fused Gromov-Wasserstein Geodesics
par: Zeng, Zhichen, et autres
Publié: (2025)
par: Zeng, Zhichen, et autres
Publié: (2025)
Improving SMOTE via Fusing Conditional VAE for Data-adaptive Noise Filtering
par: Hong, Sungchul, et autres
Publié: (2024)
par: Hong, Sungchul, et autres
Publié: (2024)
Dual-Rerank: Fusing Causality and Utility for Industrial Generative Reranking
par: Zhang, Chao, et autres
Publié: (2026)
par: Zhang, Chao, et autres
Publié: (2026)
Litespark Inference on Consumer CPUs: Custom SIMD Kernels for Ternary Neural Networks
par: Dade, Nii Osae Osae, et autres
Publié: (2026)
par: Dade, Nii Osae Osae, et autres
Publié: (2026)
A Novel Sliced Fused Gromov-Wasserstein Distance
par: Piening, Moritz, et autres
Publié: (2025)
par: Piening, Moritz, et autres
Publié: (2025)
Documents similaires
-
RateQuant: Optimal Mixed-Precision KV Cache Quantization via Rate-Distortion Theory
par: Zuo, Fei, et autres
Publié: (2026) -
Highly Optimized Kernels and Fine-Grained Codebooks for LLM Inference on Arm CPUs
par: Gope, Dibakar, et autres
Publié: (2024) -
AndroidControl-Curated: Revealing the True Potential of GUI Agents through Benchmark Purification
par: Leung, Ho Fai, et autres
Publié: (2025) -
Fusing Reward and Dueling Feedback in Stochastic Bandits
par: Wang, Xuchuang, et autres
Publié: (2025) -
When Kernels Multiply, Clusters Unify: Fusing Embeddings with the Kronecker Product
par: Wu, Youqi, et autres
Publié: (2025)