NLI:Non-uniform Linear Interpolation Approximation of Nonlinear Operations for Efficient LLMs Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Jiangyong, Han, Xiaomeng, Hu, Xing, Xu, Chen, Jiang, Zhe, Yang, Dawei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models
par: Hu, Xing, et autres
Publié: (2024)
par: Hu, Xing, et autres
Publié: (2024)
Pushing the Limits of BFP on Narrow Precision LLM Inference
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
OstQuant: Refining Large Language Model Quantization with Orthogonal and Scaling Transformations for Better Distribution Fitting
par: Hu, Xing, et autres
Publié: (2025)
par: Hu, Xing, et autres
Publié: (2025)
MoEQuant: Enhancing Quantization for Mixture-of-Experts Large Language Models via Expert-Balanced Sampling and Affinity Guidance
par: Hu, Xing, et autres
Publié: (2025)
par: Hu, Xing, et autres
Publié: (2025)
FQ-PETR: Fully Quantized Position Embedding Transformation for Multi-View 3D Object Detection
par: Yu, Jiangyong, et autres
Publié: (2025)
par: Yu, Jiangyong, et autres
Publié: (2025)
RWKVQuant: Quantizing the RWKV Family with Proxy Guided Hybrid of Scalar and Vector Quantization
par: Xu, Chen, et autres
Publié: (2025)
par: Xu, Chen, et autres
Publié: (2025)
MambaQuant: Quantizing the Mamba Family with Variance Aligned Rotation Methods
par: Xu, Zukang, et autres
Publié: (2025)
par: Xu, Zukang, et autres
Publié: (2025)
From Retinal Evidence to Safe Decisions: RETINA-SAFE and ECRT for Hallucination Risk Triage in Medical LLMs
par: Yu, Zhe, et autres
Publié: (2026)
par: Yu, Zhe, et autres
Publié: (2026)
MoBiE: Efficient Inference of Mixture of Binary Experts under Post-Training Quantization
par: Zhao, Zhixiong, et autres
Publié: (2026)
par: Zhao, Zhixiong, et autres
Publié: (2026)
TORQ: Two-Level Orthogonal Rotation for MXFP4 Quantization
par: Xu, Zukang, et autres
Publié: (2026)
par: Xu, Zukang, et autres
Publié: (2026)
Compartmentalised Agentic Reasoning for Clinical NLI
par: Jullien, Maël, et autres
Publié: (2025)
par: Jullien, Maël, et autres
Publié: (2025)
Neural Operators as Efficient Function Interpolators
par: Niarchos, Vasilis, et autres
Publié: (2026)
par: Niarchos, Vasilis, et autres
Publié: (2026)
Affective-NLI: Towards Accurate and Interpretable Personality Recognition in Conversation
par: Wen, Zhiyuan, et autres
Publié: (2024)
par: Wen, Zhiyuan, et autres
Publié: (2024)
MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization
par: Yu, JiangYong, et autres
Publié: (2025)
par: Yu, JiangYong, et autres
Publié: (2025)
ViLegalNLI: Natural Language Inference for Vietnamese Legal Texts
par: Duong, Nhung Thi-Hong, et autres
Publié: (2026)
par: Duong, Nhung Thi-Hong, et autres
Publié: (2026)
When Benchmarks Leak: Inference-Time Decontamination for LLMs
par: Chai, Jianzhe, et autres
Publié: (2026)
par: Chai, Jianzhe, et autres
Publié: (2026)
Attention Slipping: A Mechanistic Understanding of Jailbreak Attacks and Defenses in LLMs
par: Hu, Xiaomeng, et autres
Publié: (2025)
par: Hu, Xiaomeng, et autres
Publié: (2025)
Draft-based Approximate Inference for LLMs
par: Galim, Kevin, et autres
Publié: (2025)
par: Galim, Kevin, et autres
Publié: (2025)
MorphNLI: A Stepwise Approach to Natural Language Inference Using Text Morphing
par: Negru, Vlad Andrei, et autres
Publié: (2025)
par: Negru, Vlad Andrei, et autres
Publié: (2025)
Universal Approximation of Nonlinear Operators and Their Derivatives
par: de Feo, Filippo
Publié: (2026)
par: de Feo, Filippo
Publié: (2026)
KBVQ-MoE: KLT-guided SVD with Bias-Corrected Vector Quantization for MoE Large Language Models
par: Xu, Zukang, et autres
Publié: (2026)
par: Xu, Zukang, et autres
Publié: (2026)
FinNLI: Novel Dataset for Multi-Genre Financial Natural Language Inference Benchmarking
par: Magomere, Jabez, et autres
Publié: (2025)
par: Magomere, Jabez, et autres
Publié: (2025)
Revisiting NLI: Towards Cost-Effective and Human-Aligned Metrics for Evaluating LLMs in Question Answering
par: Balamurali, Sai Shridhar, et autres
Publié: (2025)
par: Balamurali, Sai Shridhar, et autres
Publié: (2025)
NoiseDiffusion: Correcting Noise for Image Interpolation with Diffusion Models beyond Spherical Linear Interpolation
par: Zheng, PengFei, et autres
Publié: (2024)
par: Zheng, PengFei, et autres
Publié: (2024)
PEANO-ViT: Power-Efficient Approximations of Non-Linearities in Vision Transformers
par: Sadeghi, Mohammad Erfan, et autres
Publié: (2024)
par: Sadeghi, Mohammad Erfan, et autres
Publié: (2024)
BWLA: Breaking the Barrier of W1AX Post-Training Quantization for LLMs
par: Zhao, Zhixiong, et autres
Publié: (2026)
par: Zhao, Zhixiong, et autres
Publié: (2026)
OpInf-LLM: Parametric PDE Solving with LLMs via Operator Inference
par: Wang, Zhuoyuan, et autres
Publié: (2026)
par: Wang, Zhuoyuan, et autres
Publié: (2026)
NeuralMatrix: Compute the Entire Neural Networks with Linear Matrix Operations for Efficient Inference
par: Sun, Ruiqi, et autres
Publié: (2023)
par: Sun, Ruiqi, et autres
Publié: (2023)
DLO: Dynamic Layer Operation for Efficient Vertical Scaling of LLMs
par: Tan, Zhen, et autres
Publié: (2024)
par: Tan, Zhen, et autres
Publié: (2024)
Revisiting Model Interpolation for Efficient Reasoning
par: Wu, Taiqiang, et autres
Publié: (2025)
par: Wu, Taiqiang, et autres
Publié: (2025)
DLLMQuant: Quantizing Diffusion-based Large Language Models
par: Xu, Chen, et autres
Publié: (2025)
par: Xu, Chen, et autres
Publié: (2025)
NL-Eye: Abductive NLI for Images
par: Ventura, Mor, et autres
Publié: (2024)
par: Ventura, Mor, et autres
Publié: (2024)
LatentAudit: Real-Time White-Box Faithfulness Monitoring for Retrieval-Augmented Generation with Verifiable Deployment
par: Yu, Zhe, et autres
Publié: (2026)
par: Yu, Zhe, et autres
Publié: (2026)
KVNAND: Efficient On-Device Large Language Model Inference Using DRAM-Free In-Flash Computing
par: Deng, Lishuo, et autres
Publié: (2025)
par: Deng, Lishuo, et autres
Publié: (2025)
FQ-PETR: Fully Quantized Position Embedding Transformation for Multi-View 3D Object Detection
par: Yu, Jiangyong, et autres
Publié: (2025)
par: Yu, Jiangyong, et autres
Publié: (2025)
An Efficient Multilevel Preconditioned Nonlinear Conjugate Gradient Method for Incremental Potential Contact
par: Zhang, Yu, et autres
Publié: (2026)
par: Zhang, Yu, et autres
Publié: (2026)
Tandem Transformers for Inference Efficient LLMs
par: S, Aishwarya P, et autres
Publié: (2024)
par: S, Aishwarya P, et autres
Publié: (2024)
PrefixNLI: Detecting Factual Inconsistencies as Soon as They Arise
par: Harary, Sapir, et autres
Publié: (2025)
par: Harary, Sapir, et autres
Publié: (2025)
XNLIeu: a dataset for cross-lingual NLI in Basque
par: Heredia, Maite, et autres
Publié: (2024)
par: Heredia, Maite, et autres
Publié: (2024)
Empowering LLMs for Structure-Based Drug Design via Exploration-Augmented Latent Inference
par: Hu, Xuanning, et autres
Publié: (2026)
par: Hu, Xuanning, et autres
Publié: (2026)
Documents similaires
-
I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models
par: Hu, Xing, et autres
Publié: (2024) -
Pushing the Limits of BFP on Narrow Precision LLM Inference
par: Wang, Hui, et autres
Publié: (2025) -
OstQuant: Refining Large Language Model Quantization with Orthogonal and Scaling Transformations for Better Distribution Fitting
par: Hu, Xing, et autres
Publié: (2025) -
MoEQuant: Enhancing Quantization for Mixture-of-Experts Large Language Models via Expert-Balanced Sampling and Affinity Guidance
par: Hu, Xing, et autres
Publié: (2025) -
FQ-PETR: Fully Quantized Position Embedding Transformation for Multi-View 3D Object Detection
par: Yu, Jiangyong, et autres
Publié: (2025)