Tequila: Trapping-free Ternary Quantization for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Hong, Wu, Decheng, Cen, Rui, Yu, Guanghua, Li, Zonghang, Liu, Kai, Zhu, Jianchen, Chen, Peng, Liu, Xue, Wu, Dapeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Sherry: Hardware-Efficient 1.25-Bit Ternary Quantization via Fine-grained Sparsification
di: Huang, Hong, et al.
Pubblicazione: (2026)
di: Huang, Hong, et al.
Pubblicazione: (2026)
EasyQuant: An Efficient Data-free Quantization Algorithm for LLMs
di: Tang, Hanlin, et al.
Pubblicazione: (2024)
di: Tang, Hanlin, et al.
Pubblicazione: (2024)
AngelSlim: A more accessible, comprehensive, and efficient toolkit for large model compression
di: Cen, Rui, et al.
Pubblicazione: (2026)
di: Cen, Rui, et al.
Pubblicazione: (2026)
DAQ: Delta-Aware Quantization for Post-Training LLM Weight Compression
di: Yu, Xiaoming, et al.
Pubblicazione: (2026)
di: Yu, Xiaoming, et al.
Pubblicazione: (2026)
SpecExit: Accelerating Large Reasoning Model via Speculative Exit
di: Yang, Rubing, et al.
Pubblicazione: (2025)
di: Yang, Rubing, et al.
Pubblicazione: (2025)
Quaff: Quantized Parameter-Efficient Fine-Tuning under Outlier Spatial Stability Hypothesis
di: Huang, Hong, et al.
Pubblicazione: (2025)
di: Huang, Hong, et al.
Pubblicazione: (2025)
IDPruner: Harmonizing Importance and Diversity in Visual Token Pruning for MLLMs
di: Tan, Yifan, et al.
Pubblicazione: (2026)
di: Tan, Yifan, et al.
Pubblicazione: (2026)
E-Sparse: Boosting the Large Language Model Inference through Entropy-based N:M Sparsity
di: Li, Yun, et al.
Pubblicazione: (2023)
di: Li, Yun, et al.
Pubblicazione: (2023)
Gaussian Entropy Fields: Driving Adaptive Sparsity in 3D Gaussian Optimization
di: Kuang, Hong, et al.
Pubblicazione: (2025)
di: Kuang, Hong, et al.
Pubblicazione: (2025)
Biomed-DPT: Dual Modality Prompt Tuning for Biomedical Vision-Language Models
di: Peng, Wei, et al.
Pubblicazione: (2025)
di: Peng, Wei, et al.
Pubblicazione: (2025)
Bifunctional Nitrogen‐Doped Yellow‐Green Carbon Dots: Integrated Fluorescent Probe for Sensitive Antibiotic Detection and Oxygen “Breathing Color” Tracking
di: Jing Hu, et al.
Pubblicazione: (2026)
di: Jing Hu, et al.
Pubblicazione: (2026)
VQ-Logits: Compressing the Output Bottleneck of Large Language Models via Vector Quantized Logits
di: Shao, Jintian, et al.
Pubblicazione: (2025)
di: Shao, Jintian, et al.
Pubblicazione: (2025)
Quantized Large Language Models in Biomedical Natural Language Processing: Evaluation and Recommendation
di: Zhan, Zaifu, et al.
Pubblicazione: (2025)
di: Zhan, Zaifu, et al.
Pubblicazione: (2025)
HoneyTrap: Deceiving Large Language Model Attackers to Honeypot Traps with Resilient Multi-Agent Defense
di: Li, Siyuan, et al.
Pubblicazione: (2026)
di: Li, Siyuan, et al.
Pubblicazione: (2026)
On the Compressibility of Quantized Large Language Models
di: Mao, Yu, et al.
Pubblicazione: (2024)
di: Mao, Yu, et al.
Pubblicazione: (2024)
A Survey on Hallucination in Large Vision-Language Models
di: Liu, Hanchao, et al.
Pubblicazione: (2024)
di: Liu, Hanchao, et al.
Pubblicazione: (2024)
TernaryLLM: Ternarized Large Language Model
di: Chen, Tianqi, et al.
Pubblicazione: (2024)
di: Chen, Tianqi, et al.
Pubblicazione: (2024)
Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning
di: Chen, Guanjie, et al.
Pubblicazione: (2025)
di: Chen, Guanjie, et al.
Pubblicazione: (2025)
TernaryCLIP: Efficiently Compressing Vision-Language Models with Ternary Weights and Distilled Knowledge
di: Zhang, Shu-Hao, et al.
Pubblicazione: (2025)
di: Zhang, Shu-Hao, et al.
Pubblicazione: (2025)
What Does the Server See? Understanding Privacy Leakage from Large Language Models in Split Inference
di: Fan, Mingyuan, et al.
Pubblicazione: (2026)
di: Fan, Mingyuan, et al.
Pubblicazione: (2026)
QQQ: Quality Quattuor-Bit Quantization for Large Language Models
di: Zhang, Ying, et al.
Pubblicazione: (2024)
di: Zhang, Ying, et al.
Pubblicazione: (2024)
RUQuant: Towards Refining Uniform Quantization for Large Language Models
di: Liu, Han, et al.
Pubblicazione: (2026)
di: Liu, Han, et al.
Pubblicazione: (2026)
1bit-Merging: Dynamic Quantized Merging for Large Language Models
di: Liu, Shuqi, et al.
Pubblicazione: (2025)
di: Liu, Shuqi, et al.
Pubblicazione: (2025)
Budget-aware Auto Optimizer Configurator
di: Liu, Kang, et al.
Pubblicazione: (2026)
di: Liu, Kang, et al.
Pubblicazione: (2026)
Learning based convex approximation for constrained parametric optimization
di: Liu, Kang, et al.
Pubblicazione: (2025)
di: Liu, Kang, et al.
Pubblicazione: (2025)
SOC-ICNN: From Polyhedral to Conic Geometry for Learning Convex Surrogate Functions
di: Liu, Kang, et al.
Pubblicazione: (2026)
di: Liu, Kang, et al.
Pubblicazione: (2026)
Exact Dual Geometry of SOC-ICNN Value Functions
di: Liu, Kang, et al.
Pubblicazione: (2026)
di: Liu, Kang, et al.
Pubblicazione: (2026)
CEQuest: Benchmarking Large Language Models for Construction Estimation
di: Wu, Yanzhao, et al.
Pubblicazione: (2025)
di: Wu, Yanzhao, et al.
Pubblicazione: (2025)
Stem: Rethinking Causal Information Flow in Sparse Attention
di: Niu, Lin, et al.
Pubblicazione: (2026)
di: Niu, Lin, et al.
Pubblicazione: (2026)
From Human Speech to Ocean Signals: Transferring Speech Large Models for Underwater Acoustic Target Recognition
di: Huang, Mengcheng, et al.
Pubblicazione: (2026)
di: Huang, Mengcheng, et al.
Pubblicazione: (2026)
Evaluating Quantized Large Language Models
di: Li, Shiyao, et al.
Pubblicazione: (2024)
di: Li, Shiyao, et al.
Pubblicazione: (2024)
Generative Text Steganography with Large Language Model
di: Wu, Jiaxuan, et al.
Pubblicazione: (2024)
di: Wu, Jiaxuan, et al.
Pubblicazione: (2024)
APTQ: Attention-aware Post-Training Mixed-Precision Quantization for Large Language Models
di: Guan, Ziyi, et al.
Pubblicazione: (2024)
di: Guan, Ziyi, et al.
Pubblicazione: (2024)
Evolving Subnetwork Training for Large Language Models
di: Li, Hanqi, et al.
Pubblicazione: (2024)
di: Li, Hanqi, et al.
Pubblicazione: (2024)
MGFFD-VLM: Multi-Granularity Prompt Learning for Face Forgery Detection with VLM
di: Chen, Tao, et al.
Pubblicazione: (2025)
di: Chen, Tao, et al.
Pubblicazione: (2025)
DVD-Quant: Data-free Video Diffusion Transformers Quantization
di: Li, Zhiteng, et al.
Pubblicazione: (2025)
di: Li, Zhiteng, et al.
Pubblicazione: (2025)
Cata del Tequila
Pubblicazione: (2002)
Pubblicazione: (2002)
ABQ-LLM: Arbitrary-Bit Quantized Inference Acceleration for Large Language Models
di: Zeng, Chao, et al.
Pubblicazione: (2024)
di: Zeng, Chao, et al.
Pubblicazione: (2024)
OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models
di: Shao, Wenqi, et al.
Pubblicazione: (2023)
di: Shao, Wenqi, et al.
Pubblicazione: (2023)
CrossQuant: A Post-Training Quantization Method with Smaller Quantization Kernel for Precise Large Language Model Compression
di: Liu, Wenyuan, et al.
Pubblicazione: (2024)
di: Liu, Wenyuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Sherry: Hardware-Efficient 1.25-Bit Ternary Quantization via Fine-grained Sparsification
di: Huang, Hong, et al.
Pubblicazione: (2026) -
EasyQuant: An Efficient Data-free Quantization Algorithm for LLMs
di: Tang, Hanlin, et al.
Pubblicazione: (2024) -
AngelSlim: A more accessible, comprehensive, and efficient toolkit for large model compression
di: Cen, Rui, et al.
Pubblicazione: (2026) -
DAQ: Delta-Aware Quantization for Post-Training LLM Weight Compression
di: Yu, Xiaoming, et al.
Pubblicazione: (2026) -
SpecExit: Accelerating Large Reasoning Model via Speculative Exit
di: Yang, Rubing, et al.
Pubblicazione: (2025)