Salvato in:
| Autori principali: | Cook, Jack, Guo, Junxian, Xiao, Guangxuan, Lin, Yujun, Wyss, Keith, Nazemi, Mahdi, Mishra, Asit, del Mundo, Carlo, Blankevoort, Tijmen, Han, Song |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2512.02010 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SOAR: Scale Optimization for Accurate Reconstruction in NVFP4 Quantization
di: Bao, Chengzhu, et al.
Pubblicazione: (2026)
di: Bao, Chengzhu, et al.
Pubblicazione: (2026)
Adaptive Block-Scaled Data Types
di: Cook, Jack, et al.
Pubblicazione: (2026)
di: Cook, Jack, et al.
Pubblicazione: (2026)
Quantization-Aware Distillation for NVFP4 Inference Accuracy Recovery
di: Xin, Meng, et al.
Pubblicazione: (2026)
di: Xin, Meng, et al.
Pubblicazione: (2026)
Pruning vs Quantization: Which is Better?
di: Kuzmin, Andrey, et al.
Pubblicazione: (2023)
di: Kuzmin, Andrey, et al.
Pubblicazione: (2023)
Optimizing Mixture of Block Attention
di: Xiao, Guangxuan, et al.
Pubblicazione: (2025)
di: Xiao, Guangxuan, et al.
Pubblicazione: (2025)
FP8 Quantization: The Power of the Exponent
di: Kuzmin, Andrey, et al.
Pubblicazione: (2022)
di: Kuzmin, Andrey, et al.
Pubblicazione: (2022)
Data Repetition Beats Data Scaling in Long-CoT Supervised Fine-Tuning
di: Kopiczko, Dawid J., et al.
Pubblicazione: (2026)
di: Kopiczko, Dawid J., et al.
Pubblicazione: (2026)
Bitune: Leveraging Bidirectional Attention to Improve Decoder-Only LLMs
di: Kopiczko, Dawid J., et al.
Pubblicazione: (2024)
di: Kopiczko, Dawid J., et al.
Pubblicazione: (2024)
VeRA: Vector-based Random Matrix Adaptation
di: Kopiczko, Dawid J., et al.
Pubblicazione: (2023)
di: Kopiczko, Dawid J., et al.
Pubblicazione: (2023)
XAttention: Block Sparse Attention with Antidiagonal Scoring
di: Xu, Ruyi, et al.
Pubblicazione: (2025)
di: Xu, Ruyi, et al.
Pubblicazione: (2025)
Pretraining Large Language Models with NVFP4
di: NVIDIA, et al.
Pubblicazione: (2025)
di: NVIDIA, et al.
Pubblicazione: (2025)
GPTVQ: The Blessing of Dimensionality for LLM Quantization
di: van Baalen, Mart, et al.
Pubblicazione: (2024)
di: van Baalen, Mart, et al.
Pubblicazione: (2024)
NeuroBlend: Towards Low-Power yet Accurate Neural Network-Based Inference Engine Blending Binary and Fixed-Point Convolutions
di: Fayyazi, Arash, et al.
Pubblicazione: (2023)
di: Fayyazi, Arash, et al.
Pubblicazione: (2023)
Sensitivity-Aware Mixed-Precision Quantization and Width Optimization of Deep Neural Networks Through Cluster-Based Tree-Structured Parzen Estimation
di: Azizi, Seyedarmin, et al.
Pubblicazione: (2023)
di: Azizi, Seyedarmin, et al.
Pubblicazione: (2023)
MixFP4: Enhancing NVFP4 with Adaptive FP4/INT4 Block Representations
di: Zou, Jiaxiang, et al.
Pubblicazione: (2026)
di: Zou, Jiaxiang, et al.
Pubblicazione: (2026)
ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs
di: Meng, Haoqian, et al.
Pubblicazione: (2026)
di: Meng, Haoqian, et al.
Pubblicazione: (2026)
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
di: Xiao, Guangxuan, et al.
Pubblicazione: (2022)
di: Xiao, Guangxuan, et al.
Pubblicazione: (2022)
FAAR: Format-Aware Adaptive Rounding for NVFP4
di: Li, Hanglin, et al.
Pubblicazione: (2026)
di: Li, Hanglin, et al.
Pubblicazione: (2026)
Think Big, Generate Quick: LLM-to-SLM for Fast Autoregressive Decoding
di: Bergner, Benjamin, et al.
Pubblicazione: (2024)
di: Bergner, Benjamin, et al.
Pubblicazione: (2024)
Elastic ViTs from Pretrained Models without Retraining
di: Simoncini, Walter, et al.
Pubblicazione: (2025)
di: Simoncini, Walter, et al.
Pubblicazione: (2025)
InterroGate: Learning to Share, Specialize, and Prune Representations for Multi-task Learning
di: Bejnordi, Babak Ehteshami, et al.
Pubblicazione: (2024)
di: Bejnordi, Babak Ehteshami, et al.
Pubblicazione: (2024)
ParetoQ: Improving Scaling Laws in Extremely Low-bit LLM Quantization
di: Liu, Zechun, et al.
Pubblicazione: (2025)
di: Liu, Zechun, et al.
Pubblicazione: (2025)
Accurate Block Quantization in LLMs with Outliers
di: Trukhanov, Nikita, et al.
Pubblicazione: (2024)
di: Trukhanov, Nikita, et al.
Pubblicazione: (2024)
QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving
di: Lin, Yujun, et al.
Pubblicazione: (2024)
di: Lin, Yujun, et al.
Pubblicazione: (2024)
RaZeR: Pushing the Limits of NVFP4 Quantization with Redundant Zero Remapping
di: Chen, Yuzong, et al.
Pubblicazione: (2025)
di: Chen, Yuzong, et al.
Pubblicazione: (2025)
Memory-Efficient Vision Transformers: An Activation-Aware Mixed-Rank Compression Strategy
di: Azizi, Seyedarmin, et al.
Pubblicazione: (2024)
di: Azizi, Seyedarmin, et al.
Pubblicazione: (2024)
Quartet II: Accurate LLM Pre-Training in NVFP4 by Improved Unbiased Gradient Estimation
di: Panferov, Andrei, et al.
Pubblicazione: (2026)
di: Panferov, Andrei, et al.
Pubblicazione: (2026)
The LLM Surgeon
di: van der Ouderaa, Tycho F. A., et al.
Pubblicazione: (2023)
di: van der Ouderaa, Tycho F. A., et al.
Pubblicazione: (2023)
LServe: Efficient Long-sequence LLM Serving with Unified Sparse Attention
di: Yang, Shang, et al.
Pubblicazione: (2025)
di: Yang, Shang, et al.
Pubblicazione: (2025)
Bifurcation and Quasiperiodic Behaviors of Ion Acoustic Waves in Magnetoplasmas with Nonthermal Electrons Featuring Tsallis Distribution
di: Asit Saha
Pubblicazione: (2015)
di: Asit Saha
Pubblicazione: (2015)
Solitonic, Periodic and Quasiperiodic Behaviors of Dust Ion Acoustic Waves in Superthermal Plasmas
di: Asit Saha
Pubblicazione: (2015)
di: Asit Saha
Pubblicazione: (2015)
Dynamic Motions of Ion Acoustic Waves in Plasmas with Superthermal Electrons
di: Asit Saha
Pubblicazione: (2015)
di: Asit Saha
Pubblicazione: (2015)
Recipes for Pre-training LLMs with MXFP8
di: Mishra, Asit, et al.
Pubblicazione: (2025)
di: Mishra, Asit, et al.
Pubblicazione: (2025)
SpinQuant: LLM quantization with learned rotations
di: Liu, Zechun, et al.
Pubblicazione: (2024)
di: Liu, Zechun, et al.
Pubblicazione: (2024)
LAUREANO CASTRO NOGUEIRA, LUIS CASTRO NOGUEIRA Y MIGUEL ÁNGEL CASTRO NOGUEIRA, ¿Quién teme a la naturaleza humana? Madrid: Tecnos, 2008
di: Jordi Mundó
Pubblicazione: (2010)
di: Jordi Mundó
Pubblicazione: (2010)
Análisis crítico de la evolución de la anemia y la deficiencia de micronutrimientos en la población
di: Verónica Mundo
Pubblicazione: (2007)
di: Verónica Mundo
Pubblicazione: (2007)
Simposio: Educación, convivencia e instituciones. Pilares de una visión compartida
di: Mabel Mundó
Pubblicazione: (2012)
di: Mabel Mundó
Pubblicazione: (2012)
TetraJet-v2: Accurate NVFP4 Training for Large Language Models with Oscillation Suppression and Outlier Control
di: Chen, Yuxiang, et al.
Pubblicazione: (2025)
di: Chen, Yuxiang, et al.
Pubblicazione: (2025)
Dissecting Outlier Dynamics in LLM NVFP4 Pretraining
di: Dong, Peijie, et al.
Pubblicazione: (2026)
di: Dong, Peijie, et al.
Pubblicazione: (2026)
Biological activities (antibacterial, antifungal and cytotoxic) of secondary metabolites of Ircinia spp.
di: Nazemi, Melika
Pubblicazione: (2013)
di: Nazemi, Melika
Pubblicazione: (2013)
Documenti analoghi
-
SOAR: Scale Optimization for Accurate Reconstruction in NVFP4 Quantization
di: Bao, Chengzhu, et al.
Pubblicazione: (2026) -
Adaptive Block-Scaled Data Types
di: Cook, Jack, et al.
Pubblicazione: (2026) -
Quantization-Aware Distillation for NVFP4 Inference Accuracy Recovery
di: Xin, Meng, et al.
Pubblicazione: (2026) -
Pruning vs Quantization: Which is Better?
di: Kuzmin, Andrey, et al.
Pubblicazione: (2023) -
Optimizing Mixture of Block Attention
di: Xiao, Guangxuan, et al.
Pubblicazione: (2025)