Efficient Hybrid Amplitude-Phase Quantization for Multi-Antenna Relay System
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Changdae, Jin, Xianglan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Pinching-Antenna Systems For Indoor Immersive Communications: A 3D-Modeling Based Performance Analysis
par: Wang, Yulei, et autres
Publié: (2025)
par: Wang, Yulei, et autres
Publié: (2025)
H2EAL: Hybrid-Bonding Architecture with Hybrid Sparse Attention for Efficient Long-Context LLM Inference
par: Fu, Zizhuo, et autres
Publié: (2025)
par: Fu, Zizhuo, et autres
Publié: (2025)
On General Linearly Implicit Quantized State System Methods
par: Bergonzi, Mariana, et autres
Publié: (2025)
par: Bergonzi, Mariana, et autres
Publié: (2025)
Energy-Efficient Software Development: A Multi-dimensional Empirical Analysis of Stack Overflow
par: Jin, Bihui, et autres
Publié: (2024)
par: Jin, Bihui, et autres
Publié: (2024)
Profiling Large Language Model Inference on Apple Silicon: A Quantization Perspective
par: Benazir, Afsara, et autres
Publié: (2025)
par: Benazir, Afsara, et autres
Publié: (2025)
Beamforming-based Achievable Rate Maximization in ISAC System for Multi-UAV Networking
par: Zhou, Shengcai, et autres
Publié: (2025)
par: Zhou, Shengcai, et autres
Publié: (2025)
A Novel Hybrid Optical and STAR IRS System for NTN Communications
par: Shang, Shunyuan, et autres
Publié: (2025)
par: Shang, Shunyuan, et autres
Publié: (2025)
QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving
par: Lin, Yujun, et autres
Publié: (2024)
par: Lin, Yujun, et autres
Publié: (2024)
AI Work Quantization Model: Closed-System AI Computational Effort Metric
par: Sharma, Aasish Kumar, et autres
Publié: (2025)
par: Sharma, Aasish Kumar, et autres
Publié: (2025)
HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing
par: Lin, Mao, et autres
Publié: (2026)
par: Lin, Mao, et autres
Publié: (2026)
Accelerating Sparse Ternary GEMM for Quantized ML on Apple Silicon
par: Lipshitz, Baraq, et autres
Publié: (2025)
par: Lipshitz, Baraq, et autres
Publié: (2025)
Unveiling the Potential of Quantization with MXFP4: Strategies for Quantization Error Reduction
par: Chhugani, Jatin, et autres
Publié: (2026)
par: Chhugani, Jatin, et autres
Publié: (2026)
KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache
par: Liu, Zirui, et autres
Publié: (2024)
par: Liu, Zirui, et autres
Publié: (2024)
SONIQ: System-Optimized Noise-Injected Ultra-Low-Precision Quantization with Full-Precision Parity
par: Zhou, Cyrus, et autres
Publié: (2023)
par: Zhou, Cyrus, et autres
Publié: (2023)
FlexQuant: Elastic Quantization Framework for Locally Hosted LLM on Edge Devices
par: Chai, Yuji, et autres
Publié: (2025)
par: Chai, Yuji, et autres
Publié: (2025)
Large-Scale Data Parallelization of Product Quantization and Inverted Indexing Using Dask
par: Abraham, Ashley N., et autres
Publié: (2026)
par: Abraham, Ashley N., et autres
Publié: (2026)
Efficient Reinforcement Learning for Routing Jobs in Heterogeneous Queueing Systems
par: Jali, Neharika, et autres
Publié: (2024)
par: Jali, Neharika, et autres
Publié: (2024)
GPU-Accelerated INT8 Quantization for KV Cache Compression in Large Language Models
par: Taneja, Maanas, et autres
Publié: (2026)
par: Taneja, Maanas, et autres
Publié: (2026)
Scaler: Efficient and Effective Cross Flow Analysis
par: Steven, et autres
Publié: (2024)
par: Steven, et autres
Publié: (2024)
HD-MoE: Hybrid and Dynamic Parallelism for Mixture-of-Expert LLMs with 3D Near-Memory Processing
par: Huang, Haochen, et autres
Publié: (2025)
par: Huang, Haochen, et autres
Publié: (2025)
When Quantization Is Free: An int4 KV Cache That Outruns fp16 on Apple Silicon
par: Bergach, Mohamed Amine
Publié: (2026)
par: Bergach, Mohamed Amine
Publié: (2026)
Multi-GPU Hybrid Particle-in-Cell Monte Carlo Simulations for Exascale Computing Systems
par: Williams, Jeremy J., et autres
Publié: (2026)
par: Williams, Jeremy J., et autres
Publié: (2026)
Efficient Data-Driven Production Scheduling in Pharmaceutical Manufacturing
par: Balatsos, Ioannis, et autres
Publié: (2026)
par: Balatsos, Ioannis, et autres
Publié: (2026)
Mosaic: Cross-Modal Clustering for Efficient Video Understanding
par: Wang, Tuowei, et autres
Publié: (2026)
par: Wang, Tuowei, et autres
Publié: (2026)
Reducing Waiting Time for Medical Tourists Through Hybrid Agent-Based and Discrete-Event Simulation: A Hospital Case Study
par: Baghi, Melika, et autres
Publié: (2026)
par: Baghi, Melika, et autres
Publié: (2026)
An Efficient Hybrid Sparse Attention with CPU-GPU Parallelism for Long-Context Inference
par: Yao, Feiyu, et autres
Publié: (2026)
par: Yao, Feiyu, et autres
Publié: (2026)
Fault-Tolerant Hybrid-Parallel Training at Scale with Reliable and Efficient In-memory Checkpointing
par: Wang, Yuxin, et autres
Publié: (2023)
par: Wang, Yuxin, et autres
Publié: (2023)
GreenServ: Energy-Efficient Context-Aware Dynamic Routing for Multi-Model LLM Inference
par: Ziller, Thomas, et autres
Publié: (2026)
par: Ziller, Thomas, et autres
Publié: (2026)
EXAQ: Exponent Aware Quantization For LLMs Acceleration
par: Shkolnik, Moran, et autres
Publié: (2024)
par: Shkolnik, Moran, et autres
Publié: (2024)
PerfSeer: An Efficient and Accurate Deep Learning Models Performance Predictor
par: Zhao, Xinlong, et autres
Publié: (2025)
par: Zhao, Xinlong, et autres
Publié: (2025)
Accurate Performance Modeling And Uncertainty Analysis of Lossy Compression in Scientific Applications
par: Liu, Youyuan, et autres
Publié: (2024)
par: Liu, Youyuan, et autres
Publié: (2024)
oneDNN Graph Compiler: A Hybrid Approach for High-Performance Deep Learning Compilation
par: Li, Jianhui, et autres
Publié: (2023)
par: Li, Jianhui, et autres
Publié: (2023)
Multi-Strided Access Patterns to Boost Hardware Prefetching
par: Blom, Miguel O., et autres
Publié: (2024)
par: Blom, Miguel O., et autres
Publié: (2024)
GreenLLM: SLO-Aware Dynamic Frequency Scaling for Energy-Efficient LLM Serving
par: Liu, Qunyou, et autres
Publié: (2025)
par: Liu, Qunyou, et autres
Publié: (2025)
Atys: An Efficient Profiling Framework for Identifying Hotspot Functions in Large-scale Cloud Microservices
par: Sun, Jiaqi, et autres
Publié: (2025)
par: Sun, Jiaqi, et autres
Publié: (2025)
SparseX: Efficient Segment-Level KV Cache Sharing for Interleaved LLM Serving
par: Zhang, Quqing, et autres
Publié: (2026)
par: Zhang, Quqing, et autres
Publié: (2026)
Dynamic Expert Quantization for Scalable Mixture-of-Experts Inference
par: Chu, Kexin, et autres
Publié: (2025)
par: Chu, Kexin, et autres
Publié: (2025)
Attributing the System's Overall Effect to its Components
par: Wang, Chenxi, et autres
Publié: (2026)
par: Wang, Chenxi, et autres
Publié: (2026)
Towards Multi-dimensional Elasticity for Pervasive Stream Processing Services
par: Sedlak, Boris, et autres
Publié: (2025)
par: Sedlak, Boris, et autres
Publié: (2025)
Statistical Modeling and Uncertainty Estimation of LLM Inference Systems
par: Ray, Kaustabha, et autres
Publié: (2025)
par: Ray, Kaustabha, et autres
Publié: (2025)
Documents similaires
-
Pinching-Antenna Systems For Indoor Immersive Communications: A 3D-Modeling Based Performance Analysis
par: Wang, Yulei, et autres
Publié: (2025) -
H2EAL: Hybrid-Bonding Architecture with Hybrid Sparse Attention for Efficient Long-Context LLM Inference
par: Fu, Zizhuo, et autres
Publié: (2025) -
On General Linearly Implicit Quantized State System Methods
par: Bergonzi, Mariana, et autres
Publié: (2025) -
Energy-Efficient Software Development: A Multi-dimensional Empirical Analysis of Stack Overflow
par: Jin, Bihui, et autres
Publié: (2024) -
Profiling Large Language Model Inference on Apple Silicon: A Quantization Perspective
par: Benazir, Afsara, et autres
Publié: (2025)