SegQuant: A Semantics-Aware and Generalizable Quantization Framework for Diffusion Models
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Jiaji, Sun, Ruichao, Zhao, Hailiang, Wu, Jiaju, Chen, Peng, Li, Hao, Liu, Yuying, Chow, Kingsum, Xiong, Gang, Deng, Shuiguang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Scene-Aware Latency Estimation for Microservices via Multi-Scale Graph Fusion
by: Sun, Zhichao, et al.
Published: (2026)
by: Sun, Zhichao, et al.
Published: (2026)
CADRef: Robust Out-of-Distribution Detection via Class-Aware Decoupled Relative Feature Leveraging
by: Ling, Zhiwei, et al.
Published: (2025)
by: Ling, Zhiwei, et al.
Published: (2025)
Morphis: SLO-Aware Resource Scheduling for Microservices with Time-Varying Call Graphs
by: Tang, Yu, et al.
Published: (2026)
by: Tang, Yu, et al.
Published: (2026)
Shiva-DiT: Residual-Based Differentiable Top-$k$ Selection for Efficient Diffusion Transformers
by: Zhang, Jiaji, et al.
Published: (2026)
by: Zhang, Jiaji, et al.
Published: (2026)
Toward Robust and Efficient ML-Based GPU Caching for Modern Inference
by: Chen, Peng, et al.
Published: (2025)
by: Chen, Peng, et al.
Published: (2025)
Robustifying Learning-Augmented Caching Efficiently without Compromising 1-Consistency
by: Chen, Peng, et al.
Published: (2025)
by: Chen, Peng, et al.
Published: (2025)
Data-Locality-Aware Task Assignment and Scheduling for Distributed Job Executions
by: Zhao, Hailiang, et al.
Published: (2024)
by: Zhao, Hailiang, et al.
Published: (2024)
Reliable Microservice Tail Latency Prediction via Decoupled Dual-Stream Learning and Gradient Modulation
by: Qian, Wenzhuo, et al.
Published: (2025)
by: Qian, Wenzhuo, et al.
Published: (2025)
Learning-Augmented Algorithms for the Bahncard Problem
by: Zhao, Hailiang, et al.
Published: (2024)
by: Zhao, Hailiang, et al.
Published: (2024)
Towards Optimal Robustness in Learning-Augmented Paging
by: Chen, Peng, et al.
Published: (2026)
by: Chen, Peng, et al.
Published: (2026)
Adaptive Dual-Weighting Framework for Federated Learning via Out-of-Distribution Detection
by: Ling, Zhiwei, et al.
Published: (2026)
by: Ling, Zhiwei, et al.
Published: (2026)
Missing-Aware Multimodal Fusion for Unified Microservice Incident Management
by: Qian, Wenzhuo, et al.
Published: (2026)
by: Qian, Wenzhuo, et al.
Published: (2026)
SecCoder: Towards Generalizable and Robust Secure Code Generation
by: Zhang, Boyu, et al.
Published: (2024)
by: Zhang, Boyu, et al.
Published: (2024)
QuantX: A Framework for Hardware-Aware Quantization of Generative AI Workloads
by: Ahmad, Muhammad, et al.
Published: (2025)
by: Ahmad, Muhammad, et al.
Published: (2025)
DVD-Quant: Data-free Video Diffusion Transformers Quantization
by: Li, Zhiteng, et al.
Published: (2025)
by: Li, Zhiteng, et al.
Published: (2025)
QuantDemoire: Quantization with Outlier Aware for Image Demoiréing
by: Chen, Zheng, et al.
Published: (2025)
by: Chen, Zheng, et al.
Published: (2025)
OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models
by: Shao, Wenqi, et al.
Published: (2023)
by: Shao, Wenqi, et al.
Published: (2023)
FlatQuant: Flatness Matters for LLM Quantization
by: Sun, Yuxuan, et al.
Published: (2024)
by: Sun, Yuxuan, et al.
Published: (2024)
A Heavy-Load-Enhanced and Changeable-Periodicity-Perceived Workload Prediction Network
by: Chen, Feiyi, et al.
Published: (2023)
by: Chen, Feiyi, et al.
Published: (2023)
Decentralized Proactive Model Offloading and Resource Allocation for Split and Federated Learning
by: Huang, Binbin, et al.
Published: (2024)
by: Huang, Binbin, et al.
Published: (2024)
TrackTeller: Temporal Multimodal 3D Grounding for Behavior-Dependent Object References
by: Yu, Jiahong, et al.
Published: (2025)
by: Yu, Jiahong, et al.
Published: (2025)
XFMNet: Decoding Cross-Site and Nonstationary Water Patterns via Stepwise Multimodal Fusion for Long-Term Water Quality Forecasting
by: Wang, Ziqi, et al.
Published: (2025)
by: Wang, Ziqi, et al.
Published: (2025)
EasyQuant: An Efficient Data-free Quantization Algorithm for LLMs
by: Tang, Hanlin, et al.
Published: (2024)
by: Tang, Hanlin, et al.
Published: (2024)
PeerSync: Accelerating Containerized Service Delivery at the Network Edge
by: Deng, Yinuo, et al.
Published: (2025)
by: Deng, Yinuo, et al.
Published: (2025)
AccuQuant: Simulating Multiple Denoising Steps for Quantizing Diffusion Models
by: Lee, Seunghoon, et al.
Published: (2025)
by: Lee, Seunghoon, et al.
Published: (2025)
DilateQuant: Accurate and Efficient Diffusion Quantization via Weight Dilation
by: Liu, Xuewen, et al.
Published: (2024)
by: Liu, Xuewen, et al.
Published: (2024)
GS-Quant: Granular Semantic and Generative Structural Quantization for Knowledge Graph Completion
by: Xie, Qizhuo, et al.
Published: (2026)
by: Xie, Qizhuo, et al.
Published: (2026)
FlexQuant: A Flexible and Efficient Dynamic Precision Switching Framework for LLM Quantization
by: Liu, Fangxin, et al.
Published: (2025)
by: Liu, Fangxin, et al.
Published: (2025)
QuantSparse: Comprehensively Compressing Video Diffusion Transformer with Model Quantization and Attention Sparsification
by: Feng, Weilun, et al.
Published: (2025)
by: Feng, Weilun, et al.
Published: (2025)
SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
by: Xiao, Guangxuan, et al.
Published: (2022)
by: Xiao, Guangxuan, et al.
Published: (2022)
SigmaQuant: Hardware-Aware Heterogeneous Quantization Method for Edge DNN Inference
by: Liu, Qunyou, et al.
Published: (2026)
by: Liu, Qunyou, et al.
Published: (2026)
FairQuant: Fairness-Aware Mixed-Precision Quantization for Medical Image Classification
by: Woergaard, Thomas, et al.
Published: (2026)
by: Woergaard, Thomas, et al.
Published: (2026)
QuantKAN: A Unified Quantization Framework for Kolmogorov Arnold Networks
by: Fuad, Kazi Ahmed Asif, et al.
Published: (2025)
by: Fuad, Kazi Ahmed Asif, et al.
Published: (2025)
SCP-Diff: Spatial-Categorical Joint Prior for Diffusion Based Semantic Image Synthesis
by: Gao, Huan-ang, et al.
Published: (2024)
by: Gao, Huan-ang, et al.
Published: (2024)
TADS: Task-Aware Data Selection for Multi-Task Multimodal Pre-Training
by: Cheng, Guanjie, et al.
Published: (2026)
by: Cheng, Guanjie, et al.
Published: (2026)
JacQuant: STE-Free Quantization-Aware Training via Learned Jacobian Surrogates
by: Yi, Kai, et al.
Published: (2026)
by: Yi, Kai, et al.
Published: (2026)
MEC-Quant: Maximum Entropy Coding for Extremely Low Bit Quantization-Aware Training
by: Pang, Junbiao, et al.
Published: (2025)
by: Pang, Junbiao, et al.
Published: (2025)
QuantFace: Efficient Quantization for Face Restoration
by: Li, Jiatong, et al.
Published: (2025)
by: Li, Jiatong, et al.
Published: (2025)
FlexQuant: Elastic Quantization Framework for Locally Hosted LLM on Edge Devices
by: Chai, Yuji, et al.
Published: (2025)
by: Chai, Yuji, et al.
Published: (2025)
More Than Meets the Eye: A Semantics-Aware Traffic Augmentation Framework for Generalizable Website Fingerprinting
by: Xian, Youquan, et al.
Published: (2026)
by: Xian, Youquan, et al.
Published: (2026)
Similar Items
-
Scene-Aware Latency Estimation for Microservices via Multi-Scale Graph Fusion
by: Sun, Zhichao, et al.
Published: (2026) -
CADRef: Robust Out-of-Distribution Detection via Class-Aware Decoupled Relative Feature Leveraging
by: Ling, Zhiwei, et al.
Published: (2025) -
Morphis: SLO-Aware Resource Scheduling for Microservices with Time-Varying Call Graphs
by: Tang, Yu, et al.
Published: (2026) -
Shiva-DiT: Residual-Based Differentiable Top-$k$ Selection for Efficient Diffusion Transformers
by: Zhang, Jiaji, et al.
Published: (2026) -
Toward Robust and Efficient ML-Based GPU Caching for Modern Inference
by: Chen, Peng, et al.
Published: (2025)