Turning LLM Activations Quantization-Friendly
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Czakó, Patrik, Kertész, Gábor, Szénási, Sándor |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SmoothRot: Combining Channel-Wise Scaling and Rotation for Quantization-Friendly LLMs
von: Czakó, Patrik, et al.
Veröffentlicht: (2025)
von: Czakó, Patrik, et al.
Veröffentlicht: (2025)
Achieving Peak Performance for Large Language Models: A Systematic Review
von: Rostam, Zhyar Rzgar K, et al.
Veröffentlicht: (2024)
von: Rostam, Zhyar Rzgar K, et al.
Veröffentlicht: (2024)
RaguTeam at SemEval-2026 Task 8: Meno and Friends in a Judge-Orchestrated LLM Ensemble for Faithful Multi-Turn Response Generation
von: Bondarenko, Ivan, et al.
Veröffentlicht: (2026)
von: Bondarenko, Ivan, et al.
Veröffentlicht: (2026)
Agile-Quant: Activation-Guided Quantization for Faster Inference of LLMs on the Edge
von: Shen, Xuan, et al.
Veröffentlicht: (2023)
von: Shen, Xuan, et al.
Veröffentlicht: (2023)
TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents
von: Djuhera, Aladin, et al.
Veröffentlicht: (2026)
von: Djuhera, Aladin, et al.
Veröffentlicht: (2026)
CDQuant: Greedy Coordinate Descent for Accurate LLM Quantization
von: Nair, Pranav Ajit, et al.
Veröffentlicht: (2024)
von: Nair, Pranav Ajit, et al.
Veröffentlicht: (2024)
PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier
von: Jiang, Yuhua, et al.
Veröffentlicht: (2025)
von: Jiang, Yuhua, et al.
Veröffentlicht: (2025)
AMAQ: Adaptive Mixed-bit Activation Quantization for Collaborative Parameter Efficient Fine-tuning
von: Song, Yurun, et al.
Veröffentlicht: (2025)
von: Song, Yurun, et al.
Veröffentlicht: (2025)
BiLLM: Pushing the Limit of Post-Training Quantization for LLMs
von: Huang, Wei, et al.
Veröffentlicht: (2024)
von: Huang, Wei, et al.
Veröffentlicht: (2024)
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
von: Wang, Zihan, et al.
Veröffentlicht: (2025)
von: Wang, Zihan, et al.
Veröffentlicht: (2025)
PQCache: Product Quantization-based KVCache for Long Context LLM Inference
von: Zhang, Hailin, et al.
Veröffentlicht: (2024)
von: Zhang, Hailin, et al.
Veröffentlicht: (2024)
RoLoRA: Fine-tuning Rotated Outlier-free LLMs for Effective Weight-Activation Quantization
von: Huang, Xijie, et al.
Veröffentlicht: (2024)
von: Huang, Xijie, et al.
Veröffentlicht: (2024)
Steer Like the LLM: Activation Steering that Mimics Prompting
von: Heyman, Geert, et al.
Veröffentlicht: (2026)
von: Heyman, Geert, et al.
Veröffentlicht: (2026)
Learning a Generative Meta-Model of LLM Activations
von: Luo, Grace, et al.
Veröffentlicht: (2026)
von: Luo, Grace, et al.
Veröffentlicht: (2026)
Measuring the Depth of LLM Unlearning via Activation Patching
von: Lee, Jaeung, et al.
Veröffentlicht: (2026)
von: Lee, Jaeung, et al.
Veröffentlicht: (2026)
QUICK: Quantization-aware Interleaving and Conflict-free Kernel for efficient LLM inference
von: Kim, Taesu, et al.
Veröffentlicht: (2024)
von: Kim, Taesu, et al.
Veröffentlicht: (2024)
Taming Sensitive Weights : Noise Perturbation Fine-tuning for Robust LLM Quantization
von: Wang, Dongwei, et al.
Veröffentlicht: (2024)
von: Wang, Dongwei, et al.
Veröffentlicht: (2024)
QuIP#: Even Better LLM Quantization with Hadamard Incoherence and Lattice Codebooks
von: Tseng, Albert, et al.
Veröffentlicht: (2024)
von: Tseng, Albert, et al.
Veröffentlicht: (2024)
Advancing Scientific Text Classification: Fine-Tuned Models with Dataset Expansion and Hard-Voting
von: Rostam, Zhyar Rzgar K, et al.
Veröffentlicht: (2025)
von: Rostam, Zhyar Rzgar K, et al.
Veröffentlicht: (2025)
EQ-5D Classification Using Biomedical Entity-Enriched Pre-trained Language Models and Multiple Instance Learning
von: Rostam, Zhyar Rzgar K, et al.
Veröffentlicht: (2026)
von: Rostam, Zhyar Rzgar K, et al.
Veröffentlicht: (2026)
Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
von: Ding, Yifeng, et al.
Veröffentlicht: (2025)
von: Ding, Yifeng, et al.
Veröffentlicht: (2025)
MoBiQuant: Mixture-of-Bits Quantization for Token-Adaptive Any-Precision LLM
von: Wang, Dongwei, et al.
Veröffentlicht: (2026)
von: Wang, Dongwei, et al.
Veröffentlicht: (2026)
From Signal Degradation to Computation Collapse: Uncovering the Two Failure Modes of LLM Quantization
von: Zhou, Chenxi, et al.
Veröffentlicht: (2026)
von: Zhou, Chenxi, et al.
Veröffentlicht: (2026)
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
von: Xi, Zhiheng, et al.
Veröffentlicht: (2025)
ButterflyQuant: Ultra-low-bit LLM Quantization through Learnable Orthogonal Butterfly Transforms
von: Xu, Bingxin, et al.
Veröffentlicht: (2025)
von: Xu, Bingxin, et al.
Veröffentlicht: (2025)
Breaking the Mirror: Activation-Based Mitigation of Self-Preference in LLM Evaluators
von: Roytburg, Dani, et al.
Veröffentlicht: (2025)
von: Roytburg, Dani, et al.
Veröffentlicht: (2025)
Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization
von: Li, Chenliang, et al.
Veröffentlicht: (2025)
von: Li, Chenliang, et al.
Veröffentlicht: (2025)
I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models
von: Hu, Xing, et al.
Veröffentlicht: (2024)
von: Hu, Xing, et al.
Veröffentlicht: (2024)
KVTuner: Sensitivity-Aware Layer-Wise Mixed-Precision KV Cache Quantization for Efficient and Nearly Lossless LLM Inference
von: Li, Xing, et al.
Veröffentlicht: (2025)
von: Li, Xing, et al.
Veröffentlicht: (2025)
Interpreting the Effects of Quantization on LLMs
von: Singh, Manpreet, et al.
Veröffentlicht: (2025)
von: Singh, Manpreet, et al.
Veröffentlicht: (2025)
Multi-Turn Code Generation Through Single-Step Rewards
von: Jain, Arnav Kumar, et al.
Veröffentlicht: (2025)
von: Jain, Arnav Kumar, et al.
Veröffentlicht: (2025)
On the Compressibility of Quantized Large Language Models
von: Mao, Yu, et al.
Veröffentlicht: (2024)
von: Mao, Yu, et al.
Veröffentlicht: (2024)
TED: Turn Emphasis with Dialogue Feature Attention for Emotion Recognition in Conversation
von: Ono, Junya, et al.
Veröffentlicht: (2025)
von: Ono, Junya, et al.
Veröffentlicht: (2025)
Revisiting Early Detection of Sexual Predators via Turn-level Optimization
von: An, Jinmyeong, et al.
Veröffentlicht: (2025)
von: An, Jinmyeong, et al.
Veröffentlicht: (2025)
Turn Waste into Worth: Rectifying Top-$k$ Router of MoE
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2024)
von: Zeng, Zhiyuan, et al.
Veröffentlicht: (2024)
Out-of-Domain Intent Detection Considering Multi-Turn Dialogue Contexts
von: Lang, Hao, et al.
Veröffentlicht: (2023)
von: Lang, Hao, et al.
Veröffentlicht: (2023)
KDFlow: A User-Friendly and Efficient Knowledge Distillation Framework for Large Language Models
von: Zhang, Songming, et al.
Veröffentlicht: (2026)
von: Zhang, Songming, et al.
Veröffentlicht: (2026)
ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction
von: Zeng, Xingshan, et al.
Veröffentlicht: (2025)
von: Zeng, Xingshan, et al.
Veröffentlicht: (2025)
TIPS: Turn-Level Information-Potential Reward Shaping for Search-Augmented LLMs
von: Xie, Yutao, et al.
Veröffentlicht: (2026)
von: Xie, Yutao, et al.
Veröffentlicht: (2026)
Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings
von: Wu, Yuning, et al.
Veröffentlicht: (2026)
von: Wu, Yuning, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
SmoothRot: Combining Channel-Wise Scaling and Rotation for Quantization-Friendly LLMs
von: Czakó, Patrik, et al.
Veröffentlicht: (2025) -
Achieving Peak Performance for Large Language Models: A Systematic Review
von: Rostam, Zhyar Rzgar K, et al.
Veröffentlicht: (2024) -
RaguTeam at SemEval-2026 Task 8: Meno and Friends in a Judge-Orchestrated LLM Ensemble for Faithful Multi-Turn Response Generation
von: Bondarenko, Ivan, et al.
Veröffentlicht: (2026) -
Agile-Quant: Activation-Guided Quantization for Faster Inference of LLMs on the Edge
von: Shen, Xuan, et al.
Veröffentlicht: (2023) -
TSR: Trajectory-Search Rollouts for Multi-Turn RL of LLM Agents
von: Djuhera, Aladin, et al.
Veröffentlicht: (2026)