PAHQ: Accelerating Automated Circuit Discovery through Mixed-Precision Inference Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Xinhai, Yang, Shu, Wang, Liangyu, Zhang, Lin, Xie, Huanyi, Hu, Lijie, Wang, Di |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Predicting LLM Output Length via Entropy-Guided Representations
par: Xie, Huanyi, et autres
Publié: (2026)
par: Xie, Huanyi, et autres
Publié: (2026)
EAP-GP: Mitigating Saturation Effect in Gradient-based Automated Circuit Identification
par: Zhang, Lin, et autres
Publié: (2025)
par: Zhang, Lin, et autres
Publié: (2025)
Evaluating Data Influence in Meta Learning
par: Ren, Chenyang, et autres
Publié: (2025)
par: Ren, Chenyang, et autres
Publié: (2025)
Attributing Data for Sharpness-Aware Minimization
par: Ren, Chenyang, et autres
Publié: (2025)
par: Ren, Chenyang, et autres
Publié: (2025)
Dissecting Representation Misalignment in Contrastive Learning via Influence Function
par: Hu, Lijie, et autres
Publié: (2024)
par: Hu, Lijie, et autres
Publié: (2024)
Efficient Text-Attributed Graph Learning through Selective Annotation and Graph Alignment
par: Xie, Huanyi, et autres
Publié: (2025)
par: Xie, Huanyi, et autres
Publié: (2025)
Accelerating Suffix Jailbreak attacks with Prefix-Shared KV-cache
par: Wang, Xinhai, et autres
Publié: (2026)
par: Wang, Xinhai, et autres
Publié: (2026)
Mechanistic Unveiling of Transformer Circuits: Self-Influence as a Key to Model Reasoning
par: Zhang, Lin, et autres
Publié: (2025)
par: Zhang, Lin, et autres
Publié: (2025)
In-Run Data Shapley for Adam Optimizer
par: Ding, Meng, et autres
Publié: (2026)
par: Ding, Meng, et autres
Publié: (2026)
Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models
par: Wang, Liangyu, et autres
Publié: (2025)
par: Wang, Liangyu, et autres
Publié: (2025)
DistZO2: High-Throughput and Memory-Efficient Zeroth-Order Fine-tuning LLMs with Distributed Parallel Computing
par: Wang, Liangyu, et autres
Publié: (2025)
par: Wang, Liangyu, et autres
Publié: (2025)
Reinforcement Inference: Leveraging Uncertainty for Self-Correcting Language Model Reasoning
par: Sun, Xinhai
Publié: (2026)
par: Sun, Xinhai
Publié: (2026)
Understanding the Dynamics of Demonstration Conflict in In-Context Learning
par: Jiao, Difan, et autres
Publié: (2026)
par: Jiao, Difan, et autres
Publié: (2026)
Understanding the Impact of Differentially Private Training on Memorization of Long-Tailed Data
par: Zhang, Jiaming, et autres
Publié: (2026)
par: Zhang, Jiaming, et autres
Publié: (2026)
Semi-supervised Concept Bottleneck Models
par: Hu, Lijie, et autres
Publié: (2024)
par: Hu, Lijie, et autres
Publié: (2024)
SynCircuit: Automated Generation of New Synthetic RTL Circuits Can Enable Big Data in Circuits
par: Liu, Shang, et autres
Publié: (2025)
par: Liu, Shang, et autres
Publié: (2025)
The Compositional Architecture of Regret in Large Language Models
par: Cui, Xiangxiang, et autres
Publié: (2025)
par: Cui, Xiangxiang, et autres
Publié: (2025)
AMPLE: Event-Driven Accelerator for Mixed-Precision Inference of Graph Neural Networks
par: Gimenes, Pedro, et autres
Publié: (2025)
par: Gimenes, Pedro, et autres
Publié: (2025)
Global Evolutionary Steering: Refining Activation Steering Control via Cross-Layer Consistency
par: Jiang, Xinyan, et autres
Publié: (2026)
par: Jiang, Xinyan, et autres
Publié: (2026)
Inference Optimization of Foundation Models on AI Accelerators
par: Park, Youngsuk, et autres
Publié: (2024)
par: Park, Youngsuk, et autres
Publié: (2024)
Faithful Interpretation for Graph Neural Networks
par: Hu, Lijie, et autres
Publié: (2024)
par: Hu, Lijie, et autres
Publié: (2024)
Diagonal-Tiled Mixed-Precision Attention for Efficient Low-Bit MXFP Inference
par: Ding, Yifu, et autres
Publié: (2026)
par: Ding, Yifu, et autres
Publié: (2026)
Automated Design and Optimization of Distributed Filtering Circuits via Reinforcement Learning
par: Gao, Peng, et autres
Publié: (2024)
par: Gao, Peng, et autres
Publié: (2024)
AnalogFed: Federated Discovery of Analog Circuit Topologies with Generative AI
par: Li, Qiufeng, et autres
Publié: (2025)
par: Li, Qiufeng, et autres
Publié: (2025)
ALISA: Accelerating Large Language Model Inference via Sparsity-Aware KV Caching
par: Zhao, Youpeng, et autres
Publié: (2024)
par: Zhao, Youpeng, et autres
Publié: (2024)
Private Language Models via Truncated Laplacian Mechanism
par: Huang, Tianhao, et autres
Publié: (2024)
par: Huang, Tianhao, et autres
Publié: (2024)
Slow-Fast Inference: Training-Free Inference Acceleration via Within-Sentence Support Stability
par: Xie, Xingyu, et autres
Publié: (2026)
par: Xie, Xingyu, et autres
Publié: (2026)
Efficient Automated Circuit Discovery in Transformers using Contextual Decomposition
par: Hsu, Aliyah R., et autres
Publié: (2024)
par: Hsu, Aliyah R., et autres
Publié: (2024)
Automated Skill Discovery for Language Agents through Exploration and Iterative Feedback
par: Yang, Yongjin, et autres
Publié: (2025)
par: Yang, Yongjin, et autres
Publié: (2025)
A Multi-Modal CNN-LSTM Framework with Multi-Head Attention and Focal Loss for Real-Time Elderly Fall Detection
par: Zhou, Lijie, et autres
Publié: (2026)
par: Zhou, Lijie, et autres
Publié: (2026)
Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images
par: Yang, Qishun, et autres
Publié: (2026)
par: Yang, Qishun, et autres
Publié: (2026)
RAMP: Reinforcement Adaptive Mixed Precision Quantization for Efficient On Device LLM Inference
par: Gautam, Arpit Singh, et autres
Publié: (2026)
par: Gautam, Arpit Singh, et autres
Publié: (2026)
Exploring the Personality Traits of LLMs through Latent Features Steering
par: Yang, Shu, et autres
Publié: (2024)
par: Yang, Shu, et autres
Publié: (2024)
HARBOR: Automated Harness Optimization
par: Sengupta, Biswa, et autres
Publié: (2026)
par: Sengupta, Biswa, et autres
Publié: (2026)
Accelerating Inference of Discrete Autoregressive Normalizing Flows by Selective Jacobi Decoding
par: Zhang, Jiaru, et autres
Publié: (2025)
par: Zhang, Jiaru, et autres
Publié: (2025)
GAMMA: Global Bit Allocation for Mixed-Precision Models under Arbitrary Budgets
par: Yao, Zhangyang, et autres
Publié: (2026)
par: Yao, Zhangyang, et autres
Publié: (2026)
MeshONet: A Generalizable and Efficient Operator Learning Method for Structured Mesh Generation
par: Xiao, Jing, et autres
Publié: (2025)
par: Xiao, Jing, et autres
Publié: (2025)
Prior-Guided Symbolic Regression: Towards Scientific Consistency in Equation Discovery
par: Xiao, Jing, et autres
Publié: (2026)
par: Xiao, Jing, et autres
Publié: (2026)
Understanding Reasoning in Chain-of-Thought from the Hopfieldian View
par: Hu, Lijie, et autres
Publié: (2024)
par: Hu, Lijie, et autres
Publié: (2024)
Deep Causal Learning: Representation, Discovery and Inference
par: Deng, Zizhen, et autres
Publié: (2022)
par: Deng, Zizhen, et autres
Publié: (2022)
Documents similaires
-
Predicting LLM Output Length via Entropy-Guided Representations
par: Xie, Huanyi, et autres
Publié: (2026) -
EAP-GP: Mitigating Saturation Effect in Gradient-based Automated Circuit Identification
par: Zhang, Lin, et autres
Publié: (2025) -
Evaluating Data Influence in Meta Learning
par: Ren, Chenyang, et autres
Publié: (2025) -
Attributing Data for Sharpness-Aware Minimization
par: Ren, Chenyang, et autres
Publié: (2025) -
Dissecting Representation Misalignment in Contrastive Learning via Influence Function
par: Hu, Lijie, et autres
Publié: (2024)