Priority Sampling of Large Language Models for Compilers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Grubisic, Dejan, Cummins, Chris, Seeker, Volker, Leather, Hugh |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Compiler generated feedback for Large Language Models
par: Grubisic, Dejan, et autres
Publié: (2024)
par: Grubisic, Dejan, et autres
Publié: (2024)
Meta Large Language Model Compiler: Foundation Models of Compiler Optimization
par: Cummins, Chris, et autres
Publié: (2024)
par: Cummins, Chris, et autres
Publié: (2024)
Systematic Evaluation of Optimization Techniques for Long-Context Language Models
par: Ahmed, Ammar, et autres
Publié: (2025)
par: Ahmed, Ammar, et autres
Publié: (2025)
LOOPerSet: A Large-Scale Dataset for Data-Driven Polyhedral Compiler Optimization
par: Merouani, Massinissa, et autres
Publié: (2025)
par: Merouani, Massinissa, et autres
Publié: (2025)
Model Compression and Efficient Inference for Large Language Models: A Survey
par: Wang, Wenxiao, et autres
Publié: (2024)
par: Wang, Wenxiao, et autres
Publié: (2024)
Don't Transform the Code, Code the Transforms: Towards Precise Code Rewriting using LLMs
par: Cummins, Chris, et autres
Publié: (2024)
par: Cummins, Chris, et autres
Publié: (2024)
Enhancing Inference Efficiency of Large Language Models: Investigating Optimization Strategies and Architectural Innovations
par: Tyukin, Georgy
Publié: (2024)
par: Tyukin, Georgy
Publié: (2024)
CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing
par: Zheng, Wenhao, et autres
Publié: (2025)
par: Zheng, Wenhao, et autres
Publié: (2025)
The Next 700 ML-Enabled Compiler Optimizations
par: VenkataKeerthy, S., et autres
Publié: (2023)
par: VenkataKeerthy, S., et autres
Publié: (2023)
EPIC: Efficient Position-Independent Caching for Serving Large Language Models
par: Hu, Junhao, et autres
Publié: (2024)
par: Hu, Junhao, et autres
Publié: (2024)
Data Efficacy for Language Model Training
par: Dai, Yalun, et autres
Publié: (2025)
par: Dai, Yalun, et autres
Publié: (2025)
KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache
par: Liu, Zirui, et autres
Publié: (2024)
par: Liu, Zirui, et autres
Publié: (2024)
ModeSwitch-LLM: A Lightweight Phase-Aware Controller for Cross-Mode LLM Inference on a Single GPU
par: Sunesh, Aman, et autres
Publié: (2026)
par: Sunesh, Aman, et autres
Publié: (2026)
FLuRKA: Fast and accurate unified Low-Rank & Kernel Attention
par: Gupta, Ahan, et autres
Publié: (2023)
par: Gupta, Ahan, et autres
Publié: (2023)
Block Sparse Flash Attention
par: Ohayon, Daniel, et autres
Publié: (2025)
par: Ohayon, Daniel, et autres
Publié: (2025)
AttentionEngine: A Versatile Framework for Efficient Attention Mechanisms on Diverse Hardware Platforms
par: Chen, Feiyang, et autres
Publié: (2025)
par: Chen, Feiyang, et autres
Publié: (2025)
ECCO: Evidence-Driven Causal Reasoning for Compiler Optimization
par: Pan, Haolin, et autres
Publié: (2026)
par: Pan, Haolin, et autres
Publié: (2026)
Library Liberation: Competitive Performance Matmul Through Compiler-composed Nanokernels
par: Thangamani, Arun, et autres
Publié: (2025)
par: Thangamani, Arun, et autres
Publié: (2025)
MMLU-CF: A Contamination-free Multi-task Language Understanding Benchmark
par: Zhao, Qihao, et autres
Publié: (2024)
par: Zhao, Qihao, et autres
Publié: (2024)
Regression Language Models for Code
par: Akhauri, Yash, et autres
Publié: (2025)
par: Akhauri, Yash, et autres
Publié: (2025)
Morpheme Boundary Detection & Grammatical Feature Prediction for Gujarati : Dataset & Model
par: Baxi, Jatayu, et autres
Publié: (2021)
par: Baxi, Jatayu, et autres
Publié: (2021)
Evaluating the Efficacy of Foundational Models: Advancing Benchmarking Practices to Enhance Fine-Tuning Decision-Making
par: Amujo, Oluyemi Enoch, et autres
Publié: (2024)
par: Amujo, Oluyemi Enoch, et autres
Publié: (2024)
Quamba2: A Robust and Scalable Post-training Quantization Framework for Selective State Space Models
par: Chiang, Hung-Yueh, et autres
Publié: (2025)
par: Chiang, Hung-Yueh, et autres
Publié: (2025)
Reconstructing Biological Pathways by Applying Selective Incremental Learning to (Very) Small Language Models
par: Saha, Pranta, et autres
Publié: (2025)
par: Saha, Pranta, et autres
Publié: (2025)
Finding Missed Code Size Optimizations in Compilers using LLMs
par: Italiano, Davide, et autres
Publié: (2024)
par: Italiano, Davide, et autres
Publié: (2024)
oneDNN Graph Compiler: A Hybrid Approach for High-Performance Deep Learning Compilation
par: Li, Jianhui, et autres
Publié: (2023)
par: Li, Jianhui, et autres
Publié: (2023)
What I cannot execute, I do not understand: Training and Evaluating LLMs on Program Execution Traces
par: Armengol-Estapé, Jordi, et autres
Publié: (2025)
par: Armengol-Estapé, Jordi, et autres
Publié: (2025)
QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving
par: Lin, Yujun, et autres
Publié: (2024)
par: Lin, Yujun, et autres
Publié: (2024)
QJL: 1-Bit Quantized JL Transform for KV Cache Quantization with Zero Overhead
par: Zandieh, Amir, et autres
Publié: (2024)
par: Zandieh, Amir, et autres
Publié: (2024)
Energy-Aware LLMs: A step towards sustainable AI for downstream applications
par: Tran, Nguyen Phuc, et autres
Publié: (2025)
par: Tran, Nguyen Phuc, et autres
Publié: (2025)
REAM: Merging Improves Pruning of Experts in LLMs
par: Jha, Saurav, et autres
Publié: (2026)
par: Jha, Saurav, et autres
Publié: (2026)
LowRA: Accurate and Efficient LoRA Fine-Tuning of LLMs under 2 Bits
par: Zhou, Zikai, et autres
Publié: (2025)
par: Zhou, Zikai, et autres
Publié: (2025)
Non-Monotonic Latency in Apple MPS Decoding: KV Cache Interactions and Execution Regimes
par: Hendria, Willy Fitra
Publié: (2026)
par: Hendria, Willy Fitra
Publié: (2026)
Bench360: Benchmarking Local LLM Inference from 360 Degrees
par: Stuhlmann, Linus, et autres
Publié: (2025)
par: Stuhlmann, Linus, et autres
Publié: (2025)
An energy-based comparative analysis of common approaches to text classification in the Legal domain
par: Gultekin, Sinan, et autres
Publié: (2023)
par: Gultekin, Sinan, et autres
Publié: (2023)
OptiSeq: Ordering Examples On-The-Fly for In-Context Learning
par: Bhope, Rahul Atul, et autres
Publié: (2025)
par: Bhope, Rahul Atul, et autres
Publié: (2025)
Accelerating Diffusion LLMs via Adaptive Parallel Decoding
par: Israel, Daniel, et autres
Publié: (2025)
par: Israel, Daniel, et autres
Publié: (2025)
Flex Attention: A Programming Model for Generating Optimized Attention Kernels
par: Dong, Juechu, et autres
Publié: (2024)
par: Dong, Juechu, et autres
Publié: (2024)
Thanos: A Block-wise Pruning Algorithm for Efficient Large Language Model Compression
par: Ilin, Ivan, et autres
Publié: (2025)
par: Ilin, Ivan, et autres
Publié: (2025)
SENSEi: Input-Sensitive Compilation for Accelerating GNNs
par: Lenadora, Damitha, et autres
Publié: (2023)
par: Lenadora, Damitha, et autres
Publié: (2023)
Documents similaires
-
Compiler generated feedback for Large Language Models
par: Grubisic, Dejan, et autres
Publié: (2024) -
Meta Large Language Model Compiler: Foundation Models of Compiler Optimization
par: Cummins, Chris, et autres
Publié: (2024) -
Systematic Evaluation of Optimization Techniques for Long-Context Language Models
par: Ahmed, Ammar, et autres
Publié: (2025) -
LOOPerSet: A Large-Scale Dataset for Data-Driven Polyhedral Compiler Optimization
par: Merouani, Massinissa, et autres
Publié: (2025) -
Model Compression and Efficient Inference for Large Language Models: A Survey
par: Wang, Wenxiao, et autres
Publié: (2024)