Hogwild! Inference: Parallel LLM Generation via Concurrent Attention
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rodionov, Gleb, Garipov, Roman, Shutova, Alina, Yakushev, George, Schultheis, Erik, Egiazarian, Vage, Sinitsin, Anton, Kuznedelev, Denis, Alistarh, Dan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models
par: Shutova, Alina, et autres
Publié: (2025)
par: Shutova, Alina, et autres
Publié: (2025)
Extreme Compression of Large Language Models via Additive Quantization
par: Egiazarian, Vage, et autres
Publié: (2024)
par: Egiazarian, Vage, et autres
Publié: (2024)
Grid Games: The Power of Multiple Grids for Quantizing Large Language Models
par: Egiazarian, Vage, et autres
Publié: (2026)
par: Egiazarian, Vage, et autres
Publié: (2026)
Evaluating Memory Structure in LLM Agents
par: Shutova, Alina, et autres
Publié: (2026)
par: Shutova, Alina, et autres
Publié: (2026)
Accurate Compression of Text-to-Image Diffusion Models via Vector Quantization
par: Egiazarian, Vage, et autres
Publié: (2024)
par: Egiazarian, Vage, et autres
Publié: (2024)
Asynchronous Reasoning: Training-Free Interactive Thinking LLMs
par: Yakushev, George, et autres
Publié: (2025)
par: Yakushev, George, et autres
Publié: (2025)
WUSH: Near-Optimal Adaptive Transforms for LLM Quantization
par: Chen, Jiale, et autres
Publié: (2025)
par: Chen, Jiale, et autres
Publié: (2025)
LLMQ: Efficient Lower-Precision Pretraining for Consumer GPUs
par: Schultheis, Erik, et autres
Publié: (2025)
par: Schultheis, Erik, et autres
Publié: (2025)
AutoJudge: Judge Decoding Without Manual Annotation
par: Garipov, Roman, et autres
Publié: (2025)
par: Garipov, Roman, et autres
Publié: (2025)
EvoPress: Accurate Dynamic Model Compression via Evolutionary Search
par: Sieberling, Oliver, et autres
Publié: (2024)
par: Sieberling, Oliver, et autres
Publié: (2024)
Quartet II: Accurate LLM Pre-Training in NVFP4 by Improved Unbiased Gradient Estimation
par: Panferov, Andrei, et autres
Publié: (2026)
par: Panferov, Andrei, et autres
Publié: (2026)
Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization
par: Egiazarian, Vage, et autres
Publié: (2025)
par: Egiazarian, Vage, et autres
Publié: (2025)
Unified Scaling Laws for Compressed Representations
par: Panferov, Andrei, et autres
Publié: (2025)
par: Panferov, Andrei, et autres
Publié: (2025)
Reasoning Shift: How Context Silently Shortens LLM Reasoning
par: Rodionov, Gleb
Publié: (2026)
par: Rodionov, Gleb
Publié: (2026)
The Iterative Optimal Brain Surgeon: Faster Sparse Recovery by Leveraging Second-Order Information
par: Wu, Diyuan, et autres
Publié: (2024)
par: Wu, Diyuan, et autres
Publié: (2024)
PV-Tuning: Beyond Straight-Through Estimation for Extreme LLM Compression
par: Malinovskii, Vladimir, et autres
Publié: (2024)
par: Malinovskii, Vladimir, et autres
Publié: (2024)
Talking Trees: Reasoning-Assisted Induction of Decision Trees for Tabular Data
par: Yakushev, George, et autres
Publié: (2025)
par: Yakushev, George, et autres
Publié: (2025)
DASH: Faster Shampoo via Batched Block Preconditioning and Efficient Inverse-Root Solvers
par: Modoranu, Ionut-Vlad, et autres
Publié: (2026)
par: Modoranu, Ionut-Vlad, et autres
Publié: (2026)
Graph Neural Networks Gone Hogwild
par: Solodova, Olga, et autres
Publié: (2024)
par: Solodova, Olga, et autres
Publié: (2024)
Neural Optimal Transport with General Cost Functionals
par: Asadulaev, Arip, et autres
Publié: (2022)
par: Asadulaev, Arip, et autres
Publié: (2022)
Discrete Neural Algorithmic Reasoning
par: Rodionov, Gleb, et autres
Publié: (2024)
par: Rodionov, Gleb, et autres
Publié: (2024)
FFT-based Dynamic Subspace Selection for Low-Rank Adaptive Optimization of Large Language Models
par: Modoranu, Ionut-Vlad, et autres
Publié: (2025)
par: Modoranu, Ionut-Vlad, et autres
Publié: (2025)
MARLIN: Mixed-Precision Auto-Regressive Parallel Inference on Large Language Models
par: Frantar, Elias, et autres
Publié: (2024)
par: Frantar, Elias, et autres
Publié: (2024)
Switti: Designing Scale-Wise Transformers for Text-to-Image Synthesis
par: Voronov, Anton, et autres
Publié: (2024)
par: Voronov, Anton, et autres
Publié: (2024)
Rethinking Optimal Transport in Offline Reinforcement Learning
par: Asadulaev, Arip, et autres
Publié: (2024)
par: Asadulaev, Arip, et autres
Publié: (2024)
Are LLMs classical or nonmonotonic reasoners? Lessons from generics
par: Leidinger, Alina, et autres
Publié: (2024)
par: Leidinger, Alina, et autres
Publié: (2024)
Position: It's Time to Act on the Risk of Efficient Personalized Text Generation
par: Iofinova, Eugenia, et autres
Publié: (2025)
par: Iofinova, Eugenia, et autres
Publié: (2025)
Speculative Decoding Speed-of-Light: Optimal Lower Bounds via Branching Random Walks
par: Pankratov, Sergey, et autres
Publié: (2025)
par: Pankratov, Sergey, et autres
Publié: (2025)
Simple Opinion Dynamics for No-Regret Learning
par: Lazarsfeld, John, et autres
Publié: (2023)
par: Lazarsfeld, John, et autres
Publié: (2023)
Behemoth: Benchmarking Unlearning in LLMs Using Fully Synthetic Data
par: Iofinova, Eugenia, et autres
Publié: (2026)
par: Iofinova, Eugenia, et autres
Publié: (2026)
Model Compression with Exact Budget Constraints via Riemannian Manifolds
par: Helcig, Michael, et autres
Publié: (2026)
par: Helcig, Michael, et autres
Publié: (2026)
MatryoshkaLoRA: Learning Accurate Hierarchical Low-Rank Representations for LLM Fine-Tuning
par: Modoranu, Ionut-Vlad, et autres
Publié: (2026)
par: Modoranu, Ionut-Vlad, et autres
Publié: (2026)
Apertus LLM Family Expansion via Distillation and Quantization
par: Panferov, Andrei, et autres
Publié: (2026)
par: Panferov, Andrei, et autres
Publié: (2026)
Catching the context: the first genre-determined reading of Francysk Skaryna’s portrait
par: Olga Shutova
Publié: (2022)
par: Olga Shutova
Publié: (2022)
How do languages influence each other? Studying cross-lingual data sharing during LM fine-tuning
par: Choenni, Rochelle, et autres
Publié: (2023)
par: Choenni, Rochelle, et autres
Publié: (2023)
Does Diffusion Beat GAN in Image Super Resolution?
par: Kuznedelev, Denis, et autres
Publié: (2024)
par: Kuznedelev, Denis, et autres
Publié: (2024)
Characterizing Graph Datasets for Node Classification: Homophily-Heterophily Dichotomy and Beyond
par: Platonov, Oleg, et autres
Publié: (2022)
par: Platonov, Oleg, et autres
Publié: (2022)
Generating artificial digital image correlation data using physics-guided adversarial networks
par: Melching, David, et autres
Publié: (2023)
par: Melching, David, et autres
Publié: (2023)
Key Algorithms for Keyphrase Generation: Instruction-Based LLMs for Russian Scientific Keyphrases
par: Glazkova, Anna, et autres
Publié: (2024)
par: Glazkova, Anna, et autres
Publié: (2024)
LitmusKt: Concurrency Stress Testing for Kotlin
par: Lochmelis, Denis, et autres
Publié: (2025)
par: Lochmelis, Denis, et autres
Publié: (2025)
Documents similaires
-
Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models
par: Shutova, Alina, et autres
Publié: (2025) -
Extreme Compression of Large Language Models via Additive Quantization
par: Egiazarian, Vage, et autres
Publié: (2024) -
Grid Games: The Power of Multiple Grids for Quantizing Large Language Models
par: Egiazarian, Vage, et autres
Publié: (2026) -
Evaluating Memory Structure in LLM Agents
par: Shutova, Alina, et autres
Publié: (2026) -
Accurate Compression of Text-to-Image Diffusion Models via Vector Quantization
par: Egiazarian, Vage, et autres
Publié: (2024)