Ladder-residual: parallelism-aware architecture for accelerating large model inference with communication overlapping
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Muru, Mishra, Mayank, Zhou, Zhongzhu, Brandon, William, Wang, Jue, Kim, Yoon, Ragan-Kelley, Jonathan, Song, Shuaiwen Leon, Athiwaratkun, Ben, Dao, Tri |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FlashFormer: Whole-Model Kernels for Efficient Low-Batch Inference
par: Nrusimha, Aniruddha, et autres
Publié: (2025)
par: Nrusimha, Aniruddha, et autres
Publié: (2025)
OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization
par: Zhou, Zhongzhu, et autres
Publié: (2026)
par: Zhou, Zhongzhu, et autres
Publié: (2026)
Understanding and Steering the Cognitive Behaviors of Reasoning Models at Test-Time
par: Zhang, Zhenyu, et autres
Publié: (2025)
par: Zhang, Zhenyu, et autres
Publié: (2025)
Reducing Transformer Key-Value Cache Size with Cross-Layer Attention
par: Brandon, William, et autres
Publié: (2024)
par: Brandon, William, et autres
Publié: (2024)
Improving Model Alignment Through Collective Intelligence of Open-Source LLMS
par: Wang, Junlin, et autres
Publié: (2025)
par: Wang, Junlin, et autres
Publié: (2025)
SAW-INT4: System-Aware 4-Bit KV-Cache Quantization for Real-World LLM Serving
par: Jia, Jinda, et autres
Publié: (2026)
par: Jia, Jinda, et autres
Publié: (2026)
Mixture-of-Agents Enhances Large Language Model Capabilities
par: Wang, Junlin, et autres
Publié: (2024)
par: Wang, Junlin, et autres
Publié: (2024)
Fast Matrix Multiplications for Lookup Table-Quantized LLMs
par: Guo, Han, et autres
Publié: (2024)
par: Guo, Han, et autres
Publié: (2024)
Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models
par: Thapa, Rahul, et autres
Publié: (2024)
par: Thapa, Rahul, et autres
Publié: (2024)
Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation
par: He, Linda, et autres
Publié: (2025)
par: He, Linda, et autres
Publié: (2025)
Squeeze Evolve: Unified Multi-Model Orchestration for Verifier-Free Evolution
par: Maheswaran, Monishwaran, et autres
Publié: (2026)
par: Maheswaran, Monishwaran, et autres
Publié: (2026)
SonicMoE: Accelerating MoE with IO and Tile-aware Optimizations
par: Guo, Wentao, et autres
Publié: (2025)
par: Guo, Wentao, et autres
Publié: (2025)
Training-Free Activation Sparsity in Large Language Models
par: Liu, James, et autres
Publié: (2024)
par: Liu, James, et autres
Publié: (2024)
Sycophantic Chatbots Cause Delusional Spiraling, Even in Ideal Bayesians
par: Chandra, Kartik, et autres
Publié: (2026)
par: Chandra, Kartik, et autres
Publié: (2026)
When Does Divide and Conquer Work for Long Context LLM? A Noise Decomposition Framework
par: Xu, Zhen, et autres
Publié: (2025)
par: Xu, Zhen, et autres
Publié: (2025)
Hardware-Efficient Attention for Fast Decoding
par: Zadouri, Ted, et autres
Publié: (2025)
par: Zadouri, Ted, et autres
Publié: (2025)
How Well Can General Vision-Language Models Learn Medicine By Watching Public Educational Videos?
par: Thapa, Rahul, et autres
Publié: (2025)
par: Thapa, Rahul, et autres
Publié: (2025)
Improving Estonian Text Simplification through Pretrained Language Models and Custom Datasets
par: Barbu, Eduard, et autres
Publié: (2025)
par: Barbu, Eduard, et autres
Publié: (2025)
CARE: Covariance-Aware and Rank-Enhanced Decomposition for Enabling Multi-Head Latent Attention
par: Zhou, Zhongzhu, et autres
Publié: (2026)
par: Zhou, Zhongzhu, et autres
Publié: (2026)
Energy efficiency optimization of task-parallel codes on asymmetric architectures
par: Costero, Luis, et autres
Publié: (2024)
par: Costero, Luis, et autres
Publié: (2024)
More efficient sifting for grid norms, and applications to multiparty communication complexity
par: Kelley, Zander, et autres
Publié: (2025)
par: Kelley, Zander, et autres
Publié: (2025)
Guided Optimization for Image Processing Pipelines
par: Ikarashi, Yuka, et autres
Publié: (2021)
par: Ikarashi, Yuka, et autres
Publié: (2021)
Streaming DiLoCo with overlapping communication: Towards a Distributed Free Lunch
par: Douillard, Arthur, et autres
Publié: (2025)
par: Douillard, Arthur, et autres
Publié: (2025)
Visual moral inference and communication
par: Zhu, Warren, et autres
Publié: (2025)
par: Zhu, Warren, et autres
Publié: (2025)
Sketching With Your Voice: "Non-Phonorealistic" Rendering of Sounds via Vocal Imitation
par: Caren, Matthew, et autres
Publié: (2024)
par: Caren, Matthew, et autres
Publié: (2024)
BILLNET: A Binarized Conv3D-LSTM Network with Logic-gated residual architecture for hardware-efficient video inference
par: Nguyen, Van Thien, et autres
Publié: (2025)
par: Nguyen, Van Thien, et autres
Publié: (2025)
Meschers: Geometry Processing of Impossible Objects
par: Dodik, Ana, et autres
Publié: (2026)
par: Dodik, Ana, et autres
Publié: (2026)
Reasoning in Token Economies: Budget-Aware Evaluation of LLM Reasoning Strategies
par: Wang, Junlin, et autres
Publié: (2024)
par: Wang, Junlin, et autres
Publié: (2024)
Introspective Diffusion Language Models
par: Yu, Yifan, et autres
Publié: (2026)
par: Yu, Yifan, et autres
Publié: (2026)
Dissociating model architectures from inference computations
par: Sajid, Noor, et autres
Publié: (2025)
par: Sajid, Noor, et autres
Publié: (2025)
Cost-aware simulation-based inference
par: Bharti, Ayush, et autres
Publié: (2024)
par: Bharti, Ayush, et autres
Publié: (2024)
Mitigating the Impact of Outlier Channels for Language Model Quantization with Activation Regularization
par: Nrusimha, Aniruddha, et autres
Publié: (2024)
par: Nrusimha, Aniruddha, et autres
Publié: (2024)
Measuring Sustainability Intention of ESG Fund Disclosure using Few-Shot Learning
par: Singh, Mayank, et autres
Publié: (2024)
par: Singh, Mayank, et autres
Publié: (2024)
Towards single-shot coherent imaging via overlap-free ptychography
par: Hoidn, Oliver, et autres
Publié: (2026)
par: Hoidn, Oliver, et autres
Publié: (2026)
Disentangling Reasoning and Knowledge in Medical Large Language Models
par: Thapa, Rahul, et autres
Publié: (2025)
par: Thapa, Rahul, et autres
Publié: (2025)
Target-aware Bayesian inference via generalized thermodynamic integration
par: Llorente, F., et autres
Publié: (2025)
par: Llorente, F., et autres
Publié: (2025)
Large-Scale Data Selection for Instruction Tuning
par: Ivison, Hamish, et autres
Publié: (2025)
par: Ivison, Hamish, et autres
Publié: (2025)
Empathy in Explanation
par: Collins, Katherine M., et autres
Publié: (2025)
par: Collins, Katherine M., et autres
Publié: (2025)
Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient
par: Zhou, Zhongzhu, et autres
Publié: (2025)
par: Zhou, Zhongzhu, et autres
Publié: (2025)
A parallel implementation of reduced-order modeling of large-scale systems
par: Farcas, Ionut-Gabriel, et autres
Publié: (2025)
par: Farcas, Ionut-Gabriel, et autres
Publié: (2025)
Documents similaires
-
FlashFormer: Whole-Model Kernels for Efficient Low-Batch Inference
par: Nrusimha, Aniruddha, et autres
Publié: (2025) -
OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization
par: Zhou, Zhongzhu, et autres
Publié: (2026) -
Understanding and Steering the Cognitive Behaviors of Reasoning Models at Test-Time
par: Zhang, Zhenyu, et autres
Publié: (2025) -
Reducing Transformer Key-Value Cache Size with Cross-Layer Attention
par: Brandon, William, et autres
Publié: (2024) -
Improving Model Alignment Through Collective Intelligence of Open-Source LLMS
par: Wang, Junlin, et autres
Publié: (2025)