Learned Cost Model for Placement on Reconfigurable Dataflow Hardware
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guha, Etash, Jiang, Tianxiao, Deng, Andrew, Zhang, Jian, Annamalai, Muthu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TileLoom: Automatic Dataflow Planning for Tile-Based Languages on Spatial Dataflow Accelerators
par: Li, Wei, et autres
Publié: (2025)
par: Li, Wei, et autres
Publié: (2025)
Suki: Choreographed Distributed Dataflow in Rust
par: Laddad, Shadaj, et autres
Publié: (2024)
par: Laddad, Shadaj, et autres
Publié: (2024)
Failure Transparency in Stateful Dataflow Systems (Technical Report)
par: Veresov, Aleksey, et autres
Publié: (2024)
par: Veresov, Aleksey, et autres
Publié: (2024)
Scaling Deep Learning Training with MPMD Pipeline Parallelism
par: Xhebraj, Anxhelo, et autres
Publié: (2024)
par: Xhebraj, Anxhelo, et autres
Publié: (2024)
LOOPer: A Learned Automatic Code Optimizer For Polyhedral Compilers
par: Merouani, Massinissa, et autres
Publié: (2024)
par: Merouani, Massinissa, et autres
Publié: (2024)
PartIR: Composing SPMD Partitioning Strategies for Machine Learning
par: Alabed, Sami, et autres
Publié: (2024)
par: Alabed, Sami, et autres
Publié: (2024)
Data-efficient Performance Modeling via Pre-training
par: Liu, Chunting, et autres
Publié: (2025)
par: Liu, Chunting, et autres
Publié: (2025)
Mirage Persistent Kernel: A Compiler and Runtime for Mega-Kernelizing Tensor Programs
par: Cheng, Xinhao, et autres
Publié: (2025)
par: Cheng, Xinhao, et autres
Publié: (2025)
Event Tensor: A Unified Abstraction for Compiling Dynamic Megakernel
par: Jin, Hongyi, et autres
Publié: (2026)
par: Jin, Hongyi, et autres
Publié: (2026)
COSTREAM: Learned Cost Models for Operator Placement in Edge-Cloud Environments
par: Heinrich, Roman, et autres
Publié: (2024)
par: Heinrich, Roman, et autres
Publié: (2024)
DOPPLER: Dual-Policy Learning for Device Assignment in Asynchronous Dataflow Graphs
par: Yao, Xinyu, et autres
Publié: (2025)
par: Yao, Xinyu, et autres
Publié: (2025)
Theoretical Foundations of GPU-Native Compilation for Rapid Code Iteration
par: Metinov, Adilet, et autres
Publié: (2025)
par: Metinov, Adilet, et autres
Publié: (2025)
VTC: DNN Compilation with Virtual Tensors for Data Movement Elimination
par: Hu, Muyan, et autres
Publié: (2026)
par: Hu, Muyan, et autres
Publié: (2026)
Morphling: Fast, Fused, and Flexible GNN Training at Scale
par: Anubhab, et autres
Publié: (2025)
par: Anubhab, et autres
Publié: (2025)
GPU-Accelerated Synthesis of Mixed-Boolean Arithmetic: Beyond Caching
par: Bathie, Gabriel, et autres
Publié: (2026)
par: Bathie, Gabriel, et autres
Publié: (2026)
veScale: Consistent and Efficient Tensor Programming with Eager-Mode SPMD
par: Li, Youjie, et autres
Publié: (2025)
par: Li, Youjie, et autres
Publié: (2025)
Integrated Hardware Architecture and Device Placement Search
par: Wang, Irene, et autres
Publié: (2024)
par: Wang, Irene, et autres
Publié: (2024)
Accelerating Recommender Model ETL with a Streaming FPGA-GPU Dataflow
par: Zhu, Yu, et autres
Publié: (2025)
par: Zhu, Yu, et autres
Publié: (2025)
Agentic Auto-Scheduling: An Experimental Study of LLM-Guided Loop Optimization
par: Merouani, Massinissa, et autres
Publié: (2025)
par: Merouani, Massinissa, et autres
Publié: (2025)
Energy-Efficient Split Learning for Fine-Tuning Large Language Models in Edge Networks
par: Li, Zuguang, et autres
Publié: (2024)
par: Li, Zuguang, et autres
Publié: (2024)
Reward Augmentation in Reinforcement Learning for Testing Distributed Systems
par: Borgarelli, Andrea, et autres
Publié: (2024)
par: Borgarelli, Andrea, et autres
Publié: (2024)
NEST: Network- and Memory-Aware Device Placement For Distributed Deep Learning
par: Wang, Irene, et autres
Publié: (2026)
par: Wang, Irene, et autres
Publié: (2026)
Graph Neural Networks and Reinforcement Learning for Proactive Application Image Placement
par: Makris, Antonios, et autres
Publié: (2024)
par: Makris, Antonios, et autres
Publié: (2024)
Axe: A Simple Unified Layout Abstraction for Machine Learning Compilers
par: Hou, Bohan, et autres
Publié: (2026)
par: Hou, Bohan, et autres
Publié: (2026)
Learning to Keep a Promise: Scaling Language Model Decoding Parallelism with Learned Asynchronous Decoding
par: Jin, Tian, et autres
Publié: (2025)
par: Jin, Tian, et autres
Publié: (2025)
FLARE: A Dataflow-Aware and Scalable Hardware Architecture for Neural-Hybrid Scientific Lossy Compression
par: Jia, Wenqi, et autres
Publié: (2025)
par: Jia, Wenqi, et autres
Publié: (2025)
Optimizing Cross-Client Domain Coverage for Federated Instruction Tuning of Large Language Models
par: Wang, Zezhou, et autres
Publié: (2024)
par: Wang, Zezhou, et autres
Publié: (2024)
Scalable Training of Mixture-of-Experts Models with Megatron Core
par: Yan, Zijie, et autres
Publié: (2026)
par: Yan, Zijie, et autres
Publié: (2026)
Federated Full-Parameter Tuning of Billion-Sized Language Models with Communication Cost under 18 Kilobytes
par: Qin, Zhen, et autres
Publié: (2023)
par: Qin, Zhen, et autres
Publié: (2023)
Federated Learning of Large Language Models with Parameter-Efficient Prompt Tuning and Adaptive Optimization
par: Che, Tianshi, et autres
Publié: (2023)
par: Che, Tianshi, et autres
Publié: (2023)
Choreographies as Macros
par: Bohosian, Alexander, et autres
Publié: (2025)
par: Bohosian, Alexander, et autres
Publié: (2025)
Charon: A Unified and Fine-Grained Simulator for Large-Scale LLM Training and Inference
par: Yang, Mengtian, et autres
Publié: (2026)
par: Yang, Mengtian, et autres
Publié: (2026)
CAFL-L: Constraint-Aware Federated Learning with Lagrangian Dual Optimization for On-Device Language Models
par: Zheng, Dongqi, et autres
Publié: (2025)
par: Zheng, Dongqi, et autres
Publié: (2025)
FedBiOT: LLM Local Fine-tuning in Federated Learning without Full Model
par: Wu, Feijie, et autres
Publié: (2024)
par: Wu, Feijie, et autres
Publié: (2024)
InferCept: Efficient Intercept Support for Augmented Large Language Model Inference
par: Abhyankar, Reyna, et autres
Publié: (2024)
par: Abhyankar, Reyna, et autres
Publié: (2024)
MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training
par: Li, Wenxuan, et autres
Publié: (2025)
par: Li, Wenxuan, et autres
Publié: (2025)
A Bring-Your-Own-Model Approach for ML-Driven Storage Placement in Warehouse-Scale Computers
par: Yang, Chenxi, et autres
Publié: (2025)
par: Yang, Chenxi, et autres
Publié: (2025)
CudaForge: An Agent Framework with Hardware Feedback for CUDA Kernel Optimization
par: Zhang, Zijian, et autres
Publié: (2025)
par: Zhang, Zijian, et autres
Publié: (2025)
Unlocking Full Efficiency of Token Filtering in Large Language Model Training
par: Chai, Di, et autres
Publié: (2025)
par: Chai, Di, et autres
Publié: (2025)
Low-Cost Privacy-Preserving Decentralized Learning
par: Biswas, Sayan, et autres
Publié: (2024)
par: Biswas, Sayan, et autres
Publié: (2024)
Documents similaires
-
TileLoom: Automatic Dataflow Planning for Tile-Based Languages on Spatial Dataflow Accelerators
par: Li, Wei, et autres
Publié: (2025) -
Suki: Choreographed Distributed Dataflow in Rust
par: Laddad, Shadaj, et autres
Publié: (2024) -
Failure Transparency in Stateful Dataflow Systems (Technical Report)
par: Veresov, Aleksey, et autres
Publié: (2024) -
Scaling Deep Learning Training with MPMD Pipeline Parallelism
par: Xhebraj, Anxhelo, et autres
Publié: (2024) -
LOOPer: A Learned Automatic Code Optimizer For Polyhedral Compilers
par: Merouani, Massinissa, et autres
Publié: (2024)