A Few GPUs, A Whole Lotta Scale: Faithful LLM Training Emulation with PrismLLM
Fuente:
arXiv
Guardado en:
| Autores principales: | Xi, Shaoke, Lao, ChonLam, Jia, Boyi, Gao, Jiaqi, Zhang, Zhipeng, Cao, Jiamin, Sutioso, Brian, Xu, Erci, Yu, Minlan, Ren, Kui, Li, Yong, Qian, Zhengping, Zhai, Ennan, Zhou, Jingren |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
EdgeSight: Enabling Modeless and Cost-Efficient Inference at the Edge
por: Lao, ChonLam, et al.
Publicado: (2024)
por: Lao, ChonLam, et al.
Publicado: (2024)
TrainMover: An Interruption-Resilient Runtime for ML Training
por: Lao, ChonLam, et al.
Publicado: (2024)
por: Lao, ChonLam, et al.
Publicado: (2024)
Towards Easy and Realistic Network Infrastructure Testing for Large-scale Machine Learning
por: Yoo, Jinsun, et al.
Publicado: (2025)
por: Yoo, Jinsun, et al.
Publicado: (2025)
Cora: Accelerating Stateful Network Applications with SmartNICs
por: Xi, Shaoke, et al.
Publicado: (2024)
por: Xi, Shaoke, et al.
Publicado: (2024)
THC: Accelerating Distributed Deep Learning Using Tensor Homomorphic Compression
por: Li, Minghao, et al.
Publicado: (2023)
por: Li, Minghao, et al.
Publicado: (2023)
An LLM-based Agentic Framework for Accessible Network Control
por: Lin, Samuel, et al.
Publicado: (2025)
por: Lin, Samuel, et al.
Publicado: (2025)
Estudo fitossociológico de um trecho da floresta estacional semidecidual em Diamante do Norte, Estado do Paraná, Brasil
por: Erci Marcos Del Quiqui
Publicado: (2007)
por: Erci Marcos Del Quiqui
Publicado: (2007)
An Extensible Software Transport Layer for GPU Networking
por: Zhou, Yang, et al.
Publicado: (2025)
por: Zhou, Yang, et al.
Publicado: (2025)
Accelerating Compound LLM Training Workloads with Maestro
por: Yuan, Xiulong, et al.
Publicado: (2026)
por: Yuan, Xiulong, et al.
Publicado: (2026)
Orla: A Library for Serving LLM-Based Multi-Agent Systems
por: Shahout, Rana, et al.
Publicado: (2026)
por: Shahout, Rana, et al.
Publicado: (2026)
PALS: Power-Aware LLM Serving for Mixture-of-Experts Models
por: Hankendi, Can, et al.
Publicado: (2026)
por: Hankendi, Can, et al.
Publicado: (2026)
Intra-request branch orchestration for efficient LLM reasoning
por: Jiang, Weifan, et al.
Publicado: (2025)
por: Jiang, Weifan, et al.
Publicado: (2025)
An Empirical Study of LLM Serving in Confidential GPUs
por: Park, Eunseong, et al.
Publicado: (2026)
por: Park, Eunseong, et al.
Publicado: (2026)
A Systematic Characterization of LLM Inference on GPUs
por: Wang, Haonan, et al.
Publicado: (2025)
por: Wang, Haonan, et al.
Publicado: (2025)
Prism: Unleashing GPU Sharing for Cost-Efficient Multi-LLM Serving
por: Yu, Shan, et al.
Publicado: (2025)
por: Yu, Shan, et al.
Publicado: (2025)
Are LLM Decisions Faithful to Verbal Confidence?
por: Wang, Jiawei, et al.
Publicado: (2026)
por: Wang, Jiawei, et al.
Publicado: (2026)
NEO: Saving GPU Memory Crisis with CPU Offloading for Online LLM Inference
por: Jiang, Xuanlin, et al.
Publicado: (2024)
por: Jiang, Xuanlin, et al.
Publicado: (2024)
Not All Tokens Are Worth Caching: Learning Semantic-Aware Eviction for LLM Prefix Caches
por: Fang, Shaoke, et al.
Publicado: (2026)
por: Fang, Shaoke, et al.
Publicado: (2026)
HetCCL: Accelerating LLM Training with Heterogeneous GPUs
por: Kim, Heehoon, et al.
Publicado: (2026)
por: Kim, Heehoon, et al.
Publicado: (2026)
Measurement of LLM's Philosophies of Human Nature
por: Ni, Minheng, et al.
Publicado: (2025)
por: Ni, Minheng, et al.
Publicado: (2025)
Benchmarking LLM Faithfulness in RAG with Evolving Leaderboards
por: Tamber, Manveer Singh, et al.
Publicado: (2025)
por: Tamber, Manveer Singh, et al.
Publicado: (2025)
LatencyPrism: Online Non-intrusive Latency Sculpting for SLO-Guaranteed LLM Inference
por: Du, Yin, et al.
Publicado: (2026)
por: Du, Yin, et al.
Publicado: (2026)
FusionLLM: A Decentralized LLM Training System on Geo-distributed GPUs with Adaptive Compression
por: Tang, Zhenheng, et al.
Publicado: (2024)
por: Tang, Zhenheng, et al.
Publicado: (2024)
Demystifying Cost-Efficiency in LLM Serving over Heterogeneous GPUs
por: Jiang, Youhe, et al.
Publicado: (2025)
por: Jiang, Youhe, et al.
Publicado: (2025)
Pushing the Envelope of LLM Inference on AI-PC and Intel GPUs
por: Georganas, Evangelos, et al.
Publicado: (2025)
por: Georganas, Evangelos, et al.
Publicado: (2025)
EdgeReasoning: Characterizing Reasoning LLM Deployment on Edge GPUs
por: Kubwimana, Benjamin, et al.
Publicado: (2025)
por: Kubwimana, Benjamin, et al.
Publicado: (2025)
Scaled Block Vecchia Approximation for High-Dimensional Gaussian Process Emulation on GPUs
por: Pan, Qilong, et al.
Publicado: (2025)
por: Pan, Qilong, et al.
Publicado: (2025)
LLM-Slice: Dedicated Wireless Network Slicing for Large Language Models
por: Liu, Boyi, et al.
Publicado: (2024)
por: Liu, Boyi, et al.
Publicado: (2024)
NeuroFaith: Evaluating LLM Self-Explanation Faithfulness via Internal Representation Alignment
por: Bhan, Milan, et al.
Publicado: (2025)
por: Bhan, Milan, et al.
Publicado: (2025)
LLM-Emu: Native Runtime Emulation of LLM Inference via Profile-Driven Sampling
por: Da, Wei, et al.
Publicado: (2026)
por: Da, Wei, et al.
Publicado: (2026)
Optimus: Accelerating Large-Scale Multi-Modal LLM Training by Bubble Exploitation
por: Feng, Weiqi, et al.
Publicado: (2024)
por: Feng, Weiqi, et al.
Publicado: (2024)
Evaluating Human Alignment and Model Faithfulness of LLM Rationale
por: Fayyaz, Mohsen, et al.
Publicado: (2024)
por: Fayyaz, Mohsen, et al.
Publicado: (2024)
Faithfulness Serum: Mitigating the Faithfulness Gap in Textual Explanations of LLM Decisions via Attribution Guidance
por: Alon, Bar, et al.
Publicado: (2026)
por: Alon, Bar, et al.
Publicado: (2026)
C2-Faith: Benchmarking LLM Judges for Causal and Coverage Faithfulness in Chain-of-Thought Reasoning
por: Mittal, Avni, et al.
Publicado: (2026)
por: Mittal, Avni, et al.
Publicado: (2026)
LLM-grounded Video Diffusion Models
por: Lian, Long, et al.
Publicado: (2023)
por: Lian, Long, et al.
Publicado: (2023)
LLM-GLOBE: A Benchmark Evaluating the Cultural Values Embedded in LLM Output
por: Karinshak, Elise, et al.
Publicado: (2024)
por: Karinshak, Elise, et al.
Publicado: (2024)
HACK: Homomorphic Acceleration via Compression of the Key-Value Cache for Disaggregated LLM Inference
por: Zhang, Zeyu, et al.
Publicado: (2025)
por: Zhang, Zeyu, et al.
Publicado: (2025)
NLP-AKG: Few-Shot Construction of NLP Academic Knowledge Graph Based on LLM
por: Lan, Jiayin, et al.
Publicado: (2025)
por: Lan, Jiayin, et al.
Publicado: (2025)
Faithful and Robust LLM-Driven Theorem Proving for NLI Explanations
por: Quan, Xin, et al.
Publicado: (2025)
por: Quan, Xin, et al.
Publicado: (2025)
Exploring Knowledge Conflicts for Faithful LLM Reasoning: Benchmark and Method
por: Zhao, Tianzhe, et al.
Publicado: (2026)
por: Zhao, Tianzhe, et al.
Publicado: (2026)
Ejemplares similares
-
EdgeSight: Enabling Modeless and Cost-Efficient Inference at the Edge
por: Lao, ChonLam, et al.
Publicado: (2024) -
TrainMover: An Interruption-Resilient Runtime for ML Training
por: Lao, ChonLam, et al.
Publicado: (2024) -
Towards Easy and Realistic Network Infrastructure Testing for Large-scale Machine Learning
por: Yoo, Jinsun, et al.
Publicado: (2025) -
Cora: Accelerating Stateful Network Applications with SmartNICs
por: Xi, Shaoke, et al.
Publicado: (2024) -
THC: Accelerating Distributed Deep Learning Using Tensor Homomorphic Compression
por: Li, Minghao, et al.
Publicado: (2023)