Why Does the LLM Stop Computing: An Empirical Study of User-Reported Failures in Open-Source LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Guangba, Wang, Zirui, Huang, Yujie, Zhong, Renyi, Zhong, Yuedong, Wang, Yilun, Lyu, Michael R. |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AI-NativeBench: An Open-Source White-Box Agentic Benchmark Suite for AI-Native Systems
par: Wang, Zirui, et autres
Publié: (2026)
par: Wang, Zirui, et autres
Publié: (2026)
L4: Diagnosing Large-scale LLM Training Failures via Automated Log Analysis
par: Jiang, Zhihan, et autres
Publié: (2025)
par: Jiang, Zhihan, et autres
Publié: (2025)
AlertGuardian: Intelligent Alert Life-Cycle Management for Large-scale Cloud Systems
par: Yu, Guangba, et autres
Publié: (2026)
par: Yu, Guangba, et autres
Publié: (2026)
A Survey on Failure Analysis and Fault Injection in AI Systems
par: Yu, Guangba, et autres
Publié: (2024)
par: Yu, Guangba, et autres
Publié: (2024)
LLM-HPC++: Evaluating LLM-Generated Modern C++ and MPI+OpenMP Codes for Scalable Mandelbrot Set Computation
par: Diehl, Patrick, et autres
Publié: (2025)
par: Diehl, Patrick, et autres
Publié: (2025)
LLM4FaaS: No-Code Application Development using LLMs and FaaS
par: Wang, Minghe, et autres
Publié: (2025)
par: Wang, Minghe, et autres
Publié: (2025)
HamilToniQ: An Open-Source Benchmark Toolkit for Quantum Computers
par: Xu, Xiaotian, et autres
Publié: (2024)
par: Xu, Xiaotian, et autres
Publié: (2024)
Hierarchical Prediction-based Management for LMaaS Systems
par: Jiang, Zhihan, et autres
Publié: (2025)
par: Jiang, Zhihan, et autres
Publié: (2025)
CSnake: Detecting Self-Sustaining Cascading Failure via Causal Stitching of Fault Propagations
par: Qian, Shangshu, et autres
Publié: (2025)
par: Qian, Shangshu, et autres
Publié: (2025)
A Framework for Effective Invocation Methods of Various LLM Services
par: Wang, Can, et autres
Publié: (2024)
par: Wang, Can, et autres
Publié: (2024)
LLOR: Automated Repair of OpenMP Programs
par: Bora, Utpal, et autres
Publié: (2024)
par: Bora, Utpal, et autres
Publié: (2024)
FSM Modeling For Off-Blockchain Computation
par: Liu, Christian Gang
Publié: (2025)
par: Liu, Christian Gang
Publié: (2025)
TraceMesh: Scalable and Streaming Sampling for Distributed Traces
par: Chen, Zhuangbin, et autres
Publié: (2024)
par: Chen, Zhuangbin, et autres
Publié: (2024)
Integrating Odeint Time Stepping into OpenFPM for Distributed and GPU Accelerated Numerical Solvers
par: Singh, Abhinav, et autres
Publié: (2023)
par: Singh, Abhinav, et autres
Publié: (2023)
gFaaS: Enabling Generic Functions in Serverless Computing
par: Chadha, Mohak, et autres
Publié: (2024)
par: Chadha, Mohak, et autres
Publié: (2024)
FlowUnits: Extending Dataflow for the Edge-to-Cloud Computing Continuum
par: Chini, Fabio, et autres
Publié: (2025)
par: Chini, Fabio, et autres
Publié: (2025)
Radon: a Programming Model and Platform for Computing Continuum Systems
par: De Martini, Luca, et autres
Publié: (2025)
par: De Martini, Luca, et autres
Publié: (2025)
A Unifying Framework to Enable Artificial Intelligence in High Performance Computing Workflows
par: Domke, Jens, et autres
Publié: (2025)
par: Domke, Jens, et autres
Publié: (2025)
Implementing Multi-GPU Scientific Computing Miniapps Across Performance Portable Frameworks
par: Villalobos, Johansell, et autres
Publié: (2025)
par: Villalobos, Johansell, et autres
Publié: (2025)
SPES: Towards Optimizing Performance-Resource Trade-Off for Serverless Functions
par: Lee, Cheryl, et autres
Publié: (2024)
par: Lee, Cheryl, et autres
Publié: (2024)
Performant Unified GPU Kernels for Portable Singular Value Computation Across Hardware and Precision
par: Ringoot, Evelyne, et autres
Publié: (2025)
par: Ringoot, Evelyne, et autres
Publié: (2025)
CodeAD: Synthesize Code of Rules for Log-based Anomaly Detection with LLMs
par: Huang, Junjie, et autres
Publié: (2025)
par: Huang, Junjie, et autres
Publié: (2025)
CLAID: Closing the Loop on AI & Data Collection -- A Cross-Platform Transparent Computing Middleware Framework for Smart Edge-Cloud and Digital Biomarker Applications
par: Langer, Patrick, et autres
Publié: (2023)
par: Langer, Patrick, et autres
Publié: (2023)
Domain Adaptation-based Edge Computing for Cross-Conditions Fault Diagnosis
par: Wang, Yanzhi, et autres
Publié: (2024)
par: Wang, Yanzhi, et autres
Publié: (2024)
GoldbachGPU: An Open Source GPU-Accelerated Framework for Verification of Goldbach's Conjecture
par: Llorente-Saguer, Isaac
Publié: (2026)
par: Llorente-Saguer, Isaac
Publié: (2026)
Optimizing OpenFaaS on Kubernetes: Comparative Analysis of Language Runtimes and Cluster Distributions
par: Ataie, Ehsan, et autres
Publié: (2026)
par: Ataie, Ehsan, et autres
Publié: (2026)
Pipelined Dense Symmetric Eigenvalue Decomposition on Multi-GPU Architectures
par: Wang, Hansheng, et autres
Publié: (2025)
par: Wang, Hansheng, et autres
Publié: (2025)
Performant Automatic BLAS Offloading on Unified Memory Architecture with OpenMP First-Touch Style Data Movement
par: Li, Junjie
Publié: (2024)
par: Li, Junjie
Publié: (2024)
Argus: Token Aware Distributed LLM Inference Optimization
par: Wu, Panlong, et autres
Publié: (2025)
par: Wu, Panlong, et autres
Publié: (2025)
Where Should I Deploy My Contracts? A Practical Experience Report
par: Lazăr, Cătălina, et autres
Publié: (2025)
par: Lazăr, Cătălina, et autres
Publié: (2025)
Collaborative Inference and Learning between Edge SLMs and Cloud LLMs: A Survey of Algorithms, Execution, and Open Challenges
par: Li, Senyao, et autres
Publié: (2025)
par: Li, Senyao, et autres
Publié: (2025)
Why Smaller Is Slower? Dimensional Misalignment in Compressed LLMs
par: Xin, Jihao, et autres
Publié: (2026)
par: Xin, Jihao, et autres
Publié: (2026)
Ten Years of Teaching Empirical Software Engineering in the context of Energy-efficient Software
par: Malavolta, Ivano, et autres
Publié: (2024)
par: Malavolta, Ivano, et autres
Publié: (2024)
LLMs as Packagers of HPC Software
par: Melone, Caetano, et autres
Publié: (2025)
par: Melone, Caetano, et autres
Publié: (2025)
SWIFT: Expedited Failure Recovery for Large-scale DNN Training
par: Zhong, Yuchen, et autres
Publié: (2023)
par: Zhong, Yuchen, et autres
Publié: (2023)
SeBS-Flow: Benchmarking Serverless Cloud Function Workflows
par: Schmid, Larissa, et autres
Publié: (2024)
par: Schmid, Larissa, et autres
Publié: (2024)
CloudHeatMap: Heatmap-Based Monitoring for Large-Scale Cloud Systems
par: Sohana, Sarah, et autres
Publié: (2024)
par: Sohana, Sarah, et autres
Publié: (2024)
$μ$OpTime: Statically Reducing the Execution Time of Microbenchmark Suites Using Stability Metrics
par: Japke, Nils, et autres
Publié: (2025)
par: Japke, Nils, et autres
Publié: (2025)
Adaptable TeaStore
par: Bliudze, Simon, et autres
Publié: (2024)
par: Bliudze, Simon, et autres
Publié: (2024)
A Test Taxonomy and Continuous Integration Ecosystem for Dynamic Resource Management in HPC
par: Sandås, Petter, et autres
Publié: (2026)
par: Sandås, Petter, et autres
Publié: (2026)
Documents similaires
-
AI-NativeBench: An Open-Source White-Box Agentic Benchmark Suite for AI-Native Systems
par: Wang, Zirui, et autres
Publié: (2026) -
L4: Diagnosing Large-scale LLM Training Failures via Automated Log Analysis
par: Jiang, Zhihan, et autres
Publié: (2025) -
AlertGuardian: Intelligent Alert Life-Cycle Management for Large-scale Cloud Systems
par: Yu, Guangba, et autres
Publié: (2026) -
A Survey on Failure Analysis and Fault Injection in AI Systems
par: Yu, Guangba, et autres
Publié: (2024) -
LLM-HPC++: Evaluating LLM-Generated Modern C++ and MPI+OpenMP Codes for Scalable Mandelbrot Set Computation
par: Diehl, Patrick, et autres
Publié: (2025)