ProbeLLM: Automating Principled Diagnosis of LLM Failures
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Yue, Jiang, Zhengzhe, Ma, Yuchen, Jiang, Yu, Wang, Xiangqi, Zhou, Yujun, Hao, Yuexing, Guo, Kehan, Chen, Pin-Yu, Feuerriegel, Stefan, Zhang, Xiangliang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLM-Based Automated Diagnosis Of Integration Test Failures At Google
por: Ziftci, Celal, et al.
Publicado: (2026)
por: Ziftci, Celal, et al.
Publicado: (2026)
Towards Automated Crowdsourced Testing via Personified-LLM
por: Yu, Shengcheng, et al.
Publicado: (2026)
por: Yu, Shengcheng, et al.
Publicado: (2026)
LLMPrism: Black-box Performance Diagnosis for Production LLM Training Platforms
por: Jiang, Zhihan, et al.
Publicado: (2025)
por: Jiang, Zhihan, et al.
Publicado: (2025)
AkiraRust: Re-thinking LLM-aided Rust Repair Using a Feedback-guided Thinking Switch
por: Jiang, Renshuang, et al.
Publicado: (2026)
por: Jiang, Renshuang, et al.
Publicado: (2026)
AutoDroid: LLM-powered Task Automation in Android
por: Wen, Hao, et al.
Publicado: (2023)
por: Wen, Hao, et al.
Publicado: (2023)
L4: Diagnosing Large-scale LLM Training Failures via Automated Log Analysis
por: Jiang, Zhihan, et al.
Publicado: (2025)
por: Jiang, Zhihan, et al.
Publicado: (2025)
DafnyPro: LLM-Assisted Automated Verification for Dafny Programs
por: Banerjee, Debangshu, et al.
Publicado: (2026)
por: Banerjee, Debangshu, et al.
Publicado: (2026)
AutoEmpirical: LLM-Based Automated Research for Empirical Software Fault Analysis
por: Yu, Jiongchi, et al.
Publicado: (2025)
por: Yu, Jiongchi, et al.
Publicado: (2025)
Leveraging LLM Agents for Automated Video Game Testing
por: Wang, Chengjia, et al.
Publicado: (2025)
por: Wang, Chengjia, et al.
Publicado: (2025)
AUCAD: Automated Construction of Alignment Dataset from Log-Related Issues for Enhancing LLM-based Log Generation
por: Zhang, Hao, et al.
Publicado: (2024)
por: Zhang, Hao, et al.
Publicado: (2024)
UVMarvel: an Automated LLM-aided UVM Machine for Subsystem-level RTL Verification
por: Ye, Junhao, et al.
Publicado: (2026)
por: Ye, Junhao, et al.
Publicado: (2026)
Wired for Reuse: Automating Context-Aware Code Adaptation in IDEs via LLM-Based Agent
por: Wang, Taiming, et al.
Publicado: (2025)
por: Wang, Taiming, et al.
Publicado: (2025)
Inducing Vulnerable Code Generation in LLM Coding Assistants
por: Zeng, Binqi, et al.
Publicado: (2025)
por: Zeng, Binqi, et al.
Publicado: (2025)
RisConFix: LLM-based Automated Repair of Risk-Prone Drone Configurations
por: Han, Liping, et al.
Publicado: (2025)
por: Han, Liping, et al.
Publicado: (2025)
LLM Agents for Automated Dependency Upgrades
por: Tawosi, Vali, et al.
Publicado: (2025)
por: Tawosi, Vali, et al.
Publicado: (2025)
MemoCoder: Automated Function Synthesis using LLM-Supported Agents
por: Jia, Yiping, et al.
Publicado: (2025)
por: Jia, Yiping, et al.
Publicado: (2025)
On the Diagnosis of Flaky Job Failures: Understanding and Prioritizing Failure Categories
por: Aïdasso, Henri, et al.
Publicado: (2025)
por: Aïdasso, Henri, et al.
Publicado: (2025)
CXXCrafter: An LLM-Based Agent for Automated C/C++ Open Source Software Building
por: Yu, Zhengmin, et al.
Publicado: (2025)
por: Yu, Zhengmin, et al.
Publicado: (2025)
Studying and Understanding the Effectiveness and Failures of Conversational LLM-Based Repair
por: Chen, Aolin, et al.
Publicado: (2025)
por: Chen, Aolin, et al.
Publicado: (2025)
Scenario-Guided LLM-based Mobile App GUI Testing
por: Yu, Shengcheng, et al.
Publicado: (2025)
por: Yu, Shengcheng, et al.
Publicado: (2025)
Failure Diagnosis in Microservice Systems: A Comprehensive Survey and Analysis
por: Zhang, Shenglin, et al.
Publicado: (2024)
por: Zhang, Shenglin, et al.
Publicado: (2024)
Exploring and Lifting the Robustness of LLM-powered Automated Program Repair with Metamorphic Testing
por: Xue, Pengyu, et al.
Publicado: (2024)
por: Xue, Pengyu, et al.
Publicado: (2024)
LELANTE: LEveraging LLM for Automated ANdroid TEsting
por: Fatin, Shamit, et al.
Publicado: (2025)
por: Fatin, Shamit, et al.
Publicado: (2025)
LogSage: An LLM-Based Framework for CI/CD Failure Detection and Remediation with Industrial Validation
por: Xu, Weiyuan, et al.
Publicado: (2025)
por: Xu, Weiyuan, et al.
Publicado: (2025)
Articulate but Wrong: Self-Review Failures in LLM-Based Code Modernization
por: Reddy, Gokul Chandra Purnachandra, et al.
Publicado: (2026)
por: Reddy, Gokul Chandra Purnachandra, et al.
Publicado: (2026)
TrajAudit: Automated Failure Diagnosis for Agentic Coding Systems
por: Wang, Minxing, et al.
Publicado: (2026)
por: Wang, Minxing, et al.
Publicado: (2026)
DebugRepair: Enhancing LLM-Based Automated Program Repair via Self-Directed Debugging
por: Wu, Linhao, et al.
Publicado: (2026)
por: Wu, Linhao, et al.
Publicado: (2026)
LUNAR: Unsupervised LLM-based Log Parsing
por: Huang, Junjie, et al.
Publicado: (2024)
por: Huang, Junjie, et al.
Publicado: (2024)
Evaluating LLM Agents on Automated Software Analysis Tasks
por: Bouzenia, Islem, et al.
Publicado: (2026)
por: Bouzenia, Islem, et al.
Publicado: (2026)
On Reasoning-Centric LLM-based Automated Theorem Proving
por: Sun, Yican, et al.
Publicado: (2026)
por: Sun, Yican, et al.
Publicado: (2026)
Assessing, Exploiting, and Mitigating Syntactic Robustness Failures in LLM-Based Code Generation
por: Sarker, Laboni, et al.
Publicado: (2024)
por: Sarker, Laboni, et al.
Publicado: (2024)
Beyond Translation Accuracy: Addressing False Failures in LLM-Based Code Translation
por: Rabbi, Fazle, et al.
Publicado: (2026)
por: Rabbi, Fazle, et al.
Publicado: (2026)
The Foundation Cracks: A Comprehensive Study on Bugs and Testing Practices in LLM Libraries
por: Jiang, Weipeng, et al.
Publicado: (2025)
por: Jiang, Weipeng, et al.
Publicado: (2025)
UICopilot: Automating UI Synthesis via Hierarchical Code Generation from Webpage Designs
por: Gui, Yi, et al.
Publicado: (2025)
por: Gui, Yi, et al.
Publicado: (2025)
Probing Privacy Leaks in LLM-based Code Generation via Test Generation
por: Ge, Yifei, et al.
Publicado: (2026)
por: Ge, Yifei, et al.
Publicado: (2026)
FailureMem: A Failure-Aware Multimodal Framework for Autonomous Software Repair
por: Ma, Ruize, et al.
Publicado: (2026)
por: Ma, Ruize, et al.
Publicado: (2026)
LLM-based Zero-shot Triple Extraction for Automated Ontology Generation from Software Engineering Standards
por: Yue, Songhui
Publicado: (2025)
por: Yue, Songhui
Publicado: (2025)
LLM-based Vulnerability Detection at Project Scale: An Empirical Study
por: Li, Fengjie, et al.
Publicado: (2026)
por: Li, Fengjie, et al.
Publicado: (2026)
GUIDE: LLM-Driven GUI Generation Decomposition for Automated Prototyping
por: Kolthoff, Kristian, et al.
Publicado: (2025)
por: Kolthoff, Kristian, et al.
Publicado: (2025)
CompileAgent: Automated Real-World Repo-Level Compilation with Tool-Integrated LLM-based Agent System
por: Hu, Li, et al.
Publicado: (2025)
por: Hu, Li, et al.
Publicado: (2025)
Ejemplares similares
-
LLM-Based Automated Diagnosis Of Integration Test Failures At Google
por: Ziftci, Celal, et al.
Publicado: (2026) -
Towards Automated Crowdsourced Testing via Personified-LLM
por: Yu, Shengcheng, et al.
Publicado: (2026) -
LLMPrism: Black-box Performance Diagnosis for Production LLM Training Platforms
por: Jiang, Zhihan, et al.
Publicado: (2025) -
AkiraRust: Re-thinking LLM-aided Rust Repair Using a Feedback-guided Thinking Switch
por: Jiang, Renshuang, et al.
Publicado: (2026) -
AutoDroid: LLM-powered Task Automation in Android
por: Wen, Hao, et al.
Publicado: (2023)