When LLMs Pass Tests but Fail the Process: A Governance Framework and Empirical Study of Multi-Agent LLM Software Development
Fuente:
Zenodo
Enregistré dans:
| Auteur principal: | Bass, Tim |
|---|---|
| Format: | Recurso digital |
| Langue: | anglais |
| Publié: |
Zenodo
2026
|
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
When LLMs Pass Tests but Fail the Process: A Governance Framework and Empirical Study of Multi-Agent LLM Software Development
par: Bass, Tim
Publié: (2026)
par: Bass, Tim
Publié: (2026)
Testing the Untestable? An Empirical Study on the Testing Process of LLM-Powered Software Systems
par: Magalhaes, Cleyton, et autres
Publié: (2025)
par: Magalhaes, Cleyton, et autres
Publié: (2025)
When Intelligence Fails: An Empirical Study on Why LLMs Struggle with Password Cracking
par: Rehman, Mohammad Abdul, et autres
Publié: (2025)
par: Rehman, Mohammad Abdul, et autres
Publié: (2025)
When Many-Shot Prompting Fails: An Empirical Study of LLM Code Translation
par: Oskooei, Amirkia Rafiei, et autres
Publié: (2025)
par: Oskooei, Amirkia Rafiei, et autres
Publié: (2025)
When Agents Fail to Act: A Diagnostic Framework for Tool Invocation Reliability in Multi-Agent LLM Systems
par: Huang, Donghao, et autres
Publié: (2026)
par: Huang, Donghao, et autres
Publié: (2026)
When Agents Fail: A Comprehensive Study of Bugs in LLM Agents with Automated Labeling
par: Islam, Niful, et autres
Publié: (2026)
par: Islam, Niful, et autres
Publié: (2026)
When Single-Agent with Skills Replace Multi-Agent Systems and When They Fail
par: Li, Xiaoxiao
Publié: (2026)
par: Li, Xiaoxiao
Publié: (2026)
The Z₂₄ Challenge: Three Hardened Pass/Fail Superconducting Tests for a Crystalline Axiverse Governance Rule
par: Diogenes
Publié: (2026)
par: Diogenes
Publié: (2026)
Beyond Pass/Fail: The Story of Learning-Based Testing
par: Rahman, Sheikh Md. Mushfiqur, et autres
Publié: (2025)
par: Rahman, Sheikh Md. Mushfiqur, et autres
Publié: (2025)
When Embedding-Based Defenses Fail: Rethinking Safety in LLM-Based Multi-Agent Systems
par: Zhang, Lingxi, et autres
Publié: (2026)
par: Zhang, Lingxi, et autres
Publié: (2026)
LLMs are Imperfect, Then What? An Empirical Study on LLM Failures in Software Engineering
par: Anonymous, Anonymous
Publié: (2024)
par: Anonymous, Anonymous
Publié: (2024)
LLMs are Imperfect, Then What? An Empirical Study on LLM Failures in Software Engineering
par: Anonymous, Anonymous
Publié: (2024)
par: Anonymous, Anonymous
Publié: (2024)
LLMs are Imperfect, Then What? An Empirical Study on LLM Failures in Software Engineering
par: Anonymous, Anonymous
Publié: (2025)
par: Anonymous, Anonymous
Publié: (2025)
When Planning Fails Despite Correct Execution: On Epistemic Calibration for LLM-Based Multi-Agent Systems
par: Wang, Zehao, et autres
Publié: (2026)
par: Wang, Zehao, et autres
Publié: (2026)
A Framework for Using LLMs for Repository Mining Studies in Empirical Software Engineering
par: de Martino, Vincenzo, et autres
Publié: (2024)
par: de Martino, Vincenzo, et autres
Publié: (2024)
When Refusals Fail: Unstable Safety Mechanisms in Long-Context LLM Agents
par: Hadeliya, Tsimur, et autres
Publié: (2025)
par: Hadeliya, Tsimur, et autres
Publié: (2025)
Why Do Multi-Agent LLM Systems Fail?
par: Cemri, Mert, et autres
Publié: (2025)
par: Cemri, Mert, et autres
Publié: (2025)
Multi-Agent LLM Committees for Autonomous Software Beta Testing
par: Karanam, Sumanth Bharadwaj Hachalli, et autres
Publié: (2025)
par: Karanam, Sumanth Bharadwaj Hachalli, et autres
Publié: (2025)
An Empirical Study of Agent Developer Practices in AI Agent Frameworks
par: Wang, Yanlin, et autres
Publié: (2025)
par: Wang, Yanlin, et autres
Publié: (2025)
Where Do AI Coding Agents Fail? An Empirical Study of Failed Agentic Pull Requests in GitHub
par: Ehsani, Ramtin, et autres
Publié: (2026)
par: Ehsani, Ramtin, et autres
Publié: (2026)
When KV Cache Reuse Fails in Multi-Agent Systems: Cross-Candidate Interaction is Crucial for LLM Judges
par: Liang, Sichu, et autres
Publié: (2026)
par: Liang, Sichu, et autres
Publié: (2026)
An Empirical Study of Bugs in Modern LLM Agent Frameworks
par: Zhu, Xinxue, et autres
Publié: (2026)
par: Zhu, Xinxue, et autres
Publié: (2026)
Replication kit for: Can LLMs Make Software Testing Greener? An Empirical Study on JUnit Test Energy Reengineering
par: Anonymous
Publié: (2025)
par: Anonymous
Publié: (2025)
M2-PALE: A Framework for Explaining Multi-Agent MCTS--Minimax Hybrids via Process Mining and LLMs
par: Qian, Yiyu, et autres
Publié: (2026)
par: Qian, Yiyu, et autres
Publié: (2026)
The Silent Scientist: When Software Research Fails to Reach Its Audience
par: Wyrich, Marvin, et autres
Publié: (2025)
par: Wyrich, Marvin, et autres
Publié: (2025)
When Rituals Fail: Rationalization, Bayesianism, and Predictive Processing
par: Ze Hong
Publié: (2025)
par: Ze Hong
Publié: (2025)
The Neimheadh Framework: Geometric Unity and Toroidal Field Interactions
par: Bass, Joseph
Publié: (2025)
par: Bass, Joseph
Publié: (2025)
An Empirical Study on the Potential of LLMs in Automated Software Refactoring
par: Liu, Bo, et autres
Publié: (2024)
par: Liu, Bo, et autres
Publié: (2024)
Can LLMs Replace Human Evaluators? An Empirical Study of LLM-as-a-Judge in Software Engineering
par: Wang, Ruiqi, et autres
Publié: (2025)
par: Wang, Ruiqi, et autres
Publié: (2025)
A Methodological Analysis of Empirical Studies in Quantum Software Testing
par: Li, Yuechen, et autres
Publié: (2026)
par: Li, Yuechen, et autres
Publié: (2026)
Optimizing LLM-Based Multi-Agent System with Textual Feedback: A Case Study on Software Development
par: Shen, Ming, et autres
Publié: (2025)
par: Shen, Ming, et autres
Publié: (2025)
When Thinking Fails: The Pitfalls of Reasoning for Instruction-Following in LLMs
par: Li, Xiaomin, et autres
Publié: (2025)
par: Li, Xiaomin, et autres
Publié: (2025)
When Reasoning Fails: Evaluating 'Thinking' LLMs for Stock Prediction
par: Sodha, Rakeshkumar H
Publié: (2025)
par: Sodha, Rakeshkumar H
Publié: (2025)
Lost in Transmission: When and Why LLMs Fail to Reason Globally
par: Schnabel, Tobias, et autres
Publié: (2025)
par: Schnabel, Tobias, et autres
Publié: (2025)
Evaluating Large Language Models with Tests of Spanish as a Foreign Language: Pass or Fail?
par: Mayor-Rocher, Marina, et autres
Publié: (2024)
par: Mayor-Rocher, Marina, et autres
Publié: (2024)
When Explanations Lie: Why Many Modified BP Attributions Fail
par: Sixt, Leon, et autres
Publié: (2019)
par: Sixt, Leon, et autres
Publié: (2019)
When Data Protection Fails to Protect: Law, Power, and Postcolonial Governance in Bangladesh
par: Saha, Pratyasha, et autres
Publié: (2026)
par: Saha, Pratyasha, et autres
Publié: (2026)
Learning When to Plan: Efficiently Allocating Test-Time Compute for LLM Agents
par: Paglieri, Davide, et autres
Publié: (2025)
par: Paglieri, Davide, et autres
Publié: (2025)
A replication package for " An Empirical Study of Bugs in LLM-based Agent Frameworks"
par: Batole, Fraol
Publié: (2026)
par: Batole, Fraol
Publié: (2026)
When Identity Overrides Incentives: Representational Choices as Governance Decisions in Multi-Agent LLM Systems
par: Manoranjan, Viswonathan, et autres
Publié: (2026)
par: Manoranjan, Viswonathan, et autres
Publié: (2026)
Documents similaires
-
When LLMs Pass Tests but Fail the Process: A Governance Framework and Empirical Study of Multi-Agent LLM Software Development
par: Bass, Tim
Publié: (2026) -
Testing the Untestable? An Empirical Study on the Testing Process of LLM-Powered Software Systems
par: Magalhaes, Cleyton, et autres
Publié: (2025) -
When Intelligence Fails: An Empirical Study on Why LLMs Struggle with Password Cracking
par: Rehman, Mohammad Abdul, et autres
Publié: (2025) -
When Many-Shot Prompting Fails: An Empirical Study of LLM Code Translation
par: Oskooei, Amirkia Rafiei, et autres
Publié: (2025) -
When Agents Fail to Act: A Diagnostic Framework for Tool Invocation Reliability in Multi-Agent LLM Systems
par: Huang, Donghao, et autres
Publié: (2026)