Towards Evaluation Guidelines for Empirical Studies involving LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Wagner, Stefan, Barón, Marvin Muñoz, Falessi, Davide, Baltes, Sebastian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Guidelines for Empirical Studies in Software Engineering involving Large Language Models
di: Baltes, Sebastian, et al.
Pubblicazione: (2025)
di: Baltes, Sebastian, et al.
Pubblicazione: (2025)
Taming Timeout Flakiness: An Empirical Study of SAP HANA
di: Berndt, Alexander, et al.
Pubblicazione: (2024)
di: Berndt, Alexander, et al.
Pubblicazione: (2024)
Do Test and Environmental Complexity Increase Flakiness? An Empirical Study of SAP HANA
di: Berndt, Alexander, et al.
Pubblicazione: (2024)
di: Berndt, Alexander, et al.
Pubblicazione: (2024)
Characterizing Requirements Smells
di: Gentili, Emanuele, et al.
Pubblicazione: (2024)
di: Gentili, Emanuele, et al.
Pubblicazione: (2024)
Flaky Tests in a Large Industrial Database Management System: An Empirical Study of Fixed Issue Reports for SAP HANA
di: Berndt, Alexander, et al.
Pubblicazione: (2026)
di: Berndt, Alexander, et al.
Pubblicazione: (2026)
Apples, Oranges, and Software Engineering: Study Selection Challenges for Secondary Research on Latent Variables
di: Wyrich, Marvin, et al.
Pubblicazione: (2024)
di: Wyrich, Marvin, et al.
Pubblicazione: (2024)
The Silent Scientist: When Software Research Fails to Reach Its Audience
di: Wyrich, Marvin, et al.
Pubblicazione: (2025)
di: Wyrich, Marvin, et al.
Pubblicazione: (2025)
Information-Theoretic Detection of Unusual Source Code Changes
di: Torres, Adriano, et al.
Pubblicazione: (2025)
di: Torres, Adriano, et al.
Pubblicazione: (2025)
Anticipating Bugs: Ticket-Level Bug Prediction and Temporal Proximity Effects
di: La Prova, Daniele, et al.
Pubblicazione: (2025)
di: La Prova, Daniele, et al.
Pubblicazione: (2025)
Teaching Literature Reviewing for Software Engineering Research
di: Baltes, Sebastian, et al.
Pubblicazione: (2024)
di: Baltes, Sebastian, et al.
Pubblicazione: (2024)
UX Debt: Developers Borrow While Users Pay
di: Baltes, Sebastian, et al.
Pubblicazione: (2021)
di: Baltes, Sebastian, et al.
Pubblicazione: (2021)
A Multifaceted View on Discrimination in Software Development Careers
di: Chakraborty, Shalini, et al.
Pubblicazione: (2025)
di: Chakraborty, Shalini, et al.
Pubblicazione: (2025)
Lost in Transition: The Struggle of Women Returning to Software Engineering Research after Career Breaks
di: Chakraborty, Shalini, et al.
Pubblicazione: (2025)
di: Chakraborty, Shalini, et al.
Pubblicazione: (2025)
Ethics of Care for Software Engineering
di: Serebrenik, Alexander, et al.
Pubblicazione: (2026)
di: Serebrenik, Alexander, et al.
Pubblicazione: (2026)
Can We Classify Flaky Tests Using Only Test Code? An LLM-Based Empirical Study
di: Berndt, Alexander, et al.
Pubblicazione: (2026)
di: Berndt, Alexander, et al.
Pubblicazione: (2026)
AI Slop and the Software Commons
di: Baltes, Sebastian, et al.
Pubblicazione: (2026)
di: Baltes, Sebastian, et al.
Pubblicazione: (2026)
How Does Cognitive Capability and Personality Influence Problem Solving in Coding Interview Puzzles?
di: Hidellaarachchi, Dulaji, et al.
Pubblicazione: (2025)
di: Hidellaarachchi, Dulaji, et al.
Pubblicazione: (2025)
"An Endless Stream of AI Slop": The Growing Burden of AI-Assisted Software Development
di: Baltes, Sebastian, et al.
Pubblicazione: (2026)
di: Baltes, Sebastian, et al.
Pubblicazione: (2026)
An Extensive Comparison of Static Application Security Testing Tools
di: Esposito, Matteo, et al.
Pubblicazione: (2024)
di: Esposito, Matteo, et al.
Pubblicazione: (2024)
The Influence of Code Comments on the Perceived Helpfulness of Stack Overflow Posts
di: Figl, Kathrin, et al.
Pubblicazione: (2025)
di: Figl, Kathrin, et al.
Pubblicazione: (2025)
Context Engineering for AI Agents in Open-Source Software
di: Mohsenimofidi, Seyedmoein, et al.
Pubblicazione: (2025)
di: Mohsenimofidi, Seyedmoein, et al.
Pubblicazione: (2025)
Evaluating LLMs Effectiveness in Detecting and Correcting Test Smells: An Empirical Study
di: Santana Jr, E. G., et al.
Pubblicazione: (2025)
di: Santana Jr, E. G., et al.
Pubblicazione: (2025)
40 Years of Designing Code Comprehension Experiments: A Systematic Mapping Study
di: Wyrich, Marvin, et al.
Pubblicazione: (2022)
di: Wyrich, Marvin, et al.
Pubblicazione: (2022)
Operationalizing Ethics for AI Agents: How Developers Encode Values into Repository Context Files
di: Treude, Christoph, et al.
Pubblicazione: (2026)
di: Treude, Christoph, et al.
Pubblicazione: (2026)
Software Engineering Podcasts: An Empirical Study of Their Potential as a Research Resource
di: Wyrich, Marvin, et al.
Pubblicazione: (2026)
di: Wyrich, Marvin, et al.
Pubblicazione: (2026)
Configuring Agentic AI Coding Tools: An Exploratory Study
di: Galster, Matthias, et al.
Pubblicazione: (2026)
di: Galster, Matthias, et al.
Pubblicazione: (2026)
On the Flakiness of LLM-Generated Tests for Industrial and Open-Source Database Management Systems
di: Berndt, Alexander, et al.
Pubblicazione: (2026)
di: Berndt, Alexander, et al.
Pubblicazione: (2026)
An Empirical Study of Perceptions of General LLMs and Multimodal LLMs on Hugging Face
di: Liu, Yujian, et al.
Pubblicazione: (2026)
di: Liu, Yujian, et al.
Pubblicazione: (2026)
Political and Ideological Pressure in Software Engineering Research: The Case of DEI Backlash
di: Hyrynsalmi, Sonja M., et al.
Pubblicazione: (2026)
di: Hyrynsalmi, Sonja M., et al.
Pubblicazione: (2026)
Not real or too soft? On the challenges of publishing interdisciplinary software engineering research
di: Hyrynsalmi, Sonja M., et al.
Pubblicazione: (2025)
di: Hyrynsalmi, Sonja M., et al.
Pubblicazione: (2025)
An Empirical Study on the Potential of LLMs in Automated Software Refactoring
di: Liu, Bo, et al.
Pubblicazione: (2024)
di: Liu, Bo, et al.
Pubblicazione: (2024)
An Empirical Study on the Capability of LLMs in Decomposing Bug Reports
di: Chen, Zhiyuan, et al.
Pubblicazione: (2025)
di: Chen, Zhiyuan, et al.
Pubblicazione: (2025)
On the Need to Rethink Trust in AI Assistants for Software Development: A Critical Review
di: Baltes, Sebastian, et al.
Pubblicazione: (2025)
di: Baltes, Sebastian, et al.
Pubblicazione: (2025)
LLMs are Bug Replicators: An Empirical Study on LLMs' Capability in Completing Bug-prone Code
di: Guo, Liwei, et al.
Pubblicazione: (2025)
di: Guo, Liwei, et al.
Pubblicazione: (2025)
Fault Localisation and Repair for DL Systems: An Empirical Study with LLMs
di: Kim, Jinhan, et al.
Pubblicazione: (2025)
di: Kim, Jinhan, et al.
Pubblicazione: (2025)
Exploring the Effectiveness of LLMs in Automated Logging Generation: An Empirical Study
di: Li, Yichen, et al.
Pubblicazione: (2023)
di: Li, Yichen, et al.
Pubblicazione: (2023)
$Classi|Q\rangle$ Towards a Translation Framework To Bridge The Classical-Quantum Programming Gap
di: Esposito, Matteo, et al.
Pubblicazione: (2024)
di: Esposito, Matteo, et al.
Pubblicazione: (2024)
Policy-driven Software Bill of Materials on GitHub: An Empirical Study
di: Novikov, Oleksii, et al.
Pubblicazione: (2025)
di: Novikov, Oleksii, et al.
Pubblicazione: (2025)
Guidelines to Prompt Large Language Models for Code Generation: An Empirical Characterization
di: Midolo, Alessandro, et al.
Pubblicazione: (2026)
di: Midolo, Alessandro, et al.
Pubblicazione: (2026)
Harnessing Hype to Teach Empirical Thinking: An Experience With AI Coding Assistants
di: Wyrich, Marvin, et al.
Pubblicazione: (2026)
di: Wyrich, Marvin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Guidelines for Empirical Studies in Software Engineering involving Large Language Models
di: Baltes, Sebastian, et al.
Pubblicazione: (2025) -
Taming Timeout Flakiness: An Empirical Study of SAP HANA
di: Berndt, Alexander, et al.
Pubblicazione: (2024) -
Do Test and Environmental Complexity Increase Flakiness? An Empirical Study of SAP HANA
di: Berndt, Alexander, et al.
Pubblicazione: (2024) -
Characterizing Requirements Smells
di: Gentili, Emanuele, et al.
Pubblicazione: (2024) -
Flaky Tests in a Large Industrial Database Management System: An Empirical Study of Fixed Issue Reports for SAP HANA
di: Berndt, Alexander, et al.
Pubblicazione: (2026)