The RealHumanEval: Evaluating Large Language Models' Abilities to Support Programmers
Fuente:
arXiv
Guardado en:
| Autores principales: | Mozannar, Hussein, Chen, Valerie, Alsobay, Mohammed, Das, Subhro, Zhao, Sebastian, Wei, Dennis, Nagireddy, Manish, Sattigeri, Prasanna, Talwalkar, Ameet, Sontag, David |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Need Help? Designing Proactive AI Assistants for Programming
por: Chen, Valerie, et al.
Publicado: (2024)
por: Chen, Valerie, et al.
Publicado: (2024)
CodingGenie: A Proactive LLM-Powered Programming Assistant
por: Zhao, Sebastian, et al.
Publicado: (2025)
por: Zhao, Sebastian, et al.
Publicado: (2025)
When to Show a Suggestion? Integrating Human Feedback in AI-Assisted Programming
por: Mozannar, Hussein, et al.
Publicado: (2023)
por: Mozannar, Hussein, et al.
Publicado: (2023)
Reading Between the Lines: Modeling User Behavior and Costs in AI-Assisted Programming
por: Mozannar, Hussein, et al.
Publicado: (2022)
por: Mozannar, Hussein, et al.
Publicado: (2022)
Language Models in Dialogue: Conversational Maxims for Human-AI Interactions
por: Miehling, Erik, et al.
Publicado: (2024)
por: Miehling, Erik, et al.
Publicado: (2024)
Code with Me or for Me? How Increasing AI Automation Transforms Developer Workflows
por: Chen, Valerie, et al.
Publicado: (2025)
por: Chen, Valerie, et al.
Publicado: (2025)
Why Do Decision Makers (Not) Use AI? A Cross-Domain Analysis of Factors Impacting AI Adoption
por: Yu, Rebecca, et al.
Publicado: (2025)
por: Yu, Rebecca, et al.
Publicado: (2025)
EDIT-Bench: Evaluating LLM Abilities to Perform Real-World Instructed Code Edits
por: Chi, Wayne, et al.
Publicado: (2025)
por: Chi, Wayne, et al.
Publicado: (2025)
Beyond the Commit: Developer Perspectives on Productivity with AI Coding Assistants
por: Chen, Valerie, et al.
Publicado: (2026)
por: Chen, Valerie, et al.
Publicado: (2026)
CentaurEval: Benchmarking Human-in-the-Loop Value in Agentic Coding
por: Luo, Hanjun, et al.
Publicado: (2025)
por: Luo, Hanjun, et al.
Publicado: (2025)
When Benchmarks Talk: Re-Evaluating Code LLMs with Interactive Feedback
por: Pan, Jane, et al.
Publicado: (2025)
por: Pan, Jane, et al.
Publicado: (2025)
Closing the Gap in High-Risk Pregnancy Care Using Machine Learning and Human-AI Collaboration
por: Mozannar, Hussein, et al.
Publicado: (2023)
por: Mozannar, Hussein, et al.
Publicado: (2023)
Learning Personalized Decision Support Policies
por: Bhatt, Umang, et al.
Publicado: (2023)
por: Bhatt, Umang, et al.
Publicado: (2023)
Evolution of Programmers' Trust in Generative AI Programming Assistants
por: Shah, Anshul, et al.
Publicado: (2025)
por: Shah, Anshul, et al.
Publicado: (2025)
Do Large Language Models Pay Similar Attention Like Human Programmers When Generating Code?
por: Kou, Bonan, et al.
Publicado: (2023)
por: Kou, Bonan, et al.
Publicado: (2023)
When in Doubt, Cascade: Towards Building Efficient and Capable Guardrails
por: Nagireddy, Manish, et al.
Publicado: (2024)
por: Nagireddy, Manish, et al.
Publicado: (2024)
Where Does My Model Underperform? A Human Evaluation of Slice Discovery Algorithms
por: Johnson, Nari, et al.
Publicado: (2023)
por: Johnson, Nari, et al.
Publicado: (2023)
Evaluating Citizen Satisfaction with Saudi Arabia's E-Government Services: A Standards-Based, Theory-Informed Approach
por: Alannsary, Mohammed O.
Publicado: (2025)
por: Alannsary, Mohammed O.
Publicado: (2025)
"Always Nice and Confident, Sometimes Wrong": Developer's Experiences Engaging Large Language Models (LLMs) Versus Human-Powered Q&A Platforms for Coding Support
por: Li, Jiachen, et al.
Publicado: (2023)
por: Li, Jiachen, et al.
Publicado: (2023)
Navigating Rifts in Human-LLM Grounding: Study and Benchmark
por: Shaikh, Omar, et al.
Publicado: (2025)
por: Shaikh, Omar, et al.
Publicado: (2025)
Developer Interaction Patterns with Proactive AI: A Five-Day Field Study
por: Kuo, Nadine, et al.
Publicado: (2026)
por: Kuo, Nadine, et al.
Publicado: (2026)
Investigating Multimodal Large Language Models to Support Usability Evaluation
por: Lubos, Sebastian, et al.
Publicado: (2025)
por: Lubos, Sebastian, et al.
Publicado: (2025)
LightSC: The Making of a Usable Security Classification Tool for DevSecOps
por: Shrestha, Manish, et al.
Publicado: (2024)
por: Shrestha, Manish, et al.
Publicado: (2024)
Enhancing Code LLM Training with Programmer Attention
por: Zhang, Yifan, et al.
Publicado: (2025)
por: Zhang, Yifan, et al.
Publicado: (2025)
Investigating Conversational Agents to Support Secondary School Students Learning CSP
por: Frazier, Matthew, et al.
Publicado: (2026)
por: Frazier, Matthew, et al.
Publicado: (2026)
Large Language Models as Visualization Agents for Immersive Binary Reverse Engineering
por: Brown, Dennis, et al.
Publicado: (2025)
por: Brown, Dennis, et al.
Publicado: (2025)
Task-Based Role-Playing VR Game for Supporting Intellectual Disability Therapies
por: Chen, Wen-Chun, et al.
Publicado: (2024)
por: Chen, Wen-Chun, et al.
Publicado: (2024)
SPARK: Real-Time Monitoring of Multi-Faceted Programming Exercises
por: Yang, Yinuo, et al.
Publicado: (2026)
por: Yang, Yinuo, et al.
Publicado: (2026)
AI Where It Matters: Where, Why, and How Developers Want AI Support in Daily Work
por: Choudhuri, Rudrajit, et al.
Publicado: (2025)
por: Choudhuri, Rudrajit, et al.
Publicado: (2025)
System-driven Cloud Architecture Design Support with Structured State Management and Guided Decision Assistance
por: Kohita, Ryosuke, et al.
Publicado: (2025)
por: Kohita, Ryosuke, et al.
Publicado: (2025)
GazeCopilot: Evaluating Novel Gaze-Informed Prompting for AI-Supported Code Comprehension and Readability
por: Elfares, Yasmine, et al.
Publicado: (2025)
por: Elfares, Yasmine, et al.
Publicado: (2025)
Evaluating the Quality of Code Comments Generated by Large Language Models for Novice Programmers
por: Fan, Aysa Xuemo, et al.
Publicado: (2024)
por: Fan, Aysa Xuemo, et al.
Publicado: (2024)
A Graph-based Approach to Human Activity Recognition
por: Peroutka, Thomas, et al.
Publicado: (2024)
por: Peroutka, Thomas, et al.
Publicado: (2024)
Human Side of Smart Contract Fuzzing: An Empirical Study
por: Qiao, Guanming, et al.
Publicado: (2025)
por: Qiao, Guanming, et al.
Publicado: (2025)
System-driven Interactive Design Support for Cloud Architecture: A Qualitative User Experience Study with Novice Engineers
por: Kohita, Ryosuke, et al.
Publicado: (2025)
por: Kohita, Ryosuke, et al.
Publicado: (2025)
Human in the Loop for Fuzz Testing: Literature Review and the Road Ahead
por: Yu, Jiongchi, et al.
Publicado: (2026)
por: Yu, Jiongchi, et al.
Publicado: (2026)
Accodemy: AI Powered Code Learning Platform to Assist Novice Programmers in Overcoming the Fear of Coding
por: Aamina, M. A. F., et al.
Publicado: (2025)
por: Aamina, M. A. F., et al.
Publicado: (2025)
Reassessing Java Code Readability Models with a Human-Centered Approach
por: Sergeyuk, Agnia, et al.
Publicado: (2024)
por: Sergeyuk, Agnia, et al.
Publicado: (2024)
In-IDE Human-AI Experience in the Era of Large Language Models; A Literature Review
por: Sergeyuk, Agnia, et al.
Publicado: (2024)
por: Sergeyuk, Agnia, et al.
Publicado: (2024)
Understanding the Human-LLM Dynamic: A Literature Survey of LLM Use in Programming Tasks
por: Etsenake, Deborah, et al.
Publicado: (2024)
por: Etsenake, Deborah, et al.
Publicado: (2024)
Ejemplares similares
-
Need Help? Designing Proactive AI Assistants for Programming
por: Chen, Valerie, et al.
Publicado: (2024) -
CodingGenie: A Proactive LLM-Powered Programming Assistant
por: Zhao, Sebastian, et al.
Publicado: (2025) -
When to Show a Suggestion? Integrating Human Feedback in AI-Assisted Programming
por: Mozannar, Hussein, et al.
Publicado: (2023) -
Reading Between the Lines: Modeling User Behavior and Costs in AI-Assisted Programming
por: Mozannar, Hussein, et al.
Publicado: (2022) -
Language Models in Dialogue: Conversational Maxims for Human-AI Interactions
por: Miehling, Erik, et al.
Publicado: (2024)