RobuNFR: Evaluating the Robustness of Large Language Models on Non-Functional Requirements Aware Code Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Lin, Feng, Kim, Dong Jae, Li, Zhenhao, Yang, Jinqiu, Tse-Hsun, Chen |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Studying and Benchmarking Large Language Models For Log Level Suggestion
by: Heng, Yi Wen, et al.
Published: (2024)
by: Heng, Yi Wen, et al.
Published: (2024)
SWE-Refactor: A Repository-Level Benchmark for Real-World LLM-Based Code Refactoring
by: Xu, Yisen, et al.
Published: (2026)
by: Xu, Yisen, et al.
Published: (2026)
SOEN-101: Code Generation by Emulating Software Process Models Using Large Language Model Agents
by: Lin, Feng, et al.
Published: (2024)
by: Lin, Feng, et al.
Published: (2024)
Evaluating Software Process Models for Multi-Agent Class-Level Code Generation
by: Shafin, Wasique Islam, et al.
Published: (2025)
by: Shafin, Wasique Islam, et al.
Published: (2025)
CFCEval: Evaluating Security Aspects in Code Generated by Large Language Models
by: Cheng, Cheng, et al.
Published: (2025)
by: Cheng, Cheng, et al.
Published: (2025)
LibreLog: Accurate and Efficient Unsupervised Log Parsing Using Open-Source Large Language Models
by: Ma, Zeyang, et al.
Published: (2024)
by: Ma, Zeyang, et al.
Published: (2024)
MANTRA: Enhancing Automated Method-Level Refactoring with Contextual RAG and Multi-Agent LLM Collaboration
by: Xu, Yisen, et al.
Published: (2025)
by: Xu, Yisen, et al.
Published: (2025)
Identifying Performance-Sensitive Configurations in Software Systems through Code Analysis with LLM Agents
by: Wang, Zehao, et al.
Published: (2024)
by: Wang, Zehao, et al.
Published: (2024)
A Multi-Language Perspective on the Robustness of LLM Code Generation
by: Rabbi, Fazle, et al.
Published: (2025)
by: Rabbi, Fazle, et al.
Published: (2025)
Crash Report Enhancement with Large Language Models: An Empirical Study
by: Fahim, S M Farah Al, et al.
Published: (2025)
by: Fahim, S M Farah Al, et al.
Published: (2025)
Empowering AIOps: Leveraging Large Language Models for IT Operations Management
by: Vitui, Arthur, et al.
Published: (2025)
by: Vitui, Arthur, et al.
Published: (2025)
LLMParser: An Exploratory Study on Using Large Language Models for Log Parsing
by: Ma, Zeyang, et al.
Published: (2024)
by: Ma, Zeyang, et al.
Published: (2024)
Towards Better Graph Neural Network-based Fault Localization Through Enhanced Code Representation
by: Rafi, Md Nakhla, et al.
Published: (2024)
by: Rafi, Md Nakhla, et al.
Published: (2024)
CODEPROMPTZIP: Code-specific Prompt Compression for Retrieval-Augmented Generation in Coding Tasks with LMs
by: He, Pengfei, et al.
Published: (2025)
by: He, Pengfei, et al.
Published: (2025)
Towards Structured, State-Aware, and Execution-Grounded Reasoning for Software Engineering Agents
by: Tse-Hsun, et al.
Published: (2026)
by: Tse-Hsun, et al.
Published: (2026)
Order Matters! An Empirical Study on Large Language Models' Input Order Bias in Software Fault Localization
by: Rafi, Md Nakhla, et al.
Published: (2024)
by: Rafi, Md Nakhla, et al.
Published: (2024)
Evaluating the Effectiveness and Efficiency of Demonstration Retrievers in RAG for Coding Tasks
by: He, Pengfei, et al.
Published: (2024)
by: He, Pengfei, et al.
Published: (2024)
A Multi-Agent Approach to Fault Localization via Graph-Based Retrieval and Reflexion
by: Rafi, Md Nakhla, et al.
Published: (2024)
by: Rafi, Md Nakhla, et al.
Published: (2024)
A Comprehensive Framework for Evaluating API-oriented Code Generation in Large Language Models
by: Wu, Yixi, et al.
Published: (2024)
by: Wu, Yixi, et al.
Published: (2024)
SBEST: Spectrum-Based Fault Localization Without Fault-Triggering Tests
by: Rafi, Md Nakhla, et al.
Published: (2024)
by: Rafi, Md Nakhla, et al.
Published: (2024)
A Survey of Code Review Benchmarks and Evaluation Practices in Pre-LLM and LLM Era
by: Khan, Taufiqul Islam, et al.
Published: (2026)
by: Khan, Taufiqul Islam, et al.
Published: (2026)
Bias Unveiled: Investigating Social Bias in LLM-Generated Code
by: Ling, Lin, et al.
Published: (2024)
by: Ling, Lin, et al.
Published: (2024)
Discovery of Timeline and Crowd Reaction of Software Vulnerability Disclosures
by: Heng, Yi Wen, et al.
Published: (2024)
by: Heng, Yi Wen, et al.
Published: (2024)
Specification-Driven Code Translation Powered by Large Language Models: How Far Are We?
by: Saha, Soumit Kanti, et al.
Published: (2024)
by: Saha, Soumit Kanti, et al.
Published: (2024)
Aligning Requirement for Large Language Model's Code Generation
by: Tian, Zhao, et al.
Published: (2025)
by: Tian, Zhao, et al.
Published: (2025)
HEJ-Robust: A Robustness Benchmark for LLM-Based Automated Program Repair
by: Rabbi, Fazle, et al.
Published: (2026)
by: Rabbi, Fazle, et al.
Published: (2026)
Tracking the Evolution of Static Code Warnings: the State-of-the-Art and a Better Approach
by: Li, Junjie, et al.
Published: (2022)
by: Li, Junjie, et al.
Published: (2022)
When LLMs Lag Behind: Knowledge Conflicts from Evolving APIs in Code Generation
by: Ashik, Ahmed Nusayer, et al.
Published: (2026)
by: Ashik, Ahmed Nusayer, et al.
Published: (2026)
SLICET5: Static Program Slicing using Language Models with Copy Mechanism and Constrained Decoding
by: He, Pengfei, et al.
Published: (2025)
by: He, Pengfei, et al.
Published: (2025)
On Rank Aggregating Test Prioritizations
by: Mondal, Shouvick, et al.
Published: (2024)
by: Mondal, Shouvick, et al.
Published: (2024)
On the Robustness Evaluation of 3D Obstacle Detection Against Specifications in Autonomous Driving
by: Pham, Tri Minh Triet, et al.
Published: (2024)
by: Pham, Tri Minh Triet, et al.
Published: (2024)
Enhancing LLM-based Fault Localization with a Functionality-Aware Retrieval-Augmented Generation Framework
by: Shi, Xinyu, et al.
Published: (2025)
by: Shi, Xinyu, et al.
Published: (2025)
CI-Repair-Bench: A Repository-Aware Benchmark for Automated Patch Validation via CI Workflows
by: Muna, Rabeya Khatun, et al.
Published: (2026)
by: Muna, Rabeya Khatun, et al.
Published: (2026)
A Benchmark Dataset And LLMs Comparison For NFR Classification With Explainable AI
by: Sakib, Esrat Ebtida, et al.
Published: (2025)
by: Sakib, Esrat Ebtida, et al.
Published: (2025)
An Exploratory Study on Fine-Tuning Large Language Models for Secure Code Generation
by: Li, Junjie, et al.
Published: (2024)
by: Li, Junjie, et al.
Published: (2024)
Toward Functional and Non-Functional Evaluation of Application-Level Code Generation
by: Pan, Ruwei, et al.
Published: (2026)
by: Pan, Ruwei, et al.
Published: (2026)
Assessing the Impact of Requirement Ambiguity on LLM-based Function-Level Code Generation
by: Yang, Di, et al.
Published: (2026)
by: Yang, Di, et al.
Published: (2026)
From Goals to Aspects, Revisited: An NFR Pattern Language for Agentic AI Systems
by: Yu, Yijun
Published: (2026)
by: Yu, Yijun
Published: (2026)
NLPerturbator: Studying the Robustness of Code LLMs to Natural Language Variations
by: Chen, Junkai, et al.
Published: (2024)
by: Chen, Junkai, et al.
Published: (2024)
COBOL-Coder: Domain-Adapted Large Language Models for COBOL Code Generation and Translation
by: Dau, Anh T. V., et al.
Published: (2026)
by: Dau, Anh T. V., et al.
Published: (2026)
Similar Items
-
Studying and Benchmarking Large Language Models For Log Level Suggestion
by: Heng, Yi Wen, et al.
Published: (2024) -
SWE-Refactor: A Repository-Level Benchmark for Real-World LLM-Based Code Refactoring
by: Xu, Yisen, et al.
Published: (2026) -
SOEN-101: Code Generation by Emulating Software Process Models Using Large Language Model Agents
by: Lin, Feng, et al.
Published: (2024) -
Evaluating Software Process Models for Multi-Agent Class-Level Code Generation
by: Shafin, Wasique Islam, et al.
Published: (2025) -
CFCEval: Evaluating Security Aspects in Code Generated by Large Language Models
by: Cheng, Cheng, et al.
Published: (2025)