Evaluating Robustness of Large Language Models in Enterprise Applications: Benchmarks for Perturbation Consistency Across Formats and Languages
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bogavelli, Tara, Bamgbose, Oluwanifemi, Melançon, Gabrielle Gauthier, Riols, Fanny, Sharma, Roshnee |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AgentArch: A Comprehensive Benchmark to Evaluate Agent Architectures in Enterprise
par: Bogavelli, Tara, et autres
Publié: (2025)
par: Bogavelli, Tara, et autres
Publié: (2025)
Improving the Robustness of Large Language Models for Code Tasks via Fine-tuning with Perturbed Data
par: Liu, Yang, et autres
Publié: (2026)
par: Liu, Yang, et autres
Publié: (2026)
EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents
par: Bogavelli, Tara, et autres
Publié: (2026)
par: Bogavelli, Tara, et autres
Publié: (2026)
Large Language Models for Spreadsheets: Benchmarking Progress and Evaluating Performance with FLARE
par: Thorne, Simon
Publié: (2025)
par: Thorne, Simon
Publié: (2025)
How Scientists Use Large Language Models to Program
par: O'Brien, Gabrielle
Publié: (2025)
par: O'Brien, Gabrielle
Publié: (2025)
A Tool for Benchmarking Large Language Models' Robustness in Assessing the Realism of Driving Scenarios
par: Wu, Jiahui, et autres
Publié: (2025)
par: Wu, Jiahui, et autres
Publié: (2025)
Assessing and Advancing Benchmarks for Evaluating Large Language Models in Software Engineering Tasks
par: Hu, Xing, et autres
Publié: (2025)
par: Hu, Xing, et autres
Publié: (2025)
Hierarchical Evaluation of Software Design Capabilities of Large Language Models of Code
par: Saad, Mootez, et autres
Publié: (2025)
par: Saad, Mootez, et autres
Publié: (2025)
Benchmarking Large Language Models for Multi-Language Software Vulnerability Detection
par: Zhang, Ting, et autres
Publié: (2025)
par: Zhang, Ting, et autres
Publié: (2025)
Cross-Task Benchmarking and Evaluation of General-Purpose and Code-Specific Large Language Models
par: Das, Gunjan, et autres
Publié: (2025)
par: Das, Gunjan, et autres
Publié: (2025)
Large Language Model Critics for Execution-Free Evaluation of Code Changes
par: Yadavally, Aashish, et autres
Publié: (2025)
par: Yadavally, Aashish, et autres
Publié: (2025)
Continuous Benchmark Generation for Evaluating Enterprise-scale LLM Agents
par: Saxena, Divyanshu, et autres
Publié: (2025)
par: Saxena, Divyanshu, et autres
Publié: (2025)
Assessing Coherency and Consistency of Code Execution Reasoning by Large Language Models
par: Liu, Changshu, et autres
Publié: (2025)
par: Liu, Changshu, et autres
Publié: (2025)
A Multi-Language Object-Oriented Programming Benchmark for Large Language Models
par: Wang, Shuai, et autres
Publié: (2025)
par: Wang, Shuai, et autres
Publié: (2025)
Output Format Biases in the Evaluation of Large Language Models for Code Translation
par: Macedo, Marcos, et autres
Publié: (2024)
par: Macedo, Marcos, et autres
Publié: (2024)
Large Language Models for Analyzing Enterprise Architecture Debt in Unstructured Documentation
par: Pagels, Christin, et autres
Publié: (2026)
par: Pagels, Christin, et autres
Publié: (2026)
Automated Test Transfer Across Android Apps Using Large Language Models
par: Beyzaei, Benyamin, et autres
Publié: (2024)
par: Beyzaei, Benyamin, et autres
Publié: (2024)
FeedbackEval: A Benchmark for Evaluating Large Language Models in Feedback-Driven Code Repair Tasks
par: Dai, Dekun, et autres
Publié: (2025)
par: Dai, Dekun, et autres
Publié: (2025)
A Real-World Benchmark for Evaluating Fine-Grained Issue Solving Capabilities of Large Language Models
par: Hu, Ruida, et autres
Publié: (2024)
par: Hu, Ruida, et autres
Publié: (2024)
ScarfBench: A Benchmark for Cross-Framework Application Migration in Enterprise Java
par: Pavuluri, Advait, et autres
Publié: (2026)
par: Pavuluri, Advait, et autres
Publié: (2026)
TESTEVAL: Benchmarking Large Language Models for Test Case Generation
par: Wang, Wenhan, et autres
Publié: (2024)
par: Wang, Wenhan, et autres
Publié: (2024)
Studying and Benchmarking Large Language Models For Log Level Suggestion
par: Heng, Yi Wen, et autres
Publié: (2024)
par: Heng, Yi Wen, et autres
Publié: (2024)
QuanBench: Benchmarking Quantum Code Generation with Large Language Models
par: Guo, Xiaoyu, et autres
Publié: (2025)
par: Guo, Xiaoyu, et autres
Publié: (2025)
On the Evaluation of Large Language Models in Unit Test Generation
par: Yang, Lin, et autres
Publié: (2024)
par: Yang, Lin, et autres
Publié: (2024)
Evaluating Generated Commit Messages with Large Language Models
par: Zeng, Qunhong, et autres
Publié: (2025)
par: Zeng, Qunhong, et autres
Publié: (2025)
On the Evaluation of Large Language Models in Multilingual Vulnerability Repair
par: wang, Dong, et autres
Publié: (2025)
par: wang, Dong, et autres
Publié: (2025)
Narrowing the Complexity Gap in the Evaluation of Large Language Models
par: Chen, Yang, et autres
Publié: (2026)
par: Chen, Yang, et autres
Publié: (2026)
Debugging with Open-Source Large Language Models: An Evaluation
par: Majdoub, Yacine, et autres
Publié: (2024)
par: Majdoub, Yacine, et autres
Publié: (2024)
Evaluating Large Language Models in Detecting Test Smells
par: Lucas, Keila, et autres
Publié: (2024)
par: Lucas, Keila, et autres
Publié: (2024)
Can Small GenAI Language Models Rival Large Language Models in Understanding Application Behavior?
par: Meymani, Mohammad, et autres
Publié: (2025)
par: Meymani, Mohammad, et autres
Publié: (2025)
AssertionBench: A Benchmark to Evaluate Large-Language Models for Assertion Generation
par: Pulavarthi, Vaishnavi, et autres
Publié: (2024)
par: Pulavarthi, Vaishnavi, et autres
Publié: (2024)
Evaluating Large Language Models for Code Translation: Effects of Prompt Language and Prompt Design
par: Aljagthami, Aamer, et autres
Publié: (2025)
par: Aljagthami, Aamer, et autres
Publié: (2025)
A Preliminary Study on the Robustness of Code Generation by Large Language Models
par: Li, Zike, et autres
Publié: (2025)
par: Li, Zike, et autres
Publié: (2025)
Adversarial Attack Classification and Robustness Testing for Large Language Models for Code
par: Liu, Yang, et autres
Publié: (2025)
par: Liu, Yang, et autres
Publié: (2025)
BinMetric: A Comprehensive Binary Analysis Benchmark for Large Language Models
par: Shang, Xiuwei, et autres
Publié: (2025)
par: Shang, Xiuwei, et autres
Publié: (2025)
SimpleDevQA: Benchmarking Large Language Models on Development Knowledge QA
par: Zhang, Jing, et autres
Publié: (2025)
par: Zhang, Jing, et autres
Publié: (2025)
A Survey of Large Language Models for Code: Evolution, Benchmarking, and Future Trends
par: Zheng, Zibin, et autres
Publié: (2023)
par: Zheng, Zibin, et autres
Publié: (2023)
MCeT: Behavioral Model Correctness Evaluation using Large Language Models
par: Ahmed, Khaled, et autres
Publié: (2025)
par: Ahmed, Khaled, et autres
Publié: (2025)
Comparative Evaluation of Large Language Models for Test-Skeleton Generation
par: Boorlagadda, Subhang, et autres
Publié: (2025)
par: Boorlagadda, Subhang, et autres
Publié: (2025)
Can Large Language Models Serve as Evaluators for Code Summarization?
par: Wu, Yang, et autres
Publié: (2024)
par: Wu, Yang, et autres
Publié: (2024)
Documents similaires
-
AgentArch: A Comprehensive Benchmark to Evaluate Agent Architectures in Enterprise
par: Bogavelli, Tara, et autres
Publié: (2025) -
Improving the Robustness of Large Language Models for Code Tasks via Fine-tuning with Perturbed Data
par: Liu, Yang, et autres
Publié: (2026) -
EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents
par: Bogavelli, Tara, et autres
Publié: (2026) -
Large Language Models for Spreadsheets: Benchmarking Progress and Evaluating Performance with FLARE
par: Thorne, Simon
Publié: (2025) -
How Scientists Use Large Language Models to Program
par: O'Brien, Gabrielle
Publié: (2025)