Automated Factual Benchmarking for In-Car Conversational Systems using Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Giebisch, Rafael, Friedl, Ken E., Sorokin, Lev, Stocco, Andrea |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
STELLAR: A Search-Based Testing Framework for Large Language Model Applications
di: Sorokin, Lev, et al.
Pubblicazione: (2026)
di: Sorokin, Lev, et al.
Pubblicazione: (2026)
Simulator Ensembles for Trustworthy Autonomous Driving Testing
di: Sorokin, Lev, et al.
Pubblicazione: (2025)
di: Sorokin, Lev, et al.
Pubblicazione: (2025)
Benchmarking Contextual Understanding for In-Car Conversational Systems
di: Habicht, Philipp, et al.
Pubblicazione: (2025)
di: Habicht, Philipp, et al.
Pubblicazione: (2025)
Can Search-Based Testing with Pareto Optimization Effectively Cover Failure-Revealing Test Inputs?
di: Sorokin, Lev, et al.
Pubblicazione: (2024)
di: Sorokin, Lev, et al.
Pubblicazione: (2024)
Large Language Models Synergize with Automated Machine Learning
di: Xu, Jinglue, et al.
Pubblicazione: (2024)
di: Xu, Jinglue, et al.
Pubblicazione: (2024)
CODEMENV: Benchmarking Large Language Models on Code Migration
di: Cheng, Keyuan, et al.
Pubblicazione: (2025)
di: Cheng, Keyuan, et al.
Pubblicazione: (2025)
The Impact of Fine-tuning Large Language Models on Automated Program Repair
di: Macháček, Roman, et al.
Pubblicazione: (2025)
di: Macháček, Roman, et al.
Pubblicazione: (2025)
Identifying the Achilles' Heel: An Iterative Method for Dynamically Uncovering Factual Errors in Large Language Models
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
di: Wang, Wenxuan, et al.
Pubblicazione: (2024)
JavaBench: A Benchmark of Object-Oriented Code Generation for Evaluating Large Language Models
di: Cao, Jialun, et al.
Pubblicazione: (2024)
di: Cao, Jialun, et al.
Pubblicazione: (2024)
System Safety Monitoring of Learned Components Using Temporal Metric Forecasting
di: Sharifi, Sepehr, et al.
Pubblicazione: (2024)
di: Sharifi, Sepehr, et al.
Pubblicazione: (2024)
EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking
di: Wei, Anjiang, et al.
Pubblicazione: (2025)
di: Wei, Anjiang, et al.
Pubblicazione: (2025)
Large Language Models for Code Summarization
di: Szalontai, Balázs, et al.
Pubblicazione: (2024)
di: Szalontai, Balázs, et al.
Pubblicazione: (2024)
A Code Comprehension Benchmark for Large Language Models for Code
di: Havare, Jayant, et al.
Pubblicazione: (2025)
di: Havare, Jayant, et al.
Pubblicazione: (2025)
Enhancing Automated Loop Invariant Generation for Complex Programs with Large Language Models
di: Liu, Ruibang, et al.
Pubblicazione: (2024)
di: Liu, Ruibang, et al.
Pubblicazione: (2024)
Evaluating Quantized Large Language Models for Code Generation on Low-Resource Language Benchmarks
di: Nyamsuren, Enkhbold
Pubblicazione: (2024)
di: Nyamsuren, Enkhbold
Pubblicazione: (2024)
ChatDBG: Augmenting Debugging with Large Language Models
di: Levin, Kyla H., et al.
Pubblicazione: (2024)
di: Levin, Kyla H., et al.
Pubblicazione: (2024)
code_transformed: The Influence of Large Language Models on Code
di: Xu, Yuliang, et al.
Pubblicazione: (2025)
di: Xu, Yuliang, et al.
Pubblicazione: (2025)
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
di: Zheng, Jiasheng, et al.
Pubblicazione: (2024)
di: Zheng, Jiasheng, et al.
Pubblicazione: (2024)
Investigating the Efficacy of Large Language Models for Code Clone Detection
di: Khajezade, Mohamad, et al.
Pubblicazione: (2024)
di: Khajezade, Mohamad, et al.
Pubblicazione: (2024)
Applying Large Language Models API to Issue Classification Problem
di: Aracena, Gabriel, et al.
Pubblicazione: (2024)
di: Aracena, Gabriel, et al.
Pubblicazione: (2024)
MacroBench: A Novel Testbed for Web Automation Scripts via Large Language Models
di: Kim, Hyunjun, et al.
Pubblicazione: (2025)
di: Kim, Hyunjun, et al.
Pubblicazione: (2025)
Are Large Language Models Memorizing Bug Benchmarks?
di: Ramos, Daniel, et al.
Pubblicazione: (2024)
di: Ramos, Daniel, et al.
Pubblicazione: (2024)
Dynamic Benchmarking of Reasoning Capabilities in Code Large Language Models Under Data Contamination
di: Chen, Simin, et al.
Pubblicazione: (2025)
di: Chen, Simin, et al.
Pubblicazione: (2025)
LLMEffiChecker: Understanding and Testing Efficiency Degradation of Large Language Models
di: Feng, Xiaoning, et al.
Pubblicazione: (2022)
di: Feng, Xiaoning, et al.
Pubblicazione: (2022)
MCP-Solver: Integrating Language Models with Constraint Programming Systems
di: Szeider, Stefan
Pubblicazione: (2024)
di: Szeider, Stefan
Pubblicazione: (2024)
Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy
di: Dong, Yihong, et al.
Pubblicazione: (2026)
di: Dong, Yihong, et al.
Pubblicazione: (2026)
DDPT: Diffusion-Driven Prompt Tuning for Large Language Model Code Generation
di: Li, Jinyang, et al.
Pubblicazione: (2025)
di: Li, Jinyang, et al.
Pubblicazione: (2025)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
di: Guo, Jiawei, et al.
Pubblicazione: (2024)
di: Guo, Jiawei, et al.
Pubblicazione: (2024)
What can Large Language Models Capture about Code Functional Equivalence?
di: Maveli, Nickil, et al.
Pubblicazione: (2024)
di: Maveli, Nickil, et al.
Pubblicazione: (2024)
A Multi-Expert Large Language Model Architecture for Verilog Code Generation
di: Nadimi, Bardia, et al.
Pubblicazione: (2024)
di: Nadimi, Bardia, et al.
Pubblicazione: (2024)
E2Edev: Benchmarking Large Language Models in End-to-End Software Development Task
di: Liu, Jingyao, et al.
Pubblicazione: (2025)
di: Liu, Jingyao, et al.
Pubblicazione: (2025)
DocAgent: A Multi-Agent System for Automated Code Documentation Generation
di: Yang, Dayu, et al.
Pubblicazione: (2025)
di: Yang, Dayu, et al.
Pubblicazione: (2025)
Solving Data-centric Tasks using Large Language Models
di: Barke, Shraddha, et al.
Pubblicazione: (2024)
di: Barke, Shraddha, et al.
Pubblicazione: (2024)
REFLEX: Reference-Free Evaluation of Log Summarization via Large Language Model Judgment
di: Mudgal, Priyanka
Pubblicazione: (2025)
di: Mudgal, Priyanka
Pubblicazione: (2025)
CodeVisionary: An Agent-based Framework for Evaluating Large Language Models in Code Generation
di: Wang, Xinchen, et al.
Pubblicazione: (2025)
di: Wang, Xinchen, et al.
Pubblicazione: (2025)
KOCO-BENCH: Can Large Language Models Leverage Domain Knowledge in Software Development?
di: Jiang, Xue, et al.
Pubblicazione: (2026)
di: Jiang, Xue, et al.
Pubblicazione: (2026)
Can It Edit? Evaluating the Ability of Large Language Models to Follow Code Editing Instructions
di: Cassano, Federico, et al.
Pubblicazione: (2023)
di: Cassano, Federico, et al.
Pubblicazione: (2023)
BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks
di: Tu, Xinming, et al.
Pubblicazione: (2026)
di: Tu, Xinming, et al.
Pubblicazione: (2026)
SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks
di: Adamenko, Pavel, et al.
Pubblicazione: (2025)
di: Adamenko, Pavel, et al.
Pubblicazione: (2025)
Benchmarking Large Language Models for ABAP Code Generation: An Empirical Study on Iterative Improvement by Compiler Feedback
di: Wallraven, Stephan, et al.
Pubblicazione: (2026)
di: Wallraven, Stephan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
STELLAR: A Search-Based Testing Framework for Large Language Model Applications
di: Sorokin, Lev, et al.
Pubblicazione: (2026) -
Simulator Ensembles for Trustworthy Autonomous Driving Testing
di: Sorokin, Lev, et al.
Pubblicazione: (2025) -
Benchmarking Contextual Understanding for In-Car Conversational Systems
di: Habicht, Philipp, et al.
Pubblicazione: (2025) -
Can Search-Based Testing with Pareto Optimization Effectively Cover Failure-Revealing Test Inputs?
di: Sorokin, Lev, et al.
Pubblicazione: (2024) -
Large Language Models Synergize with Automated Machine Learning
di: Xu, Jinglue, et al.
Pubblicazione: (2024)