DeepTest Tool Competition 2026: Benchmarking an LLM-Based Automotive Assistant
Fuente:
arXiv
Salvato in:
| Autori principali: | Sorokin, Lev, Vasilev, Ivan, Pasini, Samuele |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Can Search-Based Testing with Pareto Optimization Effectively Cover Failure-Revealing Test Inputs?
di: Sorokin, Lev, et al.
Pubblicazione: (2024)
di: Sorokin, Lev, et al.
Pubblicazione: (2024)
Simulator Ensembles for Trustworthy Autonomous Driving Testing
di: Sorokin, Lev, et al.
Pubblicazione: (2025)
di: Sorokin, Lev, et al.
Pubblicazione: (2025)
STELLAR: A Search-Based Testing Framework for Large Language Model Applications
di: Sorokin, Lev, et al.
Pubblicazione: (2026)
di: Sorokin, Lev, et al.
Pubblicazione: (2026)
Detecting Trojaned DNNs via Spectral Regression Analysis
di: Pasini, Samuele, et al.
Pubblicazione: (2026)
di: Pasini, Samuele, et al.
Pubblicazione: (2026)
Automated Factual Benchmarking for In-Car Conversational Systems using Large Language Models
di: Giebisch, Rafael, et al.
Pubblicazione: (2025)
di: Giebisch, Rafael, et al.
Pubblicazione: (2025)
BABILong: Testing the Limits of LLMs with Long Context Reasoning-in-a-Haystack
di: Kuratov, Yuri, et al.
Pubblicazione: (2024)
di: Kuratov, Yuri, et al.
Pubblicazione: (2024)
VoiceBench: Benchmarking LLM-Based Voice Assistants
di: Chen, Yiming, et al.
Pubblicazione: (2024)
di: Chen, Yiming, et al.
Pubblicazione: (2024)
Cross-site scripting adversarial attacks based on deep reinforcement learning: Evaluation and extension study
di: Pasini, Samuele, et al.
Pubblicazione: (2025)
di: Pasini, Samuele, et al.
Pubblicazione: (2025)
LLM-Based Approach for Enhancing Maintainability of Automotive Architectures
di: Petrovic, Nenad, et al.
Pubblicazione: (2025)
di: Petrovic, Nenad, et al.
Pubblicazione: (2025)
ELABORATION: A Comprehensive Benchmark on Human-LLM Competitive Programming
di: Yang, Xinwei, et al.
Pubblicazione: (2025)
di: Yang, Xinwei, et al.
Pubblicazione: (2025)
Hallucination in LLM-Based Code Generation: An Automotive Case Study
di: Pavel, Marc, et al.
Pubblicazione: (2025)
di: Pavel, Marc, et al.
Pubblicazione: (2025)
ToolFuzz -- Automated Agent Tool Testing
di: Milev, Ivan, et al.
Pubblicazione: (2025)
di: Milev, Ivan, et al.
Pubblicazione: (2025)
Towards Specification-Driven LLM-Based Generation of Embedded Automotive Software
di: Patil, Minal Suresh, et al.
Pubblicazione: (2024)
di: Patil, Minal Suresh, et al.
Pubblicazione: (2024)
Automotive innovation landscaping using LLM
di: Gorain, Raju, et al.
Pubblicazione: (2024)
di: Gorain, Raju, et al.
Pubblicazione: (2024)
LLM-based Iterative Approach to Metamodeling in Automotive
di: Petrovic, Nenad, et al.
Pubblicazione: (2025)
di: Petrovic, Nenad, et al.
Pubblicazione: (2025)
SimuAgent: An LLM-Based Simulink Modeling Assistant Enhanced with Reinforcement Learning
di: Liang, Yanchang, et al.
Pubblicazione: (2026)
di: Liang, Yanchang, et al.
Pubblicazione: (2026)
User Misconceptions of LLM-Based Conversational Programming Assistants
di: O'Brien, Gabrielle, et al.
Pubblicazione: (2025)
di: O'Brien, Gabrielle, et al.
Pubblicazione: (2025)
BPMN Assistant: An LLM-Based Approach to Business Process Modeling
di: Licardo, Josip Tomo, et al.
Pubblicazione: (2025)
di: Licardo, Josip Tomo, et al.
Pubblicazione: (2025)
Disrupting Test Development with AI Assistants
di: Joshi, Vijay, et al.
Pubblicazione: (2024)
di: Joshi, Vijay, et al.
Pubblicazione: (2024)
Internship Report: Benchmark of Deep Learning-based Imaging PPG in Automotive Domain
di: Tu, Yuqi, et al.
Pubblicazione: (2024)
di: Tu, Yuqi, et al.
Pubblicazione: (2024)
HeroBench: A Benchmark for Long-Horizon Planning and Structured Reasoning in Virtual Worlds
di: Anokhin, Petr, et al.
Pubblicazione: (2025)
di: Anokhin, Petr, et al.
Pubblicazione: (2025)
The Base-Rate Effect on LLM Benchmark Performance: Disambiguating Test-Taking Strategies from Benchmark Performance
di: Moore, Kyle, et al.
Pubblicazione: (2024)
di: Moore, Kyle, et al.
Pubblicazione: (2024)
Benchmarking LLM Tool-Use in the Wild
di: Yu, Peijie, et al.
Pubblicazione: (2026)
di: Yu, Peijie, et al.
Pubblicazione: (2026)
Intelligent Assistants for the Semiconductor Failure Analysis with LLM-Based Planning Agents
di: Dobrovsky, Aline, et al.
Pubblicazione: (2025)
di: Dobrovsky, Aline, et al.
Pubblicazione: (2025)
DriveSafe: A Hierarchical Risk Taxonomy for Safety-Critical LLM-Based Driving Assistants
di: Kumar, Abhishek, et al.
Pubblicazione: (2026)
di: Kumar, Abhishek, et al.
Pubblicazione: (2026)
Profit is the Red Team: Stress-Testing Agents in Strategic Economic Interactions
di: Wang, Shouqiao, et al.
Pubblicazione: (2026)
di: Wang, Shouqiao, et al.
Pubblicazione: (2026)
LLM-Empowered Functional Safety and Security by Design in Automotive Systems
di: Petrovic, Nenad, et al.
Pubblicazione: (2026)
di: Petrovic, Nenad, et al.
Pubblicazione: (2026)
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
di: Long, Xiang, et al.
Pubblicazione: (2026)
di: Long, Xiang, et al.
Pubblicazione: (2026)
CI-Bench: Benchmarking Contextual Integrity of AI Assistants on Synthetic Data
di: Cheng, Zhao, et al.
Pubblicazione: (2024)
di: Cheng, Zhao, et al.
Pubblicazione: (2024)
LLM-Based Agents for Competitive Landscape Mapping in Drug Asset Due Diligence
di: Vinogradov, Vlad, et al.
Pubblicazione: (2025)
di: Vinogradov, Vlad, et al.
Pubblicazione: (2025)
AssistantX: An LLM-Powered Proactive Assistant in Collaborative Human-Populated Environment
di: Sun, Nan, et al.
Pubblicazione: (2024)
di: Sun, Nan, et al.
Pubblicazione: (2024)
Benchmark Test-Time Scaling of General LLM Agents
di: Li, Xiaochuan, et al.
Pubblicazione: (2026)
di: Li, Xiaochuan, et al.
Pubblicazione: (2026)
DeepWriter: A Fact-Grounded Multimodal Writing Assistant Based On Offline Knowledge Base
di: Mao, Song, et al.
Pubblicazione: (2025)
di: Mao, Song, et al.
Pubblicazione: (2025)
Reward Hacking Benchmark: Measuring Exploits in LLM Agents with Tool Use
di: Thaman, Kunvar
Pubblicazione: (2026)
di: Thaman, Kunvar
Pubblicazione: (2026)
AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition
di: Wang, Ruipeng, et al.
Pubblicazione: (2026)
di: Wang, Ruipeng, et al.
Pubblicazione: (2026)
Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation
di: Cui, Yi
Pubblicazione: (2025)
di: Cui, Yi
Pubblicazione: (2025)
A Large-Scale Real-World Evaluation of LLM-Based Virtual Teaching Assistant
di: Kweon, Sunjun, et al.
Pubblicazione: (2025)
di: Kweon, Sunjun, et al.
Pubblicazione: (2025)
FaMA: LLM-Empowered Agentic Assistant for Consumer-to-Consumer Marketplace
di: Yan, Yineng, et al.
Pubblicazione: (2025)
di: Yan, Yineng, et al.
Pubblicazione: (2025)
Curiosity by Design: An LLM-based Coding Assistant Asking Clarification Questions
di: Darji, Harsh, et al.
Pubblicazione: (2025)
di: Darji, Harsh, et al.
Pubblicazione: (2025)
SiriusHelper: An LLM Agent-Based Operations Assistant for Big Data Platforms
di: Shen, Yu, et al.
Pubblicazione: (2026)
di: Shen, Yu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Can Search-Based Testing with Pareto Optimization Effectively Cover Failure-Revealing Test Inputs?
di: Sorokin, Lev, et al.
Pubblicazione: (2024) -
Simulator Ensembles for Trustworthy Autonomous Driving Testing
di: Sorokin, Lev, et al.
Pubblicazione: (2025) -
STELLAR: A Search-Based Testing Framework for Large Language Model Applications
di: Sorokin, Lev, et al.
Pubblicazione: (2026) -
Detecting Trojaned DNNs via Spectral Regression Analysis
di: Pasini, Samuele, et al.
Pubblicazione: (2026) -
Automated Factual Benchmarking for In-Car Conversational Systems using Large Language Models
di: Giebisch, Rafael, et al.
Pubblicazione: (2025)