Automated Benchmark Auditing for AI Agents and Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Junlin, Bianchi, Federico, Zhu, Shang, Nie, Fan, Kwon, Yongchan, Dhingra, Bhuwan, Zou, James |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Raccoon: Prompt Extraction Benchmark of LLM-Integrated Applications
di: Wang, Junlin, et al.
Pubblicazione: (2024)
di: Wang, Junlin, et al.
Pubblicazione: (2024)
To Err Is Human: Systematic Quantification of Errors in Published AI Papers via LLM Analysis
di: Bianchi, Federico, et al.
Pubblicazione: (2025)
di: Bianchi, Federico, et al.
Pubblicazione: (2025)
ChatShop: Interactive Information Seeking with Language Agents
di: Chen, Sanxing, et al.
Pubblicazione: (2024)
di: Chen, Sanxing, et al.
Pubblicazione: (2024)
Improving Model Alignment Through Collective Intelligence of Open-Source LLMS
di: Wang, Junlin, et al.
Pubblicazione: (2025)
di: Wang, Junlin, et al.
Pubblicazione: (2025)
Adversarial Math Word Problem Generation
di: Xie, Roy, et al.
Pubblicazione: (2024)
di: Xie, Roy, et al.
Pubblicazione: (2024)
Atomic Consistency Preference Optimization for Long-Form Question Answering
di: Chen, Jingfeng, et al.
Pubblicazione: (2025)
di: Chen, Jingfeng, et al.
Pubblicazione: (2025)
To Trust or Not to Trust? Enhancing Large Language Models' Situated Faithfulness to External Contexts
di: Huang, Yukun, et al.
Pubblicazione: (2024)
di: Huang, Yukun, et al.
Pubblicazione: (2024)
GenEOL: Harnessing the Generative Power of LLMs for Training-Free Sentence Embeddings
di: Thirukovalluru, Raghuveer, et al.
Pubblicazione: (2024)
di: Thirukovalluru, Raghuveer, et al.
Pubblicazione: (2024)
Large Language Models are Vulnerable to Bait-and-Switch Attacks for Generating Harmful Content
di: Bianchi, Federico, et al.
Pubblicazione: (2024)
di: Bianchi, Federico, et al.
Pubblicazione: (2024)
Mixture-of-Agents Enhances Large Language Model Capabilities
di: Wang, Junlin, et al.
Pubblicazione: (2024)
di: Wang, Junlin, et al.
Pubblicazione: (2024)
Calibrating Long-form Generations from Large Language Models
di: Huang, Yukun, et al.
Pubblicazione: (2024)
di: Huang, Yukun, et al.
Pubblicazione: (2024)
Vision2Code: A Multi-Domain Benchmark for Evaluating Image-to-Code Generation
di: Periasami, Ajay Vikram, et al.
Pubblicazione: (2026)
di: Periasami, Ajay Vikram, et al.
Pubblicazione: (2026)
Coding Agents are Effective Long-Context Processors
di: Cao, Weili, et al.
Pubblicazione: (2026)
di: Cao, Weili, et al.
Pubblicazione: (2026)
Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models
di: Huang, Yukun, et al.
Pubblicazione: (2025)
di: Huang, Yukun, et al.
Pubblicazione: (2025)
Atomic Self-Consistency for Better Long Form Generations
di: Thirukovalluru, Raghuveer, et al.
Pubblicazione: (2024)
di: Thirukovalluru, Raghuveer, et al.
Pubblicazione: (2024)
ReasonIF: Large Reasoning Models Fail to Follow Instructions During Reasoning
di: Kwon, Yongchan, et al.
Pubblicazione: (2025)
di: Kwon, Yongchan, et al.
Pubblicazione: (2025)
DSGym: A Holistic Framework for Evaluating and Training Data Science Agents
di: Nie, Fan, et al.
Pubblicazione: (2026)
di: Nie, Fan, et al.
Pubblicazione: (2026)
Interleaved Reasoning for Large Language Models via Reinforcement Learning
di: Xie, Roy, et al.
Pubblicazione: (2025)
di: Xie, Roy, et al.
Pubblicazione: (2025)
Knowing When to Stop: Efficient Context Processing via Latent Sufficiency Signals
di: Xie, Roy, et al.
Pubblicazione: (2025)
di: Xie, Roy, et al.
Pubblicazione: (2025)
RVPO: Risk-Sensitive Alignment via Variance Regularization
di: Montero, Ivan, et al.
Pubblicazione: (2026)
di: Montero, Ivan, et al.
Pubblicazione: (2026)
Real-time Factuality Assessment from Adversarial Feedback
di: Chen, Sanxing, et al.
Pubblicazione: (2024)
di: Chen, Sanxing, et al.
Pubblicazione: (2024)
Hierarchical Multi-Label Classification of Online Vaccine Concerns
di: Zhu, Chloe Qinyu, et al.
Pubblicazione: (2024)
di: Zhu, Chloe Qinyu, et al.
Pubblicazione: (2024)
Extracting Polymer Nanocomposite Samples from Full-Length Documents
di: Khalighinejad, Ghazal, et al.
Pubblicazione: (2024)
di: Khalighinejad, Ghazal, et al.
Pubblicazione: (2024)
IsoBench: Benchmarking Multimodal Foundation Models on Isomorphic Representations
di: Fu, Deqing, et al.
Pubblicazione: (2024)
di: Fu, Deqing, et al.
Pubblicazione: (2024)
Evaluating Morphological Compositional Generalization in Large Language Models
di: Ismayilzada, Mete, et al.
Pubblicazione: (2024)
di: Ismayilzada, Mete, et al.
Pubblicazione: (2024)
ReCaLL: Membership Inference via Relative Conditional Log-Likelihoods
di: Xie, Roy, et al.
Pubblicazione: (2024)
di: Xie, Roy, et al.
Pubblicazione: (2024)
A Platform for Investigating Public Health Content with Efficient Concern Classification
di: Li, Christopher, et al.
Pubblicazione: (2025)
di: Li, Christopher, et al.
Pubblicazione: (2025)
InData: Towards Secure Multi-Step, Tool-Based Data Analysis
di: K, Karthikeyan, et al.
Pubblicazione: (2025)
di: K, Karthikeyan, et al.
Pubblicazione: (2025)
BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks
di: Tu, Xinming, et al.
Pubblicazione: (2026)
di: Tu, Xinming, et al.
Pubblicazione: (2026)
Document-as-Image Representations Fall Short for Scientific Retrieval
di: Khalighinejad, Ghazal, et al.
Pubblicazione: (2026)
di: Khalighinejad, Ghazal, et al.
Pubblicazione: (2026)
Safety-Tuned LLaMAs: Lessons From Improving the Safety of Large Language Models that Follow Instructions
di: Bianchi, Federico, et al.
Pubblicazione: (2023)
di: Bianchi, Federico, et al.
Pubblicazione: (2023)
OfficeBench: Benchmarking Language Agents across Multiple Applications for Office Automation
di: Wang, Zilong, et al.
Pubblicazione: (2024)
di: Wang, Zilong, et al.
Pubblicazione: (2024)
AuditWen:An Open-Source Large Language Model for Audit
di: Huang, Jiajia, et al.
Pubblicazione: (2024)
di: Huang, Jiajia, et al.
Pubblicazione: (2024)
Benchmarking Linguistic Diversity of Large Language Models
di: Guo, Yanzhu, et al.
Pubblicazione: (2024)
di: Guo, Yanzhu, et al.
Pubblicazione: (2024)
When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training
di: Chen, Sanxing, et al.
Pubblicazione: (2025)
di: Chen, Sanxing, et al.
Pubblicazione: (2025)
Enhancing Automatic Term Extraction with Large Language Models via Syntactic Retrieval
di: Chun, Yongchan, et al.
Pubblicazione: (2025)
di: Chun, Yongchan, et al.
Pubblicazione: (2025)
Benchmarking Gaslighting Attacks Against Speech Large Language Models
di: Wu, Jinyang, et al.
Pubblicazione: (2025)
di: Wu, Jinyang, et al.
Pubblicazione: (2025)
"Sorry, I Didn't Catch That": How Speech Models Miss What Matters Most
di: Zhou, Kaitlyn, et al.
Pubblicazione: (2026)
di: Zhou, Kaitlyn, et al.
Pubblicazione: (2026)
ReliableMath: Benchmark of Reliable Mathematical Reasoning on Large Language Models
di: Xue, Boyang, et al.
Pubblicazione: (2025)
di: Xue, Boyang, et al.
Pubblicazione: (2025)
Towards Automated Regulatory Compliance Verification in Financial Auditing with Large Language Models
di: Berger, Armin, et al.
Pubblicazione: (2025)
di: Berger, Armin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Raccoon: Prompt Extraction Benchmark of LLM-Integrated Applications
di: Wang, Junlin, et al.
Pubblicazione: (2024) -
To Err Is Human: Systematic Quantification of Errors in Published AI Papers via LLM Analysis
di: Bianchi, Federico, et al.
Pubblicazione: (2025) -
ChatShop: Interactive Information Seeking with Language Agents
di: Chen, Sanxing, et al.
Pubblicazione: (2024) -
Improving Model Alignment Through Collective Intelligence of Open-Source LLMS
di: Wang, Junlin, et al.
Pubblicazione: (2025) -
Adversarial Math Word Problem Generation
di: Xie, Roy, et al.
Pubblicazione: (2024)