A Novel Metric for Measuring the Robustness of Large Language Models in Non-adversarial Scenarios
Fuente:
arXiv
Saved in:
| Main Authors: | Ackerman, Samuel, Rabinovich, Ella, Farchi, Eitan, Anaby-Tavor, Ateret |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
On the Robustness of Agentic Function Calling
by: Rabinovich, Ella, et al.
Published: (2025)
by: Rabinovich, Ella, et al.
Published: (2025)
Near-Miss: Latent Policy Failure Detection in Agentic Workflows
by: Rabinovich, Ella, et al.
Published: (2026)
by: Rabinovich, Ella, et al.
Published: (2026)
Statistical multi-metric evaluation and visualization of LLM system predictive performance
by: Ackerman, Samuel, et al.
Published: (2025)
by: Ackerman, Samuel, et al.
Published: (2025)
What's the Plan? Evaluating and Developing Planning-Aware Techniques for Language Models
by: Hirsch, Eran, et al.
Published: (2024)
by: Hirsch, Eran, et al.
Published: (2024)
Exploring Straightforward Conversational Red-Teaming
by: Kour, George, et al.
Published: (2024)
by: Kour, George, et al.
Published: (2024)
Towards Enforcing Company Policy Adherence in Agentic Workflows
by: Zwerdling, Naama, et al.
Published: (2025)
by: Zwerdling, Naama, et al.
Published: (2025)
Think Again! The Effect of Test-Time Compute on Preferences, Opinions, and Beliefs of Large Language Models
by: Kour, George, et al.
Published: (2025)
by: Kour, George, et al.
Published: (2025)
SpeCrawler: Generating OpenAPI Specifications from API Documentation Using Large Language Models
by: Lazar, Koren, et al.
Published: (2024)
by: Lazar, Koren, et al.
Published: (2024)
From Zero to Hero: Cold-Start Anomaly Detection
by: Reiss, Tal, et al.
Published: (2024)
by: Reiss, Tal, et al.
Published: (2024)
Using Combinatorial Optimization to Design a High quality LLM Solution
by: Ackerman, Samuel, et al.
Published: (2024)
by: Ackerman, Samuel, et al.
Published: (2024)
CRISP: Complex Reasoning with Interpretable Step-based Plans
by: Vetzler, Matan, et al.
Published: (2025)
by: Vetzler, Matan, et al.
Published: (2025)
Effective Red-Teaming of Policy-Adherent Agents
by: Nakash, Itay, et al.
Published: (2025)
by: Nakash, Itay, et al.
Published: (2025)
How to Choose a Threshold for an Evaluation Metric for Large Language Models
by: Sarmah, Bhaskarjit, et al.
Published: (2024)
by: Sarmah, Bhaskarjit, et al.
Published: (2024)
Does a Large Language Model Really Speak in Human-Like Language?
by: Park, Mose, et al.
Published: (2025)
by: Park, Mose, et al.
Published: (2025)
Large Language Models for Full-Text Methods Assessment: A Case Study on Mediation Analysis
by: Zhang, Wenqing, et al.
Published: (2025)
by: Zhang, Wenqing, et al.
Published: (2025)
Enhancing Systematic Reviews with Large Language Models: Using GPT-4 and Kimi
by: Kaptur, Dandan Chen, et al.
Published: (2025)
by: Kaptur, Dandan Chen, et al.
Published: (2025)
Efficient Agent Evaluation via Diversity-Guided User Simulation
by: Nakash, Itay, et al.
Published: (2026)
by: Nakash, Itay, et al.
Published: (2026)
Judging It, Washing It: Scoring and Greenwashing Corporate Climate Disclosures using Large Language Models
by: Chuang, Marianne, et al.
Published: (2025)
by: Chuang, Marianne, et al.
Published: (2025)
Personalized Prediction of Perceived Message Effectiveness Using Large Language Model Based Digital Twins
by: Han, Jasmin, et al.
Published: (2026)
by: Han, Jasmin, et al.
Published: (2026)
Systematic Evaluation of Uncertainty Estimation Methods in Large Language Models
by: Hobelsberger, Christian, et al.
Published: (2025)
by: Hobelsberger, Christian, et al.
Published: (2025)
Bayesian Evaluation of Large Language Model Behavior
by: Longjohn, Rachel, et al.
Published: (2025)
by: Longjohn, Rachel, et al.
Published: (2025)
That's Optional: A Contemporary Exploration of "that" Omission in English Subordinate Clauses
by: Rabinovich, Ella
Published: (2024)
by: Rabinovich, Ella
Published: (2024)
Repeated Sequences Reveal Gaps between Large Language Models and Natural Language
by: Tanaka-Ishii, Kumiko
Published: (2026)
by: Tanaka-Ishii, Kumiko
Published: (2026)
Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations
by: Miller, Evan
Published: (2024)
by: Miller, Evan
Published: (2024)
Metacognitive Myopia in Large Language Models
by: Scholten, Florian, et al.
Published: (2024)
by: Scholten, Florian, et al.
Published: (2024)
Auditing the Use of Language Models to Guide Hiring Decisions
by: Gaebler, Johann D., et al.
Published: (2024)
by: Gaebler, Johann D., et al.
Published: (2024)
Bias in Language Models: Beyond Trick Tests and Toward RUTEd Evaluation
by: Lum, Kristian, et al.
Published: (2024)
by: Lum, Kristian, et al.
Published: (2024)
LAVA: Language Model Assisted Verbal Autopsy for Cause-of-Death Determination
by: Chen, Yiqun T., et al.
Published: (2025)
by: Chen, Yiqun T., et al.
Published: (2025)
TransitGPT: A Generative AI-based framework for interacting with GTFS data using Large Language Models
by: Devunuri, Saipraneeth, et al.
Published: (2024)
by: Devunuri, Saipraneeth, et al.
Published: (2024)
Advanced Crash Causation Analysis for Freeway Safety: A Large Language Model Approach to Identifying Key Contributing Factors
by: Abdelrahman, Ahmed S., et al.
Published: (2025)
by: Abdelrahman, Ahmed S., et al.
Published: (2025)
The Multi-Range Theory of Translation Quality Measurement: MQM scoring models and Statistical Quality Control
by: Lommel, Arle, et al.
Published: (2024)
by: Lommel, Arle, et al.
Published: (2024)
Limits of Large Language Models in Debating Humans
by: Flamino, James, et al.
Published: (2024)
by: Flamino, James, et al.
Published: (2024)
A Design-based Solution for Causal Inference with Text: Can a Language Model Be Too Large?
by: Tierney, Graham, et al.
Published: (2025)
by: Tierney, Graham, et al.
Published: (2025)
Sampling the Swadesh List to Identify Similar Languages with Tree Spaces
by: Ordway, Garett, et al.
Published: (2024)
by: Ordway, Garett, et al.
Published: (2024)
Language Markers of Emotion Flexibility Predict Depression and Anxiety Treatment Outcomes
by: Brindle, Benjamin, et al.
Published: (2026)
by: Brindle, Benjamin, et al.
Published: (2026)
Language Hierarchization Provides the Optimal Solution to Human Working Memory Limits
by: Chen, Luyao, et al.
Published: (2026)
by: Chen, Luyao, et al.
Published: (2026)
Domain-Shift-Aware Conformal Prediction for Large Language Models
by: Lin, Zhexiao, et al.
Published: (2025)
by: Lin, Zhexiao, et al.
Published: (2025)
On the Interplay between Musical Preferences and Personality through the Lens of Language
by: Shem-Tov, Eliran, et al.
Published: (2025)
by: Shem-Tov, Eliran, et al.
Published: (2025)
Breaking ReAct Agents: Foot-in-the-Door Attack Will Get You In
by: Nakash, Itay, et al.
Published: (2024)
by: Nakash, Itay, et al.
Published: (2024)
LaajMeter: A Framework for LaaJ Evaluation
by: Ackerman, Samuel, et al.
Published: (2025)
by: Ackerman, Samuel, et al.
Published: (2025)
Similar Items
-
On the Robustness of Agentic Function Calling
by: Rabinovich, Ella, et al.
Published: (2025) -
Near-Miss: Latent Policy Failure Detection in Agentic Workflows
by: Rabinovich, Ella, et al.
Published: (2026) -
Statistical multi-metric evaluation and visualization of LLM system predictive performance
by: Ackerman, Samuel, et al.
Published: (2025) -
What's the Plan? Evaluating and Developing Planning-Aware Techniques for Language Models
by: Hirsch, Eran, et al.
Published: (2024) -
Exploring Straightforward Conversational Red-Teaming
by: Kour, George, et al.
Published: (2024)