Hell or High Water: Evaluating Agentic Recovery from External Failures
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Andrew, Hager, Sophia, Asija, Adi, Khashabi, Daniel, Andrews, Nicholas |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Feedback Friction: LLMs Struggle to Fully Incorporate External Feedback
by: Jiang, Dongwei, et al.
Published: (2025)
by: Jiang, Dongwei, et al.
Published: (2025)
Learning to Generate Text in Arbitrary Writing Styles
by: Khan, Aleem, et al.
Published: (2023)
by: Khan, Aleem, et al.
Published: (2023)
Learning Extrapolative Sequence Transformations from Markov Chains
by: Hager, Sophia, et al.
Published: (2025)
by: Hager, Sophia, et al.
Published: (2025)
Inducing Artificial Uncertainty in Language Models
by: Hager, Sophia, et al.
Published: (2026)
by: Hager, Sophia, et al.
Published: (2026)
Uncertainty Distillation: Teaching Language Models to Express Semantic Confidence
by: Hager, Sophia, et al.
Published: (2025)
by: Hager, Sophia, et al.
Published: (2025)
Challenging the Evaluator: LLM Sycophancy Under User Rebuttal
by: Kim, Sungwon, et al.
Published: (2025)
by: Kim, Sungwon, et al.
Published: (2025)
Tur[k]ingBench: A Challenge Benchmark for Web Agents
by: Xu, Kevin, et al.
Published: (2024)
by: Xu, Kevin, et al.
Published: (2024)
Evaluating the Evaluators: Are readability metrics good measures of readability?
by: Cachola, Isabel, et al.
Published: (2025)
by: Cachola, Isabel, et al.
Published: (2025)
Insights into LLM Long-Context Failures: When Transformers Know but Don't Tell
by: Lu, Taiming, et al.
Published: (2024)
by: Lu, Taiming, et al.
Published: (2024)
Hidden in the Haystack: Smaller Needles are More Difficult for LLMs to Find
by: Bianchi, Owen, et al.
Published: (2025)
by: Bianchi, Owen, et al.
Published: (2025)
GOLD PANNING: Strategic Context Shuffling for Needle-in-Haystack Reasoning
by: Byerly, Adam, et al.
Published: (2025)
by: Byerly, Adam, et al.
Published: (2025)
SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning
by: Li, Tianjian, et al.
Published: (2025)
by: Li, Tianjian, et al.
Published: (2025)
Self-Consistency Falls Short! The Adverse Effects of Positional Bias on Long-Context Problems
by: Byerly, Adam, et al.
Published: (2024)
by: Byerly, Adam, et al.
Published: (2024)
Does Local News Stay Local?: Online Content Shifts in Sinclair-Acquired Stations
by: Wanner, Miriam, et al.
Published: (2025)
by: Wanner, Miriam, et al.
Published: (2025)
AnaloBench: Benchmarking the Identification of Abstract and Long-context Analogies
by: Ye, Xiao, et al.
Published: (2024)
by: Ye, Xiao, et al.
Published: (2024)
The Translation Barrier Hypothesis: Multilingual Generation with Large Language Models Suffers from Implicit Translation Failure
by: Bafna, Niyati, et al.
Published: (2025)
by: Bafna, Niyati, et al.
Published: (2025)
arXiv2Table: Toward Realistic Benchmarking and Evaluation for LLM-Based Literature-Review Table Generation
by: Wang, Weiqi, et al.
Published: (2025)
by: Wang, Weiqi, et al.
Published: (2025)
RORA: Robust Free-Text Rationale Evaluation
by: Jiang, Zhengping, et al.
Published: (2024)
by: Jiang, Zhengping, et al.
Published: (2024)
Are Finer Citations Always Better? Rethinking Granularity for Attributed Generation
by: Wang, Hexuan, et al.
Published: (2026)
by: Wang, Hexuan, et al.
Published: (2026)
The Flaw of Averages: Quantifying Uniformity of Performance on Benchmarks
by: Uzunoglu, Arda, et al.
Published: (2025)
by: Uzunoglu, Arda, et al.
Published: (2025)
Trust Functions: Near-Lossless Weak-to-Strong Generalization by Learning When to Trust the Weak Teacher
by: Uzunoglu, Arda, et al.
Published: (2026)
by: Uzunoglu, Arda, et al.
Published: (2026)
Conditional Multi-Stage Failure Recovery for Embodied Agents
by: Farag, Youmna, et al.
Published: (2025)
by: Farag, Youmna, et al.
Published: (2025)
IA2: Alignment with ICL Activations Improves Supervised Fine-Tuning
by: Mishra, Aayush, et al.
Published: (2025)
by: Mishra, Aayush, et al.
Published: (2025)
Do pretrained Transformers Learn In-Context by Gradient Descent?
by: Shen, Lingfeng, et al.
Published: (2023)
by: Shen, Lingfeng, et al.
Published: (2023)
WorldAPIs: The World Is Worth How Many APIs? A Thought Experiment
by: Ou, Jiefu, et al.
Published: (2024)
by: Ou, Jiefu, et al.
Published: (2024)
Heaven-Sent or Hell-Bent? Benchmarking the Intelligence and Defectiveness of LLM Hallucinations
by: Yang, Chengxu, et al.
Published: (2025)
by: Yang, Chengxu, et al.
Published: (2025)
Science Hierarchography: Hierarchical Organization of Science Literature
by: Gao, Muhan, et al.
Published: (2025)
by: Gao, Muhan, et al.
Published: (2025)
Agent Meltdowns: The Road to Hell Is Paved with Helpful Agents
by: Jha, Rishi, et al.
Published: (2026)
by: Jha, Rishi, et al.
Published: (2026)
AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems?
by: Zhang, Guibin, et al.
Published: (2025)
by: Zhang, Guibin, et al.
Published: (2025)
Verifiable by Design: Aligning Language Models to Quote from Pre-Training Data
by: Zhang, Jingyu, et al.
Published: (2024)
by: Zhang, Jingyu, et al.
Published: (2024)
Near-Miss: Latent Policy Failure Detection in Agentic Workflows
by: Rabinovich, Ella, et al.
Published: (2026)
by: Rabinovich, Ella, et al.
Published: (2026)
Crystal: Characterizing Relative Impact of Scholarly Publications
by: Collison, Hannah, et al.
Published: (2026)
by: Collison, Hannah, et al.
Published: (2026)
ICL CIPHERS: Quantifying "Learning" in In-Context Learning via Substitution Ciphers
by: Fang, Zhouxiang, et al.
Published: (2025)
by: Fang, Zhouxiang, et al.
Published: (2025)
DiffNorm: Self-Supervised Normalization for Non-autoregressive Speech-to-speech Translation
by: Tan, Weiting, et al.
Published: (2024)
by: Tan, Weiting, et al.
Published: (2024)
Error Norm Truncation: Robust Training in the Presence of Data Noise for Text Generation Models
by: Li, Tianjian, et al.
Published: (2023)
by: Li, Tianjian, et al.
Published: (2023)
Certified Mitigation of Worst-Case LLM Copyright Infringement
by: Zhang, Jingyu, et al.
Published: (2025)
by: Zhang, Jingyu, et al.
Published: (2025)
Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance
by: Yu, Jiachen, et al.
Published: (2026)
by: Yu, Jiachen, et al.
Published: (2026)
Benchmarking Language Model Creativity: A Case Study on Code Generation
by: Lu, Yining, et al.
Published: (2024)
by: Lu, Yining, et al.
Published: (2024)
RATIONALYST: Mining Implicit Rationales for Process Supervision of Reasoning
by: Jiang, Dongwei, et al.
Published: (2024)
by: Jiang, Dongwei, et al.
Published: (2024)
Upsample or Upweight? Balanced Training on Heavily Imbalanced Datasets
by: Li, Tianjian, et al.
Published: (2024)
by: Li, Tianjian, et al.
Published: (2024)
Similar Items
-
Feedback Friction: LLMs Struggle to Fully Incorporate External Feedback
by: Jiang, Dongwei, et al.
Published: (2025) -
Learning to Generate Text in Arbitrary Writing Styles
by: Khan, Aleem, et al.
Published: (2023) -
Learning Extrapolative Sequence Transformations from Markov Chains
by: Hager, Sophia, et al.
Published: (2025) -
Inducing Artificial Uncertainty in Language Models
by: Hager, Sophia, et al.
Published: (2026) -
Uncertainty Distillation: Teaching Language Models to Express Semantic Confidence
by: Hager, Sophia, et al.
Published: (2025)