Where LLM Agents Fail and How They can Learn From Failures
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhu, Kunlun, Liu, Zijia, Li, Bingxuan, Tian, Muxin, Yang, Yingxuan, Zhang, Jiaxun, Han, Pengrui, Xie, Qipeng, Cui, Fuyang, Zhang, Weijia, Ma, Xiaoteng, Yu, Xiaodong, Ramesh, Gowtham, Wu, Jialian, Liu, Zicheng, Lu, Pan, Zou, James, You, Jiaxuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SafeScientist: Toward Risk-Aware Scientific Discoveries by LLM Agents
por: Zhu, Kunlun, et al.
Publicado: (2025)
por: Zhu, Kunlun, et al.
Publicado: (2025)
SeeingEye: Agentic Information Flow Unlocks Multimodal Reasoning In Text-only LLMs
por: Zhang, Weijia, et al.
Publicado: (2025)
por: Zhang, Weijia, et al.
Publicado: (2025)
AcademicEval: Live Long-Context LLM Benchmark
por: Zhang, Haozhen, et al.
Publicado: (2025)
por: Zhang, Haozhen, et al.
Publicado: (2025)
TTT-Bench: A Benchmark for Evaluating Reasoning Ability with Simple and Novel Tic-Tac-Toe-style Games
por: Mishra, Prakamya, et al.
Publicado: (2025)
por: Mishra, Prakamya, et al.
Publicado: (2025)
Thought-Retriever: Don't Just Retrieve Raw Data, Retrieve Thoughts for Memory-Augmented Agentic Systems
por: Feng, Tao, et al.
Publicado: (2026)
por: Feng, Tao, et al.
Publicado: (2026)
Paper Copilot: A Self-Evolving and Efficient LLM System for Personalized Academic Assistance
por: Lin, Guanyu, et al.
Publicado: (2024)
por: Lin, Guanyu, et al.
Publicado: (2024)
In-Context Learning May Not Elicit Trustworthy Reasoning: A-Not-B Errors in Pretrained Language Models
por: Han, Pengrui, et al.
Publicado: (2024)
por: Han, Pengrui, et al.
Publicado: (2024)
TinyScientist: An Interactive, Extensible, and Controllable Framework for Building Research Agents
por: Yu, Haofei, et al.
Publicado: (2025)
por: Yu, Haofei, et al.
Publicado: (2025)
Real-World Benchmarks Make Membership Inference Attacks Fail on Diffusion Models
por: Liang, Chumeng, et al.
Publicado: (2024)
por: Liang, Chumeng, et al.
Publicado: (2024)
Instella: Fully Open Language Models with Stellar Performance
por: Liu, Jiang, et al.
Publicado: (2025)
por: Liu, Jiang, et al.
Publicado: (2025)
When Verification Fails: How Compositionally Infeasible Claims Escape Rejection
por: Liu, Muxin, et al.
Publicado: (2026)
por: Liu, Muxin, et al.
Publicado: (2026)
Stabilizing Efficient Reasoning with Step-Level Advantage Selection
por: Wang, Han, et al.
Publicado: (2026)
por: Wang, Han, et al.
Publicado: (2026)
Time-R1: Towards Comprehensive Temporal Reasoning in LLMs
por: Liu, Zijia, et al.
Publicado: (2025)
por: Liu, Zijia, et al.
Publicado: (2025)
Which LLM Multi-Agent Protocol to Choose?
por: Du, Hongyi, et al.
Publicado: (2025)
por: Du, Hongyi, et al.
Publicado: (2025)
Mistake Notebook Learning: Batch-Clustered Failures for Training-Free Agent Adaptation
por: Su, Xuanbo, et al.
Publicado: (2025)
por: Su, Xuanbo, et al.
Publicado: (2025)
SWE-Bench Mobile: Can Large Language Model Agents Develop Industry-Level Mobile Applications?
por: Tian, Muxin, et al.
Publicado: (2026)
por: Tian, Muxin, et al.
Publicado: (2026)
Large Language Model Reasoning Failures
por: Song, Peiyang, et al.
Publicado: (2026)
por: Song, Peiyang, et al.
Publicado: (2026)
Reasoning Fails Where Step Flow Breaks
por: Xu, Xiaoyu, et al.
Publicado: (2026)
por: Xu, Xiaoyu, et al.
Publicado: (2026)
DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning
por: Huang, Chao, et al.
Publicado: (2025)
por: Huang, Chao, et al.
Publicado: (2025)
Reliable Use of Lemmas via Eligibility Reasoning and Section$-$Aware Reinforcement Learning
por: Xu, Zhikun, et al.
Publicado: (2026)
por: Xu, Zhikun, et al.
Publicado: (2026)
VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking
por: Lin, Jingyang, et al.
Publicado: (2026)
por: Lin, Jingyang, et al.
Publicado: (2026)
Where LLM Annotators Fail: Label-Free Learning on Graphs with LLMs
por: Thapaliya, Safal, et al.
Publicado: (2026)
por: Thapaliya, Safal, et al.
Publicado: (2026)
APRIL: Active Partial Rollouts in Reinforcement Learning to Tame Long-tail Generation
por: Zhou, Yuzhen, et al.
Publicado: (2025)
por: Zhou, Yuzhen, et al.
Publicado: (2025)
Learning from Online Videos at Inference Time for Computer-Use Agents
por: Liu, Yujian, et al.
Publicado: (2025)
por: Liu, Yujian, et al.
Publicado: (2025)
Uncovering Singularities in Feynman Integrals via Machine Learning
por: Liu, Yuanche, et al.
Publicado: (2025)
por: Liu, Yuanche, et al.
Publicado: (2025)
“Everyone's Struggling:” Coping With Institutionalized Hierarchies of Competence Through Emotional Resonance
por: Muxin Zhang, et al.
Publicado: (2025)
por: Muxin Zhang, et al.
Publicado: (2025)
FusionFactory: Fusing LLM Capabilities with Multi-LLM Log Data
por: Feng, Tao, et al.
Publicado: (2025)
por: Feng, Tao, et al.
Publicado: (2025)
Spectral convergence of a semi-discretized numerical system for the spatially homogeneous Boltzmann equation with uncertainties
por: Liu, Liu, et al.
Publicado: (2024)
por: Liu, Liu, et al.
Publicado: (2024)
Convergence of the Fourier-Galerkin spectral method for the Boltzmann equation with uncertainties
por: Liu, Liu, et al.
Publicado: (2022)
por: Liu, Liu, et al.
Publicado: (2022)
SonicSense: Object Perception from In-Hand Acoustic Vibration
por: Liu, Jiaxun, et al.
Publicado: (2024)
por: Liu, Jiaxun, et al.
Publicado: (2024)
Understanding GEMM Performance and Energy on NVIDIA Ada Lovelace: A Machine Learning-Based Analytical Approach
por: Xiaoteng, et al.
Publicado: (2024)
por: Xiaoteng, et al.
Publicado: (2024)
Agent Laboratory: Using LLM Agents as Research Assistants
por: Schmidgall, Samuel, et al.
Publicado: (2025)
por: Schmidgall, Samuel, et al.
Publicado: (2025)
Latent Visual Reasoning
por: Li, Bangzheng, et al.
Publicado: (2025)
por: Li, Bangzheng, et al.
Publicado: (2025)
XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models
por: Wang, Xingrui, et al.
Publicado: (2025)
por: Wang, Xingrui, et al.
Publicado: (2025)
Instella-T2I: Pushing the Limits of 1D Discrete Latent Space Image Generation
por: Wang, Ze, et al.
Publicado: (2025)
por: Wang, Ze, et al.
Publicado: (2025)
ImageDoctor: Diagnosing Text-to-Image Generation via Grounded Image Reasoning
por: Guo, Yuxiang, et al.
Publicado: (2025)
por: Guo, Yuxiang, et al.
Publicado: (2025)
Self-Taught Agentic Long Context Understanding
por: Zhuang, Yufan, et al.
Publicado: (2025)
por: Zhuang, Yufan, et al.
Publicado: (2025)
KeyVID: Keyframe-Aware Video Diffusion for Audio-Synchronized Visual Animation
por: Wang, Xingrui, et al.
Publicado: (2025)
por: Wang, Xingrui, et al.
Publicado: (2025)
Analysis of Failed Atlantoaxial Reduction: Causes of Failure and Strategies for Revision
por: Boyan Zhang, et al.
Publicado: (2024)
por: Boyan Zhang, et al.
Publicado: (2024)
How Far Are We From AGI: Are LLMs All We Need?
por: Feng, Tao, et al.
Publicado: (2024)
por: Feng, Tao, et al.
Publicado: (2024)
Ejemplares similares
-
SafeScientist: Toward Risk-Aware Scientific Discoveries by LLM Agents
por: Zhu, Kunlun, et al.
Publicado: (2025) -
SeeingEye: Agentic Information Flow Unlocks Multimodal Reasoning In Text-only LLMs
por: Zhang, Weijia, et al.
Publicado: (2025) -
AcademicEval: Live Long-Context LLM Benchmark
por: Zhang, Haozhen, et al.
Publicado: (2025) -
TTT-Bench: A Benchmark for Evaluating Reasoning Ability with Simple and Novel Tic-Tac-Toe-style Games
por: Mishra, Prakamya, et al.
Publicado: (2025) -
Thought-Retriever: Don't Just Retrieve Raw Data, Retrieve Thoughts for Memory-Augmented Agentic Systems
por: Feng, Tao, et al.
Publicado: (2026)