Evaluating the Retrieval Robustness of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Cao, Shuyang, Radhakrishnan, Karthik, Rosenberg, David, Lu, Steven, Cheng, Pengxiang, Wang, Lu, Zhang, Shiyue |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
RAG LLMs are Not Safer: A Safety Analysis of Retrieval-Augmented Generation for Large Language Models
by: An, Bang, et al.
Published: (2025)
by: An, Bang, et al.
Published: (2025)
MixCE: Training Autoregressive Language Models by Mixing Forward and Reverse Cross-Entropies
by: Zhang, Shiyue, et al.
Published: (2023)
by: Zhang, Shiyue, et al.
Published: (2023)
A Large Language Model-Empowered Agent for Reliable and Robust Structural Analysis
by: Liu, Jiachen, et al.
Published: (2025)
by: Liu, Jiachen, et al.
Published: (2025)
Improving Instruct Models for Free: A Study on Partial Adaptation
by: İrsoy, Ozan, et al.
Published: (2025)
by: İrsoy, Ozan, et al.
Published: (2025)
LongSafety: Evaluating Long-Context Safety of Large Language Models
by: Lu, Yida, et al.
Published: (2025)
by: Lu, Yida, et al.
Published: (2025)
Why Diffusion Language Models Struggle with Truly Parallel (Non-Autoregressive) Decoding?
by: Li, Pengxiang, et al.
Published: (2026)
by: Li, Pengxiang, et al.
Published: (2026)
Re-Search for The Truth: Multi-round Retrieval-augmented Large Language Models are Strong Fake News Detectors
by: Li, Guanghua, et al.
Published: (2024)
by: Li, Guanghua, et al.
Published: (2024)
Graph-oriented Instruction Tuning of Large Language Models for Generic Graph Mining
by: Tan, Yanchao, et al.
Published: (2024)
by: Tan, Yanchao, et al.
Published: (2024)
KGPA: Robustness Evaluation for Large Language Models via Cross-Domain Knowledge Graphs
by: Pei, Aihua, et al.
Published: (2024)
by: Pei, Aihua, et al.
Published: (2024)
URAG: A Benchmark for Uncertainty Quantification in Retrieval-Augmented Large Language Models
by: Nguyen, Vinh, et al.
Published: (2026)
by: Nguyen, Vinh, et al.
Published: (2026)
RAG and RAU: A Survey on Retrieval-Augmented Language Model in Natural Language Processing
by: Hu, Yucheng, et al.
Published: (2024)
by: Hu, Yucheng, et al.
Published: (2024)
Black-Box Opinion Manipulation Attacks to Retrieval-Augmented Generation of Large Language Models
by: Chen, Zhuo, et al.
Published: (2024)
by: Chen, Zhuo, et al.
Published: (2024)
Smart Trial: Evaluating the Use of Large Language Models for Recruiting Clinical Trial Participants via Social Media
by: Zhou, Xiaofan, et al.
Published: (2025)
by: Zhou, Xiaofan, et al.
Published: (2025)
InsurAgent: A Large Language Model-Empowered Agent for Simulating Individual Behavior in Purchasing Flood Insurance
by: Geng, Ziheng, et al.
Published: (2025)
by: Geng, Ziheng, et al.
Published: (2025)
Credence Calibration Game? Calibrating Large Language Models through Structured Play
by: Fang, Ke, et al.
Published: (2025)
by: Fang, Ke, et al.
Published: (2025)
Robust Prompt Optimization for Large Language Models Against Distribution Shifts
by: Li, Moxin, et al.
Published: (2023)
by: Li, Moxin, et al.
Published: (2023)
Chain-of-Note: Enhancing Robustness in Retrieval-Augmented Language Models
by: Yu, Wenhao, et al.
Published: (2023)
by: Yu, Wenhao, et al.
Published: (2023)
Miner:Mining Intrinsic Mastery for Data-Efficient RL in Large Reasoning Models
by: Jiang, Shuyang, et al.
Published: (2026)
by: Jiang, Shuyang, et al.
Published: (2026)
Evaluating and Improving Robustness in Large Language Models: A Survey and Future Directions
by: Zhang, Kun, et al.
Published: (2025)
by: Zhang, Kun, et al.
Published: (2025)
Survey on Knowledge Distillation for Large Language Models: Methods, Evaluation, and Application
by: Yang, Chuanpeng, et al.
Published: (2024)
by: Yang, Chuanpeng, et al.
Published: (2024)
R-Eval: A Unified Toolkit for Evaluating Domain Knowledge of Retrieval Augmented Large Language Models
by: Tu, Shangqing, et al.
Published: (2024)
by: Tu, Shangqing, et al.
Published: (2024)
Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models
by: Huang, Liangjie, et al.
Published: (2025)
by: Huang, Liangjie, et al.
Published: (2025)
Self-Retrieval: End-to-End Information Retrieval with One Large Language Model
by: Tang, Qiaoyu, et al.
Published: (2024)
by: Tang, Qiaoyu, et al.
Published: (2024)
Retrieval-Augmented Generation for Electrocardiogram-Language Models
by: Song, Xiaoyu, et al.
Published: (2025)
by: Song, Xiaoyu, et al.
Published: (2025)
Unraveling and Mitigating Retriever Inconsistencies in Retrieval-Augmented Large Language Models
by: Li, Mingda, et al.
Published: (2024)
by: Li, Mingda, et al.
Published: (2024)
LexInstructEval: Lexical Instruction Following Evaluation for Large Language Models
by: Ren, Huimin, et al.
Published: (2025)
by: Ren, Huimin, et al.
Published: (2025)
PRIME: Large Language Model Personalization with Cognitive Dual-Memory and Personalized Thought Process
by: Zhang, Xinliang Frederick, et al.
Published: (2025)
by: Zhang, Xinliang Frederick, et al.
Published: (2025)
Narrative-of-Thought: Improving Temporal Reasoning of Large Language Models via Recounted Narratives
by: Zhang, Xinliang Frederick, et al.
Published: (2024)
by: Zhang, Xinliang Frederick, et al.
Published: (2024)
Ask Good Questions for Large Language Models
by: Wu, Qi, et al.
Published: (2025)
by: Wu, Qi, et al.
Published: (2025)
Diffusion Language Models Know the Answer Before Decoding
by: Li, Pengxiang, et al.
Published: (2025)
by: Li, Pengxiang, et al.
Published: (2025)
Rate, Explain and Cite (REC): Enhanced Explanation and Attribution in Automatic Evaluation by Large Language Models
by: Hsu, Aliyah R., et al.
Published: (2024)
by: Hsu, Aliyah R., et al.
Published: (2024)
CreativityPrism: A Holistic Evaluation Framework for Large Language Model Creativity
by: Hou, Zhaoyi Joey, et al.
Published: (2025)
by: Hou, Zhaoyi Joey, et al.
Published: (2025)
ChatSUMO: Large Language Model for Automating Traffic Scenario Generation in Simulation of Urban MObility
by: Li, Shuyang, et al.
Published: (2024)
by: Li, Shuyang, et al.
Published: (2024)
Unveiling Performance Challenges of Large Language Models in Low-Resource Healthcare: A Demographic Fairness Perspective
by: Zhou, Yue, et al.
Published: (2024)
by: Zhou, Yue, et al.
Published: (2024)
QAPyramid: Fine-grained Evaluation of Content Selection for Text Summarization
by: Zhang, Shiyue, et al.
Published: (2024)
by: Zhang, Shiyue, et al.
Published: (2024)
The Labyrinth and the Thread: Rethinking Regularizations in Sequential Knowledge Editing for Large Language Models
by: Wang, Zheng, et al.
Published: (2026)
by: Wang, Zheng, et al.
Published: (2026)
FLEX: A Benchmark for Evaluating Robustness of Fairness in Large Language Models
by: Jung, Dahyun, et al.
Published: (2025)
by: Jung, Dahyun, et al.
Published: (2025)
Evaluating Large Language Models for Generalization and Robustness via Data Compression
by: Li, Yucheng, et al.
Published: (2024)
by: Li, Yucheng, et al.
Published: (2024)
Eliciting Informative Text Evaluations with Large Language Models
by: Lu, Yuxuan, et al.
Published: (2024)
by: Lu, Yuxuan, et al.
Published: (2024)
An Information-Theoretic Framework for Robust Large Language Model Editing
by: Chen, Qizhou, et al.
Published: (2025)
by: Chen, Qizhou, et al.
Published: (2025)
Similar Items
-
RAG LLMs are Not Safer: A Safety Analysis of Retrieval-Augmented Generation for Large Language Models
by: An, Bang, et al.
Published: (2025) -
MixCE: Training Autoregressive Language Models by Mixing Forward and Reverse Cross-Entropies
by: Zhang, Shiyue, et al.
Published: (2023) -
A Large Language Model-Empowered Agent for Reliable and Robust Structural Analysis
by: Liu, Jiachen, et al.
Published: (2025) -
Improving Instruct Models for Free: A Study on Partial Adaptation
by: İrsoy, Ozan, et al.
Published: (2025) -
LongSafety: Evaluating Long-Context Safety of Large Language Models
by: Lu, Yida, et al.
Published: (2025)