BELL: Benchmarking the Explainability of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Ahmed, Syed Quiser, Ganesh, Bharathi Vokkaliga, P, Jagadish Babu, Selvaraj, Karthick, Devi, ReddySiva Naga Parvathi, Kappala, Sravya |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VISTA: Visualization of Token Attribution via Efficient Analysis
by: Ahmed, Syed, et al.
Published: (2026)
by: Ahmed, Syed, et al.
Published: (2026)
A Comprehensive Review of Adversarial Attacks on Machine Learning
by: Ahmed, Syed Quiser, et al.
Published: (2024)
by: Ahmed, Syed Quiser, et al.
Published: (2024)
Investigating Adversarial Trigger Transfer in Large Language Models
by: Meade, Nicholas, et al.
Published: (2024)
by: Meade, Nicholas, et al.
Published: (2024)
Are self-explanations from Large Language Models faithful?
by: Madsen, Andreas, et al.
Published: (2024)
by: Madsen, Andreas, et al.
Published: (2024)
Scope Ambiguities in Large Language Models
by: Kamath, Gaurav, et al.
Published: (2024)
by: Kamath, Gaurav, et al.
Published: (2024)
Language Models Largely Exhibit Human-like Constituent Ordering Preferences
by: Tur, Ada Defne, et al.
Published: (2025)
by: Tur, Ada Defne, et al.
Published: (2025)
Faithfulness Measurable Masked Language Models
by: Madsen, Andreas, et al.
Published: (2023)
by: Madsen, Andreas, et al.
Published: (2023)
Continual-learning for Modelling Low-Resource Languages from Large Language Models
by: K, Santosh Srinath, et al.
Published: (2026)
by: K, Santosh Srinath, et al.
Published: (2026)
LLM2Vec-Gen: Generative Embeddings from Large Language Models
by: BehnamGhader, Parishad, et al.
Published: (2026)
by: BehnamGhader, Parishad, et al.
Published: (2026)
kRAIG: A Natural Language-Driven Agent for Automated DataOps Pipeline Generation
by: Siva, Rohan, et al.
Published: (2026)
by: Siva, Rohan, et al.
Published: (2026)
Zero-shot Cross-lingual Stance Detection via Adversarial Language Adaptation
by: A, Bharathi, et al.
Published: (2024)
by: A, Bharathi, et al.
Published: (2024)
LLM2Vec: Large Language Models Are Secretly Powerful Text Encoders
by: BehnamGhader, Parishad, et al.
Published: (2024)
by: BehnamGhader, Parishad, et al.
Published: (2024)
How to Get Your LLM to Generate Challenging Problems for Evaluation
by: Patel, Arkil, et al.
Published: (2025)
by: Patel, Arkil, et al.
Published: (2025)
Not All Data Are Unlearned Equally
by: Krishnan, Aravind, et al.
Published: (2025)
by: Krishnan, Aravind, et al.
Published: (2025)
End-to-end Sequence Labeling via Bi-directional LSTM-CNNs-CRF: A Reproducibility Study
by: Ganesh, Anirudh, et al.
Published: (2025)
by: Ganesh, Anirudh, et al.
Published: (2025)
A Code Comprehension Benchmark for Large Language Models for Code
by: Havare, Jayant, et al.
Published: (2025)
by: Havare, Jayant, et al.
Published: (2025)
Benchmarking Vision Language Models for Cultural Understanding
by: Nayak, Shravan, et al.
Published: (2024)
by: Nayak, Shravan, et al.
Published: (2024)
X-MuTeST: A Multilingual Benchmark for Explainable Hate Speech Detection and A Novel LLM-consulted Explanation Framework
by: Rehman, Mohammad Zia Ur, et al.
Published: (2026)
by: Rehman, Mohammad Zia Ur, et al.
Published: (2026)
When does word order matter and when doesn't it?
by: Chen, Xuanda, et al.
Published: (2024)
by: Chen, Xuanda, et al.
Published: (2024)
Investigating Decoder-only Large Language Models for Speech-to-text Translation
by: Huang, Chao-Wei, et al.
Published: (2024)
by: Huang, Chao-Wei, et al.
Published: (2024)
Evaluating In-Context Learning of Libraries for Code Generation
by: Patel, Arkil, et al.
Published: (2023)
by: Patel, Arkil, et al.
Published: (2023)
The StatCan Dialogue Dataset: Retrieving Data Tables through Conversations with Genuine Intents
by: Lu, Xing Han, et al.
Published: (2023)
by: Lu, Xing Han, et al.
Published: (2023)
A Compositional Typed Semantics for Universal Dependencies
by: Bradford, Laurestine, et al.
Published: (2024)
by: Bradford, Laurestine, et al.
Published: (2024)
Exploiting Instruction-Following Retrievers for Malicious Information Retrieval
by: BehnamGhader, Parishad, et al.
Published: (2025)
by: BehnamGhader, Parishad, et al.
Published: (2025)
A Survey of using Large Language Models for Generating Infrastructure as Code
by: Srivatsa, Kalahasti Ganesh, et al.
Published: (2024)
by: Srivatsa, Kalahasti Ganesh, et al.
Published: (2024)
Cognitive Load Limits in Large Language Models: Benchmarking Multi-Hop Reasoning
by: Adapala, Sai Teja Reddy
Published: (2025)
by: Adapala, Sai Teja Reddy
Published: (2025)
Signal or Noise? Evaluating Large Language Models in Resume Screening Across Contextual Variations and Human Expert Benchmarks
by: Varshney, Aryan, et al.
Published: (2025)
by: Varshney, Aryan, et al.
Published: (2025)
Large Language Models for Explainable Threat Intelligence
by: Dinis, Tiago, et al.
Published: (2025)
by: Dinis, Tiago, et al.
Published: (2025)
Forecasting Downstream Performance of LLMs With Proxy Metrics
by: Patel, Arkil, et al.
Published: (2026)
by: Patel, Arkil, et al.
Published: (2026)
A Causal Explainable Guardrails for Large Language Models
by: Chu, Zhixuan, et al.
Published: (2024)
by: Chu, Zhixuan, et al.
Published: (2024)
PROFASR-BENCH: A Benchmark for Context-Conditioned ASR in High-Stakes Professional Speech
by: Piskala, Deepak Babu
Published: (2025)
by: Piskala, Deepak Babu
Published: (2025)
Mechanistic Exploration of Backdoored Large Language Model Attention Patterns
by: Baker, Mohammed Abu, et al.
Published: (2025)
by: Baker, Mohammed Abu, et al.
Published: (2025)
ALMANACS: A Simulatability Benchmark for Language Model Explainability
by: Mills, Edmund, et al.
Published: (2023)
by: Mills, Edmund, et al.
Published: (2023)
Medical Large Language Model Benchmarks Should Prioritize Construct Validity
by: Alaa, Ahmed, et al.
Published: (2025)
by: Alaa, Ahmed, et al.
Published: (2025)
WebLINX: Real-World Website Navigation with Multi-Turn Dialogue
by: Lù, Xing Han, et al.
Published: (2024)
by: Lù, Xing Han, et al.
Published: (2024)
MCP4IFC: IFC-Based Building Design Using Large Language Models
by: Nithyanantham, Bharathi Kannan, et al.
Published: (2025)
by: Nithyanantham, Bharathi Kannan, et al.
Published: (2025)
Uncertainty-Aware Large Language Models for Explainable Disease Diagnosis
by: Zhou, Shuang, et al.
Published: (2025)
by: Zhou, Shuang, et al.
Published: (2025)
Build the web for agents, not agents for the web
by: Lù, Xing Han, et al.
Published: (2025)
by: Lù, Xing Han, et al.
Published: (2025)
Enhanced Language Model Truthfulness with Learnable Intervention and Uncertainty Expression
by: Bayat, Farima Fatahi, et al.
Published: (2024)
by: Bayat, Farima Fatahi, et al.
Published: (2024)
Are Large Language Models Truly Smarter Than Humans?
by: M, Eshwar Reddy, et al.
Published: (2026)
by: M, Eshwar Reddy, et al.
Published: (2026)
Similar Items
-
VISTA: Visualization of Token Attribution via Efficient Analysis
by: Ahmed, Syed, et al.
Published: (2026) -
A Comprehensive Review of Adversarial Attacks on Machine Learning
by: Ahmed, Syed Quiser, et al.
Published: (2024) -
Investigating Adversarial Trigger Transfer in Large Language Models
by: Meade, Nicholas, et al.
Published: (2024) -
Are self-explanations from Large Language Models faithful?
by: Madsen, Andreas, et al.
Published: (2024) -
Scope Ambiguities in Large Language Models
by: Kamath, Gaurav, et al.
Published: (2024)