Saved in:
| Main Authors: | Karmakar, Ranit, Chatterjee, Jayita |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2605.02038 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
AgentFloor: How Far Up the tool use Ladder Can Small Open-Weight Models Go?
by: Karmakar, Ranit, et al.
Published: (2026)
by: Karmakar, Ranit, et al.
Published: (2026)
What Is Missing: Interpretable Ratings for Large Language Model Outputs
by: Stranges, Nicholas, et al.
Published: (2026)
by: Stranges, Nicholas, et al.
Published: (2026)
Anthropomimetic Uncertainty: What Verbalized Uncertainty in Language Models is Missing
by: Ulmer, Dennis, et al.
Published: (2025)
by: Ulmer, Dennis, et al.
Published: (2025)
Soft Token Attacks Cannot Reliably Audit Unlearning in Large Language Models
by: Chen, Haokun, et al.
Published: (2025)
by: Chen, Haokun, et al.
Published: (2025)
Are Large Language Models Truly Smarter Than Humans?
by: M, Eshwar Reddy, et al.
Published: (2026)
by: M, Eshwar Reddy, et al.
Published: (2026)
SoftPQ: Robust Instance Segmentation Evaluation via Soft Matching and Tunable Thresholds
by: Karmakar, Ranit, et al.
Published: (2025)
by: Karmakar, Ranit, et al.
Published: (2025)
POSIX: A Prompt Sensitivity Index For Large Language Models
by: Chatterjee, Anwoy, et al.
Published: (2024)
by: Chatterjee, Anwoy, et al.
Published: (2024)
AuditWen:An Open-Source Large Language Model for Audit
by: Huang, Jiajia, et al.
Published: (2024)
by: Huang, Jiajia, et al.
Published: (2024)
What's in a Name? Auditing Large Language Models for Race and Gender Bias
by: Salinas, Alejandro, et al.
Published: (2024)
by: Salinas, Alejandro, et al.
Published: (2024)
On the Reliability of Large Language Models to Misinformed and Demographically-Informed Prompts
by: Aremu, Toluwani, et al.
Published: (2024)
by: Aremu, Toluwani, et al.
Published: (2024)
Beyond Single-Granularity Prompts: A Multi-Scale Chain-of-Thought Prompt Learning for Graph
by: Zheng, Ziyu, et al.
Published: (2025)
by: Zheng, Ziyu, et al.
Published: (2025)
PairBench: Are Vision-Language Models Reliable at Comparing What They See?
by: Feizi, Aarash, et al.
Published: (2025)
by: Feizi, Aarash, et al.
Published: (2025)
CALM: Curiosity-Driven Auditing for Large Language Models
by: Zheng, Xiang, et al.
Published: (2025)
by: Zheng, Xiang, et al.
Published: (2025)
PRISM: A Methodology for Auditing Biases in Large Language Models
by: Azzopardi, Leif, et al.
Published: (2024)
by: Azzopardi, Leif, et al.
Published: (2024)
Output Scouting: Auditing Large Language Models for Catastrophic Responses
by: Bell, Andrew, et al.
Published: (2024)
by: Bell, Andrew, et al.
Published: (2024)
Missed Connections: Lateral Thinking Puzzles for Large Language Models
by: Todd, Graham, et al.
Published: (2024)
by: Todd, Graham, et al.
Published: (2024)
SuperPos-Prompt: Enhancing Soft Prompt Tuning of Language Models with Superposition of Multi Token Embeddings
by: SadraeiJavaeri, MohammadAli, et al.
Published: (2024)
by: SadraeiJavaeri, MohammadAli, et al.
Published: (2024)
"Sorry, I Didn't Catch That": How Speech Models Miss What Matters Most
by: Zhou, Kaitlyn, et al.
Published: (2026)
by: Zhou, Kaitlyn, et al.
Published: (2026)
Round-Trip Translation Reveals What Frontier Multilingual Benchmarks Miss
by: Skorobogat, Ronald, et al.
Published: (2026)
by: Skorobogat, Ronald, et al.
Published: (2026)
M-Ped: Multi-Prompt Ensemble Decoding for Large Language Models
by: Guo, Jiaxin, et al.
Published: (2024)
by: Guo, Jiaxin, et al.
Published: (2024)
DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence
by: Venkit, Pranav Narayanan, et al.
Published: (2025)
by: Venkit, Pranav Narayanan, et al.
Published: (2025)
ContextGuard: Structured Self-Auditing for Context Learning in Language Models
by: Jin, Hongbo, et al.
Published: (2026)
by: Jin, Hongbo, et al.
Published: (2026)
Audit-of-Understanding: Posterior-Constrained Inference for Mathematical Reasoning in Language Models
by: Abdaljalil, Samir, et al.
Published: (2025)
by: Abdaljalil, Samir, et al.
Published: (2025)
Enhanced Review Detection and Recognition: A Platform-Agnostic Approach with Application to Online Commerce
by: Karmakar, Priyabrata, et al.
Published: (2024)
by: Karmakar, Priyabrata, et al.
Published: (2024)
PromptBridge: Cross-Model Prompt Transfer for Large Language Models
by: Wang, Yaxuan, et al.
Published: (2025)
by: Wang, Yaxuan, et al.
Published: (2025)
Aligning Knowledge Graphs and Language Models for Factual Accuracy
by: Nishat, Nur A Zarin, et al.
Published: (2025)
by: Nishat, Nur A Zarin, et al.
Published: (2025)
Preference Orchestrator: Prompt-Aware Multi-Objective Alignment for Large Language Models
by: Liu, Biao, et al.
Published: (2025)
by: Liu, Biao, et al.
Published: (2025)
Meaning Typed Prompting: A Technique for Efficient, Reliable Structured Output Generation
by: Irugalbandara, Chandra
Published: (2024)
by: Irugalbandara, Chandra
Published: (2024)
A Survey of the State of Explainable AI for Natural Language Processing
by: Danilevsky, Marina, et al.
Published: (2020)
by: Danilevsky, Marina, et al.
Published: (2020)
Can LLMs replace Neil deGrasse Tyson? Evaluating the Reliability of LLMs as Science Communicators
by: Bajpai, Prasoon, et al.
Published: (2024)
by: Bajpai, Prasoon, et al.
Published: (2024)
UtilityMax Prompting: A Formal Framework for Multi-Objective Large Language Model Tasks
by: Marom, Ofir
Published: (2026)
by: Marom, Ofir
Published: (2026)
INACIA: Integrating Large Language Models in Brazilian Audit Courts: Opportunities and Challenges
by: Pereira, Jayr, et al.
Published: (2024)
by: Pereira, Jayr, et al.
Published: (2024)
Don't Change My View: Ideological Bias Auditing in Large Language Models
by: Kröger, Paul, et al.
Published: (2025)
by: Kröger, Paul, et al.
Published: (2025)
On Active Privacy Auditing in Supervised Fine-tuning for White-Box Language Models
by: Sun, Qian, et al.
Published: (2024)
by: Sun, Qian, et al.
Published: (2024)
HIDE and Seek: Detecting Hallucinations in Language Models via Decoupled Representations
by: Chatterjee, Anwoy, et al.
Published: (2025)
by: Chatterjee, Anwoy, et al.
Published: (2025)
High Accuracy, Less Talk (HALT): Reliable LLMs through Capability-Aligned Finetuning
by: Franzmeyer, Tim, et al.
Published: (2025)
by: Franzmeyer, Tim, et al.
Published: (2025)
Abductive Inference in Retrieval-Augmented Language Models: Generating and Validating Missing Premises
by: Lin, Shiyin
Published: (2025)
by: Lin, Shiyin
Published: (2025)
Chinese Metaphor Recognition Using a Multi-stage Prompting Large Language Model
by: Wang, Jie, et al.
Published: (2024)
by: Wang, Jie, et al.
Published: (2024)
Enhancing Diagnostic Accuracy through Multi-Agent Conversations: Using Large Language Models to Mitigate Cognitive Bias
by: Ke, Yu He, et al.
Published: (2024)
by: Ke, Yu He, et al.
Published: (2024)
Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey
by: Mondorf, Philipp, et al.
Published: (2024)
by: Mondorf, Philipp, et al.
Published: (2024)
Similar Items
-
AgentFloor: How Far Up the tool use Ladder Can Small Open-Weight Models Go?
by: Karmakar, Ranit, et al.
Published: (2026) -
What Is Missing: Interpretable Ratings for Large Language Model Outputs
by: Stranges, Nicholas, et al.
Published: (2026) -
Anthropomimetic Uncertainty: What Verbalized Uncertainty in Language Models is Missing
by: Ulmer, Dennis, et al.
Published: (2025) -
Soft Token Attacks Cannot Reliably Audit Unlearning in Large Language Models
by: Chen, Haokun, et al.
Published: (2025) -
Are Large Language Models Truly Smarter Than Humans?
by: M, Eshwar Reddy, et al.
Published: (2026)