Saved in:
| Main Authors: | M, Eshwar Reddy, Karmakar, Sourav |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2603.16197 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Cause and Effect: Can Large Language Models Truly Understand Causality?
by: Ashwani, Swagata, et al.
Published: (2024)
by: Ashwani, Swagata, et al.
Published: (2024)
Benchmarks Saturate When The Model Gets Smarter Than The Judge
by: Ballon, Marthe, et al.
Published: (2026)
by: Ballon, Marthe, et al.
Published: (2026)
Reasoning with Sampling: Your Base Model is Smarter Than You Think
by: Karan, Aayush, et al.
Published: (2025)
by: Karan, Aayush, et al.
Published: (2025)
How Well Do Large Language Models Truly Ground?
by: Lee, Hyunji, et al.
Published: (2023)
by: Lee, Hyunji, et al.
Published: (2023)
Is Pre-training Truly Better Than Meta-Learning?
by: Miranda, Brando, et al.
Published: (2023)
by: Miranda, Brando, et al.
Published: (2023)
Language Models Largely Exhibit Human-like Constituent Ordering Preferences
by: Tur, Ada Defne, et al.
Published: (2025)
by: Tur, Ada Defne, et al.
Published: (2025)
The End of Manual Decoding: Towards Truly End-to-End Language Models
by: Wang, Zhichao, et al.
Published: (2025)
by: Wang, Zhichao, et al.
Published: (2025)
Why Diffusion Language Models Struggle with Truly Parallel (Non-Autoregressive) Decoding?
by: Li, Pengxiang, et al.
Published: (2026)
by: Li, Pengxiang, et al.
Published: (2026)
What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models
by: Karmakar, Ranit, et al.
Published: (2026)
by: Karmakar, Ranit, et al.
Published: (2026)
Can LLMs Truly Embody Human Personality? Analyzing AI and Human Behavior Alignment in Dispute Resolution
by: Kwon, Deuksin, et al.
Published: (2026)
by: Kwon, Deuksin, et al.
Published: (2026)
Do Large Language Models Truly Grasp Mathematics? An Empirical Exploration From Cognitive Psychology
by: Xie, Wei, et al.
Published: (2024)
by: Xie, Wei, et al.
Published: (2024)
Scope Ambiguities in Large Language Models
by: Kamath, Gaurav, et al.
Published: (2024)
by: Kamath, Gaurav, et al.
Published: (2024)
Tougher Text, Smarter Models: Raising the Bar for Adversarial Defence Benchmarks
by: Wang, Yang, et al.
Published: (2025)
by: Wang, Yang, et al.
Published: (2025)
SUGAR: Leveraging Contextual Confidence for Smarter Retrieval
by: Zubkova, Hanna, et al.
Published: (2025)
by: Zubkova, Hanna, et al.
Published: (2025)
Khayyam Challenge (PersianMMLU): Is Your LLM Truly Wise to The Persian Language?
by: Ghahroodi, Omid, et al.
Published: (2024)
by: Ghahroodi, Omid, et al.
Published: (2024)
Using Perspectival Words Is Harder Than Vocabulary Words for Humans and Even More So for Multimodal Language Models
by: Dong, Dota Tianai, et al.
Published: (2025)
by: Dong, Dota Tianai, et al.
Published: (2025)
Continual-learning for Modelling Low-Resource Languages from Large Language Models
by: K, Santosh Srinath, et al.
Published: (2026)
by: K, Santosh Srinath, et al.
Published: (2026)
Saying More Than They Know: A Framework for Quantifying Epistemic-Rhetorical Miscalibration in Large Language Models
by: Bakhshi, Asim D.
Published: (2026)
by: Bakhshi, Asim D.
Published: (2026)
Metamorphic Testing for Fairness Evaluation in Large Language Models: Identifying Intersectional Bias in LLaMA and GPT
by: Reddy, Harishwar, et al.
Published: (2025)
by: Reddy, Harishwar, et al.
Published: (2025)
Are self-explanations from Large Language Models faithful?
by: Madsen, Andreas, et al.
Published: (2024)
by: Madsen, Andreas, et al.
Published: (2024)
Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision
by: Pala, Tej Deep, et al.
Published: (2025)
by: Pala, Tej Deep, et al.
Published: (2025)
AgentFloor: How Far Up the tool use Ladder Can Small Open-Weight Models Go?
by: Karmakar, Ranit, et al.
Published: (2026)
by: Karmakar, Ranit, et al.
Published: (2026)
Is Multilingual LLM Watermarking Truly Multilingual? Scaling Robustness to 100+ Languages via Back-Translation
by: Mohamed, Asim, et al.
Published: (2025)
by: Mohamed, Asim, et al.
Published: (2025)
Informed Routing in LLMs: Smarter Token-Level Computation for Faster Inference
by: Han, Chao, et al.
Published: (2025)
by: Han, Chao, et al.
Published: (2025)
Leviathan: Decoupling Input and Output Representations in Language Models
by: Batley, Reza T., et al.
Published: (2026)
by: Batley, Reza T., et al.
Published: (2026)
Divergent Creativity in Humans and Large Language Models
by: Bellemare-Pepin, Antoine, et al.
Published: (2024)
by: Bellemare-Pepin, Antoine, et al.
Published: (2024)
Two Heads Are Better Than One: Integrating Knowledge from Knowledge Graphs and Large Language Models for Entity Alignment
by: Yang, Linyao, et al.
Published: (2024)
by: Yang, Linyao, et al.
Published: (2024)
BELL: Benchmarking the Explainability of Large Language Models
by: Ahmed, Syed Quiser, et al.
Published: (2025)
by: Ahmed, Syed Quiser, et al.
Published: (2025)
Loop as a Bridge: Can Looped Transformers Truly Link Representation Space and Natural Language Outputs?
by: Chen, Guanxu, et al.
Published: (2026)
by: Chen, Guanxu, et al.
Published: (2026)
Enhancing Human-Like Responses in Large Language Models
by: Çalık, Ethem Yağız, et al.
Published: (2025)
by: Çalık, Ethem Yağız, et al.
Published: (2025)
Humanity in AI: Detecting the Personality of Large Language Models
by: Zhan, Baohua, et al.
Published: (2024)
by: Zhan, Baohua, et al.
Published: (2024)
LLM2Vec: Large Language Models Are Secretly Powerful Text Encoders
by: BehnamGhader, Parishad, et al.
Published: (2024)
by: BehnamGhader, Parishad, et al.
Published: (2024)
TeacherLM: Teaching to Fish Rather Than Giving the Fish, Language Modeling Likewise
by: He, Nan, et al.
Published: (2023)
by: He, Nan, et al.
Published: (2023)
Are Smarter LLMs Safer? Exploring Safety-Reasoning Trade-offs in Prompting and Fine-Tuning
by: Li, Ang, et al.
Published: (2025)
by: Li, Ang, et al.
Published: (2025)
Algorithmic Cultivation: How Social Media Feeds Shape User Language
by: Pal, Olivia, et al.
Published: (2026)
by: Pal, Olivia, et al.
Published: (2026)
Opportunities and Challenges of Large Language Models for Low-Resource Languages in Humanities Research
by: Zhong, Tianyang, et al.
Published: (2024)
by: Zhong, Tianyang, et al.
Published: (2024)
Comparing Human and Large Language Model Interpretation of Implicit Information
by: De Santis, Antonio, et al.
Published: (2026)
by: De Santis, Antonio, et al.
Published: (2026)
Aligning Large Language Model Behavior with Human Citation Preferences
by: Ando, Kenichiro, et al.
Published: (2026)
by: Ando, Kenichiro, et al.
Published: (2026)
Can Large Language Models Express Uncertainty Like Human?
by: Tao, Linwei, et al.
Published: (2025)
by: Tao, Linwei, et al.
Published: (2025)
High-Dimension Human Value Representation in Large Language Models
by: Cahyawijaya, Samuel, et al.
Published: (2024)
by: Cahyawijaya, Samuel, et al.
Published: (2024)
Similar Items
-
Cause and Effect: Can Large Language Models Truly Understand Causality?
by: Ashwani, Swagata, et al.
Published: (2024) -
Benchmarks Saturate When The Model Gets Smarter Than The Judge
by: Ballon, Marthe, et al.
Published: (2026) -
Reasoning with Sampling: Your Base Model is Smarter Than You Think
by: Karan, Aayush, et al.
Published: (2025) -
How Well Do Large Language Models Truly Ground?
by: Lee, Hyunji, et al.
Published: (2023) -
Is Pre-training Truly Better Than Meta-Learning?
by: Miranda, Brando, et al.
Published: (2023)