Certifying Knowledge Comprehension in LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Chaudhary, Isha, Jain, Vedaant V., Singh, Gagandeep |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Revealing Interpretable Failure Modes of VLMs
por: Chaudhary, Isha, et al.
Publicado: (2026)
por: Chaudhary, Isha, et al.
Publicado: (2026)
Bypassing the Safety Training of Open-Source LLMs with Priming Attacks
por: Vega, Jason, et al.
Publicado: (2023)
por: Vega, Jason, et al.
Publicado: (2023)
Certifying Counterfactual Bias in LLMs
por: Chaudhary, Isha, et al.
Publicado: (2024)
por: Chaudhary, Isha, et al.
Publicado: (2024)
Lumos: Let there be Language Model System Certification
por: Chaudhary, Isha, et al.
Publicado: (2025)
por: Chaudhary, Isha, et al.
Publicado: (2025)
How Catastrophic is Your LLM? Certifying Risk in Conversation
por: Wang, Chengxiao, et al.
Publicado: (2025)
por: Wang, Chengxiao, et al.
Publicado: (2025)
Cer-Eval: Certifiable and Cost-Efficient Evaluation Framework for LLMs
por: Wang, Ganghua, et al.
Publicado: (2025)
por: Wang, Ganghua, et al.
Publicado: (2025)
SafetyNet: Detecting Harmful Outputs in LLMs by Modeling and Monitoring Deceptive Behaviors
por: Chaudhary, Maheep, et al.
Publicado: (2025)
por: Chaudhary, Maheep, et al.
Publicado: (2025)
When Shallow Wins: Silent Failures and the Depth-Accuracy Paradox in Latent Reasoning
por: Sahoo, Subramanyam, et al.
Publicado: (2026)
por: Sahoo, Subramanyam, et al.
Publicado: (2026)
SAHOO: Safeguarded Alignment for High-Order Optimization Objectives in Recursive Self-Improvement
por: Sahoo, Subramanyam, et al.
Publicado: (2026)
por: Sahoo, Subramanyam, et al.
Publicado: (2026)
The Reasoning Trap -- Logical Reasoning as a Mechanistic Pathway to Situational Awareness
por: Sahoo, Subramanyam, et al.
Publicado: (2026)
por: Sahoo, Subramanyam, et al.
Publicado: (2026)
Deep Knowledge-Infusion For Explainable Depression Detection
por: Dalal, Sumit, et al.
Publicado: (2024)
por: Dalal, Sumit, et al.
Publicado: (2024)
KSOD: Knowledge Supplement for LLMs On Demand
por: Li, Haoran, et al.
Publicado: (2025)
por: Li, Haoran, et al.
Publicado: (2025)
Demystifying Hybrid Thinking: Can LLMs Truly Switch Between Think and No-Think?
por: Wang, Shouren, et al.
Publicado: (2025)
por: Wang, Shouren, et al.
Publicado: (2025)
LLMs Are Not Intelligent Thinkers: Introducing Mathematical Topic Tree Benchmark for Comprehensive Evaluation of LLMs
por: Davoodi, Arash Gholami, et al.
Publicado: (2024)
por: Davoodi, Arash Gholami, et al.
Publicado: (2024)
A Comprehensive Evaluation framework of Alignment Techniques for LLMs
por: Azmat, Muneeza, et al.
Publicado: (2025)
por: Azmat, Muneeza, et al.
Publicado: (2025)
Interpreting the Effects of Quantization on LLMs
por: Singh, Manpreet, et al.
Publicado: (2025)
por: Singh, Manpreet, et al.
Publicado: (2025)
Certified Robustness Under Bounded Levenshtein Distance
por: Rocamora, Elias Abad, et al.
Publicado: (2025)
por: Rocamora, Elias Abad, et al.
Publicado: (2025)
Layerwise Recall and the Geometry of Interwoven Knowledge in LLMs
por: Lei, Ge, et al.
Publicado: (2025)
por: Lei, Ge, et al.
Publicado: (2025)
PropMEND: Hypernetworks for Knowledge Propagation in LLMs
por: Liu, Zeyu Leo, et al.
Publicado: (2025)
por: Liu, Zeyu Leo, et al.
Publicado: (2025)
Time-R1: Towards Comprehensive Temporal Reasoning in LLMs
por: Liu, Zijia, et al.
Publicado: (2025)
por: Liu, Zijia, et al.
Publicado: (2025)
Beyond Answers: Transferring Reasoning Capabilities to Smaller LLMs Using Multi-Teacher Knowledge Distillation
por: Tian, Yijun, et al.
Publicado: (2024)
por: Tian, Yijun, et al.
Publicado: (2024)
BlockCert: Certified Blockwise Extraction of Transformer Mechanisms
por: Andric, Sandro
Publicado: (2025)
por: Andric, Sandro
Publicado: (2025)
Parameter Efficient Fine Tuning: A Comprehensive Analysis Across Applications
por: Balne, Charith Chandra Sai, et al.
Publicado: (2024)
por: Balne, Charith Chandra Sai, et al.
Publicado: (2024)
Task-Aware LoRA Adapter Composition via Similarity Retrieval in Vector Databases
por: Adsul, Riya, et al.
Publicado: (2026)
por: Adsul, Riya, et al.
Publicado: (2026)
Memorization vs. Reasoning: Updating LLMs with New Knowledge
por: Li, Aochong Oliver, et al.
Publicado: (2025)
por: Li, Aochong Oliver, et al.
Publicado: (2025)
Fine-Tuning or Retrieval? Comparing Knowledge Injection in LLMs
por: Ovadia, Oded, et al.
Publicado: (2023)
por: Ovadia, Oded, et al.
Publicado: (2023)
Alignment-Constrained Dynamic Pruning for LLMs: Identifying and Preserving Alignment-Critical Circuits
por: Patel, Dev, et al.
Publicado: (2025)
por: Patel, Dev, et al.
Publicado: (2025)
Dialogue Without Limits: Constant-Sized KV Caches for Extended Responses in LLMs
por: Ghadia, Ravi, et al.
Publicado: (2025)
por: Ghadia, Ravi, et al.
Publicado: (2025)
Can GPT Redefine Medical Understanding? Evaluating GPT on Biomedical Machine Reading Comprehension
por: Vatsal, Shubham, et al.
Publicado: (2024)
por: Vatsal, Shubham, et al.
Publicado: (2024)
Comprehensive Modeling and Question Answering of Cancer Clinical Practice Guidelines using LLMs
por: Gupta, Bhumika, et al.
Publicado: (2025)
por: Gupta, Bhumika, et al.
Publicado: (2025)
Towards a Holistic Evaluation of LLMs on Factual Knowledge Recall
por: Yuan, Jiaqing, et al.
Publicado: (2024)
por: Yuan, Jiaqing, et al.
Publicado: (2024)
RAG in the Wild: On the (In)effectiveness of LLMs with Mixture-of-Knowledge Retrieval Augmentation
por: Xu, Ran, et al.
Publicado: (2025)
por: Xu, Ran, et al.
Publicado: (2025)
Censored LLMs as a Natural Testbed for Secret Knowledge Elicitation
por: Casademunt, Helena, et al.
Publicado: (2026)
por: Casademunt, Helena, et al.
Publicado: (2026)
Do LLMs Encode Functional Importance of Reasoning Tokens?
por: Singh, Janvijay, et al.
Publicado: (2026)
por: Singh, Janvijay, et al.
Publicado: (2026)
Agribot: agriculture-specific question answer system
por: Jain, Naman, et al.
Publicado: (2025)
por: Jain, Naman, et al.
Publicado: (2025)
Comprehensive Reassessment of Large-Scale Evaluation Outcomes in LLMs: A Multifaceted Statistical Approach
por: Sun, Kun, et al.
Publicado: (2024)
por: Sun, Kun, et al.
Publicado: (2024)
PII-Scope: A Comprehensive Study on Training Data PII Extraction Attacks in LLMs
por: Nakka, Krishna Kanth, et al.
Publicado: (2024)
por: Nakka, Krishna Kanth, et al.
Publicado: (2024)
Retrieval Augmented Generation or Long-Context LLMs? A Comprehensive Study and Hybrid Approach
por: Li, Zhuowan, et al.
Publicado: (2024)
por: Li, Zhuowan, et al.
Publicado: (2024)
KS-Lottery: Finding Certified Lottery Tickets for Multilingual Language Models
por: Yuan, Fei, et al.
Publicado: (2024)
por: Yuan, Fei, et al.
Publicado: (2024)
Code Comprehension then Auditing for Unsupervised LLM Evaluation
por: Patel, Bhrij, et al.
Publicado: (2024)
por: Patel, Bhrij, et al.
Publicado: (2024)
Ejemplares similares
-
Revealing Interpretable Failure Modes of VLMs
por: Chaudhary, Isha, et al.
Publicado: (2026) -
Bypassing the Safety Training of Open-Source LLMs with Priming Attacks
por: Vega, Jason, et al.
Publicado: (2023) -
Certifying Counterfactual Bias in LLMs
por: Chaudhary, Isha, et al.
Publicado: (2024) -
Lumos: Let there be Language Model System Certification
por: Chaudhary, Isha, et al.
Publicado: (2025) -
How Catastrophic is Your LLM? Certifying Risk in Conversation
por: Wang, Chengxiao, et al.
Publicado: (2025)