LLM Microscope: What Model Internals Reveal About Answer Correctness and Context Utilization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Jiarui, Jain, Jivitesh, Diab, Mona, Subramani, Nishant |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Personal Information Parroting in Language Models
par: Subramani, Nishant, et autres
Publié: (2026)
par: Subramani, Nishant, et autres
Publié: (2026)
SimBA: Simplifying Benchmark Analysis Using Performance Matrices Alone
par: Subramani, Nishant, et autres
Publié: (2025)
par: Subramani, Nishant, et autres
Publié: (2025)
Model Internal Sleuthing: Finding Lexical Identity and Inflectional Features in Modern Language Models
par: Li, Michael, et autres
Publié: (2025)
par: Li, Michael, et autres
Publié: (2025)
Automatic Generation of Model and Data Cards: A Step Towards Responsible AI
par: Liu, Jiarui, et autres
Publié: (2024)
par: Liu, Jiarui, et autres
Publié: (2024)
Humanizing Machines: Rethinking LLM Anthropomorphism Through a Multi-Level Framework of Design
par: Xiao, Yunze, et autres
Publié: (2025)
par: Xiao, Yunze, et autres
Publié: (2025)
How Much Do Circuits Tell Us? Measuring the Consistency and Specificity of Language Model Circuits
par: Li, Michael, et autres
Publié: (2026)
par: Li, Michael, et autres
Publié: (2026)
BIG5-CHAT: Shaping LLM Personalities Through Training on Human-Grounded Data
par: Li, Wenkai, et autres
Publié: (2024)
par: Li, Wenkai, et autres
Publié: (2024)
Taming Object Hallucinations with Verified Atomic Confidence Estimation
par: Liu, Jiarui, et autres
Publié: (2025)
par: Liu, Jiarui, et autres
Publié: (2025)
Generative Value Conflicts Reveal LLM Priorities
par: Liu, Andy, et autres
Publié: (2025)
par: Liu, Andy, et autres
Publié: (2025)
Evaluating Large Language Model Biases in Persona-Steered Generation
par: Liu, Andy, et autres
Publié: (2024)
par: Liu, Andy, et autres
Publié: (2024)
Truth as a Trajectory: What Internal Representations Reveal About Large Language Model Reasoning
par: Damirchi, Hamed, et autres
Publié: (2026)
par: Damirchi, Hamed, et autres
Publié: (2026)
A Note on Bias to Complete
par: Xu, Jia, et autres
Publié: (2024)
par: Xu, Jia, et autres
Publié: (2024)
MICE for CATs: Model-Internal Confidence Estimation for Calibrating Agents with Tools
par: Subramani, Nishant, et autres
Publié: (2025)
par: Subramani, Nishant, et autres
Publié: (2025)
NLI under the Microscope: What Atomic Hypothesis Decomposition Reveals
par: Srikanth, Neha, et autres
Publié: (2025)
par: Srikanth, Neha, et autres
Publié: (2025)
Combining Discrete Wavelet and Cosine Transforms for Efficient Sentence Embedding
par: Salama, Rana, et autres
Publié: (2025)
par: Salama, Rana, et autres
Publié: (2025)
Mining the Mind: What 100M Beliefs Reveal About Frontier LLM Knowledge
par: Ghosh, Shrestha, et autres
Publié: (2025)
par: Ghosh, Shrestha, et autres
Publié: (2025)
Defragmenting Language Models: An Interpretability-based Approach for Vocabulary Expansion
par: Mehta, Maitrey, et autres
Publié: (2026)
par: Mehta, Maitrey, et autres
Publié: (2026)
EVALUESTEER: Measuring Reward Model Steerability Towards Values and Preferences
par: Ghate, Kshitish, et autres
Publié: (2025)
par: Ghate, Kshitish, et autres
Publié: (2025)
Biases Propagate in Encoder-based Vision-Language Models: A Systematic Analysis From Intrinsic Measures to Zero-shot Retrieval Outcomes
par: Ghate, Kshitish, et autres
Publié: (2025)
par: Ghate, Kshitish, et autres
Publié: (2025)
Decoding Dark Matter: Specialized Sparse Autoencoders for Interpreting Rare Concepts in Foundation Models
par: Muhamed, Aashiq, et autres
Publié: (2024)
par: Muhamed, Aashiq, et autres
Publié: (2024)
Semantic Compression for Word and Sentence Embeddings using Discrete Wavelet Transform
par: Salama, Rana Aref, et autres
Publié: (2025)
par: Salama, Rana Aref, et autres
Publié: (2025)
MixSD: Mixed Contextual Self-Distillation for Knowledge Injection
par: Liu, Jiarui, et autres
Publié: (2026)
par: Liu, Jiarui, et autres
Publié: (2026)
Towards Global AI Inclusivity: A Large-Scale Multilingual Terminology Dataset (GIST)
par: Liu, Jiarui, et autres
Publié: (2024)
par: Liu, Jiarui, et autres
Publié: (2024)
StressRoBERTa: Cross-Condition Transfer Learning from Depression, Anxiety, and PTSD to Stress Detection
par: Alqahtani, Amal, et autres
Publié: (2025)
par: Alqahtani, Amal, et autres
Publié: (2025)
DWTSumm: Discrete Wavelet Transform for Document Summarization
par: Salama, Rana, et autres
Publié: (2026)
par: Salama, Rana, et autres
Publié: (2026)
Evaluating and Calibrating LLM Confidence on Questions with Multiple Correct Answers
par: Wang, Yuhan, et autres
Publié: (2026)
par: Wang, Yuhan, et autres
Publié: (2026)
Can Large Language Models Infer Causation from Correlation?
par: Jin, Zhijing, et autres
Publié: (2023)
par: Jin, Zhijing, et autres
Publié: (2023)
Analyzing the Role of Semantic Representations in the Era of Large Language Models
par: Jin, Zhijing, et autres
Publié: (2024)
par: Jin, Zhijing, et autres
Publié: (2024)
Synthetic Socratic Debates: Examining Persona Effects on Moral Decision and Persuasion Dynamics
par: Liu, Jiarui, et autres
Publié: (2025)
par: Liu, Jiarui, et autres
Publié: (2025)
Artifacts or Abduction: How Do LLMs Answer Multiple-Choice Questions Without the Question?
par: Balepur, Nishant, et autres
Publié: (2024)
par: Balepur, Nishant, et autres
Publié: (2024)
Reverse Question Answering: Can an LLM Write a Question so Hard (or Bad) that it Can't Answer?
par: Balepur, Nishant, et autres
Publié: (2024)
par: Balepur, Nishant, et autres
Publié: (2024)
Emotion Classification in Low and Moderate Resource Languages
par: Tafreshi, Shabnam, et autres
Publié: (2024)
par: Tafreshi, Shabnam, et autres
Publié: (2024)
Investigating Cultural Alignment of Large Language Models
par: AlKhamissi, Badr, et autres
Publié: (2024)
par: AlKhamissi, Badr, et autres
Publié: (2024)
LLM Internal States Reveal Hallucination Risk Faced With a Query
par: Ji, Ziwei, et autres
Publié: (2024)
par: Ji, Ziwei, et autres
Publié: (2024)
See What LLMs Cannot Answer: A Self-Challenge Framework for Uncovering LLM Weaknesses
par: Chen, Yulong, et autres
Publié: (2024)
par: Chen, Yulong, et autres
Publié: (2024)
Between Rules and Reality: On the Context Sensitivity of LLM Moral Judgment
par: Sauter, Adrian, et autres
Publié: (2026)
par: Sauter, Adrian, et autres
Publié: (2026)
When Names Disappear: Revealing What LLMs Actually Understand About Code
par: Le, Cuong Chi, et autres
Publié: (2025)
par: Le, Cuong Chi, et autres
Publié: (2025)
Make Your LLM Fully Utilize the Context
par: An, Shengnan, et autres
Publié: (2024)
par: An, Shengnan, et autres
Publié: (2024)
Depth-Wise Attention (DWAtt): A Layer Fusion Method for Data-Efficient Classification
par: ElNokrashy, Muhammad, et autres
Publié: (2022)
par: ElNokrashy, Muhammad, et autres
Publié: (2022)
LLM-Microscope: Uncovering the Hidden Role of Punctuation in Context Memory of Transformers
par: Razzhigaev, Anton, et autres
Publié: (2025)
par: Razzhigaev, Anton, et autres
Publié: (2025)
Documents similaires
-
Personal Information Parroting in Language Models
par: Subramani, Nishant, et autres
Publié: (2026) -
SimBA: Simplifying Benchmark Analysis Using Performance Matrices Alone
par: Subramani, Nishant, et autres
Publié: (2025) -
Model Internal Sleuthing: Finding Lexical Identity and Inflectional Features in Modern Language Models
par: Li, Michael, et autres
Publié: (2025) -
Automatic Generation of Model and Data Cards: A Step Towards Responsible AI
par: Liu, Jiarui, et autres
Publié: (2024) -
Humanizing Machines: Rethinking LLM Anthropomorphism Through a Multi-Level Framework of Design
par: Xiao, Yunze, et autres
Publié: (2025)