Entropy and Attention Dynamics in Small Language Models: A Trace-Level Structural Analysis on the TruthfulQA Benchmark
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Adeseye, Adeyemi, Adeseye, Aisvarya, Tenhunen, Hannu, Isoaho, Jouni |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Improving Quantized Model Performance in Qualitative Analysis with Multi-Pass Prompt Verification
par: Adeseye, Aisvarya, et autres
Publié: (2026)
par: Adeseye, Aisvarya, et autres
Publié: (2026)
Parallel LLM Reasoning for Bias-Resilient, Robust Conceptual Abstraction
par: Adeseye, Aisvarya, et autres
Publié: (2026)
par: Adeseye, Aisvarya, et autres
Publié: (2026)
Dynamic Agentic AI Expert Profiler System Architecture for Multidomain Intelligence Modeling
par: Adeseye, Aisvarya, et autres
Publié: (2026)
par: Adeseye, Aisvarya, et autres
Publié: (2026)
Local Language Models for Context-Aware Adaptive Anonymization of Sensitive Text
par: Adeseye, Aisvarya, et autres
Publié: (2026)
par: Adeseye, Aisvarya, et autres
Publié: (2026)
Modular AI-Powered Interviewer with Dynamic Question Generation and Expertise Profiling
par: Adeseye, Aisvarya, et autres
Publié: (2025)
par: Adeseye, Aisvarya, et autres
Publié: (2025)
A Prompt-Based Framework for Loop Vulnerability Detection Using Local LLMs
par: Adeseye, Adeyemi, et autres
Publié: (2026)
par: Adeseye, Adeyemi, et autres
Publié: (2026)
Strengthening Human-Centric Chain-of-Thought Reasoning Integrity in LLMs via a Structured Prompt Framework
par: Zhou, Jiling, et autres
Publié: (2026)
par: Zhou, Jiling, et autres
Publié: (2026)
Investigating Symbolic Triggers of Hallucination in Gemma Models Across HaluEval and TruthfulQA
par: Lamba, Naveen, et autres
Publié: (2025)
par: Lamba, Naveen, et autres
Publié: (2025)
SymLoc: Symbolic Localization of Hallucination across HaluEval and TruthfulQA
par: Lamba, Naveen, et autres
Publié: (2025)
par: Lamba, Naveen, et autres
Publié: (2025)
CorpusQA: A 10 Million Token Benchmark for Corpus-Level Analysis and Reasoning
par: Lu, Zhiyuan, et autres
Publié: (2026)
par: Lu, Zhiyuan, et autres
Publié: (2026)
Cards Against LLMs: Benchmarking Humor Alignment in Large Language Models
par: Fettach, Yousra, et autres
Publié: (2026)
par: Fettach, Yousra, et autres
Publié: (2026)
FloorplanQA: A Benchmark for Spatial Reasoning in LLMs using Structured Representations
par: Rodionov, Fedor, et autres
Publié: (2025)
par: Rodionov, Fedor, et autres
Publié: (2025)
FairMedQA: Benchmarking Bias in Large Language Models for Medical Question Answering
par: Xiao, Ying, et autres
Publié: (2025)
par: Xiao, Ying, et autres
Publié: (2025)
DateLogicQA: Benchmarking Temporal Biases in Large Language Models
par: Bhatia, Gagan, et autres
Publié: (2024)
par: Bhatia, Gagan, et autres
Publié: (2024)
Benchmarking Small Language Models and Small Reasoning Language Models on System Log Severity Classification
par: Masri, Yahya, et autres
Publié: (2026)
par: Masri, Yahya, et autres
Publié: (2026)
Reducing False Ventricular Tachycardia Alarms in ICU Settings: A Machine Learning Approach
par: Farayola, Grace Funmilayo, et autres
Publié: (2025)
par: Farayola, Grace Funmilayo, et autres
Publié: (2025)
DesignQA: A Multimodal Benchmark for Evaluating Large Language Models' Understanding of Engineering Documentation
par: Doris, Anna C., et autres
Publié: (2024)
par: Doris, Anna C., et autres
Publié: (2024)
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
par: Tan, Yingshui, et autres
Publié: (2024)
par: Tan, Yingshui, et autres
Publié: (2024)
The Geometry of Truth: Emergent Linear Structure in Large Language Model Representations of True/False Datasets
par: Marks, Samuel, et autres
Publié: (2023)
par: Marks, Samuel, et autres
Publié: (2023)
AirQA: A Comprehensive QA Dataset for AI Research with Instance-Level Evaluation
par: Huang, Tiancheng, et autres
Publié: (2025)
par: Huang, Tiancheng, et autres
Publié: (2025)
To Tell The Truth: Language of Deception and Language Models
par: Hazra, Sanchaita, et autres
Publié: (2023)
par: Hazra, Sanchaita, et autres
Publié: (2023)
MizanQA: Benchmarking Large Language Models on Moroccan Legal Question Answering
par: Bahaj, Adil, et autres
Publié: (2025)
par: Bahaj, Adil, et autres
Publié: (2025)
Evaluating Monolingual and Multilingual Large Language Models for Greek Question Answering: The DemosQA Benchmark
par: Mastrokostas, Charalampos, et autres
Publié: (2026)
par: Mastrokostas, Charalampos, et autres
Publié: (2026)
PinpointQA: A Dataset and Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos
par: Zhou, Zhiyu, et autres
Publié: (2026)
par: Zhou, Zhiyu, et autres
Publié: (2026)
Latent Multi-Head Attention for Small Language Models
par: Mehta, Sushant, et autres
Publié: (2025)
par: Mehta, Sushant, et autres
Publié: (2025)
M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
par: Li, Chuhan, et autres
Publié: (2024)
par: Li, Chuhan, et autres
Publié: (2024)
EVGeoQA: Benchmarking LLMs on Dynamic, Multi-Objective Geo-Spatial Exploration
par: Wu, Jianfei, et autres
Publié: (2026)
par: Wu, Jianfei, et autres
Publié: (2026)
FanOutQA: A Multi-Hop, Multi-Document Question Answering Benchmark for Large Language Models
par: Zhu, Andrew, et autres
Publié: (2024)
par: Zhu, Andrew, et autres
Publié: (2024)
HealthQA-BR: A System-Wide Benchmark Reveals Critical Knowledge Gaps in Large Language Models
par: D'addario, Andrew Maranhão Ventura
Publié: (2025)
par: D'addario, Andrew Maranhão Ventura
Publié: (2025)
ThermoQA: A Three-Tier Benchmark for Evaluating Thermodynamic Reasoning in Large Language Models
par: Düzkar, Kemal
Publié: (2026)
par: Düzkar, Kemal
Publié: (2026)
RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models
par: Satriani, Dario, et autres
Publié: (2025)
par: Satriani, Dario, et autres
Publié: (2025)
VideoCogQA: A Controllable Benchmark for Evaluating Cognitive Abilities in Video-Language Models
par: Li, Chenglin, et autres
Publié: (2024)
par: Li, Chenglin, et autres
Publié: (2024)
UGMathBench: A Diverse and Dynamic Benchmark for Undergraduate-Level Mathematical Reasoning with Large Language Models
par: Xu, Xin, et autres
Publié: (2025)
par: Xu, Xin, et autres
Publié: (2025)
SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding
par: Cai, Songcheng, et autres
Publié: (2026)
par: Cai, Songcheng, et autres
Publié: (2026)
OIDA-QA: A Multimodal Benchmark for Analyzing the Opioid Industry Documents Archive
par: Shen, Xuan, et autres
Publié: (2025)
par: Shen, Xuan, et autres
Publié: (2025)
The Shape of Reasoning: Topological Analysis of Reasoning Traces in Large Language Models
par: Tan, Xue Wen, et autres
Publié: (2025)
par: Tan, Xue Wen, et autres
Publié: (2025)
RealMath: A Continuous Benchmark for Evaluating Language Models on Research-Level Mathematics
par: Zhang, Jie, et autres
Publié: (2025)
par: Zhang, Jie, et autres
Publié: (2025)
MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
par: Zuo, Yuxin, et autres
Publié: (2025)
par: Zuo, Yuxin, et autres
Publié: (2025)
TruthX: Alleviating Hallucinations by Editing Large Language Models in Truthful Space
par: Zhang, Shaolei, et autres
Publié: (2024)
par: Zhang, Shaolei, et autres
Publié: (2024)
SLMQuant:Benchmarking Small Language Model Quantization for Practical Deployment
par: Wang, Jiacheng, et autres
Publié: (2025)
par: Wang, Jiacheng, et autres
Publié: (2025)
Documents similaires
-
Improving Quantized Model Performance in Qualitative Analysis with Multi-Pass Prompt Verification
par: Adeseye, Aisvarya, et autres
Publié: (2026) -
Parallel LLM Reasoning for Bias-Resilient, Robust Conceptual Abstraction
par: Adeseye, Aisvarya, et autres
Publié: (2026) -
Dynamic Agentic AI Expert Profiler System Architecture for Multidomain Intelligence Modeling
par: Adeseye, Aisvarya, et autres
Publié: (2026) -
Local Language Models for Context-Aware Adaptive Anonymization of Sensitive Text
par: Adeseye, Aisvarya, et autres
Publié: (2026) -
Modular AI-Powered Interviewer with Dynamic Question Generation and Expertise Profiling
par: Adeseye, Aisvarya, et autres
Publié: (2025)