Beyond Reproducibility: Token Probabilities Expose Large Language Model Nondeterminism
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fu, Tairan, Martínez, Gonzalo, Conde, Javier, Arriaga, Carlos, Reviriego, Pedro, Qi, Xiuyuan, Liu, Shanshan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multiple Choice Questions: Reasoning Makes Large Language Models (LLMs) More Self-Confident, Especially When They are Wrong
par: Fu, Tairan, et autres
Publié: (2025)
par: Fu, Tairan, et autres
Publié: (2025)
Is There a Case for Conversation Optimized Tokenizers in Large Language Models?
par: Ferrando, Raquel, et autres
Publié: (2025)
par: Ferrando, Raquel, et autres
Publié: (2025)
The Generative Energy Arena (GEA): Incorporating Energy Awareness in Large Language Model (LLM) Human Evaluations
par: Arriaga, Carlos, et autres
Publié: (2025)
par: Arriaga, Carlos, et autres
Publié: (2025)
Lost in Sampling: Assessing Lexical Reachability in LLMs via the Word Coverage Score (WCS)
par: Awad, Samer, et autres
Publié: (2026)
par: Awad, Samer, et autres
Publié: (2026)
Speed and Conversational Large Language Models: Not All Is About Tokens per Second
par: Conde, Javier, et autres
Publié: (2025)
par: Conde, Javier, et autres
Publié: (2025)
Why Do Large Language Models (LLMs) Struggle to Count Letters?
par: Fu, Tairan, et autres
Publié: (2024)
par: Fu, Tairan, et autres
Publié: (2024)
Can ChatGPT Learn to Count Letters?
par: Conde, Javier, et autres
Publié: (2025)
par: Conde, Javier, et autres
Publié: (2025)
Stochastic Streets: A Walk Through Random LLM Address Generation in four European Cities
par: Fu, Tairan, et autres
Publié: (2025)
par: Fu, Tairan, et autres
Publié: (2025)
Concurrent Linguistic Error Detection (CLED): a New Methodology for Error Detection in Large Language Models
par: Zhu, Jinhua, et autres
Publié: (2024)
par: Zhu, Jinhua, et autres
Publié: (2024)
To Words and Beyond: Probing Large Language Models for Sentence-Level Psycholinguistic Norms of Memorability and Reading Times
par: Clark, Thomas Hikaru, et autres
Publié: (2026)
par: Clark, Thomas Hikaru, et autres
Publié: (2026)
Understanding the Impact of Artificial Intelligence in Academic Writing: Metadata to the Rescue
par: Conde, Javier, et autres
Publié: (2025)
par: Conde, Javier, et autres
Publié: (2025)
Playing with words: Comparing the vocabulary and lexical diversity of ChatGPT and humans
par: Reviriego, Pedro, et autres
Publié: (2023)
par: Reviriego, Pedro, et autres
Publié: (2023)
Psycholinguistic Word Features: a New Approach for the Evaluation of LLMs Alignment with Humans
par: Conde, Javier, et autres
Publié: (2025)
par: Conde, Javier, et autres
Publié: (2025)
How does fine-tuning improve sensorimotor representations in large language models?
par: Wu, Minghua, et autres
Publié: (2026)
par: Wu, Minghua, et autres
Publié: (2026)
Energy-Efficient Stochastic Computing (SC) Neural Networks for Internet of Things Devices With Layer-Wise Adjustable Sequence Length (ASL)
par: Wang, Ziheng, et autres
Publié: (2025)
par: Wang, Ziheng, et autres
Publié: (2025)
Have Multimodal Large Language Models (MLLMs) Really Learned to Tell the Time on Analog Clocks?
par: Fu, Tairan, et autres
Publié: (2025)
par: Fu, Tairan, et autres
Publié: (2025)
Large Language Models and Book Summarization: Reading or Remembering, Which Is Better?
par: Fu, Tairan, et autres
Publié: (2026)
par: Fu, Tairan, et autres
Publié: (2026)
Real-time Spatial Retrieval Augmented Generation for Urban Environments
par: Campo, David Nazareno, et autres
Publié: (2025)
par: Campo, David Nazareno, et autres
Publié: (2025)
Lost in the Vibrations: Vision Language Models Fail the Dynamic Gauges Test
par: Fu, Tairan, et autres
Publié: (2026)
par: Fu, Tairan, et autres
Publié: (2026)
DiFR: Inference Verification Despite Nondeterminism
par: Karvonen, Adam, et autres
Publié: (2025)
par: Karvonen, Adam, et autres
Publié: (2025)
Backdoor Token Unlearning: Exposing and Defending Backdoors in Pretrained Language Models
par: Jiang, Peihai, et autres
Publié: (2025)
par: Jiang, Peihai, et autres
Publié: (2025)
Optimistic Verifiable Training by Controlling Hardware Nondeterminism
par: Srivastava, Megha, et autres
Publié: (2024)
par: Srivastava, Megha, et autres
Publié: (2024)
Spanish and LLM Benchmarks: is MMLU Lost in Translation?
par: Plaza, Irene, et autres
Publié: (2024)
par: Plaza, Irene, et autres
Publié: (2024)
Evaluating SAT and SMT Solvers on Large-Scale Sudoku Puzzles
par: Davis, Liam, et autres
Publié: (2025)
par: Davis, Liam, et autres
Publié: (2025)
Assessing Latency in ASR Systems: A Methodological Perspective for Real-Time Use
par: Arriaga, Carlos, et autres
Publié: (2024)
par: Arriaga, Carlos, et autres
Publié: (2024)
Detecting Hallucinations in Large Language Model Generation: A Token Probability Approach
par: Quevedo, Ernesto, et autres
Publié: (2024)
par: Quevedo, Ernesto, et autres
Publié: (2024)
Adding LLMs to the psycholinguistic norming toolbox: A practical guide to getting the most out of human ratings
par: Conde, Javier, et autres
Publié: (2025)
par: Conde, Javier, et autres
Publié: (2025)
Distributed Specialization: Rare-Token Neurons in Large Language Models
par: Liu, Jing, et autres
Publié: (2025)
par: Liu, Jing, et autres
Publié: (2025)
BrainBench: Exposing the Commonsense Reasoning Gap in Large Language Models
par: Tang, Yuzhe
Publié: (2026)
par: Tang, Yuzhe
Publié: (2026)
Calibrating Verbalized Probabilities for Large Language Models
par: Wang, Cheng, et autres
Publié: (2024)
par: Wang, Cheng, et autres
Publié: (2024)
Incoherent Probability Judgments in Large Language Models
par: Zhu, Jian-Qiao, et autres
Publié: (2024)
par: Zhu, Jian-Qiao, et autres
Publié: (2024)
Beyond Next Token Prediction: Patch-Level Training for Large Language Models
par: Shao, Chenze, et autres
Publié: (2024)
par: Shao, Chenze, et autres
Publié: (2024)
Reproducibility Study of "XRec: Large Language Models for Explainable Recommendation"
par: Mishra, Ranjan, et autres
Publié: (2025)
par: Mishra, Ranjan, et autres
Publié: (2025)
Token Signature: Predicting Chain-of-Thought Gains with Token Decoding Feature in Large Language Models
par: Liu, Peijie, et autres
Publié: (2025)
par: Liu, Peijie, et autres
Publié: (2025)
Reproducing and Extending Experiments in Behavioral Strategy with Large Language Models
par: Albert, Daniel, et autres
Publié: (2024)
par: Albert, Daniel, et autres
Publié: (2024)
Tokenization Matters! Degrading Large Language Models through Challenging Their Tokenization
par: Wang, Dixuan, et autres
Publié: (2024)
par: Wang, Dixuan, et autres
Publié: (2024)
Entropy-KL Divergence-based Token Masking: A Novel Approach for Selective Fine-tuning of Large Language Models
par: Liu, Qi, et autres
Publié: (2026)
par: Liu, Qi, et autres
Publié: (2026)
Transient Turn Injection: Exposing Stateless Multi-Turn Vulnerabilities in Large Language Models
par: Rayhan, Naheed, et autres
Publié: (2026)
par: Rayhan, Naheed, et autres
Publié: (2026)
Re-Initialization Token Learning for Tool-Augmented Large Language Models
par: Li, Chenghao, et autres
Publié: (2025)
par: Li, Chenghao, et autres
Publié: (2025)
findsylls: A Language-Agnostic Toolkit for Syllable-Level Speech Tokenization and Embedding
par: Martínez, Héctor Javier Vázquez
Publié: (2026)
par: Martínez, Héctor Javier Vázquez
Publié: (2026)
Documents similaires
-
Multiple Choice Questions: Reasoning Makes Large Language Models (LLMs) More Self-Confident, Especially When They are Wrong
par: Fu, Tairan, et autres
Publié: (2025) -
Is There a Case for Conversation Optimized Tokenizers in Large Language Models?
par: Ferrando, Raquel, et autres
Publié: (2025) -
The Generative Energy Arena (GEA): Incorporating Energy Awareness in Large Language Model (LLM) Human Evaluations
par: Arriaga, Carlos, et autres
Publié: (2025) -
Lost in Sampling: Assessing Lexical Reachability in LLMs via the Word Coverage Score (WCS)
par: Awad, Samer, et autres
Publié: (2026) -
Speed and Conversational Large Language Models: Not All Is About Tokens per Second
par: Conde, Javier, et autres
Publié: (2025)