The Geometry of Creative Variability: How Credal Sets Expose Calibration Gaps in Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Arias, Esteban Garces, Rodemann, Julian, Heumann, Christian |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Adaptive Contrastive Search: Uncertainty-Guided Decoding for Open-Ended Text Generation
par: Arias, Esteban Garces, et autres
Publié: (2024)
par: Arias, Esteban Garces, et autres
Publié: (2024)
Towards Better Open-Ended Text Generation: A Multicriteria Evaluation Framework
par: Arias, Esteban Garces, et autres
Publié: (2024)
par: Arias, Esteban Garces, et autres
Publié: (2024)
The Truncation Blind Spot: How Decoding Strategies Systematically Exclude Human-Like Token Choices
par: Arias, Esteban Garces, et autres
Publié: (2026)
par: Arias, Esteban Garces, et autres
Publié: (2026)
GUARD: Glocal Uncertainty-Aware Robust Decoding for Effective and Efficient Open-Ended Text Generation
par: Ding, Yuanhao, et autres
Publié: (2025)
par: Ding, Yuanhao, et autres
Publié: (2025)
Statistical Multicriteria Evaluation of LLM-Generated Text
par: Arias, Esteban Garces, et autres
Publié: (2025)
par: Arias, Esteban Garces, et autres
Publié: (2025)
Decoding Decoded: Understanding Hyperparameter Effects in Open-Ended Text Generation
par: Arias, Esteban Garces, et autres
Publié: (2024)
par: Arias, Esteban Garces, et autres
Publié: (2024)
Beyond Temperature: Hyperfitting as a Late-Stage Geometric Expansion
par: Li, Meimingwei, et autres
Publié: (2026)
par: Li, Meimingwei, et autres
Publié: (2026)
Modern Models, Medieval Texts: A POS Tagging Study of Old Occitan
par: Schöffel, Matthias, et autres
Publié: (2025)
par: Schöffel, Matthias, et autres
Publié: (2025)
A Statistical Case Against Empirical Human-AI Alignment
par: Rodemann, Julian, et autres
Publié: (2025)
par: Rodemann, Julian, et autres
Publié: (2025)
Unveiling Factors for Enhanced POS Tagging: A Study of Low-Resource Medieval Romance Languages
par: Schöffel, Matthias, et autres
Publié: (2025)
par: Schöffel, Matthias, et autres
Publié: (2025)
Min-$k$ Sampling: Decoupling Truncation from Temperature Scaling via Relative Logit Dynamics
par: Ding, Yuanhao, et autres
Publié: (2026)
par: Ding, Yuanhao, et autres
Publié: (2026)
From Traditional Taggers to LLMs: A Comparative Study of POS Tagging for Medieval Romance Languages
par: Schöffel, Matthias, et autres
Publié: (2026)
par: Schöffel, Matthias, et autres
Publié: (2026)
BrainBench: Exposing the Commonsense Reasoning Gap in Large Language Models
par: Tang, Yuzhe
Publié: (2026)
par: Tang, Yuzhe
Publié: (2026)
Can OpenSource beat ChatGPT? -- A Comparative Study of Large Language Models for Text-to-Code Generation
par: Mayer, Luis, et autres
Publié: (2024)
par: Mayer, Luis, et autres
Publié: (2024)
Credal Transformer: A Principled Approach for Quantifying and Mitigating Hallucinations in Large Language Models
par: Ji, Shihao, et autres
Publié: (2025)
par: Ji, Shihao, et autres
Publié: (2025)
Geometry-Calibrated Conformal Abstention for Language Models
par: Xu, Rui, et autres
Publié: (2026)
par: Xu, Rui, et autres
Publié: (2026)
Self-Reinforcing Controllable Synthesis of Rare Relational Data via Bayesian Calibration
par: Zhang, Chongsheng, et autres
Publié: (2026)
par: Zhang, Chongsheng, et autres
Publié: (2026)
Exposing Numeracy Gaps: A Benchmark to Evaluate Fundamental Numerical Abilities in Large Language Models
par: Li, Haoyang, et autres
Publié: (2025)
par: Li, Haoyang, et autres
Publié: (2025)
Theory-Grounded Evaluation Exposes the Authorship Gap in LLM Personalization
par: Sawant, Yash Ganpat
Publié: (2026)
par: Sawant, Yash Ganpat
Publié: (2026)
How Creative Are Large Language Models in Generating Molecules?
par: Tao, Wen, et autres
Publié: (2026)
par: Tao, Wen, et autres
Publié: (2026)
How Prevalent is Gender Bias in ChatGPT? -- Exploring German and English ChatGPT Responses
par: Urchs, Stefanie, et autres
Publié: (2023)
par: Urchs, Stefanie, et autres
Publié: (2023)
How do Humans and Language Models Reason About Creativity? A Comparative Analysis
par: Laverghetta Jr., Antonio, et autres
Publié: (2025)
par: Laverghetta Jr., Antonio, et autres
Publié: (2025)
Mind the Confidence Gap: Overconfidence, Calibration, and Distractor Effects in Large Language Models
par: Chhikara, Prateek
Publié: (2025)
par: Chhikara, Prateek
Publié: (2025)
Incentive Aware AI Regulations: A Credal Characterisation
par: Singh, Anurag, et autres
Publié: (2026)
par: Singh, Anurag, et autres
Publié: (2026)
Creativity Bias: How Machine Evaluation Struggles with Creativity in Literary Translations
par: Gerrits, Kyo, et autres
Publié: (2026)
par: Gerrits, Kyo, et autres
Publié: (2026)
On the Creativity of Large Language Models
par: Franceschelli, Giorgio, et autres
Publié: (2023)
par: Franceschelli, Giorgio, et autres
Publié: (2023)
Beyond Divergent Creativity: A Human-Based Evaluation of Creativity in Large Language Models
par: Nakajima, Kumiko, et autres
Publié: (2026)
par: Nakajima, Kumiko, et autres
Publié: (2026)
taz2024full: Analysing German Newspapers for Gender Bias and Discrimination across Decades
par: Urchs, Stefanie, et autres
Publié: (2025)
par: Urchs, Stefanie, et autres
Publié: (2025)
Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models
par: Kim, Mingyeong, et autres
Publié: (2026)
par: Kim, Mingyeong, et autres
Publié: (2026)
Fair Play in the Newsroom: Actor-Based Filtering Gender Discrimination in Text Corpora
par: Urchs, Stefanie, et autres
Publié: (2025)
par: Urchs, Stefanie, et autres
Publié: (2025)
Task Calibration: Calibrating Large Language Models on Inference Tasks
par: Li, Yingjie, et autres
Publié: (2024)
par: Li, Yingjie, et autres
Publié: (2024)
How Language Directions Align with Token Geometry in Multilingual LLMs
par: Kim, JaeSeong, et autres
Publié: (2025)
par: Kim, JaeSeong, et autres
Publié: (2025)
Lost in Translation? Exploring the Shift in Grammatical Gender from Latin to Occitan
par: Chatterjee, Ahan, et autres
Publié: (2026)
par: Chatterjee, Ahan, et autres
Publié: (2026)
CreativityPrism: A Holistic Evaluation Framework for Large Language Model Creativity
par: Hou, Zhaoyi Joey, et autres
Publié: (2025)
par: Hou, Zhaoyi Joey, et autres
Publié: (2025)
The AI Gap: How Socioeconomic Status Affects Language Technology Interactions
par: Bassignana, Elisa, et autres
Publié: (2025)
par: Bassignana, Elisa, et autres
Publié: (2025)
Position: Vector Prompt Interfaces Should Be Exposed to Enable Customization of Large Language Models
par: Yang, Liangwei, et autres
Publié: (2026)
par: Yang, Liangwei, et autres
Publié: (2026)
Fill In The Gaps: Model Calibration and Generalization with Synthetic Data
par: Ba, Yang, et autres
Publié: (2024)
par: Ba, Yang, et autres
Publié: (2024)
SimulBench: Evaluating Language Models with Creative Simulation Tasks
par: Jia, Qi, et autres
Publié: (2024)
par: Jia, Qi, et autres
Publié: (2024)
How Small Transformation Expose the Weakness of Semantic Similarity Measures
par: Nikiema, Serge Lionel, et autres
Publié: (2025)
par: Nikiema, Serge Lionel, et autres
Publié: (2025)
MULTIVERSE: Exposing Large Language Model Alignment Problems in Diverse Worlds
par: Jin, Xiaolong, et autres
Publié: (2024)
par: Jin, Xiaolong, et autres
Publié: (2024)
Documents similaires
-
Adaptive Contrastive Search: Uncertainty-Guided Decoding for Open-Ended Text Generation
par: Arias, Esteban Garces, et autres
Publié: (2024) -
Towards Better Open-Ended Text Generation: A Multicriteria Evaluation Framework
par: Arias, Esteban Garces, et autres
Publié: (2024) -
The Truncation Blind Spot: How Decoding Strategies Systematically Exclude Human-Like Token Choices
par: Arias, Esteban Garces, et autres
Publié: (2026) -
GUARD: Glocal Uncertainty-Aware Robust Decoding for Effective and Efficient Open-Ended Text Generation
par: Ding, Yuanhao, et autres
Publié: (2025) -
Statistical Multicriteria Evaluation of LLM-Generated Text
par: Arias, Esteban Garces, et autres
Publié: (2025)