When Numbers Tell Half the Story: Human-Metric Alignment in Topic Model Evaluation
Fuente:
arXiv
Saved in:
| Main Authors: | Prouteau, Thibault, Lareau, Francis, Dugué, Nicolas, Lamirel, Jean-Charles, Malaterre, Christophe |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
From communities to interpretable network and word embedding: an unified approach
by: Prouteau, Thibault, et al.
Published: (2024)
by: Prouteau, Thibault, et al.
Published: (2024)
From Noise to Signal: When Outliers Seed New Topics
by: Zve, Evangelia, et al.
Published: (2026)
by: Zve, Evangelia, et al.
Published: (2026)
Evaluating Creative Short Story Generation in Humans and Large Language Models
by: Ismayilzada, Mete, et al.
Published: (2024)
by: Ismayilzada, Mete, et al.
Published: (2024)
Towards Transparency: Exploring LLM Trainings Datasets through Visual Topic Modeling and Semantic Frame
by: de Dampierre, Charles, et al.
Published: (2024)
by: de Dampierre, Charles, et al.
Published: (2024)
StoryAlign: Evaluating and Training Reward Models for Story Generation
by: Xia, Haotian, et al.
Published: (2026)
by: Xia, Haotian, et al.
Published: (2026)
Enhancing Knowledge Graph Construction: Evaluating with Emphasis on Hallucination, Omission, and Graph Similarity Metrics
by: Ghanem, Hussam, et al.
Published: (2025)
by: Ghanem, Hussam, et al.
Published: (2025)
Evaluating Human Alignment and Model Faithfulness of LLM Rationale
by: Fayyaz, Mohsen, et al.
Published: (2024)
by: Fayyaz, Mohsen, et al.
Published: (2024)
Lessons Without Borders? Evaluating Cultural Alignment of LLMs Using Multilingual Story Moral Generation
by: Wu, Sophie, et al.
Published: (2026)
by: Wu, Sophie, et al.
Published: (2026)
Enabling Precise Topic Alignment in Large Language Models Via Sparse Autoencoders
by: Joshi, Ananya, et al.
Published: (2025)
by: Joshi, Ananya, et al.
Published: (2025)
Beyond Metrics: A Critical Analysis of the Variability in Large Language Model Evaluation Frameworks
by: Pimentel, Marco AF, et al.
Published: (2024)
by: Pimentel, Marco AF, et al.
Published: (2024)
What is Wrong with Language Models that Can Not Tell a Story?
by: Yamshchikov, Ivan P., et al.
Published: (2022)
by: Yamshchikov, Ivan P., et al.
Published: (2022)
Topic-aware Large Language Models for Summarizing the Lived Healthcare Experiences Described in Health Stories
by: Bilalpur, Maneesh, et al.
Published: (2025)
by: Bilalpur, Maneesh, et al.
Published: (2025)
AutoMetrics: Approximate Human Judgements with Automatically Generated Evaluators
by: Ryan, Michael J., et al.
Published: (2025)
by: Ryan, Michael J., et al.
Published: (2025)
When Metrics Disagree: Automatic Similarity vs. LLM-as-a-Judge for Clinical Dialogue Evaluation
by: Sun, Bian, et al.
Published: (2026)
by: Sun, Bian, et al.
Published: (2026)
Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding
by: Song, Feifan, et al.
Published: (2025)
by: Song, Feifan, et al.
Published: (2025)
Personalized Topic Selection Model for Topic-Grounded Dialogue
by: Fan, Shixuan, et al.
Published: (2024)
by: Fan, Shixuan, et al.
Published: (2024)
Show, Don't Tell: Evaluating Large Language Models Beyond Textual Understanding with ChildPlay
by: de Carvalho, Gonçalo Hora, et al.
Published: (2024)
by: de Carvalho, Gonçalo Hora, et al.
Published: (2024)
STORYSUMM: Evaluating Faithfulness in Story Summarization
by: Subbiah, Melanie, et al.
Published: (2024)
by: Subbiah, Melanie, et al.
Published: (2024)
To Tell The Truth: Language of Deception and Language Models
by: Hazra, Sanchaita, et al.
Published: (2023)
by: Hazra, Sanchaita, et al.
Published: (2023)
No Single Metric Tells the Whole Story: A Multi-Dimensional Evaluation Framework for Uncertainty Attributions
by: Schiller, Emily, et al.
Published: (2026)
by: Schiller, Emily, et al.
Published: (2026)
Evaluating Causal Explanation in Medical Reports with LLM-Based and Human-Aligned Metrics
by: Cho, Yousang, et al.
Published: (2025)
by: Cho, Yousang, et al.
Published: (2025)
Bridging the Evaluation Gap: Leveraging Large Language Models for Topic Model Evaluation
by: Tan, Zhiyin, et al.
Published: (2025)
by: Tan, Zhiyin, et al.
Published: (2025)
Improving Statistical Significance in Human Evaluation of Automatic Metrics via Soft Pairwise Accuracy
by: Thompson, Brian, et al.
Published: (2024)
by: Thompson, Brian, et al.
Published: (2024)
Evaluating Negative Sampling Approaches for Neural Topic Models
by: Adhya, Suman, et al.
Published: (2025)
by: Adhya, Suman, et al.
Published: (2025)
Psycholinguistic Word Features: a New Approach for the Evaluation of LLMs Alignment with Humans
by: Conde, Javier, et al.
Published: (2025)
by: Conde, Javier, et al.
Published: (2025)
Language Models Might Not Understand You: Evaluating Theory of Mind via Story Prompting
by: Getachew, Nathaniel, et al.
Published: (2025)
by: Getachew, Nathaniel, et al.
Published: (2025)
Embedding Style Beyond Topics: Analyzing Dispersion Effects Across Different Language Models
by: Icard, Benjamin, et al.
Published: (2025)
by: Icard, Benjamin, et al.
Published: (2025)
Revisiting NLI: Towards Cost-Effective and Human-Aligned Metrics for Evaluating LLMs in Question Answering
by: Balamurali, Sai Shridhar, et al.
Published: (2025)
by: Balamurali, Sai Shridhar, et al.
Published: (2025)
CulturalFrames: Assessing Cultural Expectation Alignment in Text-to-Image Models and Evaluation Metrics
by: Nayak, Shravan, et al.
Published: (2025)
by: Nayak, Shravan, et al.
Published: (2025)
WRDScore: New Metric for Evaluation of Natural Language Generation Models
by: Mussabayev, Ravil
Published: (2024)
by: Mussabayev, Ravil
Published: (2024)
Sydney Telling Fables on AI and Humans: A Corpus Tracing Memetic Transfer of Persona between LLMs
by: Milička, Jiří, et al.
Published: (2026)
by: Milička, Jiří, et al.
Published: (2026)
Uncovering Factor Level Preferences to Improve Human-Model Alignment
by: Oh, Juhyun, et al.
Published: (2024)
by: Oh, Juhyun, et al.
Published: (2024)
ALI-Agent: Assessing LLMs' Alignment with Human Values via Agent-based Evaluation
by: Zheng, Jingnan, et al.
Published: (2024)
by: Zheng, Jingnan, et al.
Published: (2024)
Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment
by: Gan, Woody Haosheng, et al.
Published: (2026)
by: Gan, Woody Haosheng, et al.
Published: (2026)
An LLM-as-Judge Metric for Bridging the Gap with Human Evaluation in SE Tasks
by: Zhou, Xin, et al.
Published: (2025)
by: Zhou, Xin, et al.
Published: (2025)
TopicImpact: Improving Customer Feedback Analysis with Opinion Units for Topic Modeling and Star-Rating Prediction
by: Häglund, Emil, et al.
Published: (2025)
by: Häglund, Emil, et al.
Published: (2025)
Toward Purpose-oriented Topic Model Evaluation enabled by Large Language Models
by: Tan, Zhiyin, et al.
Published: (2025)
by: Tan, Zhiyin, et al.
Published: (2025)
Large Language Models Often Know When They Are Being Evaluated
by: Needham, Joe, et al.
Published: (2025)
by: Needham, Joe, et al.
Published: (2025)
Detecting Sexual Content at the Sentence Level in First Millennium Latin Texts
by: Clérice, Thibault
Published: (2023)
by: Clérice, Thibault
Published: (2023)
Prompt-Based Clarity Evaluation and Topic Detection in Political Question Answering
by: Prahallad, Lavanya, et al.
Published: (2026)
by: Prahallad, Lavanya, et al.
Published: (2026)
Similar Items
-
From communities to interpretable network and word embedding: an unified approach
by: Prouteau, Thibault, et al.
Published: (2024) -
From Noise to Signal: When Outliers Seed New Topics
by: Zve, Evangelia, et al.
Published: (2026) -
Evaluating Creative Short Story Generation in Humans and Large Language Models
by: Ismayilzada, Mete, et al.
Published: (2024) -
Towards Transparency: Exploring LLM Trainings Datasets through Visual Topic Modeling and Semantic Frame
by: de Dampierre, Charles, et al.
Published: (2024) -
StoryAlign: Evaluating and Training Reward Models for Story Generation
by: Xia, Haotian, et al.
Published: (2026)