FicSim: A Dataset for Multi-Faceted Semantic Similarity in Long-Form Fiction

Fuente: arXiv
Guardado en:
Detalles Bibliográficos
Autores principales: Johnson, Natasha, Bertsch, Amanda, Deal, Maria-Emil, Strubell, Emma
Formato: Preprint
Publicado: 2025
Materias:
Acceso en línea:
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
_version_ 1866909995072749568
author Johnson, Natasha
Bertsch, Amanda
Deal, Maria-Emil
Strubell, Emma
author_facet Johnson, Natasha
Bertsch, Amanda
Deal, Maria-Emil
Strubell, Emma
contents As language models become capable of processing increasingly long and complex texts, there has been growing interest in their application within computational literary studies. However, evaluating the usefulness of these models for such tasks remains challenging due to the cost of fine-grained annotation for long-form texts and the data contamination concerns inherent in using public-domain literature. Current embedding similarity datasets are not suitable for evaluating literary-domain tasks because of a focus on coarse-grained similarity and primarily on very short text. We assemble and release FICSIM, a dataset of long-form, recently written fiction, including scores along 12 axes of similarity informed by author-produced metadata and validated by digital humanities scholars. We evaluate a suite of embedding models on this task, demonstrating a tendency across models to focus on surface-level features over semantic categories that would be useful for computational literary studies tasks. Throughout our data-collection process, we prioritize author agency and rely on continual, informed author consent.
format Preprint
id arxiv_https___arxiv_org_abs_2510_20926
institution arXiv
publishDate 2025
record_format arxiv
spellingShingle FicSim: A Dataset for Multi-Faceted Semantic Similarity in Long-Form Fiction
Johnson, Natasha
Bertsch, Amanda
Deal, Maria-Emil
Strubell, Emma
Computation and Language
As language models become capable of processing increasingly long and complex texts, there has been growing interest in their application within computational literary studies. However, evaluating the usefulness of these models for such tasks remains challenging due to the cost of fine-grained annotation for long-form texts and the data contamination concerns inherent in using public-domain literature. Current embedding similarity datasets are not suitable for evaluating literary-domain tasks because of a focus on coarse-grained similarity and primarily on very short text. We assemble and release FICSIM, a dataset of long-form, recently written fiction, including scores along 12 axes of similarity informed by author-produced metadata and validated by digital humanities scholars. We evaluate a suite of embedding models on this task, demonstrating a tendency across models to focus on surface-level features over semantic categories that would be useful for computational literary studies tasks. Throughout our data-collection process, we prioritize author agency and rely on continual, informed author consent.
title FicSim: A Dataset for Multi-Faceted Semantic Similarity in Long-Form Fiction
topic Computation and Language
url https://arxiv.org/abs/2510.20926