Testimole-Conversational: A 30-Billion-Word Italian Discussion Board Corpus (1996-2024) for Language Modeling and Sociolinguistic Research
Fuente:
arXiv
Saved in:
| Main Authors: | Rinaldi, Matteo, Varvara, Rossella, Patti, Viviana |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Evalita-LLM: Benchmarking Large Language Models on Italian
by: Magnini, Bernardo, et al.
Published: (2025)
by: Magnini, Bernardo, et al.
Published: (2025)
The Sociolinguistic Foundations of Language Modeling
by: Grieve, Jack, et al.
Published: (2024)
by: Grieve, Jack, et al.
Published: (2024)
101 Billion Arabic Words Dataset
by: Aloui, Manel, et al.
Published: (2024)
by: Aloui, Manel, et al.
Published: (2024)
PashtoCorp: A 1.25-Billion-Word Corpus, Evaluation Suite, and Reproducible Pipeline for Low-Resource Language Development
by: Rahman, Hanif
Published: (2026)
by: Rahman, Hanif
Published: (2026)
Ramsa: A Large Sociolinguistically Rich Emirati Arabic Speech Corpus for ASR and TTS
by: Al-Sabbagh, Rania
Published: (2026)
by: Al-Sabbagh, Rania
Published: (2026)
Dealing with Controversy: An Emotion and Coping Strategy Corpus Based on Role Playing
by: Troiano, Enrica, et al.
Published: (2024)
by: Troiano, Enrica, et al.
Published: (2024)
SoftMatcha: A Soft and Fast Pattern Matcher for Billion-Scale Corpus Searches
by: Deguchi, Hiroyuki, et al.
Published: (2025)
by: Deguchi, Hiroyuki, et al.
Published: (2025)
NorBERTo: A ModernBERT Model Trained for Portuguese with 331 Billion Tokens Corpus
by: Silva, Enzo S. N., et al.
Published: (2026)
by: Silva, Enzo S. N., et al.
Published: (2026)
Challenging the Abilities of Large Language Models in Italian: a Community Initiative
by: Nissim, Malvina, et al.
Published: (2025)
by: Nissim, Malvina, et al.
Published: (2025)
MathPile: A Billion-Token-Scale Pretraining Corpus for Math
by: Wang, Zengzhi, et al.
Published: (2023)
by: Wang, Zengzhi, et al.
Published: (2023)
Developing an Open Conversational Speech Corpus for the Isan Language
by: Na-Thalang, Adisai, et al.
Published: (2025)
by: Na-Thalang, Adisai, et al.
Published: (2025)
Practising responsibility: Ethics in NLP as a hands-on course
by: Nissim, Malvina, et al.
Published: (2025)
by: Nissim, Malvina, et al.
Published: (2025)
Variation is the Norm: Embracing Sociolinguistics in NLP
by: Lutgen, Anne-Marie, et al.
Published: (2026)
by: Lutgen, Anne-Marie, et al.
Published: (2026)
Decomposed Prompting to Answer Questions on a Course Discussion Board
by: Jaipersaud, Brandon, et al.
Published: (2024)
by: Jaipersaud, Brandon, et al.
Published: (2024)
Beyond the Numbers: Transparency in Relation Extraction Benchmark Creation and Leaderboards
by: Arzt, Varvara, et al.
Published: (2024)
by: Arzt, Varvara, et al.
Published: (2024)
Words Matter: Reducing Stigma in Online Conversations about Substance Use with Large Language Models
by: Bouzoubaa, Layla, et al.
Published: (2024)
by: Bouzoubaa, Layla, et al.
Published: (2024)
A Survey on Spoken Italian Datasets and Corpora
by: Giordano, Marco, et al.
Published: (2025)
by: Giordano, Marco, et al.
Published: (2025)
Relation Extraction or Pattern Matching? Unravelling the Generalisation Limits of Language Models for Biographical RE
by: Arzt, Varvara, et al.
Published: (2025)
by: Arzt, Varvara, et al.
Published: (2025)
The German Commons - 154 Billion Tokens of Openly Licensed Text for German Language Models
by: Gienapp, Lukas, et al.
Published: (2025)
by: Gienapp, Lukas, et al.
Published: (2025)
Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research
by: Soldaini, Luca, et al.
Published: (2024)
by: Soldaini, Luca, et al.
Published: (2024)
Moderation Matters:Measuring Conversational Moderation Impact in English as a Second Language Group Discussion
by: Gao, Rena, et al.
Published: (2025)
by: Gao, Rena, et al.
Published: (2025)
Gender-Neutral Rewriting in Italian: Models, Approaches, and Trade-offs
by: Piergentili, Andrea, et al.
Published: (2025)
by: Piergentili, Andrea, et al.
Published: (2025)
Benchmarking Sociolinguistic Diversity in Swahili NLP: A Taxonomy-Guided Approach
by: Oketch, Kezia, et al.
Published: (2025)
by: Oketch, Kezia, et al.
Published: (2025)
BAMBI: Developing Baby Language Models for Italian
by: Suozzi, Alice, et al.
Published: (2025)
by: Suozzi, Alice, et al.
Published: (2025)
Analyzing Large Language Models for Classroom Discussion Assessment
by: Tran, Nhat, et al.
Published: (2024)
by: Tran, Nhat, et al.
Published: (2024)
Constraining constructions with WordNet: pros and cons for the semantic annotation of fillers in the Italian Constructicon
by: Pisciotta, Flavio, et al.
Published: (2025)
by: Pisciotta, Flavio, et al.
Published: (2025)
GeoBenchX: Benchmarking LLMs in Agent Solving Multistep Geospatial Tasks
by: Krechetova, Varvara, et al.
Published: (2025)
by: Krechetova, Varvara, et al.
Published: (2025)
Do Language Models' Words Refer?
by: Mandelkern, Matthew, et al.
Published: (2023)
by: Mandelkern, Matthew, et al.
Published: (2023)
Mangosteen: An Open Thai Corpus for Language Model Pretraining
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2025)
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2025)
Parallel Corpus Augmentation using Masked Language Models
by: Kumari, Vibhuti, et al.
Published: (2024)
by: Kumari, Vibhuti, et al.
Published: (2024)
Chitrarth: Bridging Vision and Language for a Billion People
by: Khan, Shaharukh, et al.
Published: (2025)
by: Khan, Shaharukh, et al.
Published: (2025)
GFG -- Gender-Fair Generation: A CALAMITA Challenge
by: Frenda, Simona, et al.
Published: (2024)
by: Frenda, Simona, et al.
Published: (2024)
Modeling Topics and Sociolinguistic Variation in Code-Switched Discourse: Insights from Spanish-English and Spanish-Guaraní
by: Tyagi, Nemika, et al.
Published: (2025)
by: Tyagi, Nemika, et al.
Published: (2025)
Data Quality Issues in Multilingual Speech Datasets: The Need for Sociolinguistic Awareness and Proactive Language Planning
by: Lau, Mingfei, et al.
Published: (2025)
by: Lau, Mingfei, et al.
Published: (2025)
LLM Discussion: Enhancing the Creativity of Large Language Models via Discussion Framework and Role-Play
by: Lu, Li-Chun, et al.
Published: (2024)
by: Lu, Li-Chun, et al.
Published: (2024)
Sociolinguistically Informed Interpretability: A Case Study on Hinglish Emotion Classification
by: Tatariya, Kushal, et al.
Published: (2024)
by: Tatariya, Kushal, et al.
Published: (2024)
Towards Open Foundation Language Model and Corpus for Macedonian: A Low-Resource Language
by: Krsteski, Stefan, et al.
Published: (2025)
by: Krsteski, Stefan, et al.
Published: (2025)
Word Synchronization Challenge: A Benchmark for Word Association Responses for Large Language Models
by: Cazalets, Tanguy, et al.
Published: (2025)
by: Cazalets, Tanguy, et al.
Published: (2025)
Beyond Words: On Large Language Models Actionability in Mission-Critical Risk Analysis
by: Esposito, Matteo, et al.
Published: (2024)
by: Esposito, Matteo, et al.
Published: (2024)
Word Definitions from Large Language Models
by: Pham, Bach, et al.
Published: (2023)
by: Pham, Bach, et al.
Published: (2023)
Similar Items
-
Evalita-LLM: Benchmarking Large Language Models on Italian
by: Magnini, Bernardo, et al.
Published: (2025) -
The Sociolinguistic Foundations of Language Modeling
by: Grieve, Jack, et al.
Published: (2024) -
101 Billion Arabic Words Dataset
by: Aloui, Manel, et al.
Published: (2024) -
PashtoCorp: A 1.25-Billion-Word Corpus, Evaluation Suite, and Reproducible Pipeline for Low-Resource Language Development
by: Rahman, Hanif
Published: (2026) -
Ramsa: A Large Sociolinguistically Rich Emirati Arabic Speech Corpus for ASR and TTS
by: Al-Sabbagh, Rania
Published: (2026)