Crowdsourcing Piedmontese to Test LLMs on Non-Standard Orthography
Fuente:
arXiv
Salvato in:
| Autori principali: | Vico, Gianluca, Libovický, Jindřich |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CUS-QA: Local-Knowledge-Oriented Open-Ended Question Answering Dataset
di: Libovický, Jindřich, et al.
Pubblicazione: (2025)
di: Libovický, Jindřich, et al.
Pubblicazione: (2025)
On the Credibility of Evaluating LLMs using Survey Questions
di: Libovický, Jindřich
Pubblicazione: (2026)
di: Libovický, Jindřich
Pubblicazione: (2026)
Conditional Unigram Tokenization with Parallel Data
di: Vico, Gianluca, et al.
Pubblicazione: (2025)
di: Vico, Gianluca, et al.
Pubblicazione: (2025)
Lexically Grounded Subword Segmentation
di: Libovický, Jindřich, et al.
Pubblicazione: (2024)
di: Libovický, Jindřich, et al.
Pubblicazione: (2024)
Different Time, Different Language: Revisiting the Bias Against Non-Native Speakers in GPT Detectors
di: Ali, Adnan Al, et al.
Pubblicazione: (2026)
di: Ali, Adnan Al, et al.
Pubblicazione: (2026)
Evaluating Morphological Plausibility of Subword Tokenization via Statistical Alignment with Morpho-Syntactic Features
di: Stephen, Abishek, et al.
Pubblicazione: (2026)
di: Stephen, Abishek, et al.
Pubblicazione: (2026)
Multilingual Vision-Language Models, A Survey
di: Manea, Andrei-Alexandru, et al.
Pubblicazione: (2025)
di: Manea, Andrei-Alexandru, et al.
Pubblicazione: (2025)
Investigating the Effect of Parallel Data in the Cross-Lingual Transfer for Vision-Language Encoders
di: Manea, Andrei-Alexandru, et al.
Pubblicazione: (2025)
di: Manea, Andrei-Alexandru, et al.
Pubblicazione: (2025)
How Gender Interacts with Political Values: A Case Study on Czech BERT Models
di: Ali, Adnan Al, et al.
Pubblicazione: (2024)
di: Ali, Adnan Al, et al.
Pubblicazione: (2024)
LLM as a Meta-Judge: Synthetic Data for NLP Evaluation Metric Validation
di: Eigler, Lukáš, et al.
Pubblicazione: (2026)
di: Eigler, Lukáš, et al.
Pubblicazione: (2026)
Understanding Cross-Lingual Alignment -- A Survey
di: Hämmerl, Katharina, et al.
Pubblicazione: (2024)
di: Hämmerl, Katharina, et al.
Pubblicazione: (2024)
Teaching LLMs at Charles University: Assignments and Activities
di: Helcl, Jindřich, et al.
Pubblicazione: (2024)
di: Helcl, Jindřich, et al.
Pubblicazione: (2024)
Beyond Literal Token Overlap: Token Alignability for Multilinguality
di: Hämmerl, Katharina, et al.
Pubblicazione: (2025)
di: Hämmerl, Katharina, et al.
Pubblicazione: (2025)
Enhancing Conceptual Understanding in Multimodal Contrastive Learning through Hard Negative Samples
di: Rösch, Philipp J., et al.
Pubblicazione: (2024)
di: Rösch, Philipp J., et al.
Pubblicazione: (2024)
Multilingual LLMs Struggle to Link Orthography and Semantics in Bilingual Word Processing
di: Tanwar, Eshaan, et al.
Pubblicazione: (2025)
di: Tanwar, Eshaan, et al.
Pubblicazione: (2025)
Charles Translator: A Machine Translation System between Ukrainian and Czech
di: Popel, Martin, et al.
Pubblicazione: (2024)
di: Popel, Martin, et al.
Pubblicazione: (2024)
Normalized Orthography for Tunisian Arabic
di: Turki, Houcemeddine, et al.
Pubblicazione: (2024)
di: Turki, Houcemeddine, et al.
Pubblicazione: (2024)
Multilingual Text-to-Image Generation Magnifies Gender Stereotypes and Prompt Engineering May Not Help You
di: Friedrich, Felix, et al.
Pubblicazione: (2024)
di: Friedrich, Felix, et al.
Pubblicazione: (2024)
LLMs as Workers in Human-Computational Algorithms? Replicating Crowdsourcing Pipelines with LLMs
di: Wu, Tongshuang, et al.
Pubblicazione: (2023)
di: Wu, Tongshuang, et al.
Pubblicazione: (2023)
LombardoGraphia: Automatic Classification of Lombard Orthography Variants
di: Signoroni, Edoardo, et al.
Pubblicazione: (2026)
di: Signoroni, Edoardo, et al.
Pubblicazione: (2026)
A computational system to handle the orthographic layer of tajwid in contemporary Quranic Orthography
di: Martínez, Alicia González
Pubblicazione: (2025)
di: Martínez, Alicia González
Pubblicazione: (2025)
Context Biasing for Pronunciation-Orthography Mismatch in Automatic Speech Recognition
di: Huber, Christian, et al.
Pubblicazione: (2025)
di: Huber, Christian, et al.
Pubblicazione: (2025)
Mind Your Moras: Orthography-Aware Error Analysis of Neural Japanese Morphological Generation
di: Zhang, Wen
Pubblicazione: (2026)
di: Zhang, Wen
Pubblicazione: (2026)
DATASHI: A Parallel English-Tashlhiyt Corpus for Orthography Normalization and Low-Resource Language Processing
di: Monir, Nasser-Eddine, et al.
Pubblicazione: (2026)
di: Monir, Nasser-Eddine, et al.
Pubblicazione: (2026)
SYNTHEMPATHY: A Scalable Empathy Corpus Generated Using LLMs Without Any Crowdsourcing
di: Chen, Run, et al.
Pubblicazione: (2025)
di: Chen, Run, et al.
Pubblicazione: (2025)
Crowdsourcing Lexical Diversity
di: Khalilia, Hadi, et al.
Pubblicazione: (2024)
di: Khalilia, Hadi, et al.
Pubblicazione: (2024)
SemEval-2025 Task 3: Mu-SHROOM, the Multilingual Shared Task on Hallucinations and Related Observable Overgeneration Mistakes
di: Vázquez, Raúl, et al.
Pubblicazione: (2025)
di: Vázquez, Raúl, et al.
Pubblicazione: (2025)
From Test-taking to Cognitive Scaffolding: A Pedagogical Diagnostic Benchmark for LLMs on English Standardized Tests
di: Tang, Luoxi, et al.
Pubblicazione: (2025)
di: Tang, Luoxi, et al.
Pubblicazione: (2025)
LAMA-UT: Language Agnostic Multilingual ASR through Orthography Unification and Language-Specific Transliteration
di: Lee, Sangmin, et al.
Pubblicazione: (2024)
di: Lee, Sangmin, et al.
Pubblicazione: (2024)
On Crowdsourcing Task Design for Discourse Relation Annotation
di: Yung, Frances, et al.
Pubblicazione: (2024)
di: Yung, Frances, et al.
Pubblicazione: (2024)
How Important is `Perfect' English for Machine Translation Prompts?
di: Schmidtová, Patrícia, et al.
Pubblicazione: (2025)
di: Schmidtová, Patrícia, et al.
Pubblicazione: (2025)
Crowdsourced Adaptive Surveys
di: Velez, Yamil
Pubblicazione: (2024)
di: Velez, Yamil
Pubblicazione: (2024)
\textit{Versteasch du mi?} Computational and Socio-Linguistic Perspectives on GenAI, LLMs, and Non-Standard Language
di: Platzgummer, Verena, et al.
Pubblicazione: (2026)
di: Platzgummer, Verena, et al.
Pubblicazione: (2026)
Capturing Perspectives of Crowdsourced Annotators in Subjective Learning Tasks
di: Mokhberian, Negar, et al.
Pubblicazione: (2023)
di: Mokhberian, Negar, et al.
Pubblicazione: (2023)
Personas with Attitudes: Controlling LLMs for Diverse Data Annotation
di: Fröhling, Leon, et al.
Pubblicazione: (2024)
di: Fröhling, Leon, et al.
Pubblicazione: (2024)
Ideology-Based LLMs for Content Moderation
di: Civelli, Stefano, et al.
Pubblicazione: (2025)
di: Civelli, Stefano, et al.
Pubblicazione: (2025)
Benchmarking LLMs' Judgments with No Gold Standard
di: Xu, Shengwei, et al.
Pubblicazione: (2024)
di: Xu, Shengwei, et al.
Pubblicazione: (2024)
Context Shapes LLMs Retrieval-Augmented Fact-Checking Effectiveness
di: Bernardelle, Pietro, et al.
Pubblicazione: (2026)
di: Bernardelle, Pietro, et al.
Pubblicazione: (2026)
AnnoLLM: Making Large Language Models to Be Better Crowdsourced Annotators
di: He, Xingwei, et al.
Pubblicazione: (2023)
di: He, Xingwei, et al.
Pubblicazione: (2023)
A Japanese-Chinese Parallel Corpus Using Crowdsourcing for Web Mining
di: Nagata, Masaaki, et al.
Pubblicazione: (2024)
di: Nagata, Masaaki, et al.
Pubblicazione: (2024)
Documenti analoghi
-
CUS-QA: Local-Knowledge-Oriented Open-Ended Question Answering Dataset
di: Libovický, Jindřich, et al.
Pubblicazione: (2025) -
On the Credibility of Evaluating LLMs using Survey Questions
di: Libovický, Jindřich
Pubblicazione: (2026) -
Conditional Unigram Tokenization with Parallel Data
di: Vico, Gianluca, et al.
Pubblicazione: (2025) -
Lexically Grounded Subword Segmentation
di: Libovický, Jindřich, et al.
Pubblicazione: (2024) -
Different Time, Different Language: Revisiting the Bias Against Non-Native Speakers in GPT Detectors
di: Ali, Adnan Al, et al.
Pubblicazione: (2026)