A Subword Embedding Approach for Variation Detection in Luxembourgish User Comments
Fuente:
arXiv
Guardado en:
| Autores principales: | Lutgen, Anne-Marie, Plum, Alistair, Purschke, Christoph |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Neural Text Normalization for Luxembourgish using Real-Life Variation Data
por: Lutgen, Anne-Marie, et al.
Publicado: (2024)
por: Lutgen, Anne-Marie, et al.
Publicado: (2024)
LuxBank: The First Universal Dependency Treebank for Luxembourgish
por: Plum, Alistair, et al.
Publicado: (2024)
por: Plum, Alistair, et al.
Publicado: (2024)
Language Ideologies in a Multilingual Society: An LLM-based Analysis of Luxembourgish News Comments
por: Milano, Emilia, et al.
Publicado: (2026)
por: Milano, Emilia, et al.
Publicado: (2026)
Variation is the Norm: Embracing Sociolinguistics in NLP
por: Lutgen, Anne-Marie, et al.
Publicado: (2026)
por: Lutgen, Anne-Marie, et al.
Publicado: (2026)
Text Generation Models for Luxembourgish with Limited Data: A Balanced Multilingual Strategy
por: Plum, Alistair, et al.
Publicado: (2024)
por: Plum, Alistair, et al.
Publicado: (2024)
Identity-Aware Large Language Models require Cultural Reasoning
por: Plum, Alistair, et al.
Publicado: (2025)
por: Plum, Alistair, et al.
Publicado: (2025)
ltzGLUE: Luxembourgish General Language Understanding Evaluation
por: Plum, Alistair, et al.
Publicado: (2026)
por: Plum, Alistair, et al.
Publicado: (2026)
Guided Distant Supervision for Multilingual Relation Extraction Data: Adapting to a New Language
por: Plum, Alistair, et al.
Publicado: (2024)
por: Plum, Alistair, et al.
Publicado: (2024)
Towards Simulating Social Media Users with LLMs: Evaluating the Operational Validity of Conditioned Comment Prediction
por: Schwager, Nils, et al.
Publicado: (2026)
por: Schwager, Nils, et al.
Publicado: (2026)
Adapting Multilingual Embedding Models to Historical Luxembourgish
por: Michail, Andrianos, et al.
Publicado: (2025)
por: Michail, Andrianos, et al.
Publicado: (2025)
LuxEmbedder: A Cross-Lingual Approach to Enhanced Luxembourgish Sentence Embeddings
por: Philippy, Fred, et al.
Publicado: (2024)
por: Philippy, Fred, et al.
Publicado: (2024)
Subword Tokenization Strategies for Kurdish Word Embeddings
por: Salehi, Ali, et al.
Publicado: (2025)
por: Salehi, Ali, et al.
Publicado: (2025)
Do LLMs Judge Distantly Supervised Named Entity Labels Well? Constructing the JudgeWEL Dataset
por: Plum, Alistair, et al.
Publicado: (2026)
por: Plum, Alistair, et al.
Publicado: (2026)
LuxBorrow: From Pompier to Pompjee, Tracing Borrowing in Luxembourgish
por: Hosseini-Kivanani, Nina, et al.
Publicado: (2026)
por: Hosseini-Kivanani, Nina, et al.
Publicado: (2026)
Evaluating Subword Tokenization: Alien Subword Composition and OOV Generalization Challenge
por: Batsuren, Khuyagbaatar, et al.
Publicado: (2024)
por: Batsuren, Khuyagbaatar, et al.
Publicado: (2024)
Distributional Properties of Subword Regularization
por: Cognetta, Marco, et al.
Publicado: (2024)
por: Cognetta, Marco, et al.
Publicado: (2024)
Lexically Grounded Subword Segmentation
por: Libovický, Jindřich, et al.
Publicado: (2024)
por: Libovický, Jindřich, et al.
Publicado: (2024)
OFA: A Framework of Initializing Unseen Subword Embeddings for Efficient Large-scale Multilingual Continued Pretraining
por: Liu, Yihong, et al.
Publicado: (2023)
por: Liu, Yihong, et al.
Publicado: (2023)
LGSE: Lexically Grounded Subword Embedding Initialization for Low-Resource Language Adaptation
por: Teklehaymanot, Hailay, et al.
Publicado: (2026)
por: Teklehaymanot, Hailay, et al.
Publicado: (2026)
LuxIT: A Luxembourgish Instruction Tuning Dataset from Monolingual Seed Data
por: Valline, Julian, et al.
Publicado: (2025)
por: Valline, Julian, et al.
Publicado: (2025)
What Do Dialect Speakers Want? A Survey of Attitudes Towards Language Technology for German Dialects
por: Blaschke, Verena, et al.
Publicado: (2024)
por: Blaschke, Verena, et al.
Publicado: (2024)
LuxInstruct: A Cross-Lingual Instruction Tuning Dataset For Luxembourgish
por: Philippy, Fred, et al.
Publicado: (2025)
por: Philippy, Fred, et al.
Publicado: (2025)
Exploiting User Comments for Early Detection of Fake News Prior to Users' Commenting
por: Nan, Qiong, et al.
Publicado: (2023)
por: Nan, Qiong, et al.
Publicado: (2023)
ByteSpan: Information-Driven Subword Tokenisation
por: Goriely, Zébulon, et al.
Publicado: (2025)
por: Goriely, Zébulon, et al.
Publicado: (2025)
Subword models struggle with word learning, but surprisal hides it
por: Bunzeck, Bastian, et al.
Publicado: (2025)
por: Bunzeck, Bastian, et al.
Publicado: (2025)
The Learning Dynamics of Subword Segmentation for Morphologically Diverse Languages
por: Meyer, Francois, et al.
Publicado: (2025)
por: Meyer, Francois, et al.
Publicado: (2025)
Morphological Typology in BPE Subword Productivity and Language Modeling
por: Parra, Iñigo
Publicado: (2024)
por: Parra, Iñigo
Publicado: (2024)
Testing Low-Resource Language Support in LLMs Using Language Proficiency Exams: the Case of Luxembourgish
por: Lothritz, Cedric, et al.
Publicado: (2025)
por: Lothritz, Cedric, et al.
Publicado: (2025)
A Systematic Analysis of Subwords and Cross-Lingual Transfer in Multilingual Translation
por: Meyer, Francois, et al.
Publicado: (2024)
por: Meyer, Francois, et al.
Publicado: (2024)
T-FREE: Subword Tokenizer-Free Generative LLMs via Sparse Representations for Memory-Efficient Embeddings
por: Deiseroth, Björn, et al.
Publicado: (2024)
por: Deiseroth, Björn, et al.
Publicado: (2024)
Learning Mutually Informed Representations for Characters and Subwords
por: Wang, Yilin, et al.
Publicado: (2023)
por: Wang, Yilin, et al.
Publicado: (2023)
Stolen Subwords: Importance of Vocabularies for Machine Translation Model Stealing
por: Zouhar, Vilém
Publicado: (2024)
por: Zouhar, Vilém
Publicado: (2024)
Tokenization Falling Short: On Subword Robustness in Large Language Models
por: Chai, Yekun, et al.
Publicado: (2024)
por: Chai, Yekun, et al.
Publicado: (2024)
StochasTok: Improving Fine-Grained Subword Understanding in LLMs
por: Sims, Anya, et al.
Publicado: (2025)
por: Sims, Anya, et al.
Publicado: (2025)
Do LLMs Know What Luxembourgish Borrows? Probing Lexical Neology in Low-Resource Multilingual Models
por: Hosseini-Kivanani, Nina
Publicado: (2026)
por: Hosseini-Kivanani, Nina
Publicado: (2026)
Do Large Language Models Grasp The Grammar? Evidence from Grammar-Book-Guided Probing in Luxembourgish
por: Li, Lujun, et al.
Publicado: (2025)
por: Li, Lujun, et al.
Publicado: (2025)
Evaluating Subword Tokenization Techniques for Bengali: A Benchmark Study with BengaliBPE
por: Patwary, Firoj Ahmmed, et al.
Publicado: (2025)
por: Patwary, Firoj Ahmmed, et al.
Publicado: (2025)
SubRegWeigh: Effective and Efficient Annotation Weighing with Subword Regularization
por: Tsuji, Kohei, et al.
Publicado: (2024)
por: Tsuji, Kohei, et al.
Publicado: (2024)
Assessing the Importance of Frequency versus Compositionality for Subword-based Tokenization in NMT
por: Wolleb, Benoist, et al.
Publicado: (2023)
por: Wolleb, Benoist, et al.
Publicado: (2023)
Token Alignment via Character Matching for Subword Completion
por: Athiwaratkun, Ben, et al.
Publicado: (2024)
por: Athiwaratkun, Ben, et al.
Publicado: (2024)
Ejemplares similares
-
Neural Text Normalization for Luxembourgish using Real-Life Variation Data
por: Lutgen, Anne-Marie, et al.
Publicado: (2024) -
LuxBank: The First Universal Dependency Treebank for Luxembourgish
por: Plum, Alistair, et al.
Publicado: (2024) -
Language Ideologies in a Multilingual Society: An LLM-based Analysis of Luxembourgish News Comments
por: Milano, Emilia, et al.
Publicado: (2026) -
Variation is the Norm: Embracing Sociolinguistics in NLP
por: Lutgen, Anne-Marie, et al.
Publicado: (2026) -
Text Generation Models for Luxembourgish with Limited Data: A Balanced Multilingual Strategy
por: Plum, Alistair, et al.
Publicado: (2024)