MaskLID: Code-Switching Language Identification through Iterative Masking
Fuente:
arXiv
Salvato in:
| Autori principali: | Kargaran, Amir Hossein, Yvon, François, Schütze, Hinrich |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GlotLID: Language Identification for Low-Resource Languages
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2023)
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2023)
GlotScript: A Resource and Tool for Low Resource Writing System Identification
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2023)
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2023)
GlotCC: An Open Broad-Coverage CommonCrawl Corpus and Pipeline for Minority Languages
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2024)
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2024)
How Programming Concepts and Neurons Are Shared in Code Language Models
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2025)
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2025)
GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2026)
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2026)
MEXA: Multilingual Evaluation of English-Centric LLMs via Cross-Lingual Alignment
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2024)
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2024)
MenuCraft: Interactive Menu System Design with Large Language Models
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2023)
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2023)
Tracing Multilingual Factual Knowledge Acquisition in Pretraining
di: Liu, Yihong, et al.
Pubblicazione: (2025)
di: Liu, Yihong, et al.
Pubblicazione: (2025)
On Relation-Specific Neurons in Large Language Models
di: Liu, Yihong, et al.
Pubblicazione: (2025)
di: Liu, Yihong, et al.
Pubblicazione: (2025)
How Transliterations Improve Crosslingual Alignment
di: Liu, Yihong, et al.
Pubblicazione: (2024)
di: Liu, Yihong, et al.
Pubblicazione: (2024)
On the Entity-Level Alignment in Crosslingual Consistency
di: Liu, Yihong, et al.
Pubblicazione: (2025)
di: Liu, Yihong, et al.
Pubblicazione: (2025)
Understanding In-Context Machine Translation for Low-Resource Languages: A Case Study on Manchu
di: Pei, Renhao, et al.
Pubblicazione: (2025)
di: Pei, Renhao, et al.
Pubblicazione: (2025)
CoBia: Constructed Conversations Can Trigger Otherwise Concealed Societal Biases in LLMs
di: Nikeghbal, Nafiseh, et al.
Pubblicazione: (2025)
di: Nikeghbal, Nafiseh, et al.
Pubblicazione: (2025)
GLUScope: A Tool for Analyzing GLU Neurons in Transformer Language Models
di: Gerstner, Sebastian, et al.
Pubblicazione: (2026)
di: Gerstner, Sebastian, et al.
Pubblicazione: (2026)
GIRT-Model: Automated Generation of Issue Report Templates
di: Nikeghbal, Nafiseh, et al.
Pubblicazione: (2024)
di: Nikeghbal, Nafiseh, et al.
Pubblicazione: (2024)
KréyoLID From Language Identification Towards Language Mining
di: Dent, Rasul, et al.
Pubblicazione: (2025)
di: Dent, Rasul, et al.
Pubblicazione: (2025)
Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language Models
di: Nie, Ercong, et al.
Pubblicazione: (2025)
di: Nie, Ercong, et al.
Pubblicazione: (2025)
GKnow: Measuring the Entanglement of Gender Bias and Factual Gender
di: Veloso, Leonor, et al.
Pubblicazione: (2026)
di: Veloso, Leonor, et al.
Pubblicazione: (2026)
Evaluating Contextually Mediated Factual Recall in Multilingual Large Language Models
di: Liu, Yihong, et al.
Pubblicazione: (2026)
di: Liu, Yihong, et al.
Pubblicazione: (2026)
Breaking the Script Barrier in Multilingual Pre-Trained Language Models with Transliteration-Based Post-Training Alignment
di: Xhelili, Orgest, et al.
Pubblicazione: (2024)
di: Xhelili, Orgest, et al.
Pubblicazione: (2024)
Iterative Mask Filling: An Effective Text Augmentation Method Using Masked Language Modeling
di: Kesgin, Himmet Toprak, et al.
Pubblicazione: (2024)
di: Kesgin, Himmet Toprak, et al.
Pubblicazione: (2024)
Understanding Gated Neurons in Transformers from Their Input-Output Functionality
di: Gerstner, Sebastian, et al.
Pubblicazione: (2025)
di: Gerstner, Sebastian, et al.
Pubblicazione: (2025)
A Recipe of Parallel Corpora Exploitation for Multilingual Large Language Models
di: Lin, Peiqin, et al.
Pubblicazione: (2024)
di: Lin, Peiqin, et al.
Pubblicazione: (2024)
Enhancing Code-Switching Speech Recognition with LID-Based Collaborative Mixture of Experts Model
di: Huang, Hukai, et al.
Pubblicazione: (2024)
di: Huang, Hukai, et al.
Pubblicazione: (2024)
SLAyiNG: Towards Queer Language Processing
di: Veloso, Leonor, et al.
Pubblicazione: (2025)
di: Veloso, Leonor, et al.
Pubblicazione: (2025)
BERT-LID: Leveraging BERT to Improve Spoken Language Identification
di: Nie, Yuting, et al.
Pubblicazione: (2022)
di: Nie, Yuting, et al.
Pubblicazione: (2022)
CommonLID: Re-evaluating State-of-the-Art Language Identification Performance on Web Data
di: Suarez, Pedro Ortiz, et al.
Pubblicazione: (2026)
di: Suarez, Pedro Ortiz, et al.
Pubblicazione: (2026)
RET-LLM: Towards a General Read-Write Memory for Large Language Models
di: Modarressi, Ali, et al.
Pubblicazione: (2023)
di: Modarressi, Ali, et al.
Pubblicazione: (2023)
TransliCo: A Contrastive Learning Framework to Address the Script Barrier in Multilingual Pretrained Language Models
di: Liu, Yihong, et al.
Pubblicazione: (2024)
di: Liu, Yihong, et al.
Pubblicazione: (2024)
What Do Dialect Speakers Want? A Survey of Attitudes Towards Language Technology for German Dialects
di: Blaschke, Verena, et al.
Pubblicazione: (2024)
di: Blaschke, Verena, et al.
Pubblicazione: (2024)
TransMI: A Framework to Create Strong Baselines from Multilingual Pretrained Language Models for Transliterated Data
di: Liu, Yihong, et al.
Pubblicazione: (2024)
di: Liu, Yihong, et al.
Pubblicazione: (2024)
Consistent Document-Level Relation Extraction via Counterfactuals
di: Modarressi, Ali, et al.
Pubblicazione: (2024)
di: Modarressi, Ali, et al.
Pubblicazione: (2024)
Hybrid Human-LLM Corpus Construction and LLM Evaluation for Rare Linguistic Phenomena
di: Weissweiler, Leonie, et al.
Pubblicazione: (2024)
di: Weissweiler, Leonie, et al.
Pubblicazione: (2024)
Why Better Cross-Lingual Alignment Fails for Better Cross-Lingual Transfer: Case of Encoders
di: Veitsman, Yana, et al.
Pubblicazione: (2026)
di: Veitsman, Yana, et al.
Pubblicazione: (2026)
The Anatomy of an Edit: Mechanism-Guided Activation Steering for Knowledge Editing
di: Cao, Yuan, et al.
Pubblicazione: (2026)
di: Cao, Yuan, et al.
Pubblicazione: (2026)
Entropy-aware Masking for Masked Language Modeling
di: Srinivasagan, Gokul, et al.
Pubblicazione: (2026)
di: Srinivasagan, Gokul, et al.
Pubblicazione: (2026)
ConLID: Supervised Contrastive Learning for Low-Resource Language Identification
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
OpenLID-v3: Improving the Precision of Closely Related Language Identification -- An Experience Report
di: Fedorova, Mariia, et al.
Pubblicazione: (2026)
di: Fedorova, Mariia, et al.
Pubblicazione: (2026)
HYPEROFA: Expanding LLM Vocabulary to New Languages via Hypernetwork-Based Embedding Initialization
di: Özeren, Enes, et al.
Pubblicazione: (2025)
di: Özeren, Enes, et al.
Pubblicazione: (2025)
Time Course MechInterp: Analyzing the Evolution of Components and Knowledge in Large Language Models
di: Hakimi, Ahmad Dawar, et al.
Pubblicazione: (2025)
di: Hakimi, Ahmad Dawar, et al.
Pubblicazione: (2025)
Documenti analoghi
-
GlotLID: Language Identification for Low-Resource Languages
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2023) -
GlotScript: A Resource and Tool for Low Resource Writing System Identification
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2023) -
GlotCC: An Open Broad-Coverage CommonCrawl Corpus and Pipeline for Minority Languages
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2024) -
How Programming Concepts and Neurons Are Shared in Code Language Models
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2025) -
GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2026)