GlotLID: Language Identification for Low-Resource Languages
Fuente:
arXiv
Salvato in:
| Autori principali: | Kargaran, Amir Hossein, Imani, Ayyoob, Yvon, François, Schütze, Hinrich |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GlotScript: A Resource and Tool for Low Resource Writing System Identification
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2023)
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2023)
MaskLID: Code-Switching Language Identification through Iterative Masking
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2024)
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2024)
GlotCC: An Open Broad-Coverage CommonCrawl Corpus and Pipeline for Minority Languages
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2024)
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2024)
GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2026)
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2026)
How Programming Concepts and Neurons Are Shared in Code Language Models
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2025)
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2025)
How Transliterations Improve Crosslingual Alignment
di: Liu, Yihong, et al.
Pubblicazione: (2024)
di: Liu, Yihong, et al.
Pubblicazione: (2024)
RET-LLM: Towards a General Read-Write Memory for Large Language Models
di: Modarressi, Ali, et al.
Pubblicazione: (2023)
di: Modarressi, Ali, et al.
Pubblicazione: (2023)
MURI: High-Quality Instruction Tuning Datasets for Low-Resource Languages via Reverse Instructions
di: Köksal, Abdullatif, et al.
Pubblicazione: (2024)
di: Köksal, Abdullatif, et al.
Pubblicazione: (2024)
MenuCraft: Interactive Menu System Design with Large Language Models
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2023)
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2023)
MEXA: Multilingual Evaluation of English-Centric LLMs via Cross-Lingual Alignment
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2024)
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2024)
Understanding In-Context Machine Translation for Low-Resource Languages: A Case Study on Manchu
di: Pei, Renhao, et al.
Pubblicazione: (2025)
di: Pei, Renhao, et al.
Pubblicazione: (2025)
On Relation-Specific Neurons in Large Language Models
di: Liu, Yihong, et al.
Pubblicazione: (2025)
di: Liu, Yihong, et al.
Pubblicazione: (2025)
Taxi1500: A Multilingual Dataset for Text Classification in 1500 Languages
di: Ma, Chunlan, et al.
Pubblicazione: (2023)
di: Ma, Chunlan, et al.
Pubblicazione: (2023)
Tracing Multilingual Factual Knowledge Acquisition in Pretraining
di: Liu, Yihong, et al.
Pubblicazione: (2025)
di: Liu, Yihong, et al.
Pubblicazione: (2025)
Through the LLM Looking Glass: A Socratic Probing of Donkeys, Elephants, and Markets
di: Kennedy, Molly, et al.
Pubblicazione: (2025)
di: Kennedy, Molly, et al.
Pubblicazione: (2025)
MemLLM: Finetuning LLMs to Use An Explicit Read-Write Memory
di: Modarressi, Ali, et al.
Pubblicazione: (2024)
di: Modarressi, Ali, et al.
Pubblicazione: (2024)
On the Entity-Level Alignment in Crosslingual Consistency
di: Liu, Yihong, et al.
Pubblicazione: (2025)
di: Liu, Yihong, et al.
Pubblicazione: (2025)
ConLID: Supervised Contrastive Learning for Low-Resource Language Identification
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
di: Foroutan, Negar, et al.
Pubblicazione: (2025)
KréyoLID From Language Identification Towards Language Mining
di: Dent, Rasul, et al.
Pubblicazione: (2025)
di: Dent, Rasul, et al.
Pubblicazione: (2025)
Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language Models
di: Nie, Ercong, et al.
Pubblicazione: (2025)
di: Nie, Ercong, et al.
Pubblicazione: (2025)
GLUScope: A Tool for Analyzing GLU Neurons in Transformer Language Models
di: Gerstner, Sebastian, et al.
Pubblicazione: (2026)
di: Gerstner, Sebastian, et al.
Pubblicazione: (2026)
NLNDE at SemEval-2023 Task 12: Adaptive Pretraining and Source Language Selection for Low-Resource Multilingual Sentiment Analysis
di: Wang, Mingyang, et al.
Pubblicazione: (2023)
di: Wang, Mingyang, et al.
Pubblicazione: (2023)
CoBia: Constructed Conversations Can Trigger Otherwise Concealed Societal Biases in LLMs
di: Nikeghbal, Nafiseh, et al.
Pubblicazione: (2025)
di: Nikeghbal, Nafiseh, et al.
Pubblicazione: (2025)
Evaluating Contextually Mediated Factual Recall in Multilingual Large Language Models
di: Liu, Yihong, et al.
Pubblicazione: (2026)
di: Liu, Yihong, et al.
Pubblicazione: (2026)
Exploring the Role of Transliteration in In-Context Learning for Low-resource Languages Written in Non-Latin Scripts
di: Ma, Chunlan, et al.
Pubblicazione: (2024)
di: Ma, Chunlan, et al.
Pubblicazione: (2024)
Breaking the Script Barrier in Multilingual Pre-Trained Language Models with Transliteration-Based Post-Training Alignment
di: Xhelili, Orgest, et al.
Pubblicazione: (2024)
di: Xhelili, Orgest, et al.
Pubblicazione: (2024)
A Recipe of Parallel Corpora Exploitation for Multilingual Large Language Models
di: Lin, Peiqin, et al.
Pubblicazione: (2024)
di: Lin, Peiqin, et al.
Pubblicazione: (2024)
GIRT-Model: Automated Generation of Issue Report Templates
di: Nikeghbal, Nafiseh, et al.
Pubblicazione: (2024)
di: Nikeghbal, Nafiseh, et al.
Pubblicazione: (2024)
SLAyiNG: Towards Queer Language Processing
di: Veloso, Leonor, et al.
Pubblicazione: (2025)
di: Veloso, Leonor, et al.
Pubblicazione: (2025)
BERT-LID: Leveraging BERT to Improve Spoken Language Identification
di: Nie, Yuting, et al.
Pubblicazione: (2022)
di: Nie, Yuting, et al.
Pubblicazione: (2022)
CommonLID: Re-evaluating State-of-the-Art Language Identification Performance on Web Data
di: Suarez, Pedro Ortiz, et al.
Pubblicazione: (2026)
di: Suarez, Pedro Ortiz, et al.
Pubblicazione: (2026)
GKnow: Measuring the Entanglement of Gender Bias and Factual Gender
di: Veloso, Leonor, et al.
Pubblicazione: (2026)
di: Veloso, Leonor, et al.
Pubblicazione: (2026)
TransliCo: A Contrastive Learning Framework to Address the Script Barrier in Multilingual Pretrained Language Models
di: Liu, Yihong, et al.
Pubblicazione: (2024)
di: Liu, Yihong, et al.
Pubblicazione: (2024)
What Do Dialect Speakers Want? A Survey of Attitudes Towards Language Technology for German Dialects
di: Blaschke, Verena, et al.
Pubblicazione: (2024)
di: Blaschke, Verena, et al.
Pubblicazione: (2024)
MaLA-500: Massive Language Adaptation of Large Language Models
di: Lin, Peiqin, et al.
Pubblicazione: (2024)
di: Lin, Peiqin, et al.
Pubblicazione: (2024)
TransMI: A Framework to Create Strong Baselines from Multilingual Pretrained Language Models for Transliterated Data
di: Liu, Yihong, et al.
Pubblicazione: (2024)
di: Liu, Yihong, et al.
Pubblicazione: (2024)
HYPEROFA: Expanding LLM Vocabulary to New Languages via Hypernetwork-Based Embedding Initialization
di: Özeren, Enes, et al.
Pubblicazione: (2025)
di: Özeren, Enes, et al.
Pubblicazione: (2025)
OpenLID-v3: Improving the Precision of Closely Related Language Identification -- An Experience Report
di: Fedorova, Mariia, et al.
Pubblicazione: (2026)
di: Fedorova, Mariia, et al.
Pubblicazione: (2026)
LangSAMP: Language-Script Aware Multilingual Pretraining
di: Liu, Yihong, et al.
Pubblicazione: (2024)
di: Liu, Yihong, et al.
Pubblicazione: (2024)
Refusal Direction is Universal Across Safety-Aligned Languages
di: Wang, Xinpeng, et al.
Pubblicazione: (2025)
di: Wang, Xinpeng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
GlotScript: A Resource and Tool for Low Resource Writing System Identification
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2023) -
MaskLID: Code-Switching Language Identification through Iterative Masking
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2024) -
GlotCC: An Open Broad-Coverage CommonCrawl Corpus and Pipeline for Minority Languages
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2024) -
GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2026) -
How Programming Concepts and Neurons Are Shared in Code Language Models
di: Kargaran, Amir Hossein, et al.
Pubblicazione: (2025)