Breaking the Script Barrier in Multilingual Pre-Trained Language Models with Transliteration-Based Post-Training Alignment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xhelili, Orgest, Liu, Yihong, Schütze, Hinrich |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Transliterations Improve Crosslingual Alignment
par: Liu, Yihong, et autres
Publié: (2024)
par: Liu, Yihong, et autres
Publié: (2024)
TransliCo: A Contrastive Learning Framework to Address the Script Barrier in Multilingual Pretrained Language Models
par: Liu, Yihong, et autres
Publié: (2024)
par: Liu, Yihong, et autres
Publié: (2024)
Exploring the Role of Transliteration in In-Context Learning for Low-resource Languages Written in Non-Latin Scripts
par: Ma, Chunlan, et autres
Publié: (2024)
par: Ma, Chunlan, et autres
Publié: (2024)
TransMI: A Framework to Create Strong Baselines from Multilingual Pretrained Language Models for Transliterated Data
par: Liu, Yihong, et autres
Publié: (2024)
par: Liu, Yihong, et autres
Publié: (2024)
LangSAMP: Language-Script Aware Multilingual Pretraining
par: Liu, Yihong, et autres
Publié: (2024)
par: Liu, Yihong, et autres
Publié: (2024)
Evaluating Contextually Mediated Factual Recall in Multilingual Large Language Models
par: Liu, Yihong, et autres
Publié: (2026)
par: Liu, Yihong, et autres
Publié: (2026)
Why Better Cross-Lingual Alignment Fails for Better Cross-Lingual Transfer: Case of Encoders
par: Veitsman, Yana, et autres
Publié: (2026)
par: Veitsman, Yana, et autres
Publié: (2026)
Large Reasoning Models Are (Not Yet) Multilingual Latent Reasoners
par: Liu, Yihong, et autres
Publié: (2026)
par: Liu, Yihong, et autres
Publié: (2026)
Evaluating Robustness of Large Language Models Against Multilingual Typographical Errors
par: Zhao, Raoyuan, et autres
Publié: (2025)
par: Zhao, Raoyuan, et autres
Publié: (2025)
A Comprehensive Evaluation of Multilingual Chain-of-Thought Reasoning: Performance, Consistency, and Faithfulness Across Languages
par: Zhao, Raoyuan, et autres
Publié: (2025)
par: Zhao, Raoyuan, et autres
Publié: (2025)
On the Entity-Level Alignment in Crosslingual Consistency
par: Liu, Yihong, et autres
Publié: (2025)
par: Liu, Yihong, et autres
Publié: (2025)
Crosslingual On-Policy Self-Distillation for Multilingual Reasoning
par: Liu, Yihong, et autres
Publié: (2026)
par: Liu, Yihong, et autres
Publié: (2026)
OFA: A Framework of Initializing Unseen Subword Embeddings for Efficient Large-scale Multilingual Continued Pretraining
par: Liu, Yihong, et autres
Publié: (2023)
par: Liu, Yihong, et autres
Publié: (2023)
HYPEROFA: Expanding LLM Vocabulary to New Languages via Hypernetwork-Based Embedding Initialization
par: Özeren, Enes, et autres
Publié: (2025)
par: Özeren, Enes, et autres
Publié: (2025)
Lost in Multilinguality: Dissecting Cross-lingual Factual Inconsistency in Transformer Language Models
par: Wang, Mingyang, et autres
Publié: (2025)
par: Wang, Mingyang, et autres
Publié: (2025)
How Programming Concepts and Neurons Are Shared in Code Language Models
par: Kargaran, Amir Hossein, et autres
Publié: (2025)
par: Kargaran, Amir Hossein, et autres
Publié: (2025)
Your Pretrained Model Tells the Difficulty Itself: A Self-Adaptive Curriculum Learning Paradigm for Natural Language Understanding
par: Feng, Qi, et autres
Publié: (2025)
par: Feng, Qi, et autres
Publié: (2025)
A Recipe of Parallel Corpora Exploitation for Multilingual Large Language Models
par: Lin, Peiqin, et autres
Publié: (2024)
par: Lin, Peiqin, et autres
Publié: (2024)
Relational Linearity is a Predictor of Hallucinations
par: Lu, Yuetian, et autres
Publié: (2026)
par: Lu, Yuetian, et autres
Publié: (2026)
A Tale of Two Scripts: Transliteration and Post-Correction for Judeo-Arabic
par: Gonzalez, Juan Moreno, et autres
Publié: (2025)
par: Gonzalez, Juan Moreno, et autres
Publié: (2025)
Breaking Language Barriers: Cross-Lingual Continual Pre-Training at Scale
par: Zheng, Wenzhen, et autres
Publié: (2024)
par: Zheng, Wenzhen, et autres
Publié: (2024)
GlotScript: A Resource and Tool for Low Resource Writing System Identification
par: Kargaran, Amir Hossein, et autres
Publié: (2023)
par: Kargaran, Amir Hossein, et autres
Publié: (2023)
MoSECroT: Model Stitching with Static Word Embeddings for Crosslingual Zero-shot Transfer
par: Ye, Haotian, et autres
Publié: (2024)
par: Ye, Haotian, et autres
Publié: (2024)
Refusal Direction is Universal Across Safety-Aligned Languages
par: Wang, Xinpeng, et autres
Publié: (2025)
par: Wang, Xinpeng, et autres
Publié: (2025)
Enhancing Robustness of Autoregressive Language Models against Orthographic Attacks via Pixel-based Approach
par: Yang, Han, et autres
Publié: (2025)
par: Yang, Han, et autres
Publié: (2025)
Left, Right, or Center? Evaluating LLM Framing in News Classification and Generation
par: Kennedy, Molly, et autres
Publié: (2026)
par: Kennedy, Molly, et autres
Publié: (2026)
Understanding In-Context Machine Translation for Low-Resource Languages: A Case Study on Manchu
par: Pei, Renhao, et autres
Publié: (2025)
par: Pei, Renhao, et autres
Publié: (2025)
GLUScope: A Tool for Analyzing GLU Neurons in Transformer Language Models
par: Gerstner, Sebastian, et autres
Publié: (2026)
par: Gerstner, Sebastian, et autres
Publié: (2026)
Tracing Multilingual Factual Knowledge Acquisition in Pretraining
par: Liu, Yihong, et autres
Publié: (2025)
par: Liu, Yihong, et autres
Publié: (2025)
Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language Models
par: Nie, Ercong, et autres
Publié: (2025)
par: Nie, Ercong, et autres
Publié: (2025)
Breaking the Script Barrier: Enabling Automatic Alignment for PoS-based ASR Error Analysis in Non-Latin Scripts
par: Mudi, Prasenjit K, et autres
Publié: (2026)
par: Mudi, Prasenjit K, et autres
Publié: (2026)
mPLM-Sim: Better Cross-Lingual Similarity and Transfer in Multilingual Pretrained Language Models
par: Lin, Peiqin, et autres
Publié: (2023)
par: Lin, Peiqin, et autres
Publié: (2023)
Calibration Is Not Enough: Evaluating Confidence Estimation Under Language Variations
par: Xia, Yuxi, et autres
Publié: (2026)
par: Xia, Yuxi, et autres
Publié: (2026)
Beyond Input Understanding: Diagnosing Multilingual Mathematical Reasoning with Directed Acyclic Trace Graphs
par: Zhang, Jiaqiao, et autres
Publié: (2026)
par: Zhang, Jiaqiao, et autres
Publié: (2026)
Breaking Barriers: Do Reinforcement Post Training Gains Transfer To Unseen Domains?
par: Hu, Chuxuan, et autres
Publié: (2025)
par: Hu, Chuxuan, et autres
Publié: (2025)
On the Limits of Model Merging for Multilinguality in Pre-Training
par: Aycock, Seth, et autres
Publié: (2026)
par: Aycock, Seth, et autres
Publié: (2026)
GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts
par: Kargaran, Amir Hossein, et autres
Publié: (2026)
par: Kargaran, Amir Hossein, et autres
Publié: (2026)
SYNTHEVAL: Hybrid Behavioral Testing of NLP Models with Synthetic CheckLists
par: Zhao, Raoyuan, et autres
Publié: (2024)
par: Zhao, Raoyuan, et autres
Publié: (2024)
Decomposed Prompting: Probing Multilingual Linguistic Structure Knowledge in Large Language Models
par: Nie, Ercong, et autres
Publié: (2024)
par: Nie, Ercong, et autres
Publié: (2024)
MEXA: Multilingual Evaluation of English-Centric LLMs via Cross-Lingual Alignment
par: Kargaran, Amir Hossein, et autres
Publié: (2024)
par: Kargaran, Amir Hossein, et autres
Publié: (2024)
Documents similaires
-
How Transliterations Improve Crosslingual Alignment
par: Liu, Yihong, et autres
Publié: (2024) -
TransliCo: A Contrastive Learning Framework to Address the Script Barrier in Multilingual Pretrained Language Models
par: Liu, Yihong, et autres
Publié: (2024) -
Exploring the Role of Transliteration in In-Context Learning for Low-resource Languages Written in Non-Latin Scripts
par: Ma, Chunlan, et autres
Publié: (2024) -
TransMI: A Framework to Create Strong Baselines from Multilingual Pretrained Language Models for Transliterated Data
par: Liu, Yihong, et autres
Publié: (2024) -
LangSAMP: Language-Script Aware Multilingual Pretraining
par: Liu, Yihong, et autres
Publié: (2024)