Adapting Multilingual LLMs to Low-Resource Languages using Continued Pre-training and Synthetic Corpus
Fuente:
arXiv
Saved in:
| Main Authors: | Joshi, Raviraj, Singla, Kanishk, Kamath, Anusha, Kalani, Raunak, Paul, Rakesh, Vaidya, Utkarsh, Chauhan, Sanjay Singh, Wartikar, Niranjan, Long, Eileen |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Benchmarking Hindi LLMs: A New Suite of Datasets and a Comparative Analysis
by: Kamath, Anusha, et al.
Published: (2025)
by: Kamath, Anusha, et al.
Published: (2025)
Aligning Large Language Models to Low-Resource Languages through LLM-Based Selective Translation: A Systematic Study
by: Paul, Rakesh, et al.
Published: (2025)
by: Paul, Rakesh, et al.
Published: (2025)
CultureGuard: Towards Culturally-Aware Dataset and Guard Model for Multilingual Safety Applications
by: Joshi, Raviraj, et al.
Published: (2025)
by: Joshi, Raviraj, et al.
Published: (2025)
Challenges in Adapting Multilingual LLMs to Low-Resource Languages using LoRA PEFT Tuning
by: Khade, Omkar, et al.
Published: (2024)
by: Khade, Omkar, et al.
Published: (2024)
Better To Ask in English? Evaluating Factual Accuracy of Multilingual LLMs in English and Low-Resource Languages
by: Rohera, Pritika, et al.
Published: (2025)
by: Rohera, Pritika, et al.
Published: (2025)
L3Cube-MahaEmotions: A Marathi Emotion Recognition Dataset with Synthetic Annotations using CoTR prompting and Large Language Models
by: Kowtal, Nidhi, et al.
Published: (2025)
by: Kowtal, Nidhi, et al.
Published: (2025)
Rethinking Multilingual Continual Pretraining: Data Mixing for Adapting LLMs Across Languages and Resources
by: Li, Zihao, et al.
Published: (2025)
by: Li, Zihao, et al.
Published: (2025)
MahaParaphrase: A Marathi Paraphrase Detection Corpus and BERT-based Models
by: Jadhav, Suramya, et al.
Published: (2025)
by: Jadhav, Suramya, et al.
Published: (2025)
Chain-of-Translation Prompting (CoTR): A Novel Prompting Technique for Low Resource Languages
by: Deshpande, Tejas, et al.
Published: (2024)
by: Deshpande, Tejas, et al.
Published: (2024)
FiMI: A Domain-Specific Language Model for Indian Finance Ecosystem
by: Kathar, Aboli, et al.
Published: (2026)
by: Kathar, Aboli, et al.
Published: (2026)
A Data Selection Approach for Enhancing Low Resource Machine Translation Using Cross-Lingual Sentence Representations
by: Kowtal, Nidhi, et al.
Published: (2024)
by: Kowtal, Nidhi, et al.
Published: (2024)
Regularising Spectral Curves for Homogeneous Yang-Baxter strings
by: Driezen, Sibylle, et al.
Published: (2024)
by: Driezen, Sibylle, et al.
Published: (2024)
Readying precision medical training for prime time
by: Ashwini Niranjan‐Azadi, et al.
Published: (2024)
by: Ashwini Niranjan‐Azadi, et al.
Published: (2024)
On Initializing Transformers with Pre-trained Embeddings
by: Kim, Ha Young, et al.
Published: (2024)
by: Kim, Ha Young, et al.
Published: (2024)
Topic Modeling in Marathi
by: Shinde, Sanket, et al.
Published: (2025)
by: Shinde, Sanket, et al.
Published: (2025)
Adapting Multilingual LLMs to Low-Resource Languages with Knowledge Graphs via Adapters
by: Gurgurov, Daniil, et al.
Published: (2024)
by: Gurgurov, Daniil, et al.
Published: (2024)
IndicSQuAD: A Comprehensive Multilingual Question Answering Dataset for Indic Languages
by: Endait, Sharvi, et al.
Published: (2025)
by: Endait, Sharvi, et al.
Published: (2025)
L3Cube-MahaSTS: A Marathi Sentence Similarity Dataset and Models
by: Mirashi, Aishwarya, et al.
Published: (2025)
by: Mirashi, Aishwarya, et al.
Published: (2025)
Pre-training LLMs using human-like development data corpus
by: Bhardwaj, Khushi, et al.
Published: (2023)
by: Bhardwaj, Khushi, et al.
Published: (2023)
A Framework for Stochastic Fairness in Dominant Resource Allocation with Cloud Computing Applications
by: Lei, Jiaqi, et al.
Published: (2025)
by: Lei, Jiaqi, et al.
Published: (2025)
Does Synthetic Data Help Named Entity Recognition for Low-Resource Languages?
by: Kamath, Gaurav, et al.
Published: (2025)
by: Kamath, Gaurav, et al.
Published: (2025)
BIGBOY1.2: Generating Realistic Synthetic Data for Disease Outbreak Modelling and Analytics
by: Narwal, Raunak, et al.
Published: (2025)
by: Narwal, Raunak, et al.
Published: (2025)
On Limitations of LLM as Annotator for Low Resource Languages
by: Jadhav, Suramya, et al.
Published: (2024)
by: Jadhav, Suramya, et al.
Published: (2024)
MaiBERT: A Pre-training Corpus and Language Model for Low-Resourced Maithili Language
by: Yadav, Sumit, et al.
Published: (2025)
by: Yadav, Sumit, et al.
Published: (2025)
Aurora-M: Open Source Continual Pre-training for Multilingual Language and Code
by: Nakamura, Taishi, et al.
Published: (2024)
by: Nakamura, Taishi, et al.
Published: (2024)
On Importance of Layer Pruning for Smaller BERT Models and Low Resource Languages
by: Shirke, Mayur, et al.
Published: (2025)
by: Shirke, Mayur, et al.
Published: (2025)
Comparative Study of Pre-Trained BERT and Large Language Models for Code-Mixed Named Entity Recognition
by: Shirke, Mayur, et al.
Published: (2025)
by: Shirke, Mayur, et al.
Published: (2025)
Efficient Continual Pre-training of LLMs for Low-resource Languages
by: Nag, Arijit, et al.
Published: (2024)
by: Nag, Arijit, et al.
Published: (2024)
Leveraging Parameter Efficient Training Methods for Low Resource Text Classification: A Case Study in Marathi
by: Deshmukh, Pranita, et al.
Published: (2024)
by: Deshmukh, Pranita, et al.
Published: (2024)
Towards Corpus-Grounded Agentic LLMs for Multilingual Grammatical Analysis
by: Klemen, Matej, et al.
Published: (2025)
by: Klemen, Matej, et al.
Published: (2025)
Towards Building Efficient Sentence BERT Models using Layer Pruning
by: Shelke, Anushka, et al.
Published: (2024)
by: Shelke, Anushka, et al.
Published: (2024)
Layer of Truth: Probing Belief Shifts under Continual Pre-Training Poisoning
by: Churina, Svetlana, et al.
Published: (2025)
by: Churina, Svetlana, et al.
Published: (2025)
L3Cube-IndicHeadline-ID: A Dataset for Headline Identification and Semantic Evaluation in Low-Resource Indian Languages
by: Tanksale, Nishant, et al.
Published: (2025)
by: Tanksale, Nishant, et al.
Published: (2025)
On Importance of Pruning and Distillation for Efficient Low Resource NLP
by: Mirashi, Aishwarya, et al.
Published: (2024)
by: Mirashi, Aishwarya, et al.
Published: (2024)
Industrial Synthetic Segment Pre-training
by: Mae, Shinichi, et al.
Published: (2025)
by: Mae, Shinichi, et al.
Published: (2025)
Pre-training with Synthetic Patterns for Audio
by: Ishikawa, Yuchi, et al.
Published: (2024)
by: Ishikawa, Yuchi, et al.
Published: (2024)
L3Cube-IndicQuest: A Benchmark Question Answering Dataset for Evaluating Knowledge of LLMs in Indic Context
by: Rohera, Pritika, et al.
Published: (2024)
by: Rohera, Pritika, et al.
Published: (2024)
Indiscriminate Data Poisoning Attacks on Pre-trained Feature Extractors
by: Lu, Yiwei, et al.
Published: (2024)
by: Lu, Yiwei, et al.
Published: (2024)
Overcoming Low-Resource Barriers in Tulu: Neural Models and Corpus Creation for OffensiveLanguage Identification
by: D, Anusha M, et al.
Published: (2025)
by: D, Anusha M, et al.
Published: (2025)
Better as Generators Than Classifiers: Leveraging LLMs and Synthetic Data for Low-Resource Multilingual Classification
by: Pecher, Branislav, et al.
Published: (2026)
by: Pecher, Branislav, et al.
Published: (2026)
Similar Items
-
Benchmarking Hindi LLMs: A New Suite of Datasets and a Comparative Analysis
by: Kamath, Anusha, et al.
Published: (2025) -
Aligning Large Language Models to Low-Resource Languages through LLM-Based Selective Translation: A Systematic Study
by: Paul, Rakesh, et al.
Published: (2025) -
CultureGuard: Towards Culturally-Aware Dataset and Guard Model for Multilingual Safety Applications
by: Joshi, Raviraj, et al.
Published: (2025) -
Challenges in Adapting Multilingual LLMs to Low-Resource Languages using LoRA PEFT Tuning
by: Khade, Omkar, et al.
Published: (2024) -
Better To Ask in English? Evaluating Factual Accuracy of Multilingual LLMs in English and Low-Resource Languages
by: Rohera, Pritika, et al.
Published: (2025)