UrduLM: A Resource-Efficient Monolingual Urdu Language Model
Fuente:
arXiv
Saved in:
| Main Authors: | Ali, Syed Muhammad, Sajid, Hammad, Haider, Zainab, Asad, Ali Muhammad, Fatima, Haya, Samad, Abdul |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
UrduBench: An Urdu Reasoning Benchmark using Contextually Ensembled Translations with Human-in-the-Loop
by: Shafique, Muhammad Ali, et al.
Published: (2026)
by: Shafique, Muhammad Ali, et al.
Published: (2026)
Low-Resource Transliteration for Roman-Urdu and Urdu Using Transformer-Based Models
by: Butt, Umer, et al.
Published: (2025)
by: Butt, Umer, et al.
Published: (2025)
A Literature Review of Keyword Spotting Technologies for Urdu
by: Rizvi, Syed Muhammad Aqdas
Published: (2024)
by: Rizvi, Syed Muhammad Aqdas
Published: (2024)
AI-Generated Text Detection in Low-Resource Languages: A Case Study on Urdu
by: Ammar, Muhammad, et al.
Published: (2025)
by: Ammar, Muhammad, et al.
Published: (2025)
Ax-to-Grind Urdu: Benchmark Dataset for Urdu Fake News Detection
by: Harris, Sheetal, et al.
Published: (2024)
by: Harris, Sheetal, et al.
Published: (2024)
Enhanced Urdu Intent Detection with Large Language Models and Prototype-Informed Predictive Pipelines
by: Hassan, Faiza, et al.
Published: (2025)
by: Hassan, Faiza, et al.
Published: (2025)
Hope Speech Detection in code-mixed Roman Urdu tweets: A Positive Turn in Natural Language Processing
by: Ahmad, Muhammad, et al.
Published: (2025)
by: Ahmad, Muhammad, et al.
Published: (2025)
Qalb: Largest State-of-the-Art Urdu Large Language Model for 230M Speakers with Systematic Continued Pre-training
by: Hassan, Muhammad Taimoor, et al.
Published: (2026)
by: Hassan, Muhammad Taimoor, et al.
Published: (2026)
UQA: Corpus for Urdu Question Answering
by: Arif, Samee, et al.
Published: (2024)
by: Arif, Samee, et al.
Published: (2024)
Alif: Advancing Urdu Large Language Models via Multilingual Synthetic Data Distillation
by: Shafique, Muhammad Ali, et al.
Published: (2025)
by: Shafique, Muhammad Ali, et al.
Published: (2025)
Celebrity Profiling on Short Urdu Text using Twitter Followers' Feed
by: Hamza, Muhammad, et al.
Published: (2025)
by: Hamza, Muhammad, et al.
Published: (2025)
Document-Level Sentiment Analysis of Urdu Text Using Deep Learning Techniques
by: Irum, Ammarah, et al.
Published: (2025)
by: Irum, Ammarah, et al.
Published: (2025)
EDU-NER-2025: Named Entity Recognition in Urdu Educational Texts using XLM-RoBERTa with X (formerly Twitter)
by: Ullah, Fida, et al.
Published: (2025)
by: Ullah, Fida, et al.
Published: (2025)
Urdu News Article Recommendation Model using Natural Language Processing Techniques
by: Abbas, Syed Zain, et al.
Published: (2022)
by: Abbas, Syed Zain, et al.
Published: (2022)
Fake News Classification in Urdu: A Domain Adaptation Approach for a Low-Resource Language
by: Ali, Muhammad Zain, et al.
Published: (2025)
by: Ali, Muhammad Zain, et al.
Published: (2025)
A Permuted Autoregressive Approach to Word-Level Recognition for Urdu Digital Text
by: Mustafa, Ahmed, et al.
Published: (2024)
by: Mustafa, Ahmed, et al.
Published: (2024)
SEMFED: Semantic-Aware Resource-Efficient Federated Learning for Heterogeneous NLP Tasks
by: Hussain, Sajid, et al.
Published: (2025)
by: Hussain, Sajid, et al.
Published: (2025)
Generalists vs. Specialists: Evaluating Large Language Models for Urdu
by: Arif, Samee, et al.
Published: (2024)
by: Arif, Samee, et al.
Published: (2024)
Evaluating Large Language Models on Urdu Idiom Translation
by: Khan, Muhammad Farmal, et al.
Published: (2025)
by: Khan, Muhammad Farmal, et al.
Published: (2025)
Enabling Low-Resource Language Retrieval: Establishing Baselines for Urdu MS MARCO
by: Butt, Umer, et al.
Published: (2024)
by: Butt, Umer, et al.
Published: (2024)
Detection of Human and Machine-Authored Fake News in Urdu
by: Ali, Muhammad Zain, et al.
Published: (2024)
by: Ali, Muhammad Zain, et al.
Published: (2024)
LEGAL-UQA: A Low-Resource Urdu-English Dataset for Legal Question Answering
by: Faisal, Faizan, et al.
Published: (2024)
by: Faisal, Faizan, et al.
Published: (2024)
UrduLLaMA 1.0: Dataset Curation, Preprocessing, and Evaluation in Low-Resource Settings
by: Fiaz, Layba, et al.
Published: (2025)
by: Fiaz, Layba, et al.
Published: (2025)
MUTEX: Leveraging Multilingual Transformers and Conditional Random Fields for Enhanced Urdu Toxic Span Detection
by: Arshad, Inayat, et al.
Published: (2026)
by: Arshad, Inayat, et al.
Published: (2026)
Assessing the Feasibility of Lightweight Whisper Models for Low-Resource Urdu Transcription
by: Antall, Abdul Rehman, et al.
Published: (2025)
by: Antall, Abdul Rehman, et al.
Published: (2025)
Benchmarking the Performance of Pre-trained LLMs across Urdu NLP Tasks
by: Tahir, Munief Hassan, et al.
Published: (2024)
by: Tahir, Munief Hassan, et al.
Published: (2024)
UrduFactCheck: An Agentic Fact-Checking Framework for Urdu with Evidence Boosting and Benchmarking
by: Ahmad, Sarfraz, et al.
Published: (2025)
by: Ahmad, Sarfraz, et al.
Published: (2025)
BioUNER: A Benchmark Dataset for Clinical Urdu Named Entity Recognition
by: Ali, Wazir, et al.
Published: (2026)
by: Ali, Wazir, et al.
Published: (2026)
Paramanu: Compact and Competitive Monolingual Language Models for Low-Resource Morphologically Rich Indian Languages
by: Niyogi, Mitodru, et al.
Published: (2024)
by: Niyogi, Mitodru, et al.
Published: (2024)
ULTRA:Urdu Language Transformer-based Recommendation Architecture
by: Bashir, Alishbah, et al.
Published: (2026)
by: Bashir, Alishbah, et al.
Published: (2026)
Cross-Corpus Validation of Speech Emotion Recognition in Urdu using Domain-Knowledge Acoustic Features
by: Talpur, Unzela, et al.
Published: (2025)
by: Talpur, Unzela, et al.
Published: (2025)
Attention based Bidirectional GRU hybrid model for inappropriate content detection in Urdu language
by: Shoukat, Ezzah, et al.
Published: (2025)
by: Shoukat, Ezzah, et al.
Published: (2025)
Detection of Anxiety Levels in Urdu Text (Multiclass Dataset)
by: Fareed, Sadia, et al.
Published: (2025)
by: Fareed, Sadia, et al.
Published: (2025)
Introducing cosmosGPT: Monolingual Training for Turkish Language Models
by: Kesgin, H. Toprak, et al.
Published: (2024)
by: Kesgin, H. Toprak, et al.
Published: (2024)
Bilingual Adaptation of Monolingual Foundation Models
by: Gosal, Gurpreet, et al.
Published: (2024)
by: Gosal, Gurpreet, et al.
Published: (2024)
From Statistical Methods to Pre-Trained Models; A Survey on Automatic Speech Recognition for Resource Scarce Urdu Language
by: Sharif, Muhammad, et al.
Published: (2024)
by: Sharif, Muhammad, et al.
Published: (2024)
Mitigating Hallucinations Using Ensemble of Knowledge Graph and Vector Store in Large Language Models to Enhance Mental Health Support
by: Muqtadir, Abdul, et al.
Published: (2024)
by: Muqtadir, Abdul, et al.
Published: (2024)
Dallah: A Dialect-Aware Multimodal Large Language Model for Arabic
by: Alwajih, Fakhraddin, et al.
Published: (2024)
by: Alwajih, Fakhraddin, et al.
Published: (2024)
Classification of Safety Events at Nuclear Sites using Large Language Models
by: de Costa, Mishca, et al.
Published: (2024)
by: de Costa, Mishca, et al.
Published: (2024)
Neurons Speak in Ranges: Breaking Free from Discrete Neuronal Attribution
by: Haider, Muhammad Umair, et al.
Published: (2025)
by: Haider, Muhammad Umair, et al.
Published: (2025)
Similar Items
-
UrduBench: An Urdu Reasoning Benchmark using Contextually Ensembled Translations with Human-in-the-Loop
by: Shafique, Muhammad Ali, et al.
Published: (2026) -
Low-Resource Transliteration for Roman-Urdu and Urdu Using Transformer-Based Models
by: Butt, Umer, et al.
Published: (2025) -
A Literature Review of Keyword Spotting Technologies for Urdu
by: Rizvi, Syed Muhammad Aqdas
Published: (2024) -
AI-Generated Text Detection in Low-Resource Languages: A Case Study on Urdu
by: Ammar, Muhammad, et al.
Published: (2025) -
Ax-to-Grind Urdu: Benchmark Dataset for Urdu Fake News Detection
by: Harris, Sheetal, et al.
Published: (2024)