Benchmarking POS Tagging for the Tajik Language: A Comparative Study of Neural Architectures on the TajPersParallel Corpus
Fuente:
arXiv
Guardado en:
| Autor principal: | Arabov, Mullosharaf K. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TajPersLexon: A Tajik-Persian Lexical Resource and Hybrid Model for Cross-Script Low-Resource NLP
por: Arabov, Mullosharaf K.
Publicado: (2026)
por: Arabov, Mullosharaf K.
Publicado: (2026)
Benchmarking Parameter-Efficient Fine-Tuning of Large Language Models for Low-Resource Tajik Text Generation with the Tajik Web Corpus
por: Arabov, Mullosharaf K.
Publicado: (2026)
por: Arabov, Mullosharaf K.
Publicado: (2026)
A Systematic Benchmark of Machine Transliteration Models for the Tajik-Farsi Language Pair: A Comparative Study from Rule-Based to Transformer Architectures
por: Arabov, Mullosharaf K.
Publicado: (2026)
por: Arabov, Mullosharaf K.
Publicado: (2026)
Character-Level Transformer for Tajik-Persian Transliteration with a Parallel Lexical Corpus
por: Arabov, Mullosharaf K.
Publicado: (2026)
por: Arabov, Mullosharaf K.
Publicado: (2026)
Adapting Large Language Models to a Low-Resource Agglutinative Language: A Comparative Study of LoRA and QLoRA for Bashkir
por: Arabov, Mullosharaf K., et al.
Publicado: (2026)
por: Arabov, Mullosharaf K., et al.
Publicado: (2026)
Tatarstan Toponyms: A Bilingual Dataset and Hybrid RAG System for Geospatial Question Answering
por: Arabov, Mullosharaf K.
Publicado: (2026)
por: Arabov, Mullosharaf K.
Publicado: (2026)
Natural Language Processing: A Comprehensive Practical Guide from Tokenisation to RLHF
por: Arabov, Mullosharaf K.
Publicado: (2026)
por: Arabov, Mullosharaf K.
Publicado: (2026)
TajikNLP: An Open-Source Toolkit for Comprehensive Text Processing of Tajik (Cyrillic Script)
por: Arabov, Mullosharif K., et al.
Publicado: (2026)
por: Arabov, Mullosharif K., et al.
Publicado: (2026)
From Traditional Taggers to LLMs: A Comparative Study of POS Tagging for Medieval Romance Languages
por: Schöffel, Matthias, et al.
Publicado: (2026)
por: Schöffel, Matthias, et al.
Publicado: (2026)
The Mediomatix Corpus: Parallel Data for Romansh Language Varieties via Comparable Schoolbooks
por: Hopton, Zachary, et al.
Publicado: (2025)
por: Hopton, Zachary, et al.
Publicado: (2025)
Untangling the Influence of Typology, Data and Model Architecture on Ranking Transfer Languages for Cross-Lingual POS Tagging
por: Rice, Enora, et al.
Publicado: (2025)
por: Rice, Enora, et al.
Publicado: (2025)
A Comparative Analysis of Machine Learning Algorithms for Multi-Task Prediction of the Parameters of the Pectin Hydrolysis--Extraction Process
por: Arabov, Mullosharaf K., et al.
Publicado: (2026)
por: Arabov, Mullosharaf K., et al.
Publicado: (2026)
Parallel Corpus Augmentation using Masked Language Models
por: Kumari, Vibhuti, et al.
Publicado: (2024)
por: Kumari, Vibhuti, et al.
Publicado: (2024)
DecorateLM: Data Engineering through Corpus Rating, Tagging, and Editing with Language Models
por: Zhao, Ranchi, et al.
Publicado: (2024)
por: Zhao, Ranchi, et al.
Publicado: (2024)
Neural Morphological Tagging for Nguni Languages
por: Marquard, Cael, et al.
Publicado: (2025)
por: Marquard, Cael, et al.
Publicado: (2025)
FastPOS: Language-Agnostic Scalable POS Tagging Framework Low-Resource Use Case
por: Kafi, Md Abdullah Al, et al.
Publicado: (2025)
por: Kafi, Md Abdullah Al, et al.
Publicado: (2025)
Modern Models, Medieval Texts: A POS Tagging Study of Old Occitan
por: Schöffel, Matthias, et al.
Publicado: (2025)
por: Schöffel, Matthias, et al.
Publicado: (2025)
Unveiling Factors for Enhanced POS Tagging: A Study of Low-Resource Medieval Romance Languages
por: Schöffel, Matthias, et al.
Publicado: (2025)
por: Schöffel, Matthias, et al.
Publicado: (2025)
ParsTranslit: Truly Versatile Tajik-Farsi Transliteration
por: Merchant, Rayyan, et al.
Publicado: (2025)
por: Merchant, Rayyan, et al.
Publicado: (2025)
EthioMT: Parallel Corpus for Low-resource Ethiopian Languages
por: Tonja, Atnafu Lambebo, et al.
Publicado: (2024)
por: Tonja, Atnafu Lambebo, et al.
Publicado: (2024)
Feriji: A French-Zarma Parallel Corpus, Glossary & Translator
por: Keita, Mamadou K., et al.
Publicado: (2024)
por: Keita, Mamadou K., et al.
Publicado: (2024)
Soro: A Lightweight Foundation Model and Chatbot for Tajik
por: Liashkov, Stanislav, et al.
Publicado: (2026)
por: Liashkov, Stanislav, et al.
Publicado: (2026)
A Benchmark Corpus and Neural Approach for Sanskrit Derivative Nouns Analysis
por: Singh, Arun Kumar, et al.
Publicado: (2020)
por: Singh, Arun Kumar, et al.
Publicado: (2020)
ARCADE: A City-Scale Corpus for Fine-Grained Arabic Dialect Tagging
por: Nacar, Omer, et al.
Publicado: (2026)
por: Nacar, Omer, et al.
Publicado: (2026)
Leveraging the Cross-Domain & Cross-Linguistic Corpus for Low Resource NMT: A Case Study On Bhili-Hindi-English Parallel Corpus
por: Singh, Pooja, et al.
Publicado: (2025)
por: Singh, Pooja, et al.
Publicado: (2025)
PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus
por: Gao, Junyuan, et al.
Publicado: (2025)
por: Gao, Junyuan, et al.
Publicado: (2025)
Can Large Language Models (LLMs) Describe Pictures Like Children? A Comparative Corpus Study
por: Woloszyn, Hanna, et al.
Publicado: (2025)
por: Woloszyn, Hanna, et al.
Publicado: (2025)
DATASHI: A Parallel English-Tashlhiyt Corpus for Orthography Normalization and Low-Resource Language Processing
por: Monir, Nasser-Eddine, et al.
Publicado: (2026)
por: Monir, Nasser-Eddine, et al.
Publicado: (2026)
Comparative Study of Zero-Shot Cross-Lingual Transfer for Bodo POS and NER Tagging Using Gemini 2.0 Flash Thinking Experimental Model
por: Narzary, Sanjib, et al.
Publicado: (2025)
por: Narzary, Sanjib, et al.
Publicado: (2025)
DEPLAIN: A German Parallel Corpus with Intralingual Translations into Plain Language for Sentence and Document Simplification
por: Stodden, Regina, et al.
Publicado: (2023)
por: Stodden, Regina, et al.
Publicado: (2023)
Recipe for Zero-shot POS Tagging: Is It Useful in Realistic Scenarios?
por: Vandenbulcke, Zeno, et al.
Publicado: (2024)
por: Vandenbulcke, Zeno, et al.
Publicado: (2024)
PerHalluEval: Persian Hallucination Evaluation Benchmark for Large Language Models
por: Hosseini, Mohammad, et al.
Publicado: (2025)
por: Hosseini, Mohammad, et al.
Publicado: (2025)
PEACH: A sentence-aligned Parallel English-Arabic Corpus for Healthcare
por: Al-Sabbagh, Rania
Publicado: (2025)
por: Al-Sabbagh, Rania
Publicado: (2025)
A Japanese-Chinese Parallel Corpus Using Crowdsourcing for Web Mining
por: Nagata, Masaaki, et al.
Publicado: (2024)
por: Nagata, Masaaki, et al.
Publicado: (2024)
YouTube-SL-25: A Large-Scale, Open-Domain Multilingual Sign Language Parallel Corpus
por: Tanzer, Garrett, et al.
Publicado: (2024)
por: Tanzer, Garrett, et al.
Publicado: (2024)
KazParC: Kazakh Parallel Corpus for Machine Translation
por: Yeshpanov, Rustem, et al.
Publicado: (2024)
por: Yeshpanov, Rustem, et al.
Publicado: (2024)
Enhancing Neural Machine Translation of Low-Resource Languages: Corpus Development, Human Evaluation and Explainable AI Architectures
por: Lankford, Séamus
Publicado: (2024)
por: Lankford, Séamus
Publicado: (2024)
OpenWHO: A Document-Level Parallel Corpus for Health Translation in Low-Resource Languages
por: Merx, Raphaël, et al.
Publicado: (2025)
por: Merx, Raphaël, et al.
Publicado: (2025)
A Topic-aware Comparable Corpus of Chinese Variations
por: Lian, Da-Chen, et al.
Publicado: (2024)
por: Lian, Da-Chen, et al.
Publicado: (2024)
Enhancing Language Learning through Technology: Introducing a New English-Azerbaijani (Arabic Script) Parallel Corpus
por: Khiarak, Jalil Nourmohammadi, et al.
Publicado: (2024)
por: Khiarak, Jalil Nourmohammadi, et al.
Publicado: (2024)
Ejemplares similares
-
TajPersLexon: A Tajik-Persian Lexical Resource and Hybrid Model for Cross-Script Low-Resource NLP
por: Arabov, Mullosharaf K.
Publicado: (2026) -
Benchmarking Parameter-Efficient Fine-Tuning of Large Language Models for Low-Resource Tajik Text Generation with the Tajik Web Corpus
por: Arabov, Mullosharaf K.
Publicado: (2026) -
A Systematic Benchmark of Machine Transliteration Models for the Tajik-Farsi Language Pair: A Comparative Study from Rule-Based to Transformer Architectures
por: Arabov, Mullosharaf K.
Publicado: (2026) -
Character-Level Transformer for Tajik-Persian Transliteration with a Parallel Lexical Corpus
por: Arabov, Mullosharaf K.
Publicado: (2026) -
Adapting Large Language Models to a Low-Resource Agglutinative Language: A Comparative Study of LoRA and QLoRA for Bashkir
por: Arabov, Mullosharaf K., et al.
Publicado: (2026)