BURMESE-SAN: Burmese NLP Benchmark for Evaluating Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Aung, Thura, Montalan, Jann Railey, Ngui, Jian Gang, Limkonchotiwat, Peerat |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SEA-BED: How Do Embedding Models Represent Southeast Asian Languages?
by: Ponwitayarat, Wuttikorn, et al.
Published: (2025)
by: Ponwitayarat, Wuttikorn, et al.
Published: (2025)
SEA-HELM: Southeast Asian Holistic Evaluation of Language Models
by: Susanto, Yosephine, et al.
Published: (2025)
by: Susanto, Yosephine, et al.
Published: (2025)
SEA-SafeguardBench: Evaluating AI Safety in SEA Languages and Cultures
by: Tasawong, Panuthep, et al.
Published: (2025)
by: Tasawong, Panuthep, et al.
Published: (2025)
SEA-Guard: Culturally Grounded Multilingual Safeguard for Southeast Asia
by: Tasawong, Panuthep, et al.
Published: (2026)
by: Tasawong, Panuthep, et al.
Published: (2026)
Kalahi: A handcrafted, grassroots cultural LLM evaluation suite for Filipino
by: Montalan, Jann Railey, et al.
Published: (2024)
by: Montalan, Jann Railey, et al.
Published: (2024)
Batayan: A Filipino NLP benchmark for evaluating Large Language Models
by: Montalan, Jann Railey, et al.
Published: (2025)
by: Montalan, Jann Railey, et al.
Published: (2025)
KAConvText: Novel Approach to Burmese Sentence Classification using Kolmogorov-Arnold Convolution
by: Thu, Ye Kyaw, et al.
Published: (2025)
by: Thu, Ye Kyaw, et al.
Published: (2025)
ASR Error Correction in Low-Resource Burmese with Alignment-Enhanced Transformers using Phonetic Features
by: Lin, Ye Bhone, et al.
Published: (2025)
by: Lin, Ye Bhone, et al.
Published: (2025)
Enhancing Burmese News Classification with Kolmogorov-Arnold Network Head Fine-tuning
by: Aung, Thura, et al.
Published: (2025)
by: Aung, Thura, et al.
Published: (2025)
Assessing Thai Dialect Performance in LLMs with Automatic Benchmarks and Human Evaluation
by: Limkonchotiwat, Peerat, et al.
Published: (2025)
by: Limkonchotiwat, Peerat, et al.
Published: (2025)
PyThaiNLP: Thai Natural Language Processing in Python
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2023)
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2023)
Distilling Multilingual Vision-Language Models: When Smaller Models Stay Multilingual
by: Sriratanawilai, Sukrit, et al.
Published: (2025)
by: Sriratanawilai, Sukrit, et al.
Published: (2025)
Space Decomposition for Sentence Embedding
by: Ponwitayarat, Wuttikorn, et al.
Published: (2024)
by: Ponwitayarat, Wuttikorn, et al.
Published: (2024)
Seed-Free Synthetic Data Generation Framework for Instruction-Tuning LLMs: A Case Study in Thai
by: Pengpun, Parinthapat, et al.
Published: (2024)
by: Pengpun, Parinthapat, et al.
Published: (2024)
myNER: Contextualized Burmese Named Entity Recognition with Bidirectional LSTM and fastText Embeddings via Joint Training with POS Tagging
by: Thant, Kaung Lwin, et al.
Published: (2025)
by: Thant, Kaung Lwin, et al.
Published: (2025)
Mangosteen: An Open Thai Corpus for Language Model Pretraining
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2025)
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2025)
When Better Teachers Don't Make Better Students: Revisiting Knowledge Distillation for CLIP Models in VQA
by: Tuchinda, Pume, et al.
Published: (2025)
by: Tuchinda, Pume, et al.
Published: (2025)
BHDD: A Burmese Handwritten Digit Dataset
by: Aung, Swan Htet, et al.
Published: (2026)
by: Aung, Swan Htet, et al.
Published: (2026)
Language Surgery in Multilingual Large Language Models
by: Lopo, Joanito Agili, et al.
Published: (2025)
by: Lopo, Joanito Agili, et al.
Published: (2025)
SEA-LION: Southeast Asian Languages in One Network
by: Ng, Raymond, et al.
Published: (2025)
by: Ng, Raymond, et al.
Published: (2025)
Can General-Purpose Large Language Models Generalize to English-Thai Machine Translation ?
by: Chiaranaipanich, Jirat, et al.
Published: (2024)
by: Chiaranaipanich, Jirat, et al.
Published: (2024)
MultiLexNorm++: A Unified Benchmark and a Generative Model for Lexical Normalization for Asian Languages
by: Buaphet, Weerayut, et al.
Published: (2026)
by: Buaphet, Weerayut, et al.
Published: (2026)
WangchanThaiInstruct: An instruction-following Dataset for Culture-Aware, Multitask, and Multi-domain Evaluation in Thai
by: Limkonchotiwat, Peerat, et al.
Published: (2025)
by: Limkonchotiwat, Peerat, et al.
Published: (2025)
Privacy Evaluation Benchmarks for NLP Models
by: Huang, Wei, et al.
Published: (2024)
by: Huang, Wei, et al.
Published: (2024)
A Japanese Language Model and Three New Evaluation Benchmarks for Pharmaceutical NLP
by: Ono, Shinnosuke, et al.
Published: (2025)
by: Ono, Shinnosuke, et al.
Published: (2025)
Benchmarking Large Language Models on Multiple Tasks in Bioinformatics NLP with Prompting
by: Jiang, Jiyue, et al.
Published: (2025)
by: Jiang, Jiyue, et al.
Published: (2025)
Towards Sustainable NLP: Insights from Benchmarking Inference Energy in Large Language Models
by: Poddar, Soham, et al.
Published: (2025)
by: Poddar, Soham, et al.
Published: (2025)
Large Language Models on Wikipedia-Style Survey Generation: an Evaluation in NLP Concepts
by: Gao, Fan, et al.
Published: (2023)
by: Gao, Fan, et al.
Published: (2023)
Exploring the Reliability of Large Language Models as Customized Evaluators for Diverse NLP Tasks
by: Li, Qintong, et al.
Published: (2023)
by: Li, Qintong, et al.
Published: (2023)
Active Learning for NLP with Large Language Models
by: Wang, Xuesong
Published: (2024)
by: Wang, Xuesong
Published: (2024)
Benchmarking Retrieval-Augmented Large Language Models in Biomedical NLP: Application, Robustness, and Self-Awareness
by: Li, Mingchen, et al.
Published: (2024)
by: Li, Mingchen, et al.
Published: (2024)
Towards Better Understanding of Program-of-Thought Reasoning in Cross-Lingual and Multilingual Environments
by: Payoungkhamdee, Patomporn, et al.
Published: (2025)
by: Payoungkhamdee, Patomporn, et al.
Published: (2025)
Global MMLU: Understanding and Addressing Cultural and Linguistic Biases in Multilingual Evaluation
by: Singh, Shivalika, et al.
Published: (2024)
by: Singh, Shivalika, et al.
Published: (2024)
BenLLMEval: A Comprehensive Evaluation into the Potentials and Pitfalls of Large Language Models on Bengali NLP
by: Kabir, Mohsinul, et al.
Published: (2023)
by: Kabir, Mohsinul, et al.
Published: (2023)
A User-Centric Multi-Intent Benchmark for Evaluating Large Language Models
by: Wang, Jiayin, et al.
Published: (2024)
by: Wang, Jiayin, et al.
Published: (2024)
WangchanLion and WangchanX MRC Eval
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2024)
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2024)
Large Language Models Meet NLP: A Survey
by: Qin, Libo, et al.
Published: (2024)
by: Qin, Libo, et al.
Published: (2024)
NLP-ADBench: NLP Anomaly Detection Benchmark
by: Li, Yuangang, et al.
Published: (2024)
by: Li, Yuangang, et al.
Published: (2024)
D-NLP at SemEval-2024 Task 2: Evaluating Clinical Inference Capabilities of Large Language Models
by: Altinok, Duygu
Published: (2024)
by: Altinok, Duygu
Published: (2024)
MELABenchv1: Benchmarking Large Language Models against Smaller Fine-Tuned Models for Low-Resource Maltese NLP
by: Micallef, Kurt, et al.
Published: (2025)
by: Micallef, Kurt, et al.
Published: (2025)
Similar Items
-
SEA-BED: How Do Embedding Models Represent Southeast Asian Languages?
by: Ponwitayarat, Wuttikorn, et al.
Published: (2025) -
SEA-HELM: Southeast Asian Holistic Evaluation of Language Models
by: Susanto, Yosephine, et al.
Published: (2025) -
SEA-SafeguardBench: Evaluating AI Safety in SEA Languages and Cultures
by: Tasawong, Panuthep, et al.
Published: (2025) -
SEA-Guard: Culturally Grounded Multilingual Safeguard for Southeast Asia
by: Tasawong, Panuthep, et al.
Published: (2026) -
Kalahi: A handcrafted, grassroots cultural LLM evaluation suite for Filipino
by: Montalan, Jann Railey, et al.
Published: (2024)