WangchanThaiInstruct: An instruction-following Dataset for Culture-Aware, Multitask, and Multi-domain Evaluation in Thai
Fuente:
arXiv
Saved in:
| Main Authors: | Limkonchotiwat, Peerat, Tuchinda, Pume, Lowphansirikul, Lalita, Nonesung, Surapon, Tasawong, Panuthep, Aji, Alham Fikri, Udomcharoenchaikit, Can, Nutanong, Sarana |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
WangchanLion and WangchanX MRC Eval
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2024)
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2024)
Assessing Thai Dialect Performance in LLMs with Automatic Benchmarks and Human Evaluation
by: Limkonchotiwat, Peerat, et al.
Published: (2025)
by: Limkonchotiwat, Peerat, et al.
Published: (2025)
When Better Teachers Don't Make Better Students: Revisiting Knowledge Distillation for CLIP Models in VQA
by: Tuchinda, Pume, et al.
Published: (2025)
by: Tuchinda, Pume, et al.
Published: (2025)
Mangosteen: An Open Thai Corpus for Language Model Pretraining
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2025)
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2025)
PyThaiNLP: Thai Natural Language Processing in Python
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2023)
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2023)
SEA-SafeguardBench: Evaluating AI Safety in SEA Languages and Cultures
by: Tasawong, Panuthep, et al.
Published: (2025)
by: Tasawong, Panuthep, et al.
Published: (2025)
SEA-Guard: Culturally Grounded Multilingual Safeguard for Southeast Asia
by: Tasawong, Panuthep, et al.
Published: (2026)
by: Tasawong, Panuthep, et al.
Published: (2026)
Towards Better Understanding of Program-of-Thought Reasoning in Cross-Lingual and Multilingual Environments
by: Payoungkhamdee, Patomporn, et al.
Published: (2025)
by: Payoungkhamdee, Patomporn, et al.
Published: (2025)
Seed-Free Synthetic Data Generation Framework for Instruction-Tuning LLMs: A Case Study in Thai
by: Pengpun, Parinthapat, et al.
Published: (2024)
by: Pengpun, Parinthapat, et al.
Published: (2024)
NitiBench: A Comprehensive Study of LLM Framework Capabilities for Thai Legal Question Answering
by: Akarajaradwong, Pawitsapak, et al.
Published: (2025)
by: Akarajaradwong, Pawitsapak, et al.
Published: (2025)
Space Decomposition for Sentence Embedding
by: Ponwitayarat, Wuttikorn, et al.
Published: (2024)
by: Ponwitayarat, Wuttikorn, et al.
Published: (2024)
Addressing Topic Leakage in Cross-Topic Evaluation for Authorship Verification
by: Sawatphol, Jitkapat, et al.
Published: (2024)
by: Sawatphol, Jitkapat, et al.
Published: (2024)
Typhoon OCR: Open Vision-Language Model For Thai Document Extraction
by: Nonesung, Surapon, et al.
Published: (2026)
by: Nonesung, Surapon, et al.
Published: (2026)
ThaiOCRBench: A Task-Diverse Benchmark for Vision-Language Understanding in Thai
by: Nonesung, Surapon, et al.
Published: (2025)
by: Nonesung, Surapon, et al.
Published: (2025)
LoraxBench: A Multitask, Multilingual Benchmark Suite for 20 Indonesian Languages
by: Aji, Alham Fikri, et al.
Published: (2025)
by: Aji, Alham Fikri, et al.
Published: (2025)
Distilling Multilingual Vision-Language Models: When Smaller Models Stay Multilingual
by: Sriratanawilai, Sukrit, et al.
Published: (2025)
by: Sriratanawilai, Sukrit, et al.
Published: (2025)
SEA-BED: How Do Embedding Models Represent Southeast Asian Languages?
by: Ponwitayarat, Wuttikorn, et al.
Published: (2025)
by: Ponwitayarat, Wuttikorn, et al.
Published: (2025)
Exploring Cross-Client Memorization of Training Data in Large Language Models for Federated Learning
by: Udsa, Tinnakit, et al.
Published: (2025)
by: Udsa, Tinnakit, et al.
Published: (2025)
A Two-Phase Stability Study of LLM Judges and Bar Council Examiners on Thai Bar-Exam Free-Form Essays
by: Akarajaradwong, Pawitsapak, et al.
Published: (2026)
by: Akarajaradwong, Pawitsapak, et al.
Published: (2026)
Can Group Relative Policy Optimization Improve Thai Legal Reasoning and Question Answering?
by: Akarajaradwong, Pawitsapak, et al.
Published: (2025)
by: Akarajaradwong, Pawitsapak, et al.
Published: (2025)
Improving Low-Resource Machine Translation via Round-Trip Reinforcement Learning
by: Attia, Ahmed, et al.
Published: (2026)
by: Attia, Ahmed, et al.
Published: (2026)
Daisy-TTS: Simulating Wider Spectrum of Emotions via Prosody Embedding Decomposition
by: Chevi, Rendi, et al.
Published: (2024)
by: Chevi, Rendi, et al.
Published: (2024)
Can General-Purpose Large Language Models Generalize to English-Thai Machine Translation ?
by: Chiaranaipanich, Jirat, et al.
Published: (2024)
by: Chiaranaipanich, Jirat, et al.
Published: (2024)
Typhoon 2: A Family of Open Text and Multimodal Thai Large Language Models
by: Pipatanakul, Kunat, et al.
Published: (2024)
by: Pipatanakul, Kunat, et al.
Published: (2024)
Data Laundering: Artificially Boosting Benchmark Results through Knowledge Distillation
by: Mansurov, Jonibek, et al.
Published: (2024)
by: Mansurov, Jonibek, et al.
Published: (2024)
Balanced Multi-Factor In-Context Learning for Multilingual Large Language Models
by: Kaneko, Masahiro, et al.
Published: (2025)
by: Kaneko, Masahiro, et al.
Published: (2025)
Sense Representations Are Inducible Interfaces
by: Cruz, Jan Christian Blaise, et al.
Published: (2026)
by: Cruz, Jan Christian Blaise, et al.
Published: (2026)
LLM Olympiad: Why Model Evaluation Needs a Sealed Exam
by: Cruz, Jan Christian Blaise, et al.
Published: (2026)
by: Cruz, Jan Christian Blaise, et al.
Published: (2026)
Extracting General-use Transformers for Low-resource Languages via Knowledge Distillation
by: Cruz, Jan Christian Blaise, et al.
Published: (2025)
by: Cruz, Jan Christian Blaise, et al.
Published: (2025)
Beyond Probabilities: Unveiling the Misalignment in Evaluating Large Language Models
by: Lyu, Chenyang, et al.
Published: (2024)
by: Lyu, Chenyang, et al.
Published: (2024)
On Creating an English-Thai Code-switched Machine Translation in Medical Domain
by: Pengpun, Parinthapat, et al.
Published: (2024)
by: Pengpun, Parinthapat, et al.
Published: (2024)
Decom-Renorm-Merge: Model Merging on the Right Space Improves Multitasking
by: Chaichana, Yuatyong, et al.
Published: (2025)
by: Chaichana, Yuatyong, et al.
Published: (2025)
Language-Specific Latent Process Hinders Cross-Lingual Performance
by: Lim, Zheng Wei, et al.
Published: (2025)
by: Lim, Zheng Wei, et al.
Published: (2025)
The Privileged Students: On the Value of Initialization in Multilingual Knowledge Distillation
by: Wibowo, Haryo Akbarianto, et al.
Published: (2024)
by: Wibowo, Haryo Akbarianto, et al.
Published: (2024)
Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!
by: Imam, Mohamed Fazli, et al.
Published: (2025)
by: Imam, Mohamed Fazli, et al.
Published: (2025)
SEADialogues: A Multilingual Culturally Grounded Multi-turn Dialogue Dataset on Southeast Asian Languages
by: Kautsar, Muhammad Dehan Al, et al.
Published: (2025)
by: Kautsar, Muhammad Dehan Al, et al.
Published: (2025)
Language Surgery in Multilingual Large Language Models
by: Lopo, Joanito Agili, et al.
Published: (2025)
by: Lopo, Joanito Agili, et al.
Published: (2025)
Sonographic appearance of focal liver lesions and likelihood of hepatocellular carcinoma in adult Thais with chronic hepatitis B virus infection
by: Sarana Suttivanich, et al.
Published: (2024)
by: Sarana Suttivanich, et al.
Published: (2024)
Efficient and Interpretable Grammatical Error Correction with Mixture of Experts
by: Qorib, Muhammad Reza, et al.
Published: (2024)
by: Qorib, Muhammad Reza, et al.
Published: (2024)
Enabling Natural Zero-Shot Prompting on Encoder Models via Statement-Tuning
by: Elshabrawy, Ahmed, et al.
Published: (2024)
by: Elshabrawy, Ahmed, et al.
Published: (2024)
Similar Items
-
WangchanLion and WangchanX MRC Eval
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2024) -
Assessing Thai Dialect Performance in LLMs with Automatic Benchmarks and Human Evaluation
by: Limkonchotiwat, Peerat, et al.
Published: (2025) -
When Better Teachers Don't Make Better Students: Revisiting Knowledge Distillation for CLIP Models in VQA
by: Tuchinda, Pume, et al.
Published: (2025) -
Mangosteen: An Open Thai Corpus for Language Model Pretraining
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2025) -
PyThaiNLP: Thai Natural Language Processing in Python
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2023)