Mangosteen: An Open Thai Corpus for Language Model Pretraining
Fuente:
arXiv
Salvato in:
| Autori principali: | Phatthiyaphaibun, Wannaphong, Udomcharoenchaikit, Can, Singkorapoom, Pakpoom, Pipatanakul, Kunat, Chuangsuwanich, Ekapol, Limkonchotiwat, Peerat, Nutanong, Sarana |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
WangchanLion and WangchanX MRC Eval
di: Phatthiyaphaibun, Wannaphong, et al.
Pubblicazione: (2024)
di: Phatthiyaphaibun, Wannaphong, et al.
Pubblicazione: (2024)
Space Decomposition for Sentence Embedding
di: Ponwitayarat, Wuttikorn, et al.
Pubblicazione: (2024)
di: Ponwitayarat, Wuttikorn, et al.
Pubblicazione: (2024)
PyThaiNLP: Thai Natural Language Processing in Python
di: Phatthiyaphaibun, Wannaphong, et al.
Pubblicazione: (2023)
di: Phatthiyaphaibun, Wannaphong, et al.
Pubblicazione: (2023)
Towards Better Understanding of Program-of-Thought Reasoning in Cross-Lingual and Multilingual Environments
di: Payoungkhamdee, Patomporn, et al.
Pubblicazione: (2025)
di: Payoungkhamdee, Patomporn, et al.
Pubblicazione: (2025)
WangchanThaiInstruct: An instruction-following Dataset for Culture-Aware, Multitask, and Multi-domain Evaluation in Thai
di: Limkonchotiwat, Peerat, et al.
Pubblicazione: (2025)
di: Limkonchotiwat, Peerat, et al.
Pubblicazione: (2025)
Seed-Free Synthetic Data Generation Framework for Instruction-Tuning LLMs: A Case Study in Thai
di: Pengpun, Parinthapat, et al.
Pubblicazione: (2024)
di: Pengpun, Parinthapat, et al.
Pubblicazione: (2024)
Prior Prompt Engineering for Reinforcement Fine-Tuning
di: Taveekitworachai, Pittawat, et al.
Pubblicazione: (2025)
di: Taveekitworachai, Pittawat, et al.
Pubblicazione: (2025)
Addressing Topic Leakage in Cross-Topic Evaluation for Authorship Verification
di: Sawatphol, Jitkapat, et al.
Pubblicazione: (2024)
di: Sawatphol, Jitkapat, et al.
Pubblicazione: (2024)
Can Group Relative Policy Optimization Improve Thai Legal Reasoning and Question Answering?
di: Akarajaradwong, Pawitsapak, et al.
Pubblicazione: (2025)
di: Akarajaradwong, Pawitsapak, et al.
Pubblicazione: (2025)
Assessing Thai Dialect Performance in LLMs with Automatic Benchmarks and Human Evaluation
di: Limkonchotiwat, Peerat, et al.
Pubblicazione: (2025)
di: Limkonchotiwat, Peerat, et al.
Pubblicazione: (2025)
When Better Teachers Don't Make Better Students: Revisiting Knowledge Distillation for CLIP Models in VQA
di: Tuchinda, Pume, et al.
Pubblicazione: (2025)
di: Tuchinda, Pume, et al.
Pubblicazione: (2025)
Distilling Multilingual Vision-Language Models: When Smaller Models Stay Multilingual
di: Sriratanawilai, Sukrit, et al.
Pubblicazione: (2025)
di: Sriratanawilai, Sukrit, et al.
Pubblicazione: (2025)
Exploring Cross-Client Memorization of Training Data in Large Language Models for Federated Learning
di: Udsa, Tinnakit, et al.
Pubblicazione: (2025)
di: Udsa, Tinnakit, et al.
Pubblicazione: (2025)
ThaiSafetyBench: Assessing Language Model Safety in Thai Cultural Contexts
di: Ukarapol, Trapoom, et al.
Pubblicazione: (2026)
di: Ukarapol, Trapoom, et al.
Pubblicazione: (2026)
SEA-BED: How Do Embedding Models Represent Southeast Asian Languages?
di: Ponwitayarat, Wuttikorn, et al.
Pubblicazione: (2025)
di: Ponwitayarat, Wuttikorn, et al.
Pubblicazione: (2025)
Typhoon T1: An Open Thai Reasoning Model
di: Taveekitworachai, Pittawat, et al.
Pubblicazione: (2025)
di: Taveekitworachai, Pittawat, et al.
Pubblicazione: (2025)
Typhoon OCR: Open Vision-Language Model For Thai Document Extraction
di: Nonesung, Surapon, et al.
Pubblicazione: (2026)
di: Nonesung, Surapon, et al.
Pubblicazione: (2026)
Typhoon-S: Minimal Open Post-Training for Sovereign Large Language Models
di: Pipatanakul, Kunat, et al.
Pubblicazione: (2026)
di: Pipatanakul, Kunat, et al.
Pubblicazione: (2026)
A Two-Phase Stability Study of LLM Judges and Bar Council Examiners on Thai Bar-Exam Free-Form Essays
di: Akarajaradwong, Pawitsapak, et al.
Pubblicazione: (2026)
di: Akarajaradwong, Pawitsapak, et al.
Pubblicazione: (2026)
Adapting Language-Specific LLMs to a Reasoning Model in One Day via Model Merging -- An Open Recipe
di: Pipatanakul, Kunat, et al.
Pubblicazione: (2025)
di: Pipatanakul, Kunat, et al.
Pubblicazione: (2025)
ThaiOCRBench: A Task-Diverse Benchmark for Vision-Language Understanding in Thai
di: Nonesung, Surapon, et al.
Pubblicazione: (2025)
di: Nonesung, Surapon, et al.
Pubblicazione: (2025)
MrRank: Improving Question Answering Retrieval System through Multi-Result Ranking Model
di: Khamnuansin, Danupat, et al.
Pubblicazione: (2024)
di: Khamnuansin, Danupat, et al.
Pubblicazione: (2024)
MultiLexNorm++: A Unified Benchmark and a Generative Model for Lexical Normalization for Asian Languages
di: Buaphet, Weerayut, et al.
Pubblicazione: (2026)
di: Buaphet, Weerayut, et al.
Pubblicazione: (2026)
Explainable Depression Detection using Masked Hard Instance Mining
di: Prakrankamanant, Patawee, et al.
Pubblicazione: (2025)
di: Prakrankamanant, Patawee, et al.
Pubblicazione: (2025)
Typhoon ASR Real-time: FastConformer-Transducer for Thai Automatic Speech Recognition
di: Sirichotedumrong, Warit, et al.
Pubblicazione: (2026)
di: Sirichotedumrong, Warit, et al.
Pubblicazione: (2026)
Formula-One Prompting: A Composable Equation-First Prefix for Applied Mathematics
di: Nitarach, Natapong, et al.
Pubblicazione: (2026)
di: Nitarach, Natapong, et al.
Pubblicazione: (2026)
Evaluating Perspectival Biases in Cross-Modal Retrieval
di: Saengsukhiran, Teerapol, et al.
Pubblicazione: (2025)
di: Saengsukhiran, Teerapol, et al.
Pubblicazione: (2025)
Typhoon 2: A Family of Open Text and Multimodal Thai Large Language Models
di: Pipatanakul, Kunat, et al.
Pubblicazione: (2024)
di: Pipatanakul, Kunat, et al.
Pubblicazione: (2024)
Mitigating Language Bias in Cross-Lingual Job Retrieval: A Recruitment Platform Perspective
di: Laosaengpha, Napat, et al.
Pubblicazione: (2025)
di: Laosaengpha, Napat, et al.
Pubblicazione: (2025)
NitiBench: A Comprehensive Study of LLM Framework Capabilities for Thai Legal Question Answering
di: Akarajaradwong, Pawitsapak, et al.
Pubblicazione: (2025)
di: Akarajaradwong, Pawitsapak, et al.
Pubblicazione: (2025)
Decom-Renorm-Merge: Model Merging on the Right Space Improves Multitasking
di: Chaichana, Yuatyong, et al.
Pubblicazione: (2025)
di: Chaichana, Yuatyong, et al.
Pubblicazione: (2025)
Talk Less, Call Right: Enhancing Role-Play LLM Agents with Automatic Prompt Optimization and Role Prompting
di: Ruangtanusak, Saksorn, et al.
Pubblicazione: (2025)
di: Ruangtanusak, Saksorn, et al.
Pubblicazione: (2025)
SEADialogues: A Multilingual Culturally Grounded Multi-turn Dialogue Dataset on Southeast Asian Languages
di: Kautsar, Muhammad Dehan Al, et al.
Pubblicazione: (2025)
di: Kautsar, Muhammad Dehan Al, et al.
Pubblicazione: (2025)
BURMESE-SAN: Burmese NLP Benchmark for Evaluating Large Language Models
di: Aung, Thura, et al.
Pubblicazione: (2026)
di: Aung, Thura, et al.
Pubblicazione: (2026)
Can General-Purpose Large Language Models Generalize to English-Thai Machine Translation ?
di: Chiaranaipanich, Jirat, et al.
Pubblicazione: (2024)
di: Chiaranaipanich, Jirat, et al.
Pubblicazione: (2024)
Thunder : Unified Regression-Diffusion Speech Enhancement with a Single Reverse Step using Brownian Bridge
di: Trachu, Thanapat, et al.
Pubblicazione: (2024)
di: Trachu, Thanapat, et al.
Pubblicazione: (2024)
Enhancing Low-Resource Language and Instruction Following Capabilities of Audio Language Models
di: Manakul, Potsawee, et al.
Pubblicazione: (2024)
di: Manakul, Potsawee, et al.
Pubblicazione: (2024)
Spatial Language Likelihood Grounding Network for Bayesian Fusion of Human-Robot Observations
di: Sitdhipol, Supawich, et al.
Pubblicazione: (2025)
di: Sitdhipol, Supawich, et al.
Pubblicazione: (2025)
Extending Audio Context for Long-Form Understanding in Large Audio-Language Models
di: Chaichana, Yuatyong, et al.
Pubblicazione: (2025)
di: Chaichana, Yuatyong, et al.
Pubblicazione: (2025)
Learning Job Title Representation from Job Description Aggregation Network
di: Laosaengpha, Napat, et al.
Pubblicazione: (2024)
di: Laosaengpha, Napat, et al.
Pubblicazione: (2024)
Documenti analoghi
-
WangchanLion and WangchanX MRC Eval
di: Phatthiyaphaibun, Wannaphong, et al.
Pubblicazione: (2024) -
Space Decomposition for Sentence Embedding
di: Ponwitayarat, Wuttikorn, et al.
Pubblicazione: (2024) -
PyThaiNLP: Thai Natural Language Processing in Python
di: Phatthiyaphaibun, Wannaphong, et al.
Pubblicazione: (2023) -
Towards Better Understanding of Program-of-Thought Reasoning in Cross-Lingual and Multilingual Environments
di: Payoungkhamdee, Patomporn, et al.
Pubblicazione: (2025) -
WangchanThaiInstruct: An instruction-following Dataset for Culture-Aware, Multitask, and Multi-domain Evaluation in Thai
di: Limkonchotiwat, Peerat, et al.
Pubblicazione: (2025)