Seed-Free Synthetic Data Generation Framework for Instruction-Tuning LLMs: A Case Study in Thai
Fuente:
arXiv
Saved in:
| Main Authors: | Pengpun, Parinthapat, Udomcharoenchaikit, Can, Buaphet, Weerayut, Limkonchotiwat, Peerat |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
When Better Teachers Don't Make Better Students: Revisiting Knowledge Distillation for CLIP Models in VQA
by: Tuchinda, Pume, et al.
Published: (2025)
by: Tuchinda, Pume, et al.
Published: (2025)
Can General-Purpose Large Language Models Generalize to English-Thai Machine Translation ?
by: Chiaranaipanich, Jirat, et al.
Published: (2024)
by: Chiaranaipanich, Jirat, et al.
Published: (2024)
Mangosteen: An Open Thai Corpus for Language Model Pretraining
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2025)
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2025)
WangchanThaiInstruct: An instruction-following Dataset for Culture-Aware, Multitask, and Multi-domain Evaluation in Thai
by: Limkonchotiwat, Peerat, et al.
Published: (2025)
by: Limkonchotiwat, Peerat, et al.
Published: (2025)
PyThaiNLP: Thai Natural Language Processing in Python
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2023)
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2023)
On Creating an English-Thai Code-switched Machine Translation in Medical Domain
by: Pengpun, Parinthapat, et al.
Published: (2024)
by: Pengpun, Parinthapat, et al.
Published: (2024)
MultiLexNorm++: A Unified Benchmark and a Generative Model for Lexical Normalization for Asian Languages
by: Buaphet, Weerayut, et al.
Published: (2026)
by: Buaphet, Weerayut, et al.
Published: (2026)
Assessing Thai Dialect Performance in LLMs with Automatic Benchmarks and Human Evaluation
by: Limkonchotiwat, Peerat, et al.
Published: (2025)
by: Limkonchotiwat, Peerat, et al.
Published: (2025)
Towards Better Understanding of Program-of-Thought Reasoning in Cross-Lingual and Multilingual Environments
by: Payoungkhamdee, Patomporn, et al.
Published: (2025)
by: Payoungkhamdee, Patomporn, et al.
Published: (2025)
WangchanLion and WangchanX MRC Eval
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2024)
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2024)
Space Decomposition for Sentence Embedding
by: Ponwitayarat, Wuttikorn, et al.
Published: (2024)
by: Ponwitayarat, Wuttikorn, et al.
Published: (2024)
Typhoon 2: A Family of Open Text and Multimodal Thai Large Language Models
by: Pipatanakul, Kunat, et al.
Published: (2024)
by: Pipatanakul, Kunat, et al.
Published: (2024)
BURMESE-SAN: Burmese NLP Benchmark for Evaluating Large Language Models
by: Aung, Thura, et al.
Published: (2026)
by: Aung, Thura, et al.
Published: (2026)
Addressing Topic Leakage in Cross-Topic Evaluation for Authorship Verification
by: Sawatphol, Jitkapat, et al.
Published: (2024)
by: Sawatphol, Jitkapat, et al.
Published: (2024)
Distilling Multilingual Vision-Language Models: When Smaller Models Stay Multilingual
by: Sriratanawilai, Sukrit, et al.
Published: (2025)
by: Sriratanawilai, Sukrit, et al.
Published: (2025)
SEA-SafeguardBench: Evaluating AI Safety in SEA Languages and Cultures
by: Tasawong, Panuthep, et al.
Published: (2025)
by: Tasawong, Panuthep, et al.
Published: (2025)
SEA-Guard: Culturally Grounded Multilingual Safeguard for Southeast Asia
by: Tasawong, Panuthep, et al.
Published: (2026)
by: Tasawong, Panuthep, et al.
Published: (2026)
Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation
by: He, Linda, et al.
Published: (2025)
by: He, Linda, et al.
Published: (2025)
LuxIT: A Luxembourgish Instruction Tuning Dataset from Monolingual Seed Data
by: Valline, Julian, et al.
Published: (2025)
by: Valline, Julian, et al.
Published: (2025)
Exploring Cross-Client Memorization of Training Data in Large Language Models for Federated Learning
by: Udsa, Tinnakit, et al.
Published: (2025)
by: Udsa, Tinnakit, et al.
Published: (2025)
Synthetic Data (Almost) from Scratch: Generalized Instruction Tuning for Language Models
by: Li, Haoran, et al.
Published: (2024)
by: Li, Haoran, et al.
Published: (2024)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
by: Zhang, Yuanhan, et al.
Published: (2024)
by: Zhang, Yuanhan, et al.
Published: (2024)
Harnessing LLMs for API Interactions: A Framework for Classification and Synthetic Data Generation
by: Tao, Chunliang, et al.
Published: (2024)
by: Tao, Chunliang, et al.
Published: (2024)
Tool Calling for Arabic LLMs: Data Strategies and Instruction Tuning
by: Ersoy, Asim, et al.
Published: (2025)
by: Ersoy, Asim, et al.
Published: (2025)
Mosaic-IT: Cost-Free Compositional Data Synthesis for Instruction Tuning
by: Li, Ming, et al.
Published: (2024)
by: Li, Ming, et al.
Published: (2024)
SiamGPT: Quality-First Fine-Tuning for Stable Thai Text Generation
by: Pairatsuppawat, Thittipat, et al.
Published: (2025)
by: Pairatsuppawat, Thittipat, et al.
Published: (2025)
IterSelectTune: An Iterative Training Framework for Efficient Instruction-Tuning Data Selection
by: Song, Jielin, et al.
Published: (2024)
by: Song, Jielin, et al.
Published: (2024)
MedInjection-FR: Exploring the Role of Native, Synthetic, and Translated Data in Biomedical Instruction Tuning
by: Belmadani, Ikram, et al.
Published: (2026)
by: Belmadani, Ikram, et al.
Published: (2026)
Instruction Tuning on Public Government and Cultural Data for Low-Resource Language: a Case Study in Kazakh
by: Laiyk, Nurkhan, et al.
Published: (2025)
by: Laiyk, Nurkhan, et al.
Published: (2025)
GraphGen: Enhancing Supervised Fine-Tuning for LLMs with Knowledge-Driven Synthetic Data Generation
by: Chen, Zihong, et al.
Published: (2025)
by: Chen, Zihong, et al.
Published: (2025)
THaLLE-ThaiLLM: Domain-Specialized Small LLMs for Finance and Thai -- Technical Report
by: Labs, KBTG, et al.
Published: (2026)
by: Labs, KBTG, et al.
Published: (2026)
CYCLE-INSTRUCT: Fully Seed-Free Instruction Tuning via Dual Self-Training and Cycle Consistency
by: Shen, Zhanming, et al.
Published: (2025)
by: Shen, Zhanming, et al.
Published: (2025)
Does Instruction Tuning Make LLMs More Consistent?
by: Fierro, Constanza, et al.
Published: (2024)
by: Fierro, Constanza, et al.
Published: (2024)
Instruction-Tuning LLMs for Event Extraction with Annotation Guidelines
by: Srivastava, Saurabh, et al.
Published: (2025)
by: Srivastava, Saurabh, et al.
Published: (2025)
On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey
by: Long, Lin, et al.
Published: (2024)
by: Long, Lin, et al.
Published: (2024)
From Templates to Natural Language: Generalization Challenges in Instruction-Tuned LLMs for Spatial Reasoning
by: Kranti, Chalamalasetti, et al.
Published: (2025)
by: Kranti, Chalamalasetti, et al.
Published: (2025)
Constructing Synthetic Instruction Datasets for Improving Reasoning in Domain-Specific LLMs: A Case Study in the Japanese Financial Domain
by: Okochi, Yuma, et al.
Published: (2026)
by: Okochi, Yuma, et al.
Published: (2026)
How Many Languages Make Good Multilingual Instruction Tuning? A Case Study on BLOOM
by: Ji, Shaoxiong, et al.
Published: (2024)
by: Ji, Shaoxiong, et al.
Published: (2024)
Balancing Continuous Pre-Training and Instruction Fine-Tuning: Optimizing Instruction-Following in LLMs
by: Jindal, Ishan, et al.
Published: (2024)
by: Jindal, Ishan, et al.
Published: (2024)
The Atomic Instruction Gap: Instruction-Tuned LLMs Struggle with Simple, Self-Contained Directives
by: Lim, Henry, et al.
Published: (2025)
by: Lim, Henry, et al.
Published: (2025)
Similar Items
-
When Better Teachers Don't Make Better Students: Revisiting Knowledge Distillation for CLIP Models in VQA
by: Tuchinda, Pume, et al.
Published: (2025) -
Can General-Purpose Large Language Models Generalize to English-Thai Machine Translation ?
by: Chiaranaipanich, Jirat, et al.
Published: (2024) -
Mangosteen: An Open Thai Corpus for Language Model Pretraining
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2025) -
WangchanThaiInstruct: An instruction-following Dataset for Culture-Aware, Multitask, and Multi-domain Evaluation in Thai
by: Limkonchotiwat, Peerat, et al.
Published: (2025) -
PyThaiNLP: Thai Natural Language Processing in Python
by: Phatthiyaphaibun, Wannaphong, et al.
Published: (2023)