Synthetic Data Generation for Phrase Break Prediction with Large Language Model
Fuente:
arXiv
Saved in:
| Main Authors: | Lee, Hoyeon, Son, Sejung, Kang, Ye-Eun, Kim, Jong-Hwan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
A Two-Step Approach for Data-Efficient French Pronunciation Learning
by: Lee, Hoyeon, et al.
Published: (2024)
by: Lee, Hoyeon, et al.
Published: (2024)
A Dual-Prompting for Interpretable Mental Health Language Models
by: Jeon, Hyolim, et al.
Published: (2024)
by: Jeon, Hyolim, et al.
Published: (2024)
Learning Co-Speech Gesture for Multimodal Aphasia Type Detection
by: Lee, Daeun, et al.
Published: (2023)
by: Lee, Daeun, et al.
Published: (2023)
Impact of Task Phrasing on Presumptions in Large Language Models
by: Ong, Kenneth J. K.
Published: (2026)
by: Ong, Kenneth J. K.
Published: (2026)
Navigating the Path of Writing: Outline-guided Text Generation with Large Language Models
by: Lee, Yukyung, et al.
Published: (2024)
by: Lee, Yukyung, et al.
Published: (2024)
Quality-Aware Translation Tagging in Multilingual RAG system
by: Moon, Hoyeon, et al.
Published: (2025)
by: Moon, Hoyeon, et al.
Published: (2025)
Publicly Shareable Clinical Large Language Model Built on Synthetic Clinical Notes
by: Kweon, Sunjun, et al.
Published: (2023)
by: Kweon, Sunjun, et al.
Published: (2023)
General Phrase Debiaser: Debiasing Masked Language Models at a Multi-Token Level
by: Shi, Bingkang, et al.
Published: (2023)
by: Shi, Bingkang, et al.
Published: (2023)
Forging Time Series with Language: A Large Language Model Approach to Synthetic Data Generation
by: Rousseau, Cécile, et al.
Published: (2025)
by: Rousseau, Cécile, et al.
Published: (2025)
Ontology-Free General-Domain Knowledge Graph-to-Text Generation Dataset Synthesis using Large Language Model
by: Kim, Daehee, et al.
Published: (2024)
by: Kim, Daehee, et al.
Published: (2024)
Harnessing Linguistic Dissimilarity for Language Generalization on Unseen Low-Resource Varieties
by: Kim, Jinju, et al.
Published: (2026)
by: Kim, Jinju, et al.
Published: (2026)
Merging Triggers, Breaking Backdoors: Defensive Poisoning for Instruction-Tuned Language Models
by: Kim, San, et al.
Published: (2026)
by: Kim, San, et al.
Published: (2026)
Self-Boosting Large Language Models with Synthetic Preference Data
by: Dong, Qingxiu, et al.
Published: (2024)
by: Dong, Qingxiu, et al.
Published: (2024)
Synthesize-on-Graph: Knowledgeable Synthetic Data Generation for Continue Pre-training of Large Language Models
by: Ma, Shengjie, et al.
Published: (2025)
by: Ma, Shengjie, et al.
Published: (2025)
Latent Reasoning via Sentence Embedding Prediction
by: Hwang, Hyeonbin, et al.
Published: (2025)
by: Hwang, Hyeonbin, et al.
Published: (2025)
CURATRON: Complete and Robust Preference Data for Rigorous Alignment of Large Language Models
by: Nguyen, Son The, et al.
Published: (2024)
by: Nguyen, Son The, et al.
Published: (2024)
Strategic Data Ordering: Enhancing Large Language Model Performance through Curriculum Learning
by: Kim, Jisu, et al.
Published: (2024)
by: Kim, Jisu, et al.
Published: (2024)
Improving Mortality Prediction After Radiotherapy with Large Language Model Structuring of Large-Scale Unstructured Electronic Health Records
by: Park, Sangjoon, et al.
Published: (2024)
by: Park, Sangjoon, et al.
Published: (2024)
Utilizing Large Language Models to Generate Synthetic Data to Increase the Performance of BERT-Based Neural Networks
by: Woolsey, Chancellor R., et al.
Published: (2024)
by: Woolsey, Chancellor R., et al.
Published: (2024)
LP Data Pipeline: Lightweight, Purpose-driven Data Pipeline for Large Language Models
by: Kim, Yungi, et al.
Published: (2024)
by: Kim, Yungi, et al.
Published: (2024)
Persona-Based Synthetic Data Generation Using Multi-Stage Conditioning with Large Language Models for Emotion Recognition
by: Inoshita, Keito, et al.
Published: (2025)
by: Inoshita, Keito, et al.
Published: (2025)
WoLF: Wide-scope Large Language Model Framework for CXR Understanding
by: Kang, Seil, et al.
Published: (2024)
by: Kang, Seil, et al.
Published: (2024)
SyntheT2C: Generating Synthetic Data for Fine-Tuning Large Language Models on the Text2Cypher Task
by: Zhong, Ziije, et al.
Published: (2024)
by: Zhong, Ziije, et al.
Published: (2024)
Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models
by: Park, Cheonbok, et al.
Published: (2025)
by: Park, Cheonbok, et al.
Published: (2025)
Data-Driven Calibration of Prediction Sets in Large Vision-Language Models Based on Inductive Conformal Prediction
by: Ye, Yuanchang, et al.
Published: (2025)
by: Ye, Yuanchang, et al.
Published: (2025)
AI-Augmented Surveys: Leveraging Large Language Models and Surveys for Opinion Prediction
by: Kim, Junsol, et al.
Published: (2023)
by: Kim, Junsol, et al.
Published: (2023)
Scaling Laws of Synthetic Data for Language Models
by: Qin, Zeyu, et al.
Published: (2025)
by: Qin, Zeyu, et al.
Published: (2025)
Break the Chain: Large Language Models Can be Shortcut Reasoners
by: Ding, Mengru, et al.
Published: (2024)
by: Ding, Mengru, et al.
Published: (2024)
Large Language Models as a Tool for Mining Object Knowledge
by: An, Hannah YoungEun, et al.
Published: (2024)
by: An, Hannah YoungEun, et al.
Published: (2024)
Set-Valued Prediction for Large Language Models with Feasibility-Aware Coverage Guarantees
by: Li, Ye, et al.
Published: (2026)
by: Li, Ye, et al.
Published: (2026)
Domain-Adaptation through Synthetic Data: Fine-Tuning Large Language Models for German Law
by: Bashir, Ali Hamza, et al.
Published: (2026)
by: Bashir, Ali Hamza, et al.
Published: (2026)
Modular Techniques for Synthetic Long-Context Data Generation in Language Model Training and Evaluation
by: Subramanian, Seganrasan, et al.
Published: (2025)
by: Subramanian, Seganrasan, et al.
Published: (2025)
A Multi-Faceted Evaluation Framework for Assessing Synthetic Data Generated by Large Language Models
by: Yuan, Yefeng, et al.
Published: (2024)
by: Yuan, Yefeng, et al.
Published: (2024)
Socially Aware Synthetic Data Generation for Suicidal Ideation Detection Using Large Language Models
by: Ghanadian, Hamideh, et al.
Published: (2024)
by: Ghanadian, Hamideh, et al.
Published: (2024)
Breaking the Trade-Off Between Faithfulness and Expressiveness for Large Language Models
by: Yang, Chenxu, et al.
Published: (2025)
by: Yang, Chenxu, et al.
Published: (2025)
DA-Code: Agent Data Science Code Generation Benchmark for Large Language Models
by: Huang, Yiming, et al.
Published: (2024)
by: Huang, Yiming, et al.
Published: (2024)
Training a Large Language Model for Medical Coding Using Privacy-Preserving Synthetic Clinical Data
by: Cook, John, et al.
Published: (2026)
by: Cook, John, et al.
Published: (2026)
VLind-Bench: Measuring Language Priors in Large Vision-Language Models
by: Lee, Kang-il, et al.
Published: (2024)
by: Lee, Kang-il, et al.
Published: (2024)
Empowering Large Language Models for Textual Data Augmentation
by: Li, Yichuan, et al.
Published: (2024)
by: Li, Yichuan, et al.
Published: (2024)
Benchmarking Cognitive Biases in Large Language Models as Evaluators
by: Koo, Ryan, et al.
Published: (2023)
by: Koo, Ryan, et al.
Published: (2023)
Similar Items
-
A Two-Step Approach for Data-Efficient French Pronunciation Learning
by: Lee, Hoyeon, et al.
Published: (2024) -
A Dual-Prompting for Interpretable Mental Health Language Models
by: Jeon, Hyolim, et al.
Published: (2024) -
Learning Co-Speech Gesture for Multimodal Aphasia Type Detection
by: Lee, Daeun, et al.
Published: (2023) -
Impact of Task Phrasing on Presumptions in Large Language Models
by: Ong, Kenneth J. K.
Published: (2026) -
Navigating the Path of Writing: Outline-guided Text Generation with Large Language Models
by: Lee, Yukyung, et al.
Published: (2024)