Data-Constrained Synthesis of Training Data for De-Identification
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Vakili, Thomas, Henriksson, Aron, Dalianis, Hercules |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Impact of Steering Large Language Models with Persona Vectors in Educational Applications
par: Wu, Yongchao, et autres
Publié: (2026)
par: Wu, Yongchao, et autres
Publié: (2026)
Efficient Text Classification with Conformal In-Context Learning
par: Pantelidis, Ippokratis, et autres
Publié: (2025)
par: Pantelidis, Ippokratis, et autres
Publié: (2025)
D$^3$: Dynamic Directional Graph-Constrained Data Scheduling for LLM Training
par: Xu, Yuanjian, et autres
Publié: (2026)
par: Xu, Yuanjian, et autres
Publié: (2026)
Rethinking Data Synthesis: A Teacher Model Training Recipe with Interpretation
par: Chen, Yifang, et autres
Publié: (2024)
par: Chen, Yifang, et autres
Publié: (2024)
Advancing Mathematical Reasoning in Language Models: The Impact of Problem-Solving Data, Data Synthesis Methods, and Training Stages
par: Chen, Zui, et autres
Publié: (2025)
par: Chen, Zui, et autres
Publié: (2025)
Implementing a Nordic-Baltic Federated Health Data Network: a case report
par: Chomutare, Taridzo, et autres
Publié: (2024)
par: Chomutare, Taridzo, et autres
Publié: (2024)
Scaling Data-Constrained Language Models
par: Muennighoff, Niklas, et autres
Publié: (2023)
par: Muennighoff, Niklas, et autres
Publié: (2023)
Scaling Parameter-Constrained Language Models with Quality Data
par: Chang, Ernie, et autres
Publié: (2024)
par: Chang, Ernie, et autres
Publié: (2024)
FLUX: Data Worth Training On
par: Gowtham, et autres
Publié: (2026)
par: Gowtham, et autres
Publié: (2026)
Unifying Structured Data as Graph for Data-to-Text Pre-Training
par: Li, Shujie, et autres
Publié: (2024)
par: Li, Shujie, et autres
Publié: (2024)
Clinical Text Mining
par: Dalianis, Hercules
Publié: (2018)
par: Dalianis, Hercules
Publié: (2018)
Compute-Constrained Data Selection
par: Yin, Junjie Oscar, et autres
Publié: (2024)
par: Yin, Junjie Oscar, et autres
Publié: (2024)
JiuZhang3.0: Efficiently Improving Mathematical Reasoning by Training Small Data Synthesis Models
par: Zhou, Kun, et autres
Publié: (2024)
par: Zhou, Kun, et autres
Publié: (2024)
Open Data Synthesis For Deep Research
par: Xia, Ziyi, et autres
Publié: (2025)
par: Xia, Ziyi, et autres
Publié: (2025)
Beyond Repetition: Text Simplification and Curriculum Learning for Data-Constrained Pretraining
par: Roque, Matthew Theodore, et autres
Publié: (2025)
par: Roque, Matthew Theodore, et autres
Publié: (2025)
Exploring Data and Parameter Efficient Strategies for Arabic Dialect Identifications
par: Kanjirangat, Vani, et autres
Publié: (2025)
par: Kanjirangat, Vani, et autres
Publié: (2025)
Closing the Data Loop: Using OpenDataArena to Engineer Superior Training Datasets
par: Gao, Xin, et autres
Publié: (2025)
par: Gao, Xin, et autres
Publié: (2025)
Natural Language Processing for Electronic Health Records in Scandinavian Languages: Norwegian, Swedish, and Danish
par: Woldaregay, Ashenafi Zebene, et autres
Publié: (2025)
par: Woldaregay, Ashenafi Zebene, et autres
Publié: (2025)
Beyond Public Access in LLM Pre-Training Data
par: Rosenblat, Sruly, et autres
Publié: (2025)
par: Rosenblat, Sruly, et autres
Publié: (2025)
Unlearning Traces the Influential Training Data of Language Models
par: Isonuma, Masaru, et autres
Publié: (2024)
par: Isonuma, Masaru, et autres
Publié: (2024)
Balanced Data Sampling for Language Model Training with Clustering
par: Shao, Yunfan, et autres
Publié: (2024)
par: Shao, Yunfan, et autres
Publié: (2024)
SlimPajama-DC: Understanding Data Combinations for LLM Training
par: Shen, Zhiqiang, et autres
Publié: (2023)
par: Shen, Zhiqiang, et autres
Publié: (2023)
Detecting RLVR Training Data via Structural Convergence of Reasoning
par: Zhang, Hongbo, et autres
Publié: (2026)
par: Zhang, Hongbo, et autres
Publié: (2026)
Data Management For Training Large Language Models: A Survey
par: Wang, Zige, et autres
Publié: (2023)
par: Wang, Zige, et autres
Publié: (2023)
Enhancing the De-identification of Personally Identifiable Information in Educational Data
par: Ji, Zilyu, et autres
Publié: (2025)
par: Ji, Zilyu, et autres
Publié: (2025)
Synthesis by Design: Controlled Data Generation via Structural Guidance
par: Xu, Lei, et autres
Publié: (2025)
par: Xu, Lei, et autres
Publié: (2025)
Pedagogically-Inspired Data Synthesis for Language Model Knowledge Distillation
par: He, Bowei, et autres
Publié: (2026)
par: He, Bowei, et autres
Publié: (2026)
Out-of-Context Abduction: LLMs Make Inferences About Procedural Data Leveraging Declarative Facts in Earlier Training Data
par: Imran, Sohaib, et autres
Publié: (2025)
par: Imran, Sohaib, et autres
Publié: (2025)
Syntriever: How to Train Your Retriever with Synthetic Data from LLMs
par: Kim, Minsang, et autres
Publié: (2025)
par: Kim, Minsang, et autres
Publié: (2025)
Retracing the Past: LLMs Emit Training Data When They Get Lost
par: Ko, Myeongseob, et autres
Publié: (2025)
par: Ko, Myeongseob, et autres
Publié: (2025)
Translation of Multifaceted Data without Re-Training of Machine Translation Systems
par: Moon, Hyeonseok, et autres
Publié: (2024)
par: Moon, Hyeonseok, et autres
Publié: (2024)
Distilling an End-to-End Voice Assistant Without Instruction Training Data
par: Held, William, et autres
Publié: (2024)
par: Held, William, et autres
Publié: (2024)
Synthesizing Post-Training Data for LLMs through Multi-Agent Simulation
par: Tang, Shuo, et autres
Publié: (2024)
par: Tang, Shuo, et autres
Publié: (2024)
Condor: Enhance LLM Alignment with Knowledge-Driven Data Synthesis and Refinement
par: Cao, Maosong, et autres
Publié: (2025)
par: Cao, Maosong, et autres
Publié: (2025)
From Detection to Diagnosis: Advancing Hallucination Analysis with Automated Data Synthesis
par: Liu, Yanyi, et autres
Publié: (2025)
par: Liu, Yanyi, et autres
Publié: (2025)
LiteLong: Resource-Efficient Long-Context Data Synthesis for LLMs
par: Jia, Junlong, et autres
Publié: (2025)
par: Jia, Junlong, et autres
Publié: (2025)
Key-Point-Driven Data Synthesis with its Enhancement on Mathematical Reasoning
par: Huang, Yiming, et autres
Publié: (2024)
par: Huang, Yiming, et autres
Publié: (2024)
ActionStudio: A Lightweight Framework for Data and Training of Large Action Models
par: Zhang, Jianguo, et autres
Publié: (2025)
par: Zhang, Jianguo, et autres
Publié: (2025)
TeachLM: Post-Training LLMs for Education Using Authentic Learning Data
par: Perczel, Janos, et autres
Publié: (2025)
par: Perczel, Janos, et autres
Publié: (2025)
Hallucinations in Bibliographic Recommendation: Citation Frequency as a Proxy for Training Data Redundancy
par: Niimi, Junichiro
Publié: (2025)
par: Niimi, Junichiro
Publié: (2025)
Documents similaires
-
The Impact of Steering Large Language Models with Persona Vectors in Educational Applications
par: Wu, Yongchao, et autres
Publié: (2026) -
Efficient Text Classification with Conformal In-Context Learning
par: Pantelidis, Ippokratis, et autres
Publié: (2025) -
D$^3$: Dynamic Directional Graph-Constrained Data Scheduling for LLM Training
par: Xu, Yuanjian, et autres
Publié: (2026) -
Rethinking Data Synthesis: A Teacher Model Training Recipe with Interpretation
par: Chen, Yifang, et autres
Publié: (2024) -
Advancing Mathematical Reasoning in Language Models: The Impact of Problem-Solving Data, Data Synthesis Methods, and Training Stages
par: Chen, Zui, et autres
Publié: (2025)