Modular Techniques for Synthetic Long-Context Data Generation in Language Model Training and Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Subramanian, Seganrasan, Verma, Abhigya |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FABRIC: Framework for Agent-Based Realistic Intelligence Creation
par: Verma, Abhigya, et autres
Publié: (2025)
par: Verma, Abhigya, et autres
Publié: (2025)
GRAFT: GRaPH and Table Reasoning for Textual Alignment -- A Benchmark for Structured Instruction Following and Visual Reasoning
par: Verma, Abhigya, et autres
Publié: (2025)
par: Verma, Abhigya, et autres
Publié: (2025)
Untie the Knots: An Efficient Data Augmentation Strategy for Long-Context Pre-Training in Language Models
par: Tian, Junfeng, et autres
Publié: (2024)
par: Tian, Junfeng, et autres
Publié: (2024)
LongSafety: Evaluating Long-Context Safety of Large Language Models
par: Lu, Yida, et autres
Publié: (2025)
par: Lu, Yida, et autres
Publié: (2025)
Agent-Centric Projection of Prompting Techniques and Implications for Synthetic Training Data for Large Language Models
par: Dhamani, Dhruv, et autres
Publié: (2025)
par: Dhamani, Dhruv, et autres
Publié: (2025)
HELMET: How to Evaluate Long-Context Language Models Effectively and Thoroughly
par: Yen, Howard, et autres
Publié: (2024)
par: Yen, Howard, et autres
Publié: (2024)
PILOT: Steering Synthetic Data Generation with Psychological & Linguistic Output Targeting
par: Cisar, Caitlin, et autres
Publié: (2025)
par: Cisar, Caitlin, et autres
Publié: (2025)
Grounding Synthetic Data Evaluations of Language Models in Unsupervised Document Corpora
par: Majurski, Michael, et autres
Publié: (2025)
par: Majurski, Michael, et autres
Publié: (2025)
LooGLE: Can Long-Context Language Models Understand Long Contexts?
par: Li, Jiaqi, et autres
Publié: (2023)
par: Li, Jiaqi, et autres
Publié: (2023)
CUB: Benchmarking Context Utilisation Techniques for Language Models
par: Hagström, Lovisa, et autres
Publié: (2025)
par: Hagström, Lovisa, et autres
Publié: (2025)
LongSkywork: A Training Recipe for Efficiently Extending Context Length in Large Language Models
par: Zhao, Liang, et autres
Publié: (2024)
par: Zhao, Liang, et autres
Publié: (2024)
How Training Data Shapes the Use of Parametric and In-Context Knowledge in Language Models
par: Kim, Minsung, et autres
Publié: (2025)
par: Kim, Minsung, et autres
Publié: (2025)
Synthetic Data Generation for Phrase Break Prediction with Large Language Model
par: Lee, Hoyeon, et autres
Publié: (2025)
par: Lee, Hoyeon, et autres
Publié: (2025)
Training and Evaluating Language Models with Template-based Data Generation
par: Zhang, Yifan
Publié: (2024)
par: Zhang, Yifan
Publié: (2024)
Can Small Language Models Handle Context-Summarized Multi-Turn Customer-Service QA? A Synthetic Data-Driven Comparative Evaluation
par: Cooray, Lakshan, et autres
Publié: (2026)
par: Cooray, Lakshan, et autres
Publié: (2026)
CEI: A Benchmark for Evaluating Pragmatic Reasoning in Language Models
par: Chun, Jon, et autres
Publié: (2026)
par: Chun, Jon, et autres
Publié: (2026)
Lost-in-the-Middle in Long-Text Generation: Synthetic Dataset, Evaluation Framework, and Mitigation
par: Zhang, Junhao, et autres
Publié: (2025)
par: Zhang, Junhao, et autres
Publié: (2025)
Forging Time Series with Language: A Large Language Model Approach to Synthetic Data Generation
par: Rousseau, Cécile, et autres
Publié: (2025)
par: Rousseau, Cécile, et autres
Publié: (2025)
Training a Large Language Model for Medical Coding Using Privacy-Preserving Synthetic Clinical Data
par: Cook, John, et autres
Publié: (2026)
par: Cook, John, et autres
Publié: (2026)
Scaling Laws of Synthetic Data for Language Models
par: Qin, Zeyu, et autres
Publié: (2025)
par: Qin, Zeyu, et autres
Publié: (2025)
Dynamic Context Evolution for Scalable Synthetic Data Generation
par: Lingo, Ryan, et autres
Publié: (2026)
par: Lingo, Ryan, et autres
Publié: (2026)
Retrieval meets Long Context Large Language Models
par: Xu, Peng, et autres
Publié: (2023)
par: Xu, Peng, et autres
Publié: (2023)
NExtLong: Toward Effective Long-Context Training without Long Documents
par: Gao, Chaochen, et autres
Publié: (2025)
par: Gao, Chaochen, et autres
Publié: (2025)
XL-Suite: Cross-Lingual Synthetic Training and Evaluation Data for Open-Ended Generation
par: Iyer, Vivek, et autres
Publié: (2025)
par: Iyer, Vivek, et autres
Publié: (2025)
Generalizing From Short to Long: Effective Data Synthesis for Long-Context Instruction Tuning
par: Zhu, Wenhao, et autres
Publié: (2025)
par: Zhu, Wenhao, et autres
Publié: (2025)
A Multi-Faceted Evaluation Framework for Assessing Synthetic Data Generated by Large Language Models
par: Yuan, Yefeng, et autres
Publié: (2024)
par: Yuan, Yefeng, et autres
Publié: (2024)
EntropyLong: Effective Long-Context Training via Predictive Uncertainty
par: Jia, Junlong, et autres
Publié: (2025)
par: Jia, Junlong, et autres
Publié: (2025)
Context Memorization for Efficient Long Context Generation
par: Okoshi, Yasuyuki, et autres
Publié: (2026)
par: Okoshi, Yasuyuki, et autres
Publié: (2026)
Every Token Counts: Generalizing 16M Ultra-Long Context in Large Language Models
par: Hu, Xiang, et autres
Publié: (2025)
par: Hu, Xiang, et autres
Publié: (2025)
MeVe: A Modular System for Memory Verification and Effective Context Control in Language Models
par: Ottem, Andreas
Publié: (2025)
par: Ottem, Andreas
Publié: (2025)
ACC: Compiling Agent Trajectories for Long-Context Training
par: Su, Qisheng, et autres
Publié: (2026)
par: Su, Qisheng, et autres
Publié: (2026)
Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation
par: He, Linda, et autres
Publié: (2025)
par: He, Linda, et autres
Publié: (2025)
OPSDL: On-Policy Self-Distillation for Long-Context Language Models
par: Zhang, Xinsen, et autres
Publié: (2026)
par: Zhang, Xinsen, et autres
Publié: (2026)
Synthesize-on-Graph: Knowledgeable Synthetic Data Generation for Continue Pre-training of Large Language Models
par: Ma, Shengjie, et autres
Publié: (2025)
par: Ma, Shengjie, et autres
Publié: (2025)
Revisiting In-Context Learning with Long Context Language Models
par: Baek, Jinheon, et autres
Publié: (2024)
par: Baek, Jinheon, et autres
Publié: (2024)
Reasoning-Driven Synthetic Data Generation and Evaluation
par: Davidson, Tim R., et autres
Publié: (2026)
par: Davidson, Tim R., et autres
Publié: (2026)
How Bad is Training on Synthetic Data? A Statistical Analysis of Language Model Collapse
par: Seddik, Mohamed El Amine, et autres
Publié: (2024)
par: Seddik, Mohamed El Amine, et autres
Publié: (2024)
Self-Boosting Large Language Models with Synthetic Preference Data
par: Dong, Qingxiu, et autres
Publié: (2024)
par: Dong, Qingxiu, et autres
Publié: (2024)
Configurable Safety Tuning of Language Models with Synthetic Preference Data
par: Gallego, Victor
Publié: (2024)
par: Gallego, Victor
Publié: (2024)
Citekit: A Modular Toolkit for Large Language Model Citation Generation
par: Shen, Jiajun, et autres
Publié: (2024)
par: Shen, Jiajun, et autres
Publié: (2024)
Documents similaires
-
FABRIC: Framework for Agent-Based Realistic Intelligence Creation
par: Verma, Abhigya, et autres
Publié: (2025) -
GRAFT: GRaPH and Table Reasoning for Textual Alignment -- A Benchmark for Structured Instruction Following and Visual Reasoning
par: Verma, Abhigya, et autres
Publié: (2025) -
Untie the Knots: An Efficient Data Augmentation Strategy for Long-Context Pre-Training in Language Models
par: Tian, Junfeng, et autres
Publié: (2024) -
LongSafety: Evaluating Long-Context Safety of Large Language Models
par: Lu, Yida, et autres
Publié: (2025) -
Agent-Centric Projection of Prompting Techniques and Implications for Synthetic Training Data for Large Language Models
par: Dhamani, Dhruv, et autres
Publié: (2025)