Closing the Data Loop: Using OpenDataArena to Engineer Superior Training Datasets
Fuente:
arXiv
Saved in:
| Main Authors: | Gao, Xin, Wang, Xiaoyang, Zhu, Yun, Cai, Mengzhang, He, Conghui, Wu, Lijun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value
by: Cai, Mengzhang, et al.
Published: (2025)
by: Cai, Mengzhang, et al.
Published: (2025)
Middo: Model-Informed Dynamic Data Optimization for Enhanced LLM Fine-Tuning via Closed-Loop Learning
by: Tang, Zinan, et al.
Published: (2025)
by: Tang, Zinan, et al.
Published: (2025)
MetaLadder: Ascending Mathematical Solution Quality via Analogical-Problem Reasoning Transfer
by: Lin, Honglin, et al.
Published: (2025)
by: Lin, Honglin, et al.
Published: (2025)
A Strategic Coordination Framework of Small LLMs Matches Large LLMs in Data Synthesis
by: Gao, Xin, et al.
Published: (2025)
by: Gao, Xin, et al.
Published: (2025)
IDEAL: Data Equilibrium Adaptation for Multi-Capability Language Model Alignment
by: Ming, Chenlin, et al.
Published: (2025)
by: Ming, Chenlin, et al.
Published: (2025)
LoopTool: Closing the Data-Training Loop for Robust LLM Tool Calls
by: Zhang, Kangning, et al.
Published: (2025)
by: Zhang, Kangning, et al.
Published: (2025)
OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data
by: Du, Yuwen, et al.
Published: (2026)
by: Du, Yuwen, et al.
Published: (2026)
Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs
by: Li, Yu, et al.
Published: (2026)
by: Li, Yu, et al.
Published: (2026)
Topic Over Source: The Key to Effective Data Mixing for Language Models Pre-training
by: Peng, Jiahui, et al.
Published: (2025)
by: Peng, Jiahui, et al.
Published: (2025)
MathFusion: Enhancing Mathematical Problem-solving of LLM through Instruction Fusion
by: Pei, Qizhi, et al.
Published: (2025)
by: Pei, Qizhi, et al.
Published: (2025)
From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents
by: Gao, Jiaxuan, et al.
Published: (2026)
by: Gao, Jiaxuan, et al.
Published: (2026)
SIPDO: Closed-Loop Prompt Optimization via Synthetic Data Feedback
by: Yu, Yaoning, et al.
Published: (2025)
by: Yu, Yaoning, et al.
Published: (2025)
DSDL: Data Set Description Language for Bridging Modalities and Tasks in AI Data
by: Wang, Bin, et al.
Published: (2024)
by: Wang, Bin, et al.
Published: (2024)
LRAS: Advanced Legal Reasoning with Agentic Search
by: Zhou, Yujin, et al.
Published: (2026)
by: Zhou, Yujin, et al.
Published: (2026)
OpenDataLab: Empowering General Artificial Intelligence with Open Datasets
by: He, Conghui, et al.
Published: (2024)
by: He, Conghui, et al.
Published: (2024)
ScaleDiff: Scaling Difficult Problems for Advanced Mathematical Reasoning
by: Pei, Qizhi, et al.
Published: (2025)
by: Pei, Qizhi, et al.
Published: (2025)
Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference
by: Chiang, Wei-Lin, et al.
Published: (2024)
by: Chiang, Wei-Lin, et al.
Published: (2024)
STT-Arena: A More Realistic Environment for Tool-Using with Spatio-Temporal Dynamics
by: Hui, Tingfeng, et al.
Published: (2026)
by: Hui, Tingfeng, et al.
Published: (2026)
From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline
by: Li, Tianle, et al.
Published: (2024)
by: Li, Tianle, et al.
Published: (2024)
Arena Learning: Build Data Flywheel for LLMs Post-training via Simulated Chatbot Arena
by: Luo, Haipeng, et al.
Published: (2024)
by: Luo, Haipeng, et al.
Published: (2024)
MuSC: Improving Complex Instruction Following with Multi-granularity Self-Contrastive Training
by: Huang, Hui, et al.
Published: (2025)
by: Huang, Hui, et al.
Published: (2025)
Fabricator: An Open Source Toolkit for Generating Labeled Training Data with Teacher LLMs
by: Golde, Jonas, et al.
Published: (2023)
by: Golde, Jonas, et al.
Published: (2023)
Data Management For Training Large Language Models: A Survey
by: Wang, Zige, et al.
Published: (2023)
by: Wang, Zige, et al.
Published: (2023)
Unifying Structured Data as Graph for Data-to-Text Pre-Training
by: Li, Shujie, et al.
Published: (2024)
by: Li, Shujie, et al.
Published: (2024)
Chinese Cyberbullying Detection: Dataset, Method, and Validation
by: Zhu, Yi, et al.
Published: (2025)
by: Zhu, Yi, et al.
Published: (2025)
MedAlpaca -- An Open-Source Collection of Medical Conversational AI Models and Training Data
by: Han, Tianyu, et al.
Published: (2023)
by: Han, Tianyu, et al.
Published: (2023)
Multi-News+: Cost-efficient Dataset Cleansing via LLM-based Data Annotation
by: Choi, Juhwan, et al.
Published: (2024)
by: Choi, Juhwan, et al.
Published: (2024)
CyberCorrect: A Cybernetic Framework for Closed-Loop Self-Correction in Large Language Models
by: Wu, Yuning, et al.
Published: (2026)
by: Wu, Yuning, et al.
Published: (2026)
Efficient Data Learning for Open Information Extraction with Pre-trained Language Models
by: Fan, Zhiyuan, et al.
Published: (2023)
by: Fan, Zhiyuan, et al.
Published: (2023)
AutoEvoEval: An Automated Framework for Evolving Close-Ended LLM Evaluation Data
by: Wu, JiaRu, et al.
Published: (2025)
by: Wu, JiaRu, et al.
Published: (2025)
Unlocking Data Value in Finance: A Study on Distillation and Difficulty-Aware Training
by: Cao, Chuxue, et al.
Published: (2026)
by: Cao, Chuxue, et al.
Published: (2026)
SciArena: An Open Evaluation Platform for Non-Verifiable Scientific Literature-Grounded Tasks
by: Zhao, Yilun, et al.
Published: (2025)
by: Zhao, Yilun, et al.
Published: (2025)
Open-LLM-Leaderboard: From Multi-choice to Open-style Questions for LLMs Evaluation, Benchmark, and Arena
by: Myrzakhan, Aidar, et al.
Published: (2024)
by: Myrzakhan, Aidar, et al.
Published: (2024)
Measuring the Impact of Lexical Training Data Coverage on Hallucination Detection in Large Language Models
by: Zhang, Shuo, et al.
Published: (2025)
by: Zhang, Shuo, et al.
Published: (2025)
Data-Constrained Synthesis of Training Data for De-Identification
by: Vakili, Thomas, et al.
Published: (2025)
by: Vakili, Thomas, et al.
Published: (2025)
TeachLM: Post-Training LLMs for Education Using Authentic Learning Data
by: Perczel, Janos, et al.
Published: (2025)
by: Perczel, Janos, et al.
Published: (2025)
SoK: Measuring What Matters for Closed-Loop Security Agents
by: Khurana, Mudita, et al.
Published: (2025)
by: Khurana, Mudita, et al.
Published: (2025)
Unmasking and Improving Data Credibility: A Study with Datasets for Training Harmless Language Models
by: Zhu, Zhaowei, et al.
Published: (2023)
by: Zhu, Zhaowei, et al.
Published: (2023)
FLUX: Data Worth Training On
by: Gowtham, et al.
Published: (2026)
by: Gowtham, et al.
Published: (2026)
Data Efficacy for Language Model Training
by: Dai, Yalun, et al.
Published: (2025)
by: Dai, Yalun, et al.
Published: (2025)
Similar Items
-
OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value
by: Cai, Mengzhang, et al.
Published: (2025) -
Middo: Model-Informed Dynamic Data Optimization for Enhanced LLM Fine-Tuning via Closed-Loop Learning
by: Tang, Zinan, et al.
Published: (2025) -
MetaLadder: Ascending Mathematical Solution Quality via Analogical-Problem Reasoning Transfer
by: Lin, Honglin, et al.
Published: (2025) -
A Strategic Coordination Framework of Small LLMs Matches Large LLMs in Data Synthesis
by: Gao, Xin, et al.
Published: (2025) -
IDEAL: Data Equilibrium Adaptation for Multi-Capability Language Model Alignment
by: Ming, Chenlin, et al.
Published: (2025)