A Strategic Coordination Framework of Small LLMs Matches Large LLMs in Data Synthesis
Fuente:
arXiv
Guardado en:
| Autores principales: | Gao, Xin, Pei, Qizhi, Tang, Zinan, Li, Yu, Lin, Honglin, Wu, Jiang, Wu, Lijun, He, Conghui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Middo: Model-Informed Dynamic Data Optimization for Enhanced LLM Fine-Tuning via Closed-Loop Learning
por: Tang, Zinan, et al.
Publicado: (2025)
por: Tang, Zinan, et al.
Publicado: (2025)
ScaleDiff: Scaling Difficult Problems for Advanced Mathematical Reasoning
por: Pei, Qizhi, et al.
Publicado: (2025)
por: Pei, Qizhi, et al.
Publicado: (2025)
MetaLadder: Ascending Mathematical Solution Quality via Analogical-Problem Reasoning Transfer
por: Lin, Honglin, et al.
Publicado: (2025)
por: Lin, Honglin, et al.
Publicado: (2025)
LEMMA: Learning from Errors for MatheMatical Advancement in LLMs
por: Pan, Zhuoshi, et al.
Publicado: (2025)
por: Pan, Zhuoshi, et al.
Publicado: (2025)
MathFusion: Enhancing Mathematical Problem-solving of LLM through Instruction Fusion
por: Pei, Qizhi, et al.
Publicado: (2025)
por: Pei, Qizhi, et al.
Publicado: (2025)
Scaling Code-Assisted Chain-of-Thoughts and Instructions for Model Reasoning
por: Lin, Honglin, et al.
Publicado: (2025)
por: Lin, Honglin, et al.
Publicado: (2025)
Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs
por: Li, Yu, et al.
Publicado: (2026)
por: Li, Yu, et al.
Publicado: (2026)
REST: Stress Testing Large Reasoning Models by Asking Multiple Problems at Once
por: Pan, Zhuoshi, et al.
Publicado: (2025)
por: Pan, Zhuoshi, et al.
Publicado: (2025)
CipherBank: Exploring the Boundary of LLM Reasoning Capabilities through Cryptography Challenges
por: Li, Yu, et al.
Publicado: (2025)
por: Li, Yu, et al.
Publicado: (2025)
Scientific Image Synthesis: Benchmarking, Methodologies, and Downstream Utility
por: Lin, Honglin, et al.
Publicado: (2026)
por: Lin, Honglin, et al.
Publicado: (2026)
Closing the Data Loop: Using OpenDataArena to Engineer Superior Training Datasets
por: Gao, Xin, et al.
Publicado: (2025)
por: Gao, Xin, et al.
Publicado: (2025)
OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value
por: Cai, Mengzhang, et al.
Publicado: (2025)
por: Cai, Mengzhang, et al.
Publicado: (2025)
3D-MolT5: Leveraging Discrete Structural Information for Molecule-Text Modeling
por: Pei, Qizhi, et al.
Publicado: (2024)
por: Pei, Qizhi, et al.
Publicado: (2024)
Skeleton-of-Thought: Prompting LLMs for Efficient Parallel Generation
por: Ning, Xuefei, et al.
Publicado: (2023)
por: Ning, Xuefei, et al.
Publicado: (2023)
Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning
por: Li, Yu, et al.
Publicado: (2025)
por: Li, Yu, et al.
Publicado: (2025)
LiteLong: Resource-Efficient Long-Context Data Synthesis for LLMs
por: Jia, Junlong, et al.
Publicado: (2025)
por: Jia, Junlong, et al.
Publicado: (2025)
Can LLMs Clean Up Your Mess? A Survey of Application-Ready Data Preparation with LLMs
por: Zhou, Wei, et al.
Publicado: (2026)
por: Zhou, Wei, et al.
Publicado: (2026)
BioT5: Enriching Cross-modal Integration in Biology with Chemical Knowledge and Natural Language Associations
por: Pei, Qizhi, et al.
Publicado: (2023)
por: Pei, Qizhi, et al.
Publicado: (2023)
ZSMerge: Zero-Shot KV Cache Compression for Memory-Efficient Long-Context LLMs
por: Liu, Xin, et al.
Publicado: (2025)
por: Liu, Xin, et al.
Publicado: (2025)
IDEAL: Data Equilibrium Adaptation for Multi-Capability Language Model Alignment
por: Ming, Chenlin, et al.
Publicado: (2025)
por: Ming, Chenlin, et al.
Publicado: (2025)
Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing
por: Xu, Zhangchen, et al.
Publicado: (2024)
por: Xu, Zhangchen, et al.
Publicado: (2024)
Leveraging Biomolecule and Natural Language through Multi-Modal Learning: A Survey
por: Pei, Qizhi, et al.
Publicado: (2024)
por: Pei, Qizhi, et al.
Publicado: (2024)
ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
por: Feng, Jiazhan, et al.
Publicado: (2025)
por: Feng, Jiazhan, et al.
Publicado: (2025)
Can LLMs Learn by Teaching for Better Reasoning? A Preliminary Study
por: Ning, Xuefei, et al.
Publicado: (2024)
por: Ning, Xuefei, et al.
Publicado: (2024)
Knowledge Acquisition on Mass-shooting Events via LLMs for AI-Driven Justice
por: Ihugba, Benign John, et al.
Publicado: (2025)
por: Ihugba, Benign John, et al.
Publicado: (2025)
LRAS: Advanced Legal Reasoning with Agentic Search
por: Zhou, Yujin, et al.
Publicado: (2026)
por: Zhou, Yujin, et al.
Publicado: (2026)
Breaking Thought Patterns: A Multi-Dimensional Reasoning Framework for LLMs
por: Tang, Xintong, et al.
Publicado: (2025)
por: Tang, Xintong, et al.
Publicado: (2025)
Improving Natural Language Understanding for LLMs via Large-Scale Instruction Synthesis
por: Yuan, Lin, et al.
Publicado: (2025)
por: Yuan, Lin, et al.
Publicado: (2025)
Thoth: Mid-Training Bridges LLMs to Time Series Understanding
por: Lin, Jiafeng, et al.
Publicado: (2026)
por: Lin, Jiafeng, et al.
Publicado: (2026)
Automating Database-Native Function Code Synthesis with LLMs
por: Zhou, Wei, et al.
Publicado: (2026)
por: Zhou, Wei, et al.
Publicado: (2026)
RouteLLM: Learning to Route LLMs with Preference Data
por: Ong, Isaac, et al.
Publicado: (2024)
por: Ong, Isaac, et al.
Publicado: (2024)
DARE-bench: Evaluating Modeling and Instruction Fidelity of LLMs in Data Science
por: Shu, Fan, et al.
Publicado: (2026)
por: Shu, Fan, et al.
Publicado: (2026)
Towards Compositional Generalization of LLMs via Skill Taxonomy Guided Data Synthesis
por: Wei, Yifan, et al.
Publicado: (2026)
por: Wei, Yifan, et al.
Publicado: (2026)
Quokka: Accelerating Program Verification with LLMs via Invariant Synthesis
por: Wei, Anjiang, et al.
Publicado: (2025)
por: Wei, Anjiang, et al.
Publicado: (2025)
CDTP: A Large-Scale Chinese Data-Text Pair Dataset for Comprehensive Evaluation of Chinese LLMs
por: Wu, Chengwei, et al.
Publicado: (2025)
por: Wu, Chengwei, et al.
Publicado: (2025)
DSDL: Data Set Description Language for Bridging Modalities and Tasks in AI Data
por: Wang, Bin, et al.
Publicado: (2024)
por: Wang, Bin, et al.
Publicado: (2024)
Vulnerability of LLMs' Stated Beliefs? LLMs Belief Resistance Check Through Strategic Persuasive Conversation Interventions
por: Huang, Fan, et al.
Publicado: (2026)
por: Huang, Fan, et al.
Publicado: (2026)
Embodied AI: From LLMs to World Models
por: Feng, Tongtong, et al.
Publicado: (2025)
por: Feng, Tongtong, et al.
Publicado: (2025)
RouterEval: A Comprehensive Benchmark for Routing LLMs to Explore Model-level Scaling Up in LLMs
por: Huang, Zhongzhan, et al.
Publicado: (2025)
por: Huang, Zhongzhan, et al.
Publicado: (2025)
Are LLMs Capable of Data-based Statistical and Causal Reasoning? Benchmarking Advanced Quantitative Reasoning with Data
por: Liu, Xiao, et al.
Publicado: (2024)
por: Liu, Xiao, et al.
Publicado: (2024)
Ejemplares similares
-
Middo: Model-Informed Dynamic Data Optimization for Enhanced LLM Fine-Tuning via Closed-Loop Learning
por: Tang, Zinan, et al.
Publicado: (2025) -
ScaleDiff: Scaling Difficult Problems for Advanced Mathematical Reasoning
por: Pei, Qizhi, et al.
Publicado: (2025) -
MetaLadder: Ascending Mathematical Solution Quality via Analogical-Problem Reasoning Transfer
por: Lin, Honglin, et al.
Publicado: (2025) -
LEMMA: Learning from Errors for MatheMatical Advancement in LLMs
por: Pan, Zhuoshi, et al.
Publicado: (2025) -
MathFusion: Enhancing Mathematical Problem-solving of LLM through Instruction Fusion
por: Pei, Qizhi, et al.
Publicado: (2025)