FastMCTS: A Simple Sampling Strategy for Data Synthesis
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Peiji, Lv, Kai, Shao, Yunfan, Ma, Yichuan, Li, Linyang, Zheng, Xiaoqing, Qiu, Xipeng, Guo, Qipeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UnitCoder: Scalable Iterative Code Synthesis with Unit Test Guidance
di: Ma, Yichuan, et al.
Pubblicazione: (2025)
di: Ma, Yichuan, et al.
Pubblicazione: (2025)
Case2Code: Scalable Synthetic Data for Code Generation
di: Shao, Yunfan, et al.
Pubblicazione: (2024)
di: Shao, Yunfan, et al.
Pubblicazione: (2024)
Mixing Expert Knowledge: Bring Human Thoughts Back To the Game of Go
di: Ma, Yichuan, et al.
Pubblicazione: (2026)
di: Ma, Yichuan, et al.
Pubblicazione: (2026)
Timely Machine: Awareness of Time Makes Test-Time Scaling Agentic
di: Ma, Yichuan, et al.
Pubblicazione: (2026)
di: Ma, Yichuan, et al.
Pubblicazione: (2026)
Balanced Data Sampling for Language Model Training with Clustering
di: Shao, Yunfan, et al.
Pubblicazione: (2024)
di: Shao, Yunfan, et al.
Pubblicazione: (2024)
DuoDecoding: Hardware-aware Heterogeneous Speculative Decoding with Dynamic Multi-Sequence Drafting
di: Lv, Kai, et al.
Pubblicazione: (2025)
di: Lv, Kai, et al.
Pubblicazione: (2025)
Unearthing Large Scale Domain-Specific Knowledge from Public Corpora
di: Fei, Zhaoye, et al.
Pubblicazione: (2024)
di: Fei, Zhaoye, et al.
Pubblicazione: (2024)
TL-GRPO: Turn-Level RL for Reasoning-Guided Iterative Optimization
di: Li, Peiji, et al.
Pubblicazione: (2026)
di: Li, Peiji, et al.
Pubblicazione: (2026)
AdaLomo: Low-memory Optimization with Adaptive Learning Rate
di: Lv, Kai, et al.
Pubblicazione: (2023)
di: Lv, Kai, et al.
Pubblicazione: (2023)
Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections
di: Wang, Bo, et al.
Pubblicazione: (2025)
di: Wang, Bo, et al.
Pubblicazione: (2025)
Full Parameter Fine-tuning for Large Language Models with Limited Resources
di: Lv, Kai, et al.
Pubblicazione: (2023)
di: Lv, Kai, et al.
Pubblicazione: (2023)
F-Eval: Assessing Fundamental Abilities with Refined Evaluation Methods
di: Sun, Yu, et al.
Pubblicazione: (2024)
di: Sun, Yu, et al.
Pubblicazione: (2024)
Unified Active Retrieval for Retrieval Augmented Generation
di: Cheng, Qinyuan, et al.
Pubblicazione: (2024)
di: Cheng, Qinyuan, et al.
Pubblicazione: (2024)
LongWanjuan: Towards Systematic Measurement for Long Text Quality
di: Lv, Kai, et al.
Pubblicazione: (2024)
di: Lv, Kai, et al.
Pubblicazione: (2024)
InternBootcamp Technical Report: Boosting LLM Reasoning with Verifiable Task Scaling
di: Li, Peiji, et al.
Pubblicazione: (2025)
di: Li, Peiji, et al.
Pubblicazione: (2025)
CritiQ: Mining Data Quality Criteria from Human Preferences
di: Guo, Honglin, et al.
Pubblicazione: (2025)
di: Guo, Honglin, et al.
Pubblicazione: (2025)
Explicit Multi-head Attention for Inter-head Interaction in Large Language Models
di: Peng, Runyu, et al.
Pubblicazione: (2026)
di: Peng, Runyu, et al.
Pubblicazione: (2026)
Data-free Weight Compress and Denoise for Large Language Models
di: Peng, Runyu, et al.
Pubblicazione: (2024)
di: Peng, Runyu, et al.
Pubblicazione: (2024)
Mousse: Rectifying the Geometry of Muon with Curvature-Aware Preconditioning
di: Zhang, Yechen, et al.
Pubblicazione: (2026)
di: Zhang, Yechen, et al.
Pubblicazione: (2026)
How Attention Sinks Emerge in Large Language Models: An Interpretability Perspective
di: Peng, Runyu, et al.
Pubblicazione: (2026)
di: Peng, Runyu, et al.
Pubblicazione: (2026)
GAOKAO-Eval: Does high scores truly reflect strong capabilities in LLMs?
di: Lei, Zhikai, et al.
Pubblicazione: (2024)
di: Lei, Zhikai, et al.
Pubblicazione: (2024)
Turn Waste into Worth: Rectifying Top-$k$ Router of MoE
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2024)
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2024)
ReAttention: Training-Free Infinite Context with Finite Attention Scope
di: Liu, Xiaoran, et al.
Pubblicazione: (2024)
di: Liu, Xiaoran, et al.
Pubblicazione: (2024)
Can Language Models Learn to Skip Steps?
di: Liu, Tengxiao, et al.
Pubblicazione: (2024)
di: Liu, Tengxiao, et al.
Pubblicazione: (2024)
Benchmarking Hallucination in Large Language Models based on Unanswerable Math Word Problem
di: Sun, Yuhong, et al.
Pubblicazione: (2024)
di: Sun, Yuhong, et al.
Pubblicazione: (2024)
LLatrieval: LLM-Verified Retrieval for Verifiable Generation
di: Li, Xiaonan, et al.
Pubblicazione: (2023)
di: Li, Xiaonan, et al.
Pubblicazione: (2023)
What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents
di: Li, Xiaozhe, et al.
Pubblicazione: (2026)
di: Li, Xiaozhe, et al.
Pubblicazione: (2026)
InternLM-Math: Open Math Large Language Models Toward Verifiable Reasoning
di: Ying, Huaiyuan, et al.
Pubblicazione: (2024)
di: Ying, Huaiyuan, et al.
Pubblicazione: (2024)
Sparse-dLLM: Accelerating Diffusion LLMs with Dynamic Cache Eviction
di: Song, Yuerong, et al.
Pubblicazione: (2025)
di: Song, Yuerong, et al.
Pubblicazione: (2025)
LongLLaDA: Unlocking Long Context Capabilities in Diffusion LLMs
di: Liu, Xiaoran, et al.
Pubblicazione: (2025)
di: Liu, Xiaoran, et al.
Pubblicazione: (2025)
BiT-MCTS: A Theme-based Bidirectional MCTS Approach to Chinese Fiction Generation
di: Li, Zhaoyi, et al.
Pubblicazione: (2026)
di: Li, Zhaoyi, et al.
Pubblicazione: (2026)
InferAligner: Inference-Time Alignment for Harmlessness through Cross-Model Guidance
di: Wang, Pengyu, et al.
Pubblicazione: (2024)
di: Wang, Pengyu, et al.
Pubblicazione: (2024)
Can AI Assistants Know What They Don't Know?
di: Cheng, Qinyuan, et al.
Pubblicazione: (2024)
di: Cheng, Qinyuan, et al.
Pubblicazione: (2024)
Identifying Semantic Induction Heads to Understand In-Context Learning
di: Ren, Jie, et al.
Pubblicazione: (2024)
di: Ren, Jie, et al.
Pubblicazione: (2024)
VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search
di: Wang, Yikun, et al.
Pubblicazione: (2025)
di: Wang, Yikun, et al.
Pubblicazione: (2025)
LongSafety: Enhance Safety for Long-Context LLMs
di: Huang, Mianqiu, et al.
Pubblicazione: (2024)
di: Huang, Mianqiu, et al.
Pubblicazione: (2024)
CodeEvo: Interaction-Driven Synthesis of Code-centric Data through Hybrid and Iterative Feedback
di: Sun, Qiushi, et al.
Pubblicazione: (2025)
di: Sun, Qiushi, et al.
Pubblicazione: (2025)
Beyond Real: Imaginary Extension of Rotary Position Embeddings for Long-Context LLMs
di: Liu, Xiaoran, et al.
Pubblicazione: (2025)
di: Liu, Xiaoran, et al.
Pubblicazione: (2025)
Towards Economical Inference: Enabling DeepSeek's Multi-Head Latent Attention in Any Transformer-based LLMs
di: Ji, Tao, et al.
Pubblicazione: (2025)
di: Ji, Tao, et al.
Pubblicazione: (2025)
Synthetic Pre-Pre-Training Improves Language Model Robustness to Noisy Pre-Training Data
di: Guo, Xu, et al.
Pubblicazione: (2026)
di: Guo, Xu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
UnitCoder: Scalable Iterative Code Synthesis with Unit Test Guidance
di: Ma, Yichuan, et al.
Pubblicazione: (2025) -
Case2Code: Scalable Synthetic Data for Code Generation
di: Shao, Yunfan, et al.
Pubblicazione: (2024) -
Mixing Expert Knowledge: Bring Human Thoughts Back To the Game of Go
di: Ma, Yichuan, et al.
Pubblicazione: (2026) -
Timely Machine: Awareness of Time Makes Test-Time Scaling Agentic
di: Ma, Yichuan, et al.
Pubblicazione: (2026) -
Balanced Data Sampling for Language Model Training with Clustering
di: Shao, Yunfan, et al.
Pubblicazione: (2024)