P3: A Policy-Driven, Pace-Adaptive, and Diversity-Promoted Framework for data pruning in LLM Training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Yingxuan, Wang, Huayi, Wen, Muning, Mo, Xiaoyun, Peng, Qiuying, Wang, Jun, Zhang, Weinan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HammerBench: Fine-Grained Function-Calling Evaluation in Real Mobile Device Scenarios
par: Wang, Jun, et autres
Publié: (2024)
par: Wang, Jun, et autres
Publié: (2024)
LLM-based Multi-Agent Systems: Techniques and Business Perspectives
par: Yang, Yingxuan, et autres
Publié: (2024)
par: Yang, Yingxuan, et autres
Publié: (2024)
TRAD: Enhancing LLM Agents with Step-Wise Thought Retrieval and Aligned Decision
par: Zhou, Ruiwen, et autres
Publié: (2024)
par: Zhou, Ruiwen, et autres
Publié: (2024)
Understanding Agent Scaling in LLM-Based Multi-Agent Systems via Diversity
par: Yang, Yingxuan, et autres
Publié: (2026)
par: Yang, Yingxuan, et autres
Publié: (2026)
Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training
par: Feng, Xidong, et autres
Publié: (2023)
par: Feng, Xidong, et autres
Publié: (2023)
Reinforcing Language Agents via Policy Optimization with Action Decomposition
par: Wen, Muning, et autres
Publié: (2024)
par: Wen, Muning, et autres
Publié: (2024)
Hammer: Robust Function-Calling for On-Device Language Models via Function Masking
par: Lin, Qiqiang, et autres
Publié: (2024)
par: Lin, Qiqiang, et autres
Publié: (2024)
PARL-MT: Learning to Call Functions in Multi-Turn Conversation with Progress Awareness
par: Chai, Huacan, et autres
Publié: (2025)
par: Chai, Huacan, et autres
Publié: (2025)
Decoupling Scores and Text: The Politeness Principle in Peer Review
par: Wen, Yingxuan
Publié: (2026)
par: Wen, Yingxuan
Publié: (2026)
Towards Cold-Start Drafting and Continual Refining: A Value-Driven Memory Approach with Application to NPU Kernel Synthesis
par: Zheng, Yujie, et autres
Publié: (2026)
par: Zheng, Yujie, et autres
Publié: (2026)
Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement
par: Wen, Muning, et autres
Publié: (2024)
par: Wen, Muning, et autres
Publié: (2024)
OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models
par: Wang, Jun, et autres
Publié: (2024)
par: Wang, Jun, et autres
Publié: (2024)
MARFT: Multi-Agent Reinforcement Fine-Tuning
par: Liao, Junwei, et autres
Publié: (2025)
par: Liao, Junwei, et autres
Publié: (2025)
AgentNet: Decentralized Evolutionary Coordination for LLM-based Multi-Agent Systems
par: Yang, Yingxuan, et autres
Publié: (2025)
par: Yang, Yingxuan, et autres
Publié: (2025)
A Framework to Implement 1+N Multi-task Fine-tuning Pattern in LLMs Using the CGC-LORA Algorithm
par: Song, Chao, et autres
Publié: (2024)
par: Song, Chao, et autres
Publié: (2024)
SMMBench: A Benchmark for Source-Distributed Multimodal Agent Memory
par: Chai, Huacan, et autres
Publié: (2026)
par: Chai, Huacan, et autres
Publié: (2026)
Agent Exchange: Shaping the Future of AI Agent Economics
par: Yang, Yingxuan, et autres
Publié: (2025)
par: Yang, Yingxuan, et autres
Publié: (2025)
Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents
par: Wang, Jingxing, et autres
Publié: (2026)
par: Wang, Jingxing, et autres
Publié: (2026)
MobileUse: A GUI Agent with Hierarchical Reflection for Autonomous Mobile Operation
par: Li, Ning, et autres
Publié: (2025)
par: Li, Ning, et autres
Publié: (2025)
Adaptive Milestone Reward for GUI Agents
par: Zheng, Congmin, et autres
Publié: (2026)
par: Zheng, Congmin, et autres
Publié: (2026)
STaR-SQL: Self-Taught Reasoner for Text-to-SQL
par: He, Mingqian, et autres
Publié: (2025)
par: He, Mingqian, et autres
Publié: (2025)
Understanding and Optimizing Agentic Workflows via Shapley value
par: Yang, Yingxuan, et autres
Publié: (2025)
par: Yang, Yingxuan, et autres
Publié: (2025)
Position: Agentic AI System Is a Foreseeable Pathway to AGI
par: Liao, Junwei, et autres
Publié: (2026)
par: Liao, Junwei, et autres
Publié: (2026)
Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection
par: Lyu, Weijie, et autres
Publié: (2025)
par: Lyu, Weijie, et autres
Publié: (2025)
A Method for Constructing a Digital Transformation Driving Mechanism Based on Semantic Understanding of Large Models
par: Liu, Huayi
Publié: (2026)
par: Liu, Huayi
Publié: (2026)
EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training
par: Pan, Chengjun, et autres
Publié: (2026)
par: Pan, Chengjun, et autres
Publié: (2026)
PaceLLM: Brain-Inspired Large Language Models for Long-Context Understanding
par: Li, Kangcong, et autres
Publié: (2025)
par: Li, Kangcong, et autres
Publié: (2025)
MemRL: Self-Evolving Agents via Runtime Reinforcement Learning on Episodic Memory
par: Zhang, Shengtao, et autres
Publié: (2026)
par: Zhang, Shengtao, et autres
Publié: (2026)
Self-Contrast: Better Reflection Through Inconsistent Solving Perspectives
par: Zhang, Wenqi, et autres
Publié: (2024)
par: Zhang, Wenqi, et autres
Publié: (2024)
SRTJ: Self-Evolving Rule-Driven Training-Free LLM Jailbreaking
par: Li, Jindong, et autres
Publié: (2026)
par: Li, Jindong, et autres
Publié: (2026)
ReMiT: RL-Guided Mid-Training for Iterative LLM Evolution
par: Huang, Junjie, et autres
Publié: (2026)
par: Huang, Junjie, et autres
Publié: (2026)
Learning Humanoid Standing-up Control across Diverse Postures
par: Huang, Tao, et autres
Publié: (2025)
par: Huang, Tao, et autres
Publié: (2025)
Template-Driven LLM-Paraphrased Framework for Tabular Math Word Problem Generation
par: Kang, Xiaoqiang, et autres
Publié: (2024)
par: Kang, Xiaoqiang, et autres
Publié: (2024)
QAQ: Quality Adaptive Quantization for LLM KV Cache
par: Dong, Shichen, et autres
Publié: (2024)
par: Dong, Shichen, et autres
Publié: (2024)
ColorAgent: Building A Robust, Personalized, and Interactive OS Agent
par: Li, Ning, et autres
Publié: (2025)
par: Li, Ning, et autres
Publié: (2025)
DB-Explore: Automated Database Exploration and Instruction Synthesis for Text-to-SQL
par: Ma, Haoyuan, et autres
Publié: (2025)
par: Ma, Haoyuan, et autres
Publié: (2025)
Adaptive Group Policy Optimization: Towards Stable Training and Token-Efficient Reasoning
par: Li, Chen, et autres
Publié: (2025)
par: Li, Chen, et autres
Publié: (2025)
Divergent Token Metrics: Measuring degradation to prune away LLM components -- and optimize quantization
par: Deiseroth, Björn, et autres
Publié: (2023)
par: Deiseroth, Björn, et autres
Publié: (2023)
ThinkBench: Dynamic Out-of-Distribution Evaluation for Robust LLM Reasoning
par: Huang, Shulin, et autres
Publié: (2025)
par: Huang, Shulin, et autres
Publié: (2025)
CRAFTQA: A Code-Driven Adaptive Framework for Complex Structured Data Reasoning
par: Gan, Chengtao, et autres
Publié: (2026)
par: Gan, Chengtao, et autres
Publié: (2026)
Documents similaires
-
HammerBench: Fine-Grained Function-Calling Evaluation in Real Mobile Device Scenarios
par: Wang, Jun, et autres
Publié: (2024) -
LLM-based Multi-Agent Systems: Techniques and Business Perspectives
par: Yang, Yingxuan, et autres
Publié: (2024) -
TRAD: Enhancing LLM Agents with Step-Wise Thought Retrieval and Aligned Decision
par: Zhou, Ruiwen, et autres
Publié: (2024) -
Understanding Agent Scaling in LLM-Based Multi-Agent Systems via Diversity
par: Yang, Yingxuan, et autres
Publié: (2026) -
Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training
par: Feng, Xidong, et autres
Publié: (2023)