P3: A Policy-Driven, Pace-Adaptive, and Diversity-Promoted Framework for data pruning in LLM Training
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Yingxuan, Wang, Huayi, Wen, Muning, Mo, Xiaoyun, Peng, Qiuying, Wang, Jun, Zhang, Weinan |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
HammerBench: Fine-Grained Function-Calling Evaluation in Real Mobile Device Scenarios
by: Wang, Jun, et al.
Published: (2024)
by: Wang, Jun, et al.
Published: (2024)
LLM-based Multi-Agent Systems: Techniques and Business Perspectives
by: Yang, Yingxuan, et al.
Published: (2024)
by: Yang, Yingxuan, et al.
Published: (2024)
TRAD: Enhancing LLM Agents with Step-Wise Thought Retrieval and Aligned Decision
by: Zhou, Ruiwen, et al.
Published: (2024)
by: Zhou, Ruiwen, et al.
Published: (2024)
Understanding Agent Scaling in LLM-Based Multi-Agent Systems via Diversity
by: Yang, Yingxuan, et al.
Published: (2026)
by: Yang, Yingxuan, et al.
Published: (2026)
Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training
by: Feng, Xidong, et al.
Published: (2023)
by: Feng, Xidong, et al.
Published: (2023)
Reinforcing Language Agents via Policy Optimization with Action Decomposition
by: Wen, Muning, et al.
Published: (2024)
by: Wen, Muning, et al.
Published: (2024)
Hammer: Robust Function-Calling for On-Device Language Models via Function Masking
by: Lin, Qiqiang, et al.
Published: (2024)
by: Lin, Qiqiang, et al.
Published: (2024)
PARL-MT: Learning to Call Functions in Multi-Turn Conversation with Progress Awareness
by: Chai, Huacan, et al.
Published: (2025)
by: Chai, Huacan, et al.
Published: (2025)
Decoupling Scores and Text: The Politeness Principle in Peer Review
by: Wen, Yingxuan
Published: (2026)
by: Wen, Yingxuan
Published: (2026)
Towards Cold-Start Drafting and Continual Refining: A Value-Driven Memory Approach with Application to NPU Kernel Synthesis
by: Zheng, Yujie, et al.
Published: (2026)
by: Zheng, Yujie, et al.
Published: (2026)
Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement
by: Wen, Muning, et al.
Published: (2024)
by: Wen, Muning, et al.
Published: (2024)
MARFT: Multi-Agent Reinforcement Fine-Tuning
by: Liao, Junwei, et al.
Published: (2025)
by: Liao, Junwei, et al.
Published: (2025)
OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models
by: Wang, Jun, et al.
Published: (2024)
by: Wang, Jun, et al.
Published: (2024)
AgentNet: Decentralized Evolutionary Coordination for LLM-based Multi-Agent Systems
by: Yang, Yingxuan, et al.
Published: (2025)
by: Yang, Yingxuan, et al.
Published: (2025)
A Framework to Implement 1+N Multi-task Fine-tuning Pattern in LLMs Using the CGC-LORA Algorithm
by: Song, Chao, et al.
Published: (2024)
by: Song, Chao, et al.
Published: (2024)
SMMBench: A Benchmark for Source-Distributed Multimodal Agent Memory
by: Chai, Huacan, et al.
Published: (2026)
by: Chai, Huacan, et al.
Published: (2026)
Agent Exchange: Shaping the Future of AI Agent Economics
by: Yang, Yingxuan, et al.
Published: (2025)
by: Yang, Yingxuan, et al.
Published: (2025)
Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents
by: Wang, Jingxing, et al.
Published: (2026)
by: Wang, Jingxing, et al.
Published: (2026)
MobileUse: A GUI Agent with Hierarchical Reflection for Autonomous Mobile Operation
by: Li, Ning, et al.
Published: (2025)
by: Li, Ning, et al.
Published: (2025)
Adaptive Milestone Reward for GUI Agents
by: Zheng, Congmin, et al.
Published: (2026)
by: Zheng, Congmin, et al.
Published: (2026)
STaR-SQL: Self-Taught Reasoner for Text-to-SQL
by: He, Mingqian, et al.
Published: (2025)
by: He, Mingqian, et al.
Published: (2025)
Understanding and Optimizing Agentic Workflows via Shapley value
by: Yang, Yingxuan, et al.
Published: (2025)
by: Yang, Yingxuan, et al.
Published: (2025)
Position: Agentic AI System Is a Foreseeable Pathway to AGI
by: Liao, Junwei, et al.
Published: (2026)
by: Liao, Junwei, et al.
Published: (2026)
Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection
by: Lyu, Weijie, et al.
Published: (2025)
by: Lyu, Weijie, et al.
Published: (2025)
A Method for Constructing a Digital Transformation Driving Mechanism Based on Semantic Understanding of Large Models
by: Liu, Huayi
Published: (2026)
by: Liu, Huayi
Published: (2026)
EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training
by: Pan, Chengjun, et al.
Published: (2026)
by: Pan, Chengjun, et al.
Published: (2026)
PaceLLM: Brain-Inspired Large Language Models for Long-Context Understanding
by: Li, Kangcong, et al.
Published: (2025)
by: Li, Kangcong, et al.
Published: (2025)
MemRL: Self-Evolving Agents via Runtime Reinforcement Learning on Episodic Memory
by: Zhang, Shengtao, et al.
Published: (2026)
by: Zhang, Shengtao, et al.
Published: (2026)
Self-Contrast: Better Reflection Through Inconsistent Solving Perspectives
by: Zhang, Wenqi, et al.
Published: (2024)
by: Zhang, Wenqi, et al.
Published: (2024)
SRTJ: Self-Evolving Rule-Driven Training-Free LLM Jailbreaking
by: Li, Jindong, et al.
Published: (2026)
by: Li, Jindong, et al.
Published: (2026)
Learning Humanoid Standing-up Control across Diverse Postures
by: Huang, Tao, et al.
Published: (2025)
by: Huang, Tao, et al.
Published: (2025)
ReMiT: RL-Guided Mid-Training for Iterative LLM Evolution
by: Huang, Junjie, et al.
Published: (2026)
by: Huang, Junjie, et al.
Published: (2026)
Template-Driven LLM-Paraphrased Framework for Tabular Math Word Problem Generation
by: Kang, Xiaoqiang, et al.
Published: (2024)
by: Kang, Xiaoqiang, et al.
Published: (2024)
QAQ: Quality Adaptive Quantization for LLM KV Cache
by: Dong, Shichen, et al.
Published: (2024)
by: Dong, Shichen, et al.
Published: (2024)
ColorAgent: Building A Robust, Personalized, and Interactive OS Agent
by: Li, Ning, et al.
Published: (2025)
by: Li, Ning, et al.
Published: (2025)
DB-Explore: Automated Database Exploration and Instruction Synthesis for Text-to-SQL
by: Ma, Haoyuan, et al.
Published: (2025)
by: Ma, Haoyuan, et al.
Published: (2025)
Adaptive Group Policy Optimization: Towards Stable Training and Token-Efficient Reasoning
by: Li, Chen, et al.
Published: (2025)
by: Li, Chen, et al.
Published: (2025)
Divergent Token Metrics: Measuring degradation to prune away LLM components -- and optimize quantization
by: Deiseroth, Björn, et al.
Published: (2023)
by: Deiseroth, Björn, et al.
Published: (2023)
ThinkBench: Dynamic Out-of-Distribution Evaluation for Robust LLM Reasoning
by: Huang, Shulin, et al.
Published: (2025)
by: Huang, Shulin, et al.
Published: (2025)
CRAFTQA: A Code-Driven Adaptive Framework for Complex Structured Data Reasoning
by: Gan, Chengtao, et al.
Published: (2026)
by: Gan, Chengtao, et al.
Published: (2026)
Similar Items
-
HammerBench: Fine-Grained Function-Calling Evaluation in Real Mobile Device Scenarios
by: Wang, Jun, et al.
Published: (2024) -
LLM-based Multi-Agent Systems: Techniques and Business Perspectives
by: Yang, Yingxuan, et al.
Published: (2024) -
TRAD: Enhancing LLM Agents with Step-Wise Thought Retrieval and Aligned Decision
by: Zhou, Ruiwen, et al.
Published: (2024) -
Understanding Agent Scaling in LLM-Based Multi-Agent Systems via Diversity
by: Yang, Yingxuan, et al.
Published: (2026) -
Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training
by: Feng, Xidong, et al.
Published: (2023)