Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhu, Haodong, Ren, Yangyang, Li, Yanjing, Lin, Mingbao, Yang, Linlin, Liu, Xuhui, Zhen, Xiantong, Liu, Haiguang, Zhang, Baochang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models
von: Lin, Zhihang, et al.
Veröffentlicht: (2025)
von: Lin, Zhihang, et al.
Veröffentlicht: (2025)
SURGE: Surrogate Gradient Adaptation in Binary Neural Networks
von: Huang, Haoyu, et al.
Veröffentlicht: (2026)
von: Huang, Haoyu, et al.
Veröffentlicht: (2026)
Surf3R: Rapid Surface Reconstruction from Sparse RGB Views in Seconds
von: Zhu, Haodong, et al.
Veröffentlicht: (2025)
von: Zhu, Haodong, et al.
Veröffentlicht: (2025)
Fusion-Mamba for Cross-modality Object Detection
von: Dong, Wenhao, et al.
Veröffentlicht: (2024)
von: Dong, Wenhao, et al.
Veröffentlicht: (2024)
Step-GRPO: Internalizing Dynamic Early Exit for Efficient Reasoning
von: Chen, Benteng, et al.
Veröffentlicht: (2026)
von: Chen, Benteng, et al.
Veröffentlicht: (2026)
Squeeze10-LLM: Squeezing LLMs' Weights by 10 Times via a Staged Mixed-Precision Quantization Method
von: Zhu, Qingcheng, et al.
Veröffentlicht: (2025)
von: Zhu, Qingcheng, et al.
Veröffentlicht: (2025)
Group Sequence Policy Optimization
von: Zheng, Chujie, et al.
Veröffentlicht: (2025)
von: Zheng, Chujie, et al.
Veröffentlicht: (2025)
A Channel-ensemble Approach: Unbiased and Low-variance Pseudo-labels is Critical for Semi-supervised Classification
von: Wu, Jiaqi, et al.
Veröffentlicht: (2024)
von: Wu, Jiaqi, et al.
Veröffentlicht: (2024)
Group-in-Group Policy Optimization for LLM Agent Training
von: Feng, Lang, et al.
Veröffentlicht: (2025)
von: Feng, Lang, et al.
Veröffentlicht: (2025)
Context Over Compute Human-in-the-Loop Outperforms Iterative Chain-of-Thought Prompting in Interview Answer Quality
von: Zhu, Kewen, et al.
Veröffentlicht: (2026)
von: Zhu, Kewen, et al.
Veröffentlicht: (2026)
Large Multimodal Model Compression via Efficient Pruning and Distillation at AntGroup
von: Wang, Maolin, et al.
Veröffentlicht: (2023)
von: Wang, Maolin, et al.
Veröffentlicht: (2023)
ProtoGCD: Unified and Unbiased Prototype Learning for Generalized Category Discovery
von: Ma, Shijie, et al.
Veröffentlicht: (2025)
von: Ma, Shijie, et al.
Veröffentlicht: (2025)
HRGS: Hierarchical Gaussian Splatting for Memory-Efficient High-Resolution 3D Reconstruction
von: Li, Changbai, et al.
Veröffentlicht: (2025)
von: Li, Changbai, et al.
Veröffentlicht: (2025)
Distributed Knowing How
von: Liu, Bin, et al.
Veröffentlicht: (2025)
von: Liu, Bin, et al.
Veröffentlicht: (2025)
Variational Task Vector Composition
von: Zhang, Boyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Boyuan, et al.
Veröffentlicht: (2025)
GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models
von: Huang, Mingzhe, et al.
Veröffentlicht: (2026)
von: Huang, Mingzhe, et al.
Veröffentlicht: (2026)
Dynamic Sparse No Training: Training-Free Fine-tuning for Sparse LLMs
von: Zhang, Yuxin, et al.
Veröffentlicht: (2023)
von: Zhang, Yuxin, et al.
Veröffentlicht: (2023)
Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning
von: Yang, Zhicheng, et al.
Veröffentlicht: (2026)
von: Yang, Zhicheng, et al.
Veröffentlicht: (2026)
GFT: From Imitation to Reward Fine-Tuning with Unbiased Group Advantages and Dynamic Coefficient Rectification
von: Gan, Wangjie, et al.
Veröffentlicht: (2026)
von: Gan, Wangjie, et al.
Veröffentlicht: (2026)
Truncated Proximal Policy Optimization
von: Fan, Tiantian, et al.
Veröffentlicht: (2025)
von: Fan, Tiantian, et al.
Veröffentlicht: (2025)
Group Orthogonalized Policy Optimization:Group Policy Optimization as Orthogonal Projection in Hilbert Space
von: Zixian, Wang
Veröffentlicht: (2026)
von: Zixian, Wang
Veröffentlicht: (2026)
Unbiased Gradient Low-Rank Projection
von: Pan, Rui, et al.
Veröffentlicht: (2025)
von: Pan, Rui, et al.
Veröffentlicht: (2025)
Agent-GSPO: Communication-Efficient Multi-Agent Systems via Group Sequence Policy Optimization
von: Fan, Yijia, et al.
Veröffentlicht: (2025)
von: Fan, Yijia, et al.
Veröffentlicht: (2025)
Train Less, Learn More: Adaptive Efficient Rollout Optimization for Group-Based Reinforcement Learning
von: Zhang, Zhi, et al.
Veröffentlicht: (2026)
von: Zhang, Zhi, et al.
Veröffentlicht: (2026)
P4Q: Learning to Prompt for Quantization in Visual-language Models
von: Sun, Huixin, et al.
Veröffentlicht: (2024)
von: Sun, Huixin, et al.
Veröffentlicht: (2024)
SimKO: Simple Pass@K Policy Optimization
von: Peng, Ruotian, et al.
Veröffentlicht: (2025)
von: Peng, Ruotian, et al.
Veröffentlicht: (2025)
Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference
von: Lin, Zhihang, et al.
Veröffentlicht: (2024)
von: Lin, Zhihang, et al.
Veröffentlicht: (2024)
Calibration and Transformation-Free Weight-Only LLMs Quantization via Dynamic Grouping
von: Zheng, Xinzhe, et al.
Veröffentlicht: (2025)
von: Zheng, Xinzhe, et al.
Veröffentlicht: (2025)
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
von: Li, Gang, et al.
Veröffentlicht: (2025)
von: Li, Gang, et al.
Veröffentlicht: (2025)
Learning More with Less: A Dynamic Dual-Level Down-Sampling Framework for Efficient Policy Optimization
von: Wang, Chao, et al.
Veröffentlicht: (2025)
von: Wang, Chao, et al.
Veröffentlicht: (2025)
Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
von: Liu, Ziyan, et al.
Veröffentlicht: (2025)
von: Liu, Ziyan, et al.
Veröffentlicht: (2025)
Reducing Fine-Tuning Memory Overhead by Approximate and Memory-Sharing Backpropagation
von: Yang, Yuchen, et al.
Veröffentlicht: (2024)
von: Yang, Yuchen, et al.
Veröffentlicht: (2024)
Reinforced Imitative Trajectory Planning for Urban Automated Driving
von: Zeng, Di, et al.
Veröffentlicht: (2024)
von: Zeng, Di, et al.
Veröffentlicht: (2024)
AceGRPO: Adaptive Curriculum Enhanced Group Relative Policy Optimization for Autonomous Machine Learning Engineering
von: Cai, Yuzhu, et al.
Veröffentlicht: (2026)
von: Cai, Yuzhu, et al.
Veröffentlicht: (2026)
MLVTG: Mamba-Based Feature Alignment and LLM-Driven Purification for Multi-Modal Video Temporal Grounding
von: Zhu, Zhiyi, et al.
Veröffentlicht: (2025)
von: Zhu, Zhiyi, et al.
Veröffentlicht: (2025)
AccDiffusion v2: Towards More Accurate Higher-Resolution Diffusion Extrapolation
von: Lin, Zhihang, et al.
Veröffentlicht: (2024)
von: Lin, Zhihang, et al.
Veröffentlicht: (2024)
Environment-Aware Adaptive Pruning with Interleaved Inference Orchestration for Vision-Language-Action Models
von: Huang, Yuting, et al.
Veröffentlicht: (2026)
von: Huang, Yuting, et al.
Veröffentlicht: (2026)
Class-Aware Pruning for Efficient Neural Networks
von: Jiang, Mengnan, et al.
Veröffentlicht: (2023)
von: Jiang, Mengnan, et al.
Veröffentlicht: (2023)
Is On-Policy Data always the Best Choice for Direct Preference Optimization-based LM Alignment?
von: Sun, Zetian, et al.
Veröffentlicht: (2025)
von: Sun, Zetian, et al.
Veröffentlicht: (2025)
AI Agents and Agentic AI-Navigating a Plethora of Concepts for Future Manufacturing
von: Ren, Yinwang, et al.
Veröffentlicht: (2025)
von: Ren, Yinwang, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models
von: Lin, Zhihang, et al.
Veröffentlicht: (2025) -
SURGE: Surrogate Gradient Adaptation in Binary Neural Networks
von: Huang, Haoyu, et al.
Veröffentlicht: (2026) -
Surf3R: Rapid Surface Reconstruction from Sparse RGB Views in Seconds
von: Zhu, Haodong, et al.
Veröffentlicht: (2025) -
Fusion-Mamba for Cross-modality Object Detection
von: Dong, Wenhao, et al.
Veröffentlicht: (2024) -
Step-GRPO: Internalizing Dynamic Early Exit for Efficient Reasoning
von: Chen, Benteng, et al.
Veröffentlicht: (2026)