Unbiased Dynamic Pruning for Efficient Group-Based Policy Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhu, Haodong, Ren, Yangyang, Li, Yanjing, Lin, Mingbao, Yang, Linlin, Liu, Xuhui, Zhen, Xiantong, Liu, Haiguang, Zhang, Baochang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models
por: Lin, Zhihang, et al.
Publicado: (2025)
por: Lin, Zhihang, et al.
Publicado: (2025)
SURGE: Surrogate Gradient Adaptation in Binary Neural Networks
por: Huang, Haoyu, et al.
Publicado: (2026)
por: Huang, Haoyu, et al.
Publicado: (2026)
Surf3R: Rapid Surface Reconstruction from Sparse RGB Views in Seconds
por: Zhu, Haodong, et al.
Publicado: (2025)
por: Zhu, Haodong, et al.
Publicado: (2025)
Fusion-Mamba for Cross-modality Object Detection
por: Dong, Wenhao, et al.
Publicado: (2024)
por: Dong, Wenhao, et al.
Publicado: (2024)
Step-GRPO: Internalizing Dynamic Early Exit for Efficient Reasoning
por: Chen, Benteng, et al.
Publicado: (2026)
por: Chen, Benteng, et al.
Publicado: (2026)
Squeeze10-LLM: Squeezing LLMs' Weights by 10 Times via a Staged Mixed-Precision Quantization Method
por: Zhu, Qingcheng, et al.
Publicado: (2025)
por: Zhu, Qingcheng, et al.
Publicado: (2025)
Group Sequence Policy Optimization
por: Zheng, Chujie, et al.
Publicado: (2025)
por: Zheng, Chujie, et al.
Publicado: (2025)
A Channel-ensemble Approach: Unbiased and Low-variance Pseudo-labels is Critical for Semi-supervised Classification
por: Wu, Jiaqi, et al.
Publicado: (2024)
por: Wu, Jiaqi, et al.
Publicado: (2024)
Group-in-Group Policy Optimization for LLM Agent Training
por: Feng, Lang, et al.
Publicado: (2025)
por: Feng, Lang, et al.
Publicado: (2025)
Context Over Compute Human-in-the-Loop Outperforms Iterative Chain-of-Thought Prompting in Interview Answer Quality
por: Zhu, Kewen, et al.
Publicado: (2026)
por: Zhu, Kewen, et al.
Publicado: (2026)
Large Multimodal Model Compression via Efficient Pruning and Distillation at AntGroup
por: Wang, Maolin, et al.
Publicado: (2023)
por: Wang, Maolin, et al.
Publicado: (2023)
ProtoGCD: Unified and Unbiased Prototype Learning for Generalized Category Discovery
por: Ma, Shijie, et al.
Publicado: (2025)
por: Ma, Shijie, et al.
Publicado: (2025)
HRGS: Hierarchical Gaussian Splatting for Memory-Efficient High-Resolution 3D Reconstruction
por: Li, Changbai, et al.
Publicado: (2025)
por: Li, Changbai, et al.
Publicado: (2025)
Distributed Knowing How
por: Liu, Bin, et al.
Publicado: (2025)
por: Liu, Bin, et al.
Publicado: (2025)
Variational Task Vector Composition
por: Zhang, Boyuan, et al.
Publicado: (2025)
por: Zhang, Boyuan, et al.
Publicado: (2025)
GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models
por: Huang, Mingzhe, et al.
Publicado: (2026)
por: Huang, Mingzhe, et al.
Publicado: (2026)
Dynamic Sparse No Training: Training-Free Fine-tuning for Sparse LLMs
por: Zhang, Yuxin, et al.
Publicado: (2023)
por: Zhang, Yuxin, et al.
Publicado: (2023)
Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning
por: Yang, Zhicheng, et al.
Publicado: (2026)
por: Yang, Zhicheng, et al.
Publicado: (2026)
GFT: From Imitation to Reward Fine-Tuning with Unbiased Group Advantages and Dynamic Coefficient Rectification
por: Gan, Wangjie, et al.
Publicado: (2026)
por: Gan, Wangjie, et al.
Publicado: (2026)
Truncated Proximal Policy Optimization
por: Fan, Tiantian, et al.
Publicado: (2025)
por: Fan, Tiantian, et al.
Publicado: (2025)
Group Orthogonalized Policy Optimization:Group Policy Optimization as Orthogonal Projection in Hilbert Space
por: Zixian, Wang
Publicado: (2026)
por: Zixian, Wang
Publicado: (2026)
Unbiased Gradient Low-Rank Projection
por: Pan, Rui, et al.
Publicado: (2025)
por: Pan, Rui, et al.
Publicado: (2025)
Agent-GSPO: Communication-Efficient Multi-Agent Systems via Group Sequence Policy Optimization
por: Fan, Yijia, et al.
Publicado: (2025)
por: Fan, Yijia, et al.
Publicado: (2025)
Train Less, Learn More: Adaptive Efficient Rollout Optimization for Group-Based Reinforcement Learning
por: Zhang, Zhi, et al.
Publicado: (2026)
por: Zhang, Zhi, et al.
Publicado: (2026)
P4Q: Learning to Prompt for Quantization in Visual-language Models
por: Sun, Huixin, et al.
Publicado: (2024)
por: Sun, Huixin, et al.
Publicado: (2024)
Boosting Multimodal Large Language Models with Visual Tokens Withdrawal for Rapid Inference
por: Lin, Zhihang, et al.
Publicado: (2024)
por: Lin, Zhihang, et al.
Publicado: (2024)
SimKO: Simple Pass@K Policy Optimization
por: Peng, Ruotian, et al.
Publicado: (2025)
por: Peng, Ruotian, et al.
Publicado: (2025)
Calibration and Transformation-Free Weight-Only LLMs Quantization via Dynamic Grouping
por: Zheng, Xinzhe, et al.
Publicado: (2025)
por: Zheng, Xinzhe, et al.
Publicado: (2025)
DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization
por: Li, Gang, et al.
Publicado: (2025)
por: Li, Gang, et al.
Publicado: (2025)
Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference
por: Liu, Ziyan, et al.
Publicado: (2025)
por: Liu, Ziyan, et al.
Publicado: (2025)
Learning More with Less: A Dynamic Dual-Level Down-Sampling Framework for Efficient Policy Optimization
por: Wang, Chao, et al.
Publicado: (2025)
por: Wang, Chao, et al.
Publicado: (2025)
Reducing Fine-Tuning Memory Overhead by Approximate and Memory-Sharing Backpropagation
por: Yang, Yuchen, et al.
Publicado: (2024)
por: Yang, Yuchen, et al.
Publicado: (2024)
Reinforced Imitative Trajectory Planning for Urban Automated Driving
por: Zeng, Di, et al.
Publicado: (2024)
por: Zeng, Di, et al.
Publicado: (2024)
AceGRPO: Adaptive Curriculum Enhanced Group Relative Policy Optimization for Autonomous Machine Learning Engineering
por: Cai, Yuzhu, et al.
Publicado: (2026)
por: Cai, Yuzhu, et al.
Publicado: (2026)
MLVTG: Mamba-Based Feature Alignment and LLM-Driven Purification for Multi-Modal Video Temporal Grounding
por: Zhu, Zhiyi, et al.
Publicado: (2025)
por: Zhu, Zhiyi, et al.
Publicado: (2025)
AccDiffusion v2: Towards More Accurate Higher-Resolution Diffusion Extrapolation
por: Lin, Zhihang, et al.
Publicado: (2024)
por: Lin, Zhihang, et al.
Publicado: (2024)
Environment-Aware Adaptive Pruning with Interleaved Inference Orchestration for Vision-Language-Action Models
por: Huang, Yuting, et al.
Publicado: (2026)
por: Huang, Yuting, et al.
Publicado: (2026)
Class-Aware Pruning for Efficient Neural Networks
por: Jiang, Mengnan, et al.
Publicado: (2023)
por: Jiang, Mengnan, et al.
Publicado: (2023)
Is On-Policy Data always the Best Choice for Direct Preference Optimization-based LM Alignment?
por: Sun, Zetian, et al.
Publicado: (2025)
por: Sun, Zetian, et al.
Publicado: (2025)
AI Agents and Agentic AI-Navigating a Plethora of Concepts for Future Manufacturing
por: Ren, Yinwang, et al.
Publicado: (2025)
por: Ren, Yinwang, et al.
Publicado: (2025)
Ejemplares similares
-
CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models
por: Lin, Zhihang, et al.
Publicado: (2025) -
SURGE: Surrogate Gradient Adaptation in Binary Neural Networks
por: Huang, Haoyu, et al.
Publicado: (2026) -
Surf3R: Rapid Surface Reconstruction from Sparse RGB Views in Seconds
por: Zhu, Haodong, et al.
Publicado: (2025) -
Fusion-Mamba for Cross-modality Object Detection
por: Dong, Wenhao, et al.
Publicado: (2024) -
Step-GRPO: Internalizing Dynamic Early Exit for Efficient Reasoning
por: Chen, Benteng, et al.
Publicado: (2026)