Guardado en:
| Autores principales: | Han, Kevin, Zhou, Yuhang, Gao, Mingze, Zhou, Gedi, Li, Serena, Kumar, Abhishek, Fan, Xiangjun, Li, Weiwei, Zhang, Lizhu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2602.05165 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLM-Driven Reasoning for Constraint-Aware Feature Selection in Industrial Systems
por: Zhou, Yuhang, et al.
Publicado: (2026)
por: Zhou, Yuhang, et al.
Publicado: (2026)
Mixture-of-Minds: Multi-Agent Reinforcement Learning for Table Understanding
por: Zhou, Yuhang, et al.
Publicado: (2025)
por: Zhou, Yuhang, et al.
Publicado: (2025)
OmniOPD: Logit-Free On-Policy Distillation via Speculative Verification
por: Zhou, Yuhang, et al.
Publicado: (2026)
por: Zhou, Yuhang, et al.
Publicado: (2026)
Synthetic Sandbox for Training Machine Learning Engineering Agents
por: Zhou, Yuhang, et al.
Publicado: (2026)
por: Zhou, Yuhang, et al.
Publicado: (2026)
Group Sequence Policy Optimization
por: Zheng, Chujie, et al.
Publicado: (2025)
por: Zheng, Chujie, et al.
Publicado: (2025)
Graph-GRPO: Stabilizing Multi-Agent Topology Learning via Group Relative Policy Optimization
por: Cang, Yueyang, et al.
Publicado: (2026)
por: Cang, Yueyang, et al.
Publicado: (2026)
GEM: Empowering LLM for both Embedding Generation and Language Understanding
por: Zhang, Caojin, et al.
Publicado: (2025)
por: Zhang, Caojin, et al.
Publicado: (2025)
Training-Free Group Relative Policy Optimization
por: Cai, Yuzheng, et al.
Publicado: (2025)
por: Cai, Yuzheng, et al.
Publicado: (2025)
Agentic Recommender System with Hierarchical Belief-State Memory
por: Shen, Xiang, et al.
Publicado: (2026)
por: Shen, Xiang, et al.
Publicado: (2026)
On Group Relative Policy Optimization Collapse in Agent Search: The Lazy Likelihood-Displacement
por: Deng, Wenlong, et al.
Publicado: (2025)
por: Deng, Wenlong, et al.
Publicado: (2025)
GTPO: Stabilizing Group Relative Policy Optimization via Gradient and Entropy Control
por: Simoni, Marco, et al.
Publicado: (2025)
por: Simoni, Marco, et al.
Publicado: (2025)
Bridging Draft Policy Misalignment: Group Tree Optimization for Speculative Decoding
por: Hu, Shijing, et al.
Publicado: (2025)
por: Hu, Shijing, et al.
Publicado: (2025)
Constrained Group Relative Policy Optimization
por: Girgis, Roger, et al.
Publicado: (2026)
por: Girgis, Roger, et al.
Publicado: (2026)
J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization
por: Xu, Austin, et al.
Publicado: (2025)
por: Xu, Austin, et al.
Publicado: (2025)
TARo: Token-level Adaptive Routing for LLM Test-time Alignment
por: Rai, Arushi, et al.
Publicado: (2026)
por: Rai, Arushi, et al.
Publicado: (2026)
LIONs: An Empirically Optimized Approach to Align Language Models
por: Yu, Xiao, et al.
Publicado: (2024)
por: Yu, Xiao, et al.
Publicado: (2024)
Latent-GRPO: Group Relative Policy Optimization for Latent Reasoning
por: Deng, Jingcheng, et al.
Publicado: (2026)
por: Deng, Jingcheng, et al.
Publicado: (2026)
From Text to Insight: Leveraging Large Language Models for Performance Evaluation in Management
por: Li, Ning, et al.
Publicado: (2024)
por: Li, Ning, et al.
Publicado: (2024)
Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment
por: Wang, Jialu, et al.
Publicado: (2026)
por: Wang, Jialu, et al.
Publicado: (2026)
Token-Level LLM Collaboration via FusionRoute
por: Xiong, Nuoya, et al.
Publicado: (2026)
por: Xiong, Nuoya, et al.
Publicado: (2026)
S'MoRE: Structural Mixture of Residual Experts for Parameter-Efficient LLM Fine-tuning
por: Zeng, Hanqing, et al.
Publicado: (2025)
por: Zeng, Hanqing, et al.
Publicado: (2025)
Agentic Policy Optimization via Instruction-Policy Co-Evolution
por: Zhou, Han, et al.
Publicado: (2025)
por: Zhou, Han, et al.
Publicado: (2025)
Stabilizing Policy Optimization via Logits Convexity
por: Chen, Hongzhan, et al.
Publicado: (2026)
por: Chen, Hongzhan, et al.
Publicado: (2026)
Can Group Relative Policy Optimization Improve Thai Legal Reasoning and Question Answering?
por: Akarajaradwong, Pawitsapak, et al.
Publicado: (2025)
por: Akarajaradwong, Pawitsapak, et al.
Publicado: (2025)
The Comparison of Translationese in Machine Translation and Human Transation in terms of Translation Relations
por: Zhou, Fan
Publicado: (2024)
por: Zhou, Fan
Publicado: (2024)
ICPO: Illocution-Calibrated Policy Optimization for Multi-Turn Conversation
por: Wang, Zhebo, et al.
Publicado: (2026)
por: Wang, Zhebo, et al.
Publicado: (2026)
Decompiling Rust: An Empirical Study of Compiler Optimizations and Reverse Engineering Challenges
por: Zhou, Zixu
Publicado: (2025)
por: Zhou, Zixu
Publicado: (2025)
On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization
por: Deng, Wenlong, et al.
Publicado: (2025)
por: Deng, Wenlong, et al.
Publicado: (2025)
Adaptive Group Policy Optimization: Towards Stable Training and Token-Efficient Reasoning
por: Li, Chen, et al.
Publicado: (2025)
por: Li, Chen, et al.
Publicado: (2025)
Improving LLM Reasoning for Vulnerability Detection via Group Relative Policy Optimization
por: Simoni, Marco, et al.
Publicado: (2025)
por: Simoni, Marco, et al.
Publicado: (2025)
Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning
por: Zhang, Xichen, et al.
Publicado: (2025)
por: Zhang, Xichen, et al.
Publicado: (2025)
CAFe: Unifying Representation and Generation with Contrastive-Autoregressive Finetuning
por: Yu, Hao, et al.
Publicado: (2025)
por: Yu, Hao, et al.
Publicado: (2025)
Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
por: Ding, Yifeng, et al.
Publicado: (2025)
por: Ding, Yifeng, et al.
Publicado: (2025)
On-Policy Optimization with Group Equivalent Preference for Multi-Programming Language Understanding
por: Wu, Haoyuan, et al.
Publicado: (2025)
por: Wu, Haoyuan, et al.
Publicado: (2025)
Recursive Agent Optimization
por: Gandhi, Apurva, et al.
Publicado: (2026)
por: Gandhi, Apurva, et al.
Publicado: (2026)
CRPO: Character-centric Group Relative Policy Optimization for Role-aware Reasoning in Role-playing Agents
por: Tang, Yihong, et al.
Publicado: (2026)
por: Tang, Yihong, et al.
Publicado: (2026)
RePO: Replay-Enhanced Policy Optimization
por: Li, Siheng, et al.
Publicado: (2025)
por: Li, Siheng, et al.
Publicado: (2025)
A$^2$TGPO: Agentic Turn-Group Policy Optimization with Adaptive Turn-level Clipping
por: Chen, Dingwei, et al.
Publicado: (2026)
por: Chen, Dingwei, et al.
Publicado: (2026)
ANX: Protocol-First Design for AI Agent Interaction with a Supporting 3EX Decoupled Architecture
por: Mingze, Xu
Publicado: (2026)
por: Mingze, Xu
Publicado: (2026)
RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents
por: Zhong, Haitian, et al.
Publicado: (2026)
por: Zhong, Haitian, et al.
Publicado: (2026)
Ejemplares similares
-
LLM-Driven Reasoning for Constraint-Aware Feature Selection in Industrial Systems
por: Zhou, Yuhang, et al.
Publicado: (2026) -
Mixture-of-Minds: Multi-Agent Reinforcement Learning for Table Understanding
por: Zhou, Yuhang, et al.
Publicado: (2025) -
OmniOPD: Logit-Free On-Policy Distillation via Speculative Verification
por: Zhou, Yuhang, et al.
Publicado: (2026) -
Synthetic Sandbox for Training Machine Learning Engineering Agents
por: Zhou, Yuhang, et al.
Publicado: (2026) -
Group Sequence Policy Optimization
por: Zheng, Chujie, et al.
Publicado: (2025)