WS-GRPO: Weakly-Supervised Group-Relative Policy Optimization for Rollout-Efficient Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Mundada, Gagan, Huang, Zihan, Surana, Rohan, Yu, Sheldon, Zhang, Jennifer Yuntong, Li, Xintong, Yu, Tong, Yao, Lina, Shang, Jingbo, McAuley, Julian, Wu, Junda |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking
di: Surana, Rohan, et al.
Pubblicazione: (2026)
di: Surana, Rohan, et al.
Pubblicazione: (2026)
Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization
di: Li, Xintong, et al.
Pubblicazione: (2025)
di: Li, Xintong, et al.
Pubblicazione: (2025)
AMPS: Adaptive Modality Preference Steering via Functional Entropy
di: Huang, Zihan, et al.
Pubblicazione: (2026)
di: Huang, Zihan, et al.
Pubblicazione: (2026)
MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization
di: Surana, Rohan, et al.
Pubblicazione: (2026)
di: Surana, Rohan, et al.
Pubblicazione: (2026)
MusiCRS: Benchmarking Audio-Centric Conversational Recommendation
di: Surana, Rohan, et al.
Pubblicazione: (2025)
di: Surana, Rohan, et al.
Pubblicazione: (2025)
Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning
di: Surana, Rohan, et al.
Pubblicazione: (2026)
di: Surana, Rohan, et al.
Pubblicazione: (2026)
SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes
di: Wang, Chuhan, et al.
Pubblicazione: (2026)
di: Wang, Chuhan, et al.
Pubblicazione: (2026)
Evaluation on Entity Matching in Recommender Systems
di: Huang, Zihan, et al.
Pubblicazione: (2026)
di: Huang, Zihan, et al.
Pubblicazione: (2026)
Explainable Chain-of-Thought Reasoning: An Empirical Analysis on State-Aware Reasoning Dynamics
di: Yu, Sheldon, et al.
Pubblicazione: (2025)
di: Yu, Sheldon, et al.
Pubblicazione: (2025)
Active Learning for Direct Preference Optimization
di: Kveton, Branislav, et al.
Pubblicazione: (2025)
di: Kveton, Branislav, et al.
Pubblicazione: (2025)
Skill-R1: Agent Skill Evolution via Reinforcement Learning
di: Vishe, Yash, et al.
Pubblicazione: (2026)
di: Vishe, Yash, et al.
Pubblicazione: (2026)
OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents
di: Yu, Sheldon, et al.
Pubblicazione: (2026)
di: Yu, Sheldon, et al.
Pubblicazione: (2026)
CoMMIT: Coordinated Multimodal Instruction Tuning
di: Li, Xintong, et al.
Pubblicazione: (2024)
di: Li, Xintong, et al.
Pubblicazione: (2024)
CTRLS: Chain-of-Thought Reasoning via Latent State-Transition
di: Wu, Junda, et al.
Pubblicazione: (2025)
di: Wu, Junda, et al.
Pubblicazione: (2025)
Skill-CMIB: Multimodal Agent Skill for Consistent Action via Conditional Multimodal Information Bottleneck
di: Huang, Zihan, et al.
Pubblicazione: (2026)
di: Huang, Zihan, et al.
Pubblicazione: (2026)
Weakly-supervised VLM-guided Partial Contrastive Learning for Visual Language Navigation
di: Wang, Ruoyu, et al.
Pubblicazione: (2025)
di: Wang, Ruoyu, et al.
Pubblicazione: (2025)
WildScore: Benchmarking MLLMs in-the-Wild Symbolic Music Reasoning
di: Mundada, Gagan, et al.
Pubblicazione: (2025)
di: Mundada, Gagan, et al.
Pubblicazione: (2025)
In-context Ranking Preference Optimization
di: Wu, Junda, et al.
Pubblicazione: (2025)
di: Wu, Junda, et al.
Pubblicazione: (2025)
From Reviews to Dialogues: Active Synthesis for Zero-Shot LLM-based Conversational Recommender System
di: Surana, Rohan, et al.
Pubblicazione: (2025)
di: Surana, Rohan, et al.
Pubblicazione: (2025)
Listwise Preference Diffusion Optimization for User Behavior Trajectories Prediction
di: Huang, Hongtao, et al.
Pubblicazione: (2025)
di: Huang, Hongtao, et al.
Pubblicazione: (2025)
OCEAN: Offline Chain-of-thought Evaluation and Alignment in Large Language Models
di: Wu, Junda, et al.
Pubblicazione: (2024)
di: Wu, Junda, et al.
Pubblicazione: (2024)
Mitigating Visual Knowledge Forgetting in MLLM Instruction-tuning via Modality-decoupled Gradient Descent
di: Wu, Junda, et al.
Pubblicazione: (2025)
di: Wu, Junda, et al.
Pubblicazione: (2025)
A Low-Latency Fraud Detection Layer for Detecting Adversarial Interaction Patterns in LLM-Powered Agents
di: Yu, Sheldon, et al.
Pubblicazione: (2026)
di: Yu, Sheldon, et al.
Pubblicazione: (2026)
DICE: Dynamic In-Context Example Selection in LLM Agents via Efficient Knowledge Transfer
di: Wang, Ruoyu, et al.
Pubblicazione: (2025)
di: Wang, Ruoyu, et al.
Pubblicazione: (2025)
SAND: Boosting LLM Agents with Self-Taught Action Deliberation
di: Xia, Yu, et al.
Pubblicazione: (2025)
di: Xia, Yu, et al.
Pubblicazione: (2025)
Multi-Behavior Generative Recommendation
di: Liu, Zihan, et al.
Pubblicazione: (2024)
di: Liu, Zihan, et al.
Pubblicazione: (2024)
Pluralistic Off-policy Evaluation and Alignment
di: Huang, Chengkai, et al.
Pubblicazione: (2025)
di: Huang, Chengkai, et al.
Pubblicazione: (2025)
CachePrune: Teaching LLMs What Not to Follow via KV-Cache Editing
di: Wang, Rui, et al.
Pubblicazione: (2025)
di: Wang, Rui, et al.
Pubblicazione: (2025)
Knowledge-Aware Query Expansion with Large Language Models for Textual and Relational Retrieval
di: Xia, Yu, et al.
Pubblicazione: (2024)
di: Xia, Yu, et al.
Pubblicazione: (2024)
Visual Prompting in Multimodal Large Language Models: A Survey
di: Wu, Junda, et al.
Pubblicazione: (2024)
di: Wu, Junda, et al.
Pubblicazione: (2024)
A Survey on Personalized and Pluralistic Preference Alignment in Large Language Models
di: Xie, Zhouhang, et al.
Pubblicazione: (2025)
di: Xie, Zhouhang, et al.
Pubblicazione: (2025)
FERA: Uncertainty-Aware Federated Reasoning for Large Language Models
di: Wang, Ruhan, et al.
Pubblicazione: (2026)
di: Wang, Ruhan, et al.
Pubblicazione: (2026)
Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
di: Hu, Yuanzhe, et al.
Pubblicazione: (2025)
di: Hu, Yuanzhe, et al.
Pubblicazione: (2025)
Foundation Models for Recommender Systems: A Survey and New Perspectives
di: Huang, Chengkai, et al.
Pubblicazione: (2024)
di: Huang, Chengkai, et al.
Pubblicazione: (2024)
CoRAL: Collaborative Retrieval-Augmented Large Language Models Improve Long-tail Recommendation
di: Wu, Junda, et al.
Pubblicazione: (2024)
di: Wu, Junda, et al.
Pubblicazione: (2024)
Open-world Multi-label Text Classification with Extremely Weak Supervision
di: Li, Xintong, et al.
Pubblicazione: (2024)
di: Li, Xintong, et al.
Pubblicazione: (2024)
Latent Factor Models Meets Instructions: Goal-conditioned Latent Factor Discovery without Task Supervision
di: Xie, Zhouhang, et al.
Pubblicazione: (2025)
di: Xie, Zhouhang, et al.
Pubblicazione: (2025)
MC-GRPO: Median-Centered Group Relative Policy Optimization for Small-Rollout Reinforcement Learning
di: Kim, Youngeun
Pubblicazione: (2026)
di: Kim, Youngeun
Pubblicazione: (2026)
Reddit2Deezer: A Scalable Dataset for Real-World Grounded Conversational Music Recommendation
di: Kim, Haven, et al.
Pubblicazione: (2026)
di: Kim, Haven, et al.
Pubblicazione: (2026)
Embedding-Informed Adaptive Retrieval-Augmented Generation of Large Language Models
di: Huang, Chengkai, et al.
Pubblicazione: (2024)
di: Huang, Chengkai, et al.
Pubblicazione: (2024)
Documenti analoghi
-
F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking
di: Surana, Rohan, et al.
Pubblicazione: (2026) -
Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization
di: Li, Xintong, et al.
Pubblicazione: (2025) -
AMPS: Adaptive Modality Preference Steering via Functional Entropy
di: Huang, Zihan, et al.
Pubblicazione: (2026) -
MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization
di: Surana, Rohan, et al.
Pubblicazione: (2026) -
MusiCRS: Benchmarking Audio-Centric Conversational Recommendation
di: Surana, Rohan, et al.
Pubblicazione: (2025)