Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
Fuente:
arXiv
Salvato in:
| Autori principali: | Ramesh, Shyam Sundhar, Ji, Xiaotong, Zimmer, Matthieu, Yoon, Sangwoong, Wang, Zhiyong, Ammar, Haitham Bou, Lucchi, Aurelien, Bogunovic, Ilija |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On Almost Surely Safe Alignment of Large Language Models at Inference-Time
di: Ji, Xiaotong, et al.
Pubblicazione: (2025)
di: Ji, Xiaotong, et al.
Pubblicazione: (2025)
Group Robust Preference Optimization in Reward-free RLHF
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2024)
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2024)
Robust Multi-Objective Controlled Decoding of Large Language Models
di: Son, Seongho, et al.
Pubblicazione: (2025)
di: Son, Seongho, et al.
Pubblicazione: (2025)
This Is Your Doge, If It Please You: Exploring Deception and Robustness in Mixture of LLMs
di: Wolf, Lorenz, et al.
Pubblicazione: (2025)
di: Wolf, Lorenz, et al.
Pubblicazione: (2025)
Risk-Controlled Lean-as-Judge for Natural-Language Mathematical Reasoning
di: Bourigault, Pauline, et al.
Pubblicazione: (2026)
di: Bourigault, Pauline, et al.
Pubblicazione: (2026)
Scalable Power Sampling: Unlocking Efficient, Training-Free Reasoning for LLMs via Distribution Sharpening
di: Ji, Xiaotong, et al.
Pubblicazione: (2026)
di: Ji, Xiaotong, et al.
Pubblicazione: (2026)
Decoding as Optimisation on the Probability Simplex: From Top-K to Top-P (Nucleus) to Best-of-K Samplers
di: Ji, Xiaotong, et al.
Pubblicazione: (2026)
di: Ji, Xiaotong, et al.
Pubblicazione: (2026)
Rethinking Large Language Model Distillation: A Constrained Markov Decision Process Perspective
di: Zimmer, Matthieu, et al.
Pubblicazione: (2025)
di: Zimmer, Matthieu, et al.
Pubblicazione: (2025)
wd1: Weighted Policy Optimization for Reasoning in Diffusion Language Models
di: Tang, Xiaohang, et al.
Pubblicazione: (2025)
di: Tang, Xiaohang, et al.
Pubblicazione: (2025)
Mixture of Attentions For Speculative Decoding
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
di: Zimmer, Matthieu, et al.
Pubblicazione: (2024)
The Model Knows, the Decoder Finds: Future Value Guided Particle Power Sampling
di: Nguyen, Tu, et al.
Pubblicazione: (2026)
di: Nguyen, Tu, et al.
Pubblicazione: (2026)
The $\mathbf{Y}$-Combinator for LLMs: Solving Long-Context Rot with $λ$-Calculus
di: Roy, Amartya, et al.
Pubblicazione: (2026)
di: Roy, Amartya, et al.
Pubblicazione: (2026)
LLM-WikiRace Benchmark: How Far Can LLMs Plan over Real-World Knowledge Graphs?
di: Ziomek, Juliusz, et al.
Pubblicazione: (2026)
di: Ziomek, Juliusz, et al.
Pubblicazione: (2026)
Distributionally Robust Model-based Reinforcement Learning with Large State Spaces
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2023)
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2023)
Bourbaki: Self-Generated and Goal-Conditioned MDPs for Theorem Proving
di: Zimmer, Matthieu, et al.
Pubblicazione: (2025)
di: Zimmer, Matthieu, et al.
Pubblicazione: (2025)
Many of Your DPOs are Secretly One: Attempting Unification Through Mutual Information
di: Tutnov, Rasul, et al.
Pubblicazione: (2025)
di: Tutnov, Rasul, et al.
Pubblicazione: (2025)
A Pragmatist Robot: Learning to Plan Tasks by Experiencing the Real World
di: Qu, Kaixian, et al.
Pubblicazione: (2025)
di: Qu, Kaixian, et al.
Pubblicazione: (2025)
Overton Pluralistic Reinforcement Learning for Large Language Models
di: Fu, Yu, et al.
Pubblicazione: (2026)
di: Fu, Yu, et al.
Pubblicazione: (2026)
RSPO: Regularized Self-Play Alignment of Large Language Models
di: Tang, Xiaohang, et al.
Pubblicazione: (2025)
di: Tang, Xiaohang, et al.
Pubblicazione: (2025)
Why Can Large Language Models Generate Correct Chain-of-Thoughts?
di: Tutunov, Rasul, et al.
Pubblicazione: (2023)
di: Tutunov, Rasul, et al.
Pubblicazione: (2023)
GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models
di: Tang, Xiaohang, et al.
Pubblicazione: (2026)
di: Tang, Xiaohang, et al.
Pubblicazione: (2026)
SuRe: Surprise-Driven Prioritised Replay for Continual LLM Learning
di: Hazard, Hugo, et al.
Pubblicazione: (2025)
di: Hazard, Hugo, et al.
Pubblicazione: (2025)
SparsePO: Controlling Preference Alignment of LLMs via Sparse Token Masks
di: Christopoulou, Fenia, et al.
Pubblicazione: (2024)
di: Christopoulou, Fenia, et al.
Pubblicazione: (2024)
Subjective Depth and Timescale Transformers: Learning Where and When to Compute
di: Wieser, Frederico, et al.
Pubblicazione: (2025)
di: Wieser, Frederico, et al.
Pubblicazione: (2025)
Self-Evolving LLM Memory Extraction Across Heterogeneous Tasks
di: Yang, Yuqing, et al.
Pubblicazione: (2026)
di: Yang, Yuqing, et al.
Pubblicazione: (2026)
Untangling Component Imbalance in Hybrid Linear Attention Conversion Methods
di: Benfeghoul, Martin, et al.
Pubblicazione: (2025)
di: Benfeghoul, Martin, et al.
Pubblicazione: (2025)
Reliable LLM-based User Simulator for Task-Oriented Dialogue Systems
di: Sekulić, Ivan, et al.
Pubblicazione: (2024)
di: Sekulić, Ivan, et al.
Pubblicazione: (2024)
LLM-Driven Multi-Turn Task-Oriented Dialogue Synthesis for Realistic Reasoning
di: Zhu, Yu, et al.
Pubblicazione: (2026)
di: Zhu, Yu, et al.
Pubblicazione: (2026)
DRA-GRPO: Your GRPO Needs to Know Diverse Reasoning Paths for Mathematical Reasoning
di: Chen, Xiwen, et al.
Pubblicazione: (2025)
di: Chen, Xiwen, et al.
Pubblicazione: (2025)
Al-Khwarizmi: Discovering Physical Laws with Foundation Models
di: Mower, Christopher E., et al.
Pubblicazione: (2025)
di: Mower, Christopher E., et al.
Pubblicazione: (2025)
Tree-OPO: Off-policy Monte Carlo Tree-Guided Advantage Optimization for Multistep Reasoning
di: Huang, Bingning, et al.
Pubblicazione: (2025)
di: Huang, Bingning, et al.
Pubblicazione: (2025)
Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback
di: Zhang, Xiaoying, et al.
Pubblicazione: (2025)
di: Zhang, Xiaoying, et al.
Pubblicazione: (2025)
Bottlenecked Transformers: Periodic KV Cache Consolidation for Generalised Reasoning
di: Oomerjee, Adnan, et al.
Pubblicazione: (2025)
di: Oomerjee, Adnan, et al.
Pubblicazione: (2025)
LLM for Complex Reasoning Task: An Exploratory Study in Fermi Problems
di: Liu, Zishuo, et al.
Pubblicazione: (2025)
di: Liu, Zishuo, et al.
Pubblicazione: (2025)
Question-Analysis Prompting Improves LLM Performance in Reasoning Tasks
di: Yugeswardeenoo, Dharunish, et al.
Pubblicazione: (2024)
di: Yugeswardeenoo, Dharunish, et al.
Pubblicazione: (2024)
TDAG: A Multi-Agent Framework based on Dynamic Task Decomposition and Agent Generation
di: Wang, Yaoxiang, et al.
Pubblicazione: (2024)
di: Wang, Yaoxiang, et al.
Pubblicazione: (2024)
Beware of Reasoning Overconfidence: Pitfalls in the Reasoning Process for Multi-solution Tasks
di: Guan, Jiannan, et al.
Pubblicazione: (2025)
di: Guan, Jiannan, et al.
Pubblicazione: (2025)
Beyond Memorization: Testing LLM Reasoning on Unseen Theory of Computation Tasks
di: Shelat, Shlok, et al.
Pubblicazione: (2026)
di: Shelat, Shlok, et al.
Pubblicazione: (2026)
Harder Is Better: Boosting Mathematical Reasoning via Difficulty-Aware GRPO and Multi-Aspect Question Reformulation
di: Dai, Yanqi, et al.
Pubblicazione: (2026)
di: Dai, Yanqi, et al.
Pubblicazione: (2026)
SG-Bench: Evaluating LLM Safety Generalization Across Diverse Tasks and Prompt Types
di: Mou, Yutao, et al.
Pubblicazione: (2024)
di: Mou, Yutao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
On Almost Surely Safe Alignment of Large Language Models at Inference-Time
di: Ji, Xiaotong, et al.
Pubblicazione: (2025) -
Group Robust Preference Optimization in Reward-free RLHF
di: Ramesh, Shyam Sundhar, et al.
Pubblicazione: (2024) -
Robust Multi-Objective Controlled Decoding of Large Language Models
di: Son, Seongho, et al.
Pubblicazione: (2025) -
This Is Your Doge, If It Please You: Exploring Deception and Robustness in Mixture of LLMs
di: Wolf, Lorenz, et al.
Pubblicazione: (2025) -
Risk-Controlled Lean-as-Judge for Natural-Language Mathematical Reasoning
di: Bourigault, Pauline, et al.
Pubblicazione: (2026)