Salvato in:
| Autori principali: | Li, Chusen, Liu, Zhou, Zhou, Shuigeng, Zhang, Wentao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2605.28699 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Adaptive Stopping for Multi-Turn LLM Reasoning
di: Zhou, Xiaofan, et al.
Pubblicazione: (2026)
di: Zhou, Xiaofan, et al.
Pubblicazione: (2026)
Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking
di: He, Zhida, et al.
Pubblicazione: (2026)
di: He, Zhida, et al.
Pubblicazione: (2026)
Multi-level Advantage Credit Assignment for Cooperative Multi-Agent Reinforcement Learning
di: Zhao, Xutong, et al.
Pubblicazione: (2025)
di: Zhao, Xutong, et al.
Pubblicazione: (2025)
TRACER: Trajectory Risk Aggregation for Critical Episodes in Agentic Reasoning
di: Tayebati, Sina, et al.
Pubblicazione: (2026)
di: Tayebati, Sina, et al.
Pubblicazione: (2026)
TRACER: Trace-Based Adaptive Cost-Efficient Routing for LLM Classification
di: Rida, Adam
Pubblicazione: (2026)
di: Rida, Adam
Pubblicazione: (2026)
Proximity-Based Multi-Turn Optimization: Practical Credit Assignment for LLM Agent Training
di: Fang, Yangyi, et al.
Pubblicazione: (2026)
di: Fang, Yangyi, et al.
Pubblicazione: (2026)
Imagination-Limited Q-Learning for Offline Reinforcement Learning
di: Liu, Wenhui, et al.
Pubblicazione: (2025)
di: Liu, Wenhui, et al.
Pubblicazione: (2025)
Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning
di: Ning, Yansong, et al.
Pubblicazione: (2025)
di: Ning, Yansong, et al.
Pubblicazione: (2025)
Exact Is Easier: Credit Assignment for Cooperative LLM Agents
di: Chen, Yanjun, et al.
Pubblicazione: (2026)
di: Chen, Yanjun, et al.
Pubblicazione: (2026)
TRACER: Persistent Regularization for Robust Multimodal Finetuning
di: Asadollahzadeh, Hesam, et al.
Pubblicazione: (2026)
di: Asadollahzadeh, Hesam, et al.
Pubblicazione: (2026)
LAMARL: LLM-Aided Multi-Agent Reinforcement Learning for Cooperative Policy Generation
di: Zhu, Guobin, et al.
Pubblicazione: (2025)
di: Zhu, Guobin, et al.
Pubblicazione: (2025)
A Simple "Try Again" Can Elicit Multi-Turn LLM Reasoning
di: Liu, Licheng, et al.
Pubblicazione: (2025)
di: Liu, Licheng, et al.
Pubblicazione: (2025)
VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
di: Wang, Kangrui, et al.
Pubblicazione: (2025)
di: Wang, Kangrui, et al.
Pubblicazione: (2025)
Discovering Process-Outcome Credit in Multi-Step LLM Reasoning
di: Wang, Xiangwei, et al.
Pubblicazione: (2026)
di: Wang, Xiangwei, et al.
Pubblicazione: (2026)
scI2CL: Effectively Integrating Single-cell Multi-omics by Intra- and Inter-omics Contrastive Learning
di: Liu, Wuchao, et al.
Pubblicazione: (2025)
di: Liu, Wuchao, et al.
Pubblicazione: (2025)
An LLM-Powered Cooperative Framework for Large-Scale Multi-Vehicle Navigation
di: Zhou, Yuping, et al.
Pubblicazione: (2025)
di: Zhou, Yuping, et al.
Pubblicazione: (2025)
Fairness Amidst Non-IID Graph Data: A Literature Review
di: Zhang, Wenbin, et al.
Pubblicazione: (2022)
di: Zhang, Wenbin, et al.
Pubblicazione: (2022)
One Pass for All: A Discrete Diffusion Model for Knowledge Graph Triple Set Prediction
di: Guan, Jihong, et al.
Pubblicazione: (2026)
di: Guan, Jihong, et al.
Pubblicazione: (2026)
Shapley-Coop: Credit Assignment for Emergent Cooperation in Self-Interested LLM Agents
di: Hua, Yun, et al.
Pubblicazione: (2025)
di: Hua, Yun, et al.
Pubblicazione: (2025)
Search-Based Credit Assignment for Offline Preference-Based Reinforcement Learning
di: Gao, Xiancheng, et al.
Pubblicazione: (2025)
di: Gao, Xiancheng, et al.
Pubblicazione: (2025)
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
di: Jiang, Xitai, et al.
Pubblicazione: (2026)
di: Jiang, Xitai, et al.
Pubblicazione: (2026)
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
MathMixup: Boosting LLM Mathematical Reasoning with Difficulty-Controllable Data Synthesis and Curriculum Learning
di: Li, Xuchen, et al.
Pubblicazione: (2026)
di: Li, Xuchen, et al.
Pubblicazione: (2026)
GRPO-$λ$: Credit Assignment improves LLM Reasoning
di: Parthasarathi, Prasanna, et al.
Pubblicazione: (2025)
di: Parthasarathi, Prasanna, et al.
Pubblicazione: (2025)
AIR: Unifying Individual and Collective Exploration in Cooperative Multi-Agent Reinforcement Learning
di: Zhou, Guangchong, et al.
Pubblicazione: (2024)
di: Zhou, Guangchong, et al.
Pubblicazione: (2024)
Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning
di: Qu, Yun, et al.
Pubblicazione: (2024)
di: Qu, Yun, et al.
Pubblicazione: (2024)
MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation
di: Ekbote, Chanakya, et al.
Pubblicazione: (2025)
di: Ekbote, Chanakya, et al.
Pubblicazione: (2025)
Credit Where It is Due: Cross-Modality Connectivity Drives Precise Reinforcement Learning for MLLM Reasoning
di: Jiao, Zhengbo, et al.
Pubblicazione: (2026)
di: Jiao, Zhengbo, et al.
Pubblicazione: (2026)
LLM-Driven Multi-Turn Task-Oriented Dialogue Synthesis for Realistic Reasoning
di: Zhu, Yu, et al.
Pubblicazione: (2026)
di: Zhu, Yu, et al.
Pubblicazione: (2026)
Reasoning without Regret
di: Chitra, Tarun
Pubblicazione: (2025)
di: Chitra, Tarun
Pubblicazione: (2025)
Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning
di: Zhou, Yang, et al.
Pubblicazione: (2025)
di: Zhou, Yang, et al.
Pubblicazione: (2025)
OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning
di: Li, Yu, et al.
Pubblicazione: (2026)
di: Li, Yu, et al.
Pubblicazione: (2026)
FlowRL: Matching Reward Distributions for LLM Reasoning
di: Zhu, Xuekai, et al.
Pubblicazione: (2025)
di: Zhu, Xuekai, et al.
Pubblicazione: (2025)
Evolutionary Enhanced Multi-Agent Reinforcement Learning for Cooperative Air Combat
di: Li, Chengwei, et al.
Pubblicazione: (2026)
di: Li, Chengwei, et al.
Pubblicazione: (2026)
Drift-Bench: Diagnosing Cooperative Breakdowns in LLM Agents under Input Faults via Multi-Turn Interaction
di: Bao, Han, et al.
Pubblicazione: (2026)
di: Bao, Han, et al.
Pubblicazione: (2026)
Breaking Contextual Inertia: Reinforcement Learning with Single-Turn Anchors for Stable Multi-Turn Interaction
di: Chen, Xingwu, et al.
Pubblicazione: (2026)
di: Chen, Xingwu, et al.
Pubblicazione: (2026)
MMCR: Advancing Visual Language Model in Multimodal Multi-Turn Contextual Reasoning
di: Yan, Dawei, et al.
Pubblicazione: (2025)
di: Yan, Dawei, et al.
Pubblicazione: (2025)
Nucleolus Credit Assignment for Effective Coalitions in Multi-agent Reinforcement Learning
di: Li, Yugu, et al.
Pubblicazione: (2025)
di: Li, Yugu, et al.
Pubblicazione: (2025)
AdaMamba: Adaptive Frequency-Gated Mamba for Long-Term Time Series Forecasting
di: Jiang, Xudong, et al.
Pubblicazione: (2026)
di: Jiang, Xudong, et al.
Pubblicazione: (2026)
AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning
di: Zhao, Haotian, et al.
Pubblicazione: (2026)
di: Zhao, Haotian, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Adaptive Stopping for Multi-Turn LLM Reasoning
di: Zhou, Xiaofan, et al.
Pubblicazione: (2026) -
Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking
di: He, Zhida, et al.
Pubblicazione: (2026) -
Multi-level Advantage Credit Assignment for Cooperative Multi-Agent Reinforcement Learning
di: Zhao, Xutong, et al.
Pubblicazione: (2025) -
TRACER: Trajectory Risk Aggregation for Critical Episodes in Agentic Reasoning
di: Tayebati, Sina, et al.
Pubblicazione: (2026) -
TRACER: Trace-Based Adaptive Cost-Efficient Routing for LLM Classification
di: Rida, Adam
Pubblicazione: (2026)