Enregistré dans:
| Auteurs principaux: | He, Zhitao, Liu, Zijun, Li, Peng, Fung, Yi R., Yan, Ming, Zhang, Ji, Huang, Fei, Liu, Yang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2502.14496 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ReAct Meets ActRe: When Language Agents Enjoy Training Data Autonomy
par: Yang, Zonghan, et autres
Publié: (2024)
par: Yang, Zonghan, et autres
Publié: (2024)
Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration
par: Liu, Zijun, et autres
Publié: (2025)
par: Liu, Zijun, et autres
Publié: (2025)
RebuttalAgent: Strategic Persuasion in Academic Rebuttal via Theory of Mind
par: He, Zhitao, et autres
Publié: (2026)
par: He, Zhitao, et autres
Publié: (2026)
ClinTutor-R1: Advancing Scalable and Robust One-to-Many Alignment in Clinical Socratic Education
par: He, Zhitao, et autres
Publié: (2025)
par: He, Zhitao, et autres
Publié: (2025)
CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective Critic
par: Zhang, Yaocheng, et autres
Publié: (2025)
par: Zhang, Yaocheng, et autres
Publié: (2025)
MMBoundary: Advancing MLLM Knowledge Boundary Awareness through Reasoning Step Confidence Calibration
par: He, Zhitao, et autres
Publié: (2025)
par: He, Zhitao, et autres
Publié: (2025)
On Stable Long-Form Generation: Benchmarking and Mitigating Length Volatility
par: He, Zhitao, et autres
Publié: (2026)
par: He, Zhitao, et autres
Publié: (2026)
Enabling Weak LLMs to Judge Response Reliability via Meta Ranking
par: Liu, Zijun, et autres
Publié: (2024)
par: Liu, Zijun, et autres
Publié: (2024)
MAC-Tuning: LLM Multi-Compositional Problem Reasoning with Enhanced Knowledge Boundary Awareness
par: Huang, Junsheng, et autres
Publié: (2025)
par: Huang, Junsheng, et autres
Publié: (2025)
CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents
par: Liu, Jiayu, et autres
Publié: (2025)
par: Liu, Jiayu, et autres
Publié: (2025)
MARS-SQL: A multi-agent reinforcement learning framework for Text-to-SQL
par: Yang, Haolin, et autres
Publié: (2025)
par: Yang, Haolin, et autres
Publié: (2025)
From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models
par: Zhang, Chenchen
Publié: (2026)
par: Zhang, Chenchen
Publié: (2026)
MATP-BENCH: Can MLLM Be a Good Automated Theorem Prover for Multimodal Problems?
par: He, Zhitao, et autres
Publié: (2025)
par: He, Zhitao, et autres
Publié: (2025)
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
par: Ding, Fei, et autres
Publié: (2026)
par: Ding, Fei, et autres
Publié: (2026)
Re-ReST: Reflection-Reinforced Self-Training for Language Agents
par: Dou, Zi-Yi, et autres
Publié: (2024)
par: Dou, Zi-Yi, et autres
Publié: (2024)
A Dynamic LLM-Powered Agent Network for Task-Oriented Agent Collaboration
par: Liu, Zijun, et autres
Publié: (2023)
par: Liu, Zijun, et autres
Publié: (2023)
Self-Correction is More than Refinement: A Learning Framework for Visual and Language Reasoning Tasks
par: He, Jiayi, et autres
Publié: (2024)
par: He, Jiayi, et autres
Publié: (2024)
OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation
par: Hu, Xiaomeng, et autres
Publié: (2026)
par: Hu, Xiaomeng, et autres
Publié: (2026)
RePPL: Recalibrating Perplexity by Uncertainty in Semantic Propagation and Language Generation for Explainable QA Hallucination Detection
par: Huang, Yiming, et autres
Publié: (2025)
par: Huang, Yiming, et autres
Publié: (2025)
CultureCLIP: Empowering CLIP with Cultural Awareness through Synthetic Images and Contextualized Captions
par: Huang, Yuchen, et autres
Publié: (2025)
par: Huang, Yuchen, et autres
Publié: (2025)
Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization
par: Khandoga, Mykola, et autres
Publié: (2026)
par: Khandoga, Mykola, et autres
Publié: (2026)
LLMArena: Assessing Capabilities of Large Language Models in Dynamic Multi-Agent Environments
par: Chen, Junzhe, et autres
Publié: (2024)
par: Chen, Junzhe, et autres
Publié: (2024)
Towards Unified Alignment Between Agents, Humans, and Environment
par: Yang, Zonghan, et autres
Publié: (2024)
par: Yang, Zonghan, et autres
Publié: (2024)
Writing-RL: Advancing Long-form Writing via Adaptive Curriculum Reinforcement Learning
par: Lei, Xuanyu, et autres
Publié: (2025)
par: Lei, Xuanyu, et autres
Publié: (2025)
Segment Policy Optimization: Effective Segment-Level Credit Assignment in RL for Large Language Models
par: Guo, Yiran, et autres
Publié: (2025)
par: Guo, Yiran, et autres
Publié: (2025)
MICA: Multi-granularity Intertemporal Credit Assignment for Long-Horizon Emotional Support Dialogue
par: Zhang, Naifan, et autres
Publié: (2026)
par: Zhang, Naifan, et autres
Publié: (2026)
Reasoning Path Divergence: A New Metric and Curation Strategy to Unlock LLM Diverse Thinking
par: Ju, Feng, et autres
Publié: (2025)
par: Ju, Feng, et autres
Publié: (2025)
Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training
par: Yang, Kailai, et autres
Publié: (2025)
par: Yang, Kailai, et autres
Publié: (2025)
Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents
par: Tang, Wenjie, et autres
Publié: (2026)
par: Tang, Wenjie, et autres
Publié: (2026)
DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models
par: Monsefi, Amin Karimi, et autres
Publié: (2026)
par: Monsefi, Amin Karimi, et autres
Publié: (2026)
Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning
par: Li, Ziheng, et autres
Publié: (2026)
par: Li, Ziheng, et autres
Publié: (2026)
Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without Verifiers
par: Hu, Senkang, et autres
Publié: (2026)
par: Hu, Senkang, et autres
Publié: (2026)
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
par: Jiang, Xitai, et autres
Publié: (2026)
par: Jiang, Xitai, et autres
Publié: (2026)
CAPO: Towards Enhancing LLM Reasoning through Generative Credit Assignment
par: Xie, Guofu, et autres
Publié: (2025)
par: Xie, Guofu, et autres
Publié: (2025)
RICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning Agents
par: Li, Mingchen, et autres
Publié: (2026)
par: Li, Mingchen, et autres
Publié: (2026)
APEX-Searcher: Refining Credit Assignment with Subgoaling for Agentic Retrieval-Augmented Generation
par: Chen, Kun, et autres
Publié: (2026)
par: Chen, Kun, et autres
Publié: (2026)
InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning
par: Yang, Matthew Y. R., et autres
Publié: (2026)
par: Yang, Matthew Y. R., et autres
Publié: (2026)
Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception
par: Wang, Junyang, et autres
Publié: (2024)
par: Wang, Junyang, et autres
Publié: (2024)
Exploiting Tree Structure for Credit Assignment in RL Training of LLMs
par: Tran, Hieu, et autres
Publié: (2025)
par: Tran, Hieu, et autres
Publié: (2025)
Reducing Distraction in Long-Context Language Models by Focused Learning
par: Wu, Zijun, et autres
Publié: (2024)
par: Wu, Zijun, et autres
Publié: (2024)
Documents similaires
-
ReAct Meets ActRe: When Language Agents Enjoy Training Data Autonomy
par: Yang, Zonghan, et autres
Publié: (2024) -
Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration
par: Liu, Zijun, et autres
Publié: (2025) -
RebuttalAgent: Strategic Persuasion in Academic Rebuttal via Theory of Mind
par: He, Zhitao, et autres
Publié: (2026) -
ClinTutor-R1: Advancing Scalable and Robust One-to-Many Alignment in Clinical Socratic Education
par: He, Zhitao, et autres
Publié: (2025) -
CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective Critic
par: Zhang, Yaocheng, et autres
Publié: (2025)