Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Xinzhu, He, Wei, Fan, Huichuan, Niu, Wenzhe, Sun, Zhongxiang, Wang, Xuanru, Gao, Jiuchong, Hao, Jinghua, He, Renqing, Yu, Weijie |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
From Absolute to Relative: Rethinking Reward Shaping in Group-Based Reinforcement Learning
by: Niu, Wenzhe, et al.
Published: (2026)
by: Niu, Wenzhe, et al.
Published: (2026)
LTS-VoiceAgent: A Listen-Think-Speak Framework for Efficient Streaming Voice Interaction via Semantic Triggering and Incremental Reasoning
by: Zou, Wenhao, et al.
Published: (2026)
by: Zou, Wenhao, et al.
Published: (2026)
GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR
by: Zhang, Jiaying, et al.
Published: (2026)
by: Zhang, Jiaying, et al.
Published: (2026)
Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
by: Liu, Yan, et al.
Published: (2026)
by: Liu, Yan, et al.
Published: (2026)
Long-term Task-oriented Agent: Proactive Long-term Intent Maintenance in Dynamic Environments
by: Shi, Qinglong, et al.
Published: (2026)
by: Shi, Qinglong, et al.
Published: (2026)
MUSE: Multi-Domain Chinese User Simulation via Self-Evolving Profiles and Rubric-Guided Alignment
by: Liu, Zihao, et al.
Published: (2026)
by: Liu, Zihao, et al.
Published: (2026)
Silence the Judge: Reinforcement Learning with Self-Verifier via Latent Geometric Clustering
by: Zhang, Nonghai, et al.
Published: (2026)
by: Zhang, Nonghai, et al.
Published: (2026)
UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning
by: Zhang, Feng, et al.
Published: (2026)
by: Zhang, Feng, et al.
Published: (2026)
Beyond High-Entropy Exploration: Correctness-Aware Low-Entropy Segment-Based Advantage Shaping for Reasoning LLMs
by: Chen, Xinzhu, et al.
Published: (2025)
by: Chen, Xinzhu, et al.
Published: (2025)
State Rank Dynamics in Linear Attention LLMs
by: Sun, Ao, et al.
Published: (2026)
by: Sun, Ao, et al.
Published: (2026)
Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management
by: Ma, Weitao, et al.
Published: (2026)
by: Ma, Weitao, et al.
Published: (2026)
Harvesting Efficient On-Demand Order Pooling from Skilled Couriers: Enhancing Graph Representation Learning for Refining Real-time Many-to-One Assignments
by: Liang, Yile, et al.
Published: (2024)
by: Liang, Yile, et al.
Published: (2024)
Knowing When to Ask: Segment-Level Credit Assignment for LLM Tool Use
by: Kumar, Abhijit, et al.
Published: (2026)
by: Kumar, Abhijit, et al.
Published: (2026)
Reasoning Models Know When They're Right: Probing Hidden States for Self-Verification
by: Zhang, Anqi, et al.
Published: (2025)
by: Zhang, Anqi, et al.
Published: (2025)
OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning
by: Li, Yu, et al.
Published: (2026)
by: Li, Yu, et al.
Published: (2026)
Credit Assignment with Resets in Language Model Reasoning
by: Samanta, Ankur, et al.
Published: (2026)
by: Samanta, Ankur, et al.
Published: (2026)
VoiceAgentEval: A Dual-Dimensional Benchmark for Expert-Level Intelligent Voice-Agent Evaluation of Xbench's Professional-Aligned Series
by: Xu, Pengyu, et al.
Published: (2025)
by: Xu, Pengyu, et al.
Published: (2025)
InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning
by: Yang, Matthew Y. R., et al.
Published: (2026)
by: Yang, Matthew Y. R., et al.
Published: (2026)
Where Does Reasoning Break? Step-Level Hallucination Detection via Hidden-State Transport Geometry
by: Alvarez, Tyler, et al.
Published: (2026)
by: Alvarez, Tyler, et al.
Published: (2026)
GRPO-$λ$: Credit Assignment improves LLM Reasoning
by: Parthasarathi, Prasanna, et al.
Published: (2025)
by: Parthasarathi, Prasanna, et al.
Published: (2025)
Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation
by: Lv, Jiaming, et al.
Published: (2024)
by: Lv, Jiaming, et al.
Published: (2024)
RTMC: Step-Level Credit Assignment via Rollout Trees
by: Wang, Tao, et al.
Published: (2026)
by: Wang, Tao, et al.
Published: (2026)
Wasserstein Distance-Weighted Adversarial Network for Cross-Domain Credit Risk Assessment
by: Jiang, Mohan, et al.
Published: (2024)
by: Jiang, Mohan, et al.
Published: (2024)
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
by: Ding, Fei, et al.
Published: (2026)
by: Ding, Fei, et al.
Published: (2026)
Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories
by: Wang, Jiaming, et al.
Published: (2026)
by: Wang, Jiaming, et al.
Published: (2026)
Fast Gradient Computation for Gromov-Wasserstein Distance
by: Zhang, Wei, et al.
Published: (2024)
by: Zhang, Wei, et al.
Published: (2024)
Asynchronous Credit Assignment for Multi-Agent Reinforcement Learning
by: Liang, Yongheng, et al.
Published: (2024)
by: Liang, Yongheng, et al.
Published: (2024)
An Explicit Syllogistic Legal Reasoning Framework for Large Language Models
by: Zhang, Kepu, et al.
Published: (2025)
by: Zhang, Kepu, et al.
Published: (2025)
CAPO: Towards Enhancing LLM Reasoning through Generative Credit Assignment
by: Xie, Guofu, et al.
Published: (2025)
by: Xie, Guofu, et al.
Published: (2025)
Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking
by: He, Zhida, et al.
Published: (2026)
by: He, Zhida, et al.
Published: (2026)
PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning
by: Liu, Dongyi, et al.
Published: (2026)
by: Liu, Dongyi, et al.
Published: (2026)
Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization
by: Khandoga, Mykola, et al.
Published: (2026)
by: Khandoga, Mykola, et al.
Published: (2026)
CAVE: A Structured Credit Assignment Approach for Fragmented Visual Evidence Reasoning
by: Guo, Tengda, et al.
Published: (2026)
by: Guo, Tengda, et al.
Published: (2026)
From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models
by: Zhang, Chenchen
Published: (2026)
by: Zhang, Chenchen
Published: (2026)
Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning
by: Li, Ziheng, et al.
Published: (2026)
by: Li, Ziheng, et al.
Published: (2026)
Diffusion of Neuromodulators for Temporal Credit Assignment
by: Barretto-Bittar, João, et al.
Published: (2026)
by: Barretto-Bittar, João, et al.
Published: (2026)
In-Context Credit Assignment via the Core
by: Harris, Keegan, et al.
Published: (2026)
by: Harris, Keegan, et al.
Published: (2026)
Masked AutoEncoder for Graph Clustering without Pre-defined Cluster Number k
by: Ma, Yuanchi, et al.
Published: (2024)
by: Ma, Yuanchi, et al.
Published: (2024)
AMR-SD: Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignment
by: Wei, Zhenlin, et al.
Published: (2026)
by: Wei, Zhenlin, et al.
Published: (2026)
Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without Verifiers
by: Hu, Senkang, et al.
Published: (2026)
by: Hu, Senkang, et al.
Published: (2026)
Similar Items
-
From Absolute to Relative: Rethinking Reward Shaping in Group-Based Reinforcement Learning
by: Niu, Wenzhe, et al.
Published: (2026) -
LTS-VoiceAgent: A Listen-Think-Speak Framework for Efficient Streaming Voice Interaction via Semantic Triggering and Incremental Reasoning
by: Zou, Wenhao, et al.
Published: (2026) -
GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR
by: Zhang, Jiaying, et al.
Published: (2026) -
Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
by: Liu, Yan, et al.
Published: (2026) -
Long-term Task-oriented Agent: Proactive Long-term Intent Maintenance in Dynamic Environments
by: Shi, Qinglong, et al.
Published: (2026)