Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Xinzhu, He, Wei, Fan, Huichuan, Niu, Wenzhe, Sun, Zhongxiang, Wang, Xuanru, Gao, Jiuchong, Hao, Jinghua, He, Renqing, Yu, Weijie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
From Absolute to Relative: Rethinking Reward Shaping in Group-Based Reinforcement Learning
por: Niu, Wenzhe, et al.
Publicado: (2026)
por: Niu, Wenzhe, et al.
Publicado: (2026)
LTS-VoiceAgent: A Listen-Think-Speak Framework for Efficient Streaming Voice Interaction via Semantic Triggering and Incremental Reasoning
por: Zou, Wenhao, et al.
Publicado: (2026)
por: Zou, Wenhao, et al.
Publicado: (2026)
GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR
por: Zhang, Jiaying, et al.
Publicado: (2026)
por: Zhang, Jiaying, et al.
Publicado: (2026)
Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
por: Liu, Yan, et al.
Publicado: (2026)
por: Liu, Yan, et al.
Publicado: (2026)
Long-term Task-oriented Agent: Proactive Long-term Intent Maintenance in Dynamic Environments
por: Shi, Qinglong, et al.
Publicado: (2026)
por: Shi, Qinglong, et al.
Publicado: (2026)
MUSE: Multi-Domain Chinese User Simulation via Self-Evolving Profiles and Rubric-Guided Alignment
por: Liu, Zihao, et al.
Publicado: (2026)
por: Liu, Zihao, et al.
Publicado: (2026)
Silence the Judge: Reinforcement Learning with Self-Verifier via Latent Geometric Clustering
por: Zhang, Nonghai, et al.
Publicado: (2026)
por: Zhang, Nonghai, et al.
Publicado: (2026)
UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning
por: Zhang, Feng, et al.
Publicado: (2026)
por: Zhang, Feng, et al.
Publicado: (2026)
Beyond High-Entropy Exploration: Correctness-Aware Low-Entropy Segment-Based Advantage Shaping for Reasoning LLMs
por: Chen, Xinzhu, et al.
Publicado: (2025)
por: Chen, Xinzhu, et al.
Publicado: (2025)
State Rank Dynamics in Linear Attention LLMs
por: Sun, Ao, et al.
Publicado: (2026)
por: Sun, Ao, et al.
Publicado: (2026)
Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management
por: Ma, Weitao, et al.
Publicado: (2026)
por: Ma, Weitao, et al.
Publicado: (2026)
Harvesting Efficient On-Demand Order Pooling from Skilled Couriers: Enhancing Graph Representation Learning for Refining Real-time Many-to-One Assignments
por: Liang, Yile, et al.
Publicado: (2024)
por: Liang, Yile, et al.
Publicado: (2024)
Knowing When to Ask: Segment-Level Credit Assignment for LLM Tool Use
por: Kumar, Abhijit, et al.
Publicado: (2026)
por: Kumar, Abhijit, et al.
Publicado: (2026)
Reasoning Models Know When They're Right: Probing Hidden States for Self-Verification
por: Zhang, Anqi, et al.
Publicado: (2025)
por: Zhang, Anqi, et al.
Publicado: (2025)
OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning
por: Li, Yu, et al.
Publicado: (2026)
por: Li, Yu, et al.
Publicado: (2026)
Credit Assignment with Resets in Language Model Reasoning
por: Samanta, Ankur, et al.
Publicado: (2026)
por: Samanta, Ankur, et al.
Publicado: (2026)
VoiceAgentEval: A Dual-Dimensional Benchmark for Expert-Level Intelligent Voice-Agent Evaluation of Xbench's Professional-Aligned Series
por: Xu, Pengyu, et al.
Publicado: (2025)
por: Xu, Pengyu, et al.
Publicado: (2025)
InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning
por: Yang, Matthew Y. R., et al.
Publicado: (2026)
por: Yang, Matthew Y. R., et al.
Publicado: (2026)
Where Does Reasoning Break? Step-Level Hallucination Detection via Hidden-State Transport Geometry
por: Alvarez, Tyler, et al.
Publicado: (2026)
por: Alvarez, Tyler, et al.
Publicado: (2026)
GRPO-$λ$: Credit Assignment improves LLM Reasoning
por: Parthasarathi, Prasanna, et al.
Publicado: (2025)
por: Parthasarathi, Prasanna, et al.
Publicado: (2025)
Wasserstein Distance Rivals Kullback-Leibler Divergence for Knowledge Distillation
por: Lv, Jiaming, et al.
Publicado: (2024)
por: Lv, Jiaming, et al.
Publicado: (2024)
RTMC: Step-Level Credit Assignment via Rollout Trees
por: Wang, Tao, et al.
Publicado: (2026)
por: Wang, Tao, et al.
Publicado: (2026)
Wasserstein Distance-Weighted Adversarial Network for Cross-Domain Credit Risk Assessment
por: Jiang, Mohan, et al.
Publicado: (2024)
por: Jiang, Mohan, et al.
Publicado: (2024)
Reducing Credit Assignment Variance via Counterfactual Reasoning Paths
por: Ding, Fei, et al.
Publicado: (2026)
por: Ding, Fei, et al.
Publicado: (2026)
Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories
por: Wang, Jiaming, et al.
Publicado: (2026)
por: Wang, Jiaming, et al.
Publicado: (2026)
Fast Gradient Computation for Gromov-Wasserstein Distance
por: Zhang, Wei, et al.
Publicado: (2024)
por: Zhang, Wei, et al.
Publicado: (2024)
Asynchronous Credit Assignment for Multi-Agent Reinforcement Learning
por: Liang, Yongheng, et al.
Publicado: (2024)
por: Liang, Yongheng, et al.
Publicado: (2024)
An Explicit Syllogistic Legal Reasoning Framework for Large Language Models
por: Zhang, Kepu, et al.
Publicado: (2025)
por: Zhang, Kepu, et al.
Publicado: (2025)
CAPO: Towards Enhancing LLM Reasoning through Generative Credit Assignment
por: Xie, Guofu, et al.
Publicado: (2025)
por: Xie, Guofu, et al.
Publicado: (2025)
Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking
por: He, Zhida, et al.
Publicado: (2026)
por: He, Zhida, et al.
Publicado: (2026)
PiCA: Pivot-Based Credit Assignment for Search Agentic Reinforcement Learning
por: Liu, Dongyi, et al.
Publicado: (2026)
por: Liu, Dongyi, et al.
Publicado: (2026)
Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization
por: Khandoga, Mykola, et al.
Publicado: (2026)
por: Khandoga, Mykola, et al.
Publicado: (2026)
CAVE: A Structured Credit Assignment Approach for Fragmented Visual Evidence Reasoning
por: Guo, Tengda, et al.
Publicado: (2026)
por: Guo, Tengda, et al.
Publicado: (2026)
From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models
por: Zhang, Chenchen
Publicado: (2026)
por: Zhang, Chenchen
Publicado: (2026)
Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning
por: Li, Ziheng, et al.
Publicado: (2026)
por: Li, Ziheng, et al.
Publicado: (2026)
Diffusion of Neuromodulators for Temporal Credit Assignment
por: Barretto-Bittar, João, et al.
Publicado: (2026)
por: Barretto-Bittar, João, et al.
Publicado: (2026)
In-Context Credit Assignment via the Core
por: Harris, Keegan, et al.
Publicado: (2026)
por: Harris, Keegan, et al.
Publicado: (2026)
Masked AutoEncoder for Graph Clustering without Pre-defined Cluster Number k
por: Ma, Yuanchi, et al.
Publicado: (2024)
por: Ma, Yuanchi, et al.
Publicado: (2024)
AMR-SD: Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignment
por: Wei, Zhenlin, et al.
Publicado: (2026)
por: Wei, Zhenlin, et al.
Publicado: (2026)
Self-Induced Outcome Potential: Turn-Level Credit Assignment for Agents without Verifiers
por: Hu, Senkang, et al.
Publicado: (2026)
por: Hu, Senkang, et al.
Publicado: (2026)
Ejemplares similares
-
From Absolute to Relative: Rethinking Reward Shaping in Group-Based Reinforcement Learning
por: Niu, Wenzhe, et al.
Publicado: (2026) -
LTS-VoiceAgent: A Listen-Think-Speak Framework for Efficient Streaming Voice Interaction via Semantic Triggering and Incremental Reasoning
por: Zou, Wenhao, et al.
Publicado: (2026) -
GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR
por: Zhang, Jiaying, et al.
Publicado: (2026) -
Efficient Paths and Dense Rewards: Probabilistic Flow Reasoning for Large Language Models
por: Liu, Yan, et al.
Publicado: (2026) -
Long-term Task-oriented Agent: Proactive Long-term Intent Maintenance in Dynamic Environments
por: Shi, Qinglong, et al.
Publicado: (2026)