Generalized Policy Gradient with History-Aware Decision Transformer for Reliable Routing over Graph Signals
Fuente:
arXiv
Guardado en:
| Autores principales: | Wei, Xing, Wang, Yuanhang, Zhao, Duoxiang, Zhang, Zezhou, Qin, Hao, Ouyang, Yuqi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Graph-Aware Diffusion for Signal Generation
por: Rozada, Sergio, et al.
Publicado: (2025)
por: Rozada, Sergio, et al.
Publicado: (2025)
Policy Gradient for Robust Markov Decision Processes
por: Wang, Qiuhao, et al.
Publicado: (2024)
por: Wang, Qiuhao, et al.
Publicado: (2024)
GPG: Generalized Policy Gradient Theorem for Transformer-based Policies
por: Mao, Hangyu, et al.
Publicado: (2025)
por: Mao, Hangyu, et al.
Publicado: (2025)
Adjusting the Output of Decision Transformer with Action Gradient
por: Lin, Rui, et al.
Publicado: (2025)
por: Lin, Rui, et al.
Publicado: (2025)
MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning
por: Fu, Xiaoliang, et al.
Publicado: (2026)
por: Fu, Xiaoliang, et al.
Publicado: (2026)
Uncertainty-Aware Decision Transformer for Stochastic Driving Environments
por: Li, Zenan, et al.
Publicado: (2023)
por: Li, Zenan, et al.
Publicado: (2023)
Is Your Explanation Reliable: Confidence-Aware Explanation on Graph Neural Networks
por: Zhang, Jiaxing, et al.
Publicado: (2025)
por: Zhang, Jiaxing, et al.
Publicado: (2025)
Online Finetuning Decision Transformers with Pure RL Gradients
por: Luo, Junkai, et al.
Publicado: (2026)
por: Luo, Junkai, et al.
Publicado: (2026)
Learning General Policies with Policy Gradient Methods
por: Ståhlberg, Simon, et al.
Publicado: (2025)
por: Ståhlberg, Simon, et al.
Publicado: (2025)
Reinforcement Learning Gradients as Vitamin for Online Finetuning Decision Transformers
por: Yan, Kai, et al.
Publicado: (2024)
por: Yan, Kai, et al.
Publicado: (2024)
RACER: Risk-Aware Calibrated Efficient Routing for Large Language Models
por: Hao, Sai, et al.
Publicado: (2026)
por: Hao, Sai, et al.
Publicado: (2026)
TRACE: Distilling Where It Matters via Token-Routed Self On-Policy Alignment
por: Wang, Jiaxuan, et al.
Publicado: (2026)
por: Wang, Jiaxuan, et al.
Publicado: (2026)
Signal-Adaptive Trust Regions for Gradient-Free Optimization of Recurrent Spiking Neural Networks
por: Li, Jinhao, et al.
Publicado: (2026)
por: Li, Jinhao, et al.
Publicado: (2026)
Learning Spatio-Temporal Dynamics for Trajectory Recovery via Time-Aware Transformer
por: Sun, Tian, et al.
Publicado: (2025)
por: Sun, Tian, et al.
Publicado: (2025)
Do Transformer World Models Give Better Policy Gradients?
por: Ma, Michel, et al.
Publicado: (2024)
por: Ma, Michel, et al.
Publicado: (2024)
Solving Robust Markov Decision Processes: Generic, Reliable, Efficient
por: Meggendorfer, Tobias, et al.
Publicado: (2024)
por: Meggendorfer, Tobias, et al.
Publicado: (2024)
Policy Gradient Algorithms with Monte Carlo Tree Learning for Non-Markov Decision Processes
por: Morimura, Tetsuro, et al.
Publicado: (2022)
por: Morimura, Tetsuro, et al.
Publicado: (2022)
SeqRoute: Global Budget-Aware Sequential LLM Routing via Offline Reinforcement Learning
por: Xu, Zhongling, et al.
Publicado: (2026)
por: Xu, Zhongling, et al.
Publicado: (2026)
Gradient Routing: Masking Gradients to Localize Computation in Neural Networks
por: Cloud, Alex, et al.
Publicado: (2024)
por: Cloud, Alex, et al.
Publicado: (2024)
Data Fusion-Enhanced Decision Transformer for Stable Cross-Domain Generalization
por: Wang, Guojian, et al.
Publicado: (2025)
por: Wang, Guojian, et al.
Publicado: (2025)
Input Domain Aware MoE: Decoupling Routing Decisions from Task Optimization in Mixture of Experts
por: Hua, Yongxiang, et al.
Publicado: (2025)
por: Hua, Yongxiang, et al.
Publicado: (2025)
GraphGPT: Generative Pre-trained Graph Eulerian Transformer
por: Zhao, Qifang, et al.
Publicado: (2023)
por: Zhao, Qifang, et al.
Publicado: (2023)
Validated Intent Compilation for Constrained Routing in LEO Mega-Constellations
por: Li, Yuanhang
Publicado: (2026)
por: Li, Yuanhang
Publicado: (2026)
Regret Analysis of Policy Gradient Algorithm for Infinite Horizon Average Reward Markov Decision Processes
por: Bai, Qinbo, et al.
Publicado: (2023)
por: Bai, Qinbo, et al.
Publicado: (2023)
Physics-Guided Tiny-Mamba Transformer for Reliability-Aware Early Fault Warning
por: Li, Changyu, et al.
Publicado: (2026)
por: Li, Changyu, et al.
Publicado: (2026)
Directional Routing in Transformers
por: Taylor, Kevin
Publicado: (2026)
por: Taylor, Kevin
Publicado: (2026)
Complexity-Aware Deep Symbolic Regression with Robust Risk-Seeking Policy Gradients
por: Bastiani, Zachary, et al.
Publicado: (2024)
por: Bastiani, Zachary, et al.
Publicado: (2024)
Improved Sample Complexity Analysis of Natural Policy Gradient Algorithm with General Parameterization for Infinite Horizon Discounted Reward Markov Decision Processes
por: Mondal, Washim Uddin, et al.
Publicado: (2023)
por: Mondal, Washim Uddin, et al.
Publicado: (2023)
Retrieval-Aware Distillation for Transformer-SSM Hybrids
por: Bick, Aviv, et al.
Publicado: (2026)
por: Bick, Aviv, et al.
Publicado: (2026)
RouteHijack: Routing-Aware Attack on Mixture-of-Experts LLMs
por: Xu, Zhiyuan, et al.
Publicado: (2026)
por: Xu, Zhiyuan, et al.
Publicado: (2026)
Distance-Misaligned Training in Graph Transformers and Adaptive Graph-Aware Control
por: Hou, Qinhan, et al.
Publicado: (2026)
por: Hou, Qinhan, et al.
Publicado: (2026)
PR-CapsNet: Pseudo-Riemannian Capsule Network with Adaptive Curvature Routing for Graph Learning
por: Qin, Ye, et al.
Publicado: (2025)
por: Qin, Ye, et al.
Publicado: (2025)
The Devil Is in Gradient Entanglement: Energy-Aware Gradient Coordinator for Robust Generalized Category Discovery
por: Zheng, Haiyang, et al.
Publicado: (2026)
por: Zheng, Haiyang, et al.
Publicado: (2026)
Discrepancy-Aware Graph Mask Auto-Encoder
por: Zheng, Ziyu, et al.
Publicado: (2025)
por: Zheng, Ziyu, et al.
Publicado: (2025)
Uncertainty-Aware Gradient Signal-to-Noise Data Selection for Instruction Tuning
por: Yuan, Zhihang, et al.
Publicado: (2026)
por: Yuan, Zhihang, et al.
Publicado: (2026)
ImaginationPolicy: Towards Generalizable, Precise and Reliable End-to-End Policy for Robotic Manipulation
por: Lu, Dekun, et al.
Publicado: (2025)
por: Lu, Dekun, et al.
Publicado: (2025)
Task-Aware Harmony Multi-Task Decision Transformer for Offline Reinforcement Learning
por: Fan, Ziqing, et al.
Publicado: (2024)
por: Fan, Ziqing, et al.
Publicado: (2024)
Randomized Advantage Transformation (RAT): Computing Natural Policy Gradients via Direct Backpropagation
por: Sun, Mingfei
Publicado: (2026)
por: Sun, Mingfei
Publicado: (2026)
From Imperfect Signals to Trustworthy Structure: Confidence-Aware Inference from Heterogeneous and Reliability-Varying Utility Data
por: Li, Haoran, et al.
Publicado: (2025)
por: Li, Haoran, et al.
Publicado: (2025)
One Router to Route Them All: Homogeneous Expert Routing for Heterogeneous Graph Transformers
por: Shakirov, Georgiy, et al.
Publicado: (2025)
por: Shakirov, Georgiy, et al.
Publicado: (2025)
Ejemplares similares
-
Graph-Aware Diffusion for Signal Generation
por: Rozada, Sergio, et al.
Publicado: (2025) -
Policy Gradient for Robust Markov Decision Processes
por: Wang, Qiuhao, et al.
Publicado: (2024) -
GPG: Generalized Policy Gradient Theorem for Transformer-based Policies
por: Mao, Hangyu, et al.
Publicado: (2025) -
Adjusting the Output of Decision Transformer with Action Gradient
por: Lin, Rui, et al.
Publicado: (2025) -
MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning
por: Fu, Xiaoliang, et al.
Publicado: (2026)