Policy Dispersion in Non-Markovian Environment
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qu, Bohao, Cao, Xiaofeng, Yang, Jielong, Chen, Hechang, Yi, Chang, Tsang, Ivor W., Ong, Yew-Soon |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Flow-Direct: Feedback-Efficient and Reusable Guidance for Flow Models via Non-Parametric Guidance Field
par: Tan, Kim Yong, et autres
Publié: (2026)
par: Tan, Kim Yong, et autres
Publié: (2026)
Transductive Reward Inference on Graph
par: Qu, Bohao, et autres
Publié: (2024)
par: Qu, Bohao, et autres
Publié: (2024)
Fast Direct: Query-Efficient Online Black-box Guidance for Diffusion-model Target Generation
par: Tan, Kim Yong, et autres
Publié: (2025)
par: Tan, Kim Yong, et autres
Publié: (2025)
Distributional Multi-objective Black-box Optimization for Diffusion-model Inference-time Multi-Target Generation
par: Tan, Kim Yong, et autres
Publié: (2025)
par: Tan, Kim Yong, et autres
Publié: (2025)
Diversifying Policy Behaviors with Extrinsic Behavioral Curiosity
par: Wan, Zhenglin, et autres
Publié: (2024)
par: Wan, Zhenglin, et autres
Publié: (2024)
Lang-PINN: From Language to Physics-Informed Neural Networks via a Multi-Agent Framework
par: He, Xin, et autres
Publié: (2025)
par: He, Xin, et autres
Publié: (2025)
Analytical Survey of Learning with Low-Resource Data: From Analysis to Investigation
par: Cao, Xiaofeng, et autres
Publié: (2025)
par: Cao, Xiaofeng, et autres
Publié: (2025)
RouteMark: A Fingerprint for Intellectual Property Attribution in Routing-based Model Merging
par: He, Xin, et autres
Publié: (2025)
par: He, Xin, et autres
Publié: (2025)
Position Paper: Rethinking Privacy in RL for Sequential Decision-making in the Age of LLMs
par: Fan, Flint Xiaofeng, et autres
Publié: (2025)
par: Fan, Flint Xiaofeng, et autres
Publié: (2025)
Learning with Foresight: Enhancing Neural Routing Policy via Multi-Node Lookahead Prediction
par: Jiang, Xia, et autres
Publié: (2026)
par: Jiang, Xia, et autres
Publié: (2026)
FedRLHF: A Convergence-Guaranteed Federated Framework for Privacy-Preserving and Personalized RLHF
par: Fan, Flint Xiaofeng, et autres
Publié: (2024)
par: Fan, Flint Xiaofeng, et autres
Publié: (2024)
A Continuous Encoding-Based Representation for Efficient Multi-Fidelity Multi-Objective Neural Architecture Search
par: Wei, Zhao, et autres
Publié: (2025)
par: Wei, Zhao, et autres
Publié: (2025)
Towards Harmless Rawlsian Fairness Regardless of Demographic Prior
par: Wang, Xuanqian, et autres
Publié: (2024)
par: Wang, Xuanqian, et autres
Publié: (2024)
Covariance-Adaptive Sequential Black-box Optimization for Diffusion Targeted Generation
par: Lyu, Yueming, et autres
Publié: (2024)
par: Lyu, Yueming, et autres
Publié: (2024)
Information Fidelity in Tool-Using LLM Agents: A Martingale Analysis of the Model Context Protocol
par: Fan, Flint Xiaofeng, et autres
Publié: (2026)
par: Fan, Flint Xiaofeng, et autres
Publié: (2026)
Automated Large-scale CVRP Solver Design via LLM-assisted Flexible MCTS
par: Guo, Tong, et autres
Publié: (2026)
par: Guo, Tong, et autres
Publié: (2026)
SiamNAS: Siamese Surrogate Model for Dominance Relation Prediction in Multi-objective Neural Architecture Search
par: Zhou, Yuyang, et autres
Publié: (2025)
par: Zhou, Yuyang, et autres
Publié: (2025)
Possibilistic Predictive Uncertainty for Deep Learning
par: Ni, Yao, et autres
Publié: (2026)
par: Ni, Yao, et autres
Publié: (2026)
Uncertain Multi-Objective Recommendation via Orthogonal Meta-Learning Enhanced Bayesian Optimization
par: Wang, Hongxu, et autres
Publié: (2025)
par: Wang, Hongxu, et autres
Publié: (2025)
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
par: Hu, Jifeng, et autres
Publié: (2025)
par: Hu, Jifeng, et autres
Publié: (2025)
Multi-Task Learning with Multi-Task Optimization
par: Bai, Lu, et autres
Publié: (2024)
par: Bai, Lu, et autres
Publié: (2024)
Decision Flow Policy Optimization
par: Hu, Jifeng, et autres
Publié: (2025)
par: Hu, Jifeng, et autres
Publié: (2025)
Towards Trustworthy Vital Sign Forecasting: Leveraging Uncertainty for Prediction Intervals
par: Wang, Li Rong, et autres
Publié: (2025)
par: Wang, Li Rong, et autres
Publié: (2025)
Policy Gradient Methods for Non-Markovian Reinforcement Learning
par: Kar, Avik, et autres
Publié: (2026)
par: Kar, Avik, et autres
Publié: (2026)
Scalable Structure Learning of Bayesian Networks by Learning Algorithm Ensembles
par: Liu, Shengcai, et autres
Publié: (2025)
par: Liu, Shengcai, et autres
Publié: (2025)
Hierarchically Robust Zero-shot Vision-language Models
par: Dong, Junhao, et autres
Publié: (2026)
par: Dong, Junhao, et autres
Publié: (2026)
SIG: Efficient Self-Interpretable Graph Neural Network for Continuous-time Dynamic Graphs
par: Fang, Lanting, et autres
Publié: (2024)
par: Fang, Lanting, et autres
Publié: (2024)
Dockformer: A transformer-based molecular docking paradigm for large-scale virtual screening
par: Yang, Zhangfan, et autres
Publié: (2024)
par: Yang, Zhangfan, et autres
Publié: (2024)
Mastering Continual Reinforcement Learning through Fine-Grained Sparse Network Allocation and Dormant Neuron Exploration
par: Zheng, Chengqi, et autres
Publié: (2025)
par: Zheng, Chengqi, et autres
Publié: (2025)
Voronoi-grid-based Pareto Front Learning and Its Application to Collaborative Federated Learning
par: Chen, Mengmeng, et autres
Publié: (2025)
par: Chen, Mengmeng, et autres
Publié: (2025)
Beyond Sliding Windows: Learning to Manage Memory in Non-Markovian Environments
par: Tasse, Geraud Nangue, et autres
Publié: (2025)
par: Tasse, Geraud Nangue, et autres
Publié: (2025)
Out-of-Distribution Generalization for Neural Physics Solvers
par: Wei, Zhao, et autres
Publié: (2026)
par: Wei, Zhao, et autres
Publié: (2026)
An Agentic Framework with LLMs for Solving Complex Vehicle Routing Problems
par: Zhang, Ni, et autres
Publié: (2025)
par: Zhang, Ni, et autres
Publié: (2025)
VPWEM: Non-Markovian Visuomotor Policy with Working and Episodic Memory
par: Lei, Yuheng, et autres
Publié: (2026)
par: Lei, Yuheng, et autres
Publié: (2026)
Beyond-Expert Performance with Limited Demonstrations: Efficient Imitation Learning with Double Exploration
par: Zhao, Heyang, et autres
Publié: (2025)
par: Zhao, Heyang, et autres
Publié: (2025)
MosaicFusion: Diffusion Models as Data Augmenters for Large Vocabulary Instance Segmentation
par: Xie, Jiahao, et autres
Publié: (2023)
par: Xie, Jiahao, et autres
Publié: (2023)
Benchmarking Data Heterogeneity Evaluation Approaches for Personalized Federated Learning
par: Li, Zhilong, et autres
Publié: (2024)
par: Li, Zhilong, et autres
Publié: (2024)
Where to Move Next: Zero-shot Generalization of LLMs for Next POI Recommendation
par: Feng, Shanshan, et autres
Publié: (2024)
par: Feng, Shanshan, et autres
Publié: (2024)
CASCADE: Case-Based Continual Adaptation for Large Language Models During Deployment
par: Guo, Siyuan, et autres
Publié: (2026)
par: Guo, Siyuan, et autres
Publié: (2026)
Learning Structurally Stabilized Representations for Multi-modal Lossless DNA Storage
par: Cao, Ben, et autres
Publié: (2024)
par: Cao, Ben, et autres
Publié: (2024)
Documents similaires
-
Flow-Direct: Feedback-Efficient and Reusable Guidance for Flow Models via Non-Parametric Guidance Field
par: Tan, Kim Yong, et autres
Publié: (2026) -
Transductive Reward Inference on Graph
par: Qu, Bohao, et autres
Publié: (2024) -
Fast Direct: Query-Efficient Online Black-box Guidance for Diffusion-model Target Generation
par: Tan, Kim Yong, et autres
Publié: (2025) -
Distributional Multi-objective Black-box Optimization for Diffusion-model Inference-time Multi-Target Generation
par: Tan, Kim Yong, et autres
Publié: (2025) -
Diversifying Policy Behaviors with Extrinsic Behavioral Curiosity
par: Wan, Zhenglin, et autres
Publié: (2024)