SHARP: A Self-Evolving Human-Auditable Rubric Policy for Financial Trading Agents
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Xiwen, Zhu, Wenhui, Zheng, Songzhu, Rasul, Kashif, Deng, Yueyue, Li, Huayu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Forecasting with Hyper-Trees
por: März, Alexander, et al.
Publicado: (2024)
por: März, Alexander, et al.
Publicado: (2024)
AlphaLab: Autonomous Multi-Agent Research Across Optimization Domains with Frontier LLMs
por: Hogan, Brendan R., et al.
Publicado: (2026)
por: Hogan, Brendan R., et al.
Publicado: (2026)
Reinforcing Chain-of-Thought Reasoning with Self-Evolving Rubrics
por: Sheng, Leheng, et al.
Publicado: (2026)
por: Sheng, Leheng, et al.
Publicado: (2026)
TimeMIL: Advancing Multivariate Time Series Classification via a Time-aware Multiple Instance Learning
por: Chen, Xiwen, et al.
Publicado: (2024)
por: Chen, Xiwen, et al.
Publicado: (2024)
Sequence Complementor: Complementing Transformers For Time Series Forecasting with Learnable Sequences
por: Chen, Xiwen, et al.
Publicado: (2025)
por: Chen, Xiwen, et al.
Publicado: (2025)
Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization
por: Rojas, Kevin, et al.
Publicado: (2025)
por: Rojas, Kevin, et al.
Publicado: (2025)
APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents
por: Li, Yibo, et al.
Publicado: (2026)
por: Li, Yibo, et al.
Publicado: (2026)
FIC-TSC: Learning Time Series Classification with Fisher Information Constraint
por: Chen, Xiwen, et al.
Publicado: (2025)
por: Chen, Xiwen, et al.
Publicado: (2025)
Self-Consolidation for Self-Evolving Agents
por: Yu, Hongzhuo, et al.
Publicado: (2026)
por: Yu, Hongzhuo, et al.
Publicado: (2026)
Knowledge Distillation Under Ideal Joint Classifier Assumption
por: Li, Huayu, et al.
Publicado: (2023)
por: Li, Huayu, et al.
Publicado: (2023)
Recurrent Interpolants for Probabilistic Time Series Prediction
por: Chen, Yu, et al.
Publicado: (2024)
por: Chen, Yu, et al.
Publicado: (2024)
RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
por: Li, Gaotang, et al.
Publicado: (2026)
por: Li, Gaotang, et al.
Publicado: (2026)
Learning Fingerprints for Medical Time Series with Redundancy-Constrained Information Maximization
por: Li, Huayu, et al.
Publicado: (2026)
por: Li, Huayu, et al.
Publicado: (2026)
MTS-LOF: Medical Time-Series Representation Learning via Occlusion-Invariant Features
por: Li, Huayu, et al.
Publicado: (2023)
por: Li, Huayu, et al.
Publicado: (2023)
SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents
por: Feng, Xinshun, et al.
Publicado: (2026)
por: Feng, Xinshun, et al.
Publicado: (2026)
ORCE: Order-Aware Alignment of Verbalized Confidence in Large Language Models
por: Li, Chen, et al.
Publicado: (2026)
por: Li, Chen, et al.
Publicado: (2026)
DRA-GRPO: Your GRPO Needs to Know Diverse Reasoning Paths for Mathematical Reasoning
por: Chen, Xiwen, et al.
Publicado: (2025)
por: Chen, Xiwen, et al.
Publicado: (2025)
AgentEvolver: Towards Efficient Self-Evolving Agent System
por: Zhai, Yunpeng, et al.
Publicado: (2025)
por: Zhai, Yunpeng, et al.
Publicado: (2025)
Proximal Point Nash Learning from Human Feedback
por: Tiapkin, Daniil, et al.
Publicado: (2025)
por: Tiapkin, Daniil, et al.
Publicado: (2025)
Context Pruning for Coding Agents via Multi-Rubric Latent Reasoning
por: Wang, Jingjing, et al.
Publicado: (2026)
por: Wang, Jingjing, et al.
Publicado: (2026)
Score Regularized Policy Optimization through Diffusion Behavior
por: Chen, Huayu, et al.
Publicado: (2023)
por: Chen, Huayu, et al.
Publicado: (2023)
PolicyEvol-Agent: Evolving Policy via Environment Perception and Self-Awareness with Theory of Mind
por: Yu, Yajie, et al.
Publicado: (2025)
por: Yu, Yajie, et al.
Publicado: (2025)
Dynamic Mixture of Latent Memories for Self-Evolving Agents
por: Yu, Dianzhi, et al.
Publicado: (2026)
por: Yu, Dianzhi, et al.
Publicado: (2026)
Diving into Self-Evolving Training for Multimodal Reasoning
por: Liu, Wei, et al.
Publicado: (2024)
por: Liu, Wei, et al.
Publicado: (2024)
Agentic Rubrics as Contextual Verifiers for SWE Agents
por: Raghavendra, Mohit, et al.
Publicado: (2026)
por: Raghavendra, Mohit, et al.
Publicado: (2026)
AriadneMem: Threading the Maze of Lifelong Memory for LLM Agents
por: Zhu, Wenhui, et al.
Publicado: (2026)
por: Zhu, Wenhui, et al.
Publicado: (2026)
EvolveMem:Self-Evolving Memory Architecture via AutoResearch for LLM Agents
por: Liu, Jiaqi, et al.
Publicado: (2026)
por: Liu, Jiaqi, et al.
Publicado: (2026)
DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research
por: Shao, Rulin, et al.
Publicado: (2025)
por: Shao, Rulin, et al.
Publicado: (2025)
SODA: Semi On-Policy Black-Box Distillation for Large Language Models
por: Chen, Xiwen, et al.
Publicado: (2026)
por: Chen, Xiwen, et al.
Publicado: (2026)
Aligning Diffusion Behaviors with Q-functions for Efficient Continuous Control
por: Chen, Huayu, et al.
Publicado: (2024)
por: Chen, Huayu, et al.
Publicado: (2024)
Enhancing Graph Neural Networks in Large-scale Traffic Incident Analysis with Concurrency Hypothesis
por: Chen, Xiwen, et al.
Publicado: (2024)
por: Chen, Xiwen, et al.
Publicado: (2024)
ResearchRubrics: A Benchmark of Prompts and Rubrics For Evaluating Deep Research Agents
por: Sharma, Manasi, et al.
Publicado: (2025)
por: Sharma, Manasi, et al.
Publicado: (2025)
One-Way Policy Optimization for Self-Evolving LLMs
por: Yang, Shuo, et al.
Publicado: (2026)
por: Yang, Shuo, et al.
Publicado: (2026)
Symbolic Learning Enables Self-Evolving Agents
por: Zhou, Wangchunshu, et al.
Publicado: (2024)
por: Zhou, Wangchunshu, et al.
Publicado: (2024)
Co-Evolving Policy Distillation
por: Gu, Naibin, et al.
Publicado: (2026)
por: Gu, Naibin, et al.
Publicado: (2026)
The N+ Implementation Details of RLHF with PPO: A Case Study on TL;DR Summarization
por: Huang, Shengyi, et al.
Publicado: (2024)
por: Huang, Shengyi, et al.
Publicado: (2024)
Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents
por: Huang, Jiawei, et al.
Publicado: (2026)
por: Huang, Jiawei, et al.
Publicado: (2026)
PDE-SHARP: PDE Solver Hybrids through Analysis and Refinement Passes
por: Fazliani, Shaghayegh, et al.
Publicado: (2025)
por: Fazliani, Shaghayegh, et al.
Publicado: (2025)
MedMamba: Recasting Mamba for Medical Time Series Classification
por: He, ZhengXiao, et al.
Publicado: (2026)
por: He, ZhengXiao, et al.
Publicado: (2026)
ReVeal: Self-Evolving Code Agents via Reliable Self-Verification
por: Jin, Yiyang, et al.
Publicado: (2025)
por: Jin, Yiyang, et al.
Publicado: (2025)
Ejemplares similares
-
Forecasting with Hyper-Trees
por: März, Alexander, et al.
Publicado: (2024) -
AlphaLab: Autonomous Multi-Agent Research Across Optimization Domains with Frontier LLMs
por: Hogan, Brendan R., et al.
Publicado: (2026) -
Reinforcing Chain-of-Thought Reasoning with Self-Evolving Rubrics
por: Sheng, Leheng, et al.
Publicado: (2026) -
TimeMIL: Advancing Multivariate Time Series Classification via a Time-aware Multiple Instance Learning
por: Chen, Xiwen, et al.
Publicado: (2024) -
Sequence Complementor: Complementing Transformers For Time Series Forecasting with Learnable Sequences
por: Chen, Xiwen, et al.
Publicado: (2025)