ATPO: Adaptive Tree Policy Optimization for Multi-Turn Medical Dialogue
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Cao, Ruike, Bai, Shaojie, Yao, Fugen, Dong, Liang, Xu, Jian, Xiao, Li |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MedAidDialog: A Multilingual Multi-Turn Medical Dialogue Dataset for Accessible Healthcare
von: Nigam, Shubham Kumar, et al.
Veröffentlicht: (2026)
von: Nigam, Shubham Kumar, et al.
Veröffentlicht: (2026)
POLO: Preference-Guided Multi-Turn Reinforcement Learning for Lead Optimization
von: Wang, Ziqing, et al.
Veröffentlicht: (2025)
von: Wang, Ziqing, et al.
Veröffentlicht: (2025)
Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
von: Ding, Yifeng, et al.
Veröffentlicht: (2025)
von: Ding, Yifeng, et al.
Veröffentlicht: (2025)
Trust-Region Adaptive Policy Optimization
von: Su, Mingyu, et al.
Veröffentlicht: (2025)
von: Su, Mingyu, et al.
Veröffentlicht: (2025)
Dialogue Action Tokens: Steering Language Models in Goal-Directed Dialogue with a Multi-Turn Planner
von: Li, Kenneth, et al.
Veröffentlicht: (2024)
von: Li, Kenneth, et al.
Veröffentlicht: (2024)
Out-of-Domain Intent Detection Considering Multi-Turn Dialogue Contexts
von: Lang, Hao, et al.
Veröffentlicht: (2023)
von: Lang, Hao, et al.
Veröffentlicht: (2023)
Not All Turns Are Equally Hard: Adaptive Thinking Budgets For Efficient Multi-Turn Reasoning
von: Jali, Neharika, et al.
Veröffentlicht: (2026)
von: Jali, Neharika, et al.
Veröffentlicht: (2026)
BNPO: Beta Normalization Policy Optimization
von: Xiao, Changyi, et al.
Veröffentlicht: (2025)
von: Xiao, Changyi, et al.
Veröffentlicht: (2025)
Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search Agents
von: Wang, Guoqing, et al.
Veröffentlicht: (2025)
von: Wang, Guoqing, et al.
Veröffentlicht: (2025)
RL-Struct: A Lightweight Reinforcement Learning Framework for Reliable Structured Output in LLMs
von: Hu, Ruike, et al.
Veröffentlicht: (2025)
von: Hu, Ruike, et al.
Veröffentlicht: (2025)
Peer Review as A Multi-Turn and Long-Context Dialogue with Role-Based Interactions
von: Tan, Cheng, et al.
Veröffentlicht: (2024)
von: Tan, Cheng, et al.
Veröffentlicht: (2024)
Tree-based Dialogue Reinforced Policy Optimization for Red-Teaming Attacks
von: Guo, Ruohao, et al.
Veröffentlicht: (2025)
von: Guo, Ruohao, et al.
Veröffentlicht: (2025)
Soft Adaptive Policy Optimization
von: Gao, Chang, et al.
Veröffentlicht: (2025)
von: Gao, Chang, et al.
Veröffentlicht: (2025)
ADWIN: Adaptive Windows for Horizon-Aware On-Policy Distillation
von: Liang, Kun, et al.
Veröffentlicht: (2026)
von: Liang, Kun, et al.
Veröffentlicht: (2026)
Sequential Policy Gradient for Adaptive Hyperparameter Optimization
von: Li, Zheng, et al.
Veröffentlicht: (2025)
von: Li, Zheng, et al.
Veröffentlicht: (2025)
IndicMedDialog: A Parallel Multi-Turn Medical Dialogue Dataset for Accessible Healthcare in Indic Languages
von: Nigam, Shubham Kumar, et al.
Veröffentlicht: (2026)
von: Nigam, Shubham Kumar, et al.
Veröffentlicht: (2026)
TreeRPO: Tree Relative Policy Optimization
von: Yang, Zhicheng, et al.
Veröffentlicht: (2025)
von: Yang, Zhicheng, et al.
Veröffentlicht: (2025)
AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback
von: Hu, Miaobo, et al.
Veröffentlicht: (2026)
von: Hu, Miaobo, et al.
Veröffentlicht: (2026)
Mitigating Conversational Inertia in Multi-Turn Agents
von: Wan, Yang, et al.
Veröffentlicht: (2026)
von: Wan, Yang, et al.
Veröffentlicht: (2026)
Gradient-Adaptive Policy Optimization: Towards Multi-Objective Alignment of Large Language Models
von: Li, Chengao, et al.
Veröffentlicht: (2025)
von: Li, Chengao, et al.
Veröffentlicht: (2025)
Proximal Policy Optimization with Adaptive Exploration
von: Lixandru, Andrei
Veröffentlicht: (2024)
von: Lixandru, Andrei
Veröffentlicht: (2024)
Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2025)
von: Gao, Chen-Xiao, et al.
Veröffentlicht: (2025)
TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards
von: Xiong, Xiqiao, et al.
Veröffentlicht: (2025)
von: Xiong, Xiqiao, et al.
Veröffentlicht: (2025)
MMMT-IF: A Challenging Multimodal Multi-Turn Instruction Following Benchmark
von: Epstein, Elliot L., et al.
Veröffentlicht: (2024)
von: Epstein, Elliot L., et al.
Veröffentlicht: (2024)
PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier
von: Jiang, Yuhua, et al.
Veröffentlicht: (2025)
von: Jiang, Yuhua, et al.
Veröffentlicht: (2025)
Adaptive Exploration for Multi-Reward Multi-Policy Evaluation
von: Russo, Alessio, et al.
Veröffentlicht: (2025)
von: Russo, Alessio, et al.
Veröffentlicht: (2025)
Offline Multi-Agent Reinforcement Learning via In-Sample Sequential Policy Optimization
von: Liu, Zongkai, et al.
Veröffentlicht: (2024)
von: Liu, Zongkai, et al.
Veröffentlicht: (2024)
Segment-Aligned Policy Optimization for Multi-Modal Reasoning
von: Gao, Lei, et al.
Veröffentlicht: (2026)
von: Gao, Lei, et al.
Veröffentlicht: (2026)
Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization
von: Li, Yu, et al.
Veröffentlicht: (2026)
von: Li, Yu, et al.
Veröffentlicht: (2026)
MIMOSA: Multi-constraint Molecule Sampling for Molecule Optimization
von: Fu, Tianfan, et al.
Veröffentlicht: (2020)
von: Fu, Tianfan, et al.
Veröffentlicht: (2020)
Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training
von: Fakoor, Rasool, et al.
Veröffentlicht: (2026)
von: Fakoor, Rasool, et al.
Veröffentlicht: (2026)
CROP: Conservative Reward for Model-based Offline Policy Optimization
von: Li, Hao, et al.
Veröffentlicht: (2023)
von: Li, Hao, et al.
Veröffentlicht: (2023)
Contextualized Policy Recovery: Modeling and Interpreting Medical Decisions with Adaptive Imitation Learning
von: Deuschel, Jannik, et al.
Veröffentlicht: (2023)
von: Deuschel, Jannik, et al.
Veröffentlicht: (2023)
Meta-Aligner: Bidirectional Preference-Policy Optimization for Multi-Objective LLMs Alignment
von: Xu, Wenzhe, et al.
Veröffentlicht: (2026)
von: Xu, Wenzhe, et al.
Veröffentlicht: (2026)
A Simple "Try Again" Can Elicit Multi-Turn LLM Reasoning
von: Liu, Licheng, et al.
Veröffentlicht: (2025)
von: Liu, Licheng, et al.
Veröffentlicht: (2025)
Reference-guided Policy Optimization for Molecular Optimization via LLM Reasoning
von: Li, Xuan, et al.
Veröffentlicht: (2026)
von: Li, Xuan, et al.
Veröffentlicht: (2026)
Words & Weights: Streamlining Multi-Turn Interactions via Co-Adaptation
von: Wei, Chenxing, et al.
Veröffentlicht: (2026)
von: Wei, Chenxing, et al.
Veröffentlicht: (2026)
Breaking $\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning
von: Chen, Haoxuan, et al.
Veröffentlicht: (2026)
von: Chen, Haoxuan, et al.
Veröffentlicht: (2026)
TED: Turn Emphasis with Dialogue Feature Attention for Emotion Recognition in Conversation
von: Ono, Junya, et al.
Veröffentlicht: (2025)
von: Ono, Junya, et al.
Veröffentlicht: (2025)
Radiology Report Generation via Multi-objective Preference Optimization
von: Xiao, Ting, et al.
Veröffentlicht: (2024)
von: Xiao, Ting, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
MedAidDialog: A Multilingual Multi-Turn Medical Dialogue Dataset for Accessible Healthcare
von: Nigam, Shubham Kumar, et al.
Veröffentlicht: (2026) -
POLO: Preference-Guided Multi-Turn Reinforcement Learning for Lead Optimization
von: Wang, Ziqing, et al.
Veröffentlicht: (2025) -
Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
von: Ding, Yifeng, et al.
Veröffentlicht: (2025) -
Trust-Region Adaptive Policy Optimization
von: Su, Mingyu, et al.
Veröffentlicht: (2025) -
Dialogue Action Tokens: Steering Language Models in Goal-Directed Dialogue with a Multi-Turn Planner
von: Li, Kenneth, et al.
Veröffentlicht: (2024)