Building Coding Agents via Entropy-Enhanced Multi-Turn Preference Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Yu, Jiahao, Cheng, Zelei, Wu, Xian, Xing, Xinyu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GPO: Learning from Critical Steps to Improve LLM Reasoning
por: Yu, Jiahao, et al.
Publicado: (2025)
por: Yu, Jiahao, et al.
Publicado: (2025)
A Survey on Explainable Deep Reinforcement Learning
por: Cheng, Zelei, et al.
Publicado: (2025)
por: Cheng, Zelei, et al.
Publicado: (2025)
RICE: Breaking Through the Training Bottlenecks of Reinforcement Learning with Explanation
por: Cheng, Zelei, et al.
Publicado: (2024)
por: Cheng, Zelei, et al.
Publicado: (2024)
Soft-Label Integration for Robust Toxicity Classification
por: Cheng, Zelei, et al.
Publicado: (2024)
por: Cheng, Zelei, et al.
Publicado: (2024)
UC-MOA: Utility-Conditioned Multi-Objective Alignment for Distributional Pareto-Optimality
por: Cheng, Zelei, et al.
Publicado: (2025)
por: Cheng, Zelei, et al.
Publicado: (2025)
BlockScan: Detecting Anomalies in Blockchain Transactions
por: Yu, Jiahao, et al.
Publicado: (2024)
por: Yu, Jiahao, et al.
Publicado: (2024)
POLO: Preference-Guided Multi-Turn Reinforcement Learning for Lead Optimization
por: Wang, Ziqing, et al.
Publicado: (2025)
por: Wang, Ziqing, et al.
Publicado: (2025)
TABQAWORLD: Optimizing Multimodal Reasoning for Multi-Turn Table Question Answering
por: Kwok, Tung Sum Thomas, et al.
Publicado: (2026)
por: Kwok, Tung Sum Thomas, et al.
Publicado: (2026)
Recognize Your Orchestrator: An Entropy Dynamics Perspective for LLM Multi-Agent Systems
por: Zhu, Junze, et al.
Publicado: (2026)
por: Zhu, Junze, et al.
Publicado: (2026)
MEMO: Memory-Augmented Model Context Optimization for Robust Multi-Turn Multi-Agent LLM Games
por: Xie, Yunfei, et al.
Publicado: (2026)
por: Xie, Yunfei, et al.
Publicado: (2026)
On the Role of Preference Variance in Preference Optimization
por: Guo, Jiacheng, et al.
Publicado: (2025)
por: Guo, Jiacheng, et al.
Publicado: (2025)
GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts
por: Yu, Jiahao, et al.
Publicado: (2023)
por: Yu, Jiahao, et al.
Publicado: (2023)
Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
por: Hu, Yuanzhe, et al.
Publicado: (2025)
por: Hu, Yuanzhe, et al.
Publicado: (2025)
PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization
por: Kim, Wonjoong, et al.
Publicado: (2026)
por: Kim, Wonjoong, et al.
Publicado: (2026)
TO-Agents: A Multi-Agent AI Pipeline for Preference-Guided Topology Optimization
por: Stewart, Isabella A., et al.
Publicado: (2026)
por: Stewart, Isabella A., et al.
Publicado: (2026)
Mars-PO: Multi-Agent Reasoning System Preference Optimization
por: Lou, Xiaoxuan, et al.
Publicado: (2024)
por: Lou, Xiaoxuan, et al.
Publicado: (2024)
Towards Trustworthy Multi-Turn LLM Agents via Behavioral Guidance
por: Gürsun, Gonca
Publicado: (2025)
por: Gürsun, Gonca
Publicado: (2025)
ICON: Intent-Context Coupling for Efficient Multi-Turn Jailbreak Attack
por: Lin, Xingwei, et al.
Publicado: (2026)
por: Lin, Xingwei, et al.
Publicado: (2026)
InterMT: Multi-Turn Interleaved Preference Alignment with Human Feedback
por: Chen, Boyuan, et al.
Publicado: (2025)
por: Chen, Boyuan, et al.
Publicado: (2025)
Improving Code Translation with Syntax-Guided and Semantic-aware Preference Optimization
por: Wu, Yuhan, et al.
Publicado: (2026)
por: Wu, Yuhan, et al.
Publicado: (2026)
DEEPMED: Building a Medical DeepResearch Agent via Multi-hop Med-Search Data and Turn-Controlled Agentic Training & Inference
por: Wang, Zihan, et al.
Publicado: (2026)
por: Wang, Zihan, et al.
Publicado: (2026)
STEMS: Spatial-Temporal Enhanced Safe Multi-Agent Coordination for Building Energy Management
por: Zhang, Huiliang, et al.
Publicado: (2025)
por: Zhang, Huiliang, et al.
Publicado: (2025)
MACPO: Weak-to-Strong Alignment via Multi-Agent Contrastive Preference Optimization
por: Lyu, Yougang, et al.
Publicado: (2024)
por: Lyu, Yougang, et al.
Publicado: (2024)
Proximity-Based Multi-Turn Optimization: Practical Credit Assignment for LLM Agent Training
por: Fang, Yangyi, et al.
Publicado: (2026)
por: Fang, Yangyi, et al.
Publicado: (2026)
MOTIF: Multi-strategy Optimization via Turn-based Interactive Framework
por: Kiet, Nguyen Viet Tuan, et al.
Publicado: (2025)
por: Kiet, Nguyen Viet Tuan, et al.
Publicado: (2025)
General Modular Harness for LLM Agents in Multi-Turn Gaming Environments
por: Zhang, Yuxuan, et al.
Publicado: (2025)
por: Zhang, Yuxuan, et al.
Publicado: (2025)
ICPO: Illocution-Calibrated Policy Optimization for Multi-Turn Conversation
por: Wang, Zhebo, et al.
Publicado: (2026)
por: Wang, Zhebo, et al.
Publicado: (2026)
PGPO: Enhancing Agent Reasoning via Pseudocode-style Planning Guided Preference Optimization
por: Cao, Zouying, et al.
Publicado: (2025)
por: Cao, Zouying, et al.
Publicado: (2025)
CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning
por: Yu, Huimu, et al.
Publicado: (2024)
por: Yu, Huimu, et al.
Publicado: (2024)
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
por: Wang, Zihan, et al.
Publicado: (2025)
por: Wang, Zihan, et al.
Publicado: (2025)
Improving Safety Alignment via Balanced Direct Preference Optimization
por: Zhao, Shiji, et al.
Publicado: (2026)
por: Zhao, Shiji, et al.
Publicado: (2026)
Learning Game-Playing Agents with Generative Code Optimization
por: Kuang, Zhiyi, et al.
Publicado: (2025)
por: Kuang, Zhiyi, et al.
Publicado: (2025)
WebGraphEval: Multi-Turn Trajectory Evaluation for Web Agents using Graph Representation
por: Qian, Yaoyao, et al.
Publicado: (2025)
por: Qian, Yaoyao, et al.
Publicado: (2025)
Entropy Controllable Direct Preference Optimization
por: Omura, Motoki, et al.
Publicado: (2024)
por: Omura, Motoki, et al.
Publicado: (2024)
Enhancing Personalized Multi-Turn Dialogue with Curiosity Reward
por: Wan, Yanming, et al.
Publicado: (2025)
por: Wan, Yanming, et al.
Publicado: (2025)
ContextEvolve: Multi-Agent Context Compression for Systems Code Optimization
por: Su, Hongyuan, et al.
Publicado: (2026)
por: Su, Hongyuan, et al.
Publicado: (2026)
TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making
por: Jiao, Kechen, et al.
Publicado: (2025)
por: Jiao, Kechen, et al.
Publicado: (2025)
Decomposing the Delta: What Do Models Actually Learn from Preference Pairs?
por: Lee, Chia-Hsuan, et al.
Publicado: (2026)
por: Lee, Chia-Hsuan, et al.
Publicado: (2026)
Preference as Reward, Maximum Preference Optimization with Importance Sampling
por: Jiang, Zaifan, et al.
Publicado: (2023)
por: Jiang, Zaifan, et al.
Publicado: (2023)
ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents
por: Zhang, Hao, et al.
Publicado: (2026)
por: Zhang, Hao, et al.
Publicado: (2026)
Ejemplares similares
-
GPO: Learning from Critical Steps to Improve LLM Reasoning
por: Yu, Jiahao, et al.
Publicado: (2025) -
A Survey on Explainable Deep Reinforcement Learning
por: Cheng, Zelei, et al.
Publicado: (2025) -
RICE: Breaking Through the Training Bottlenecks of Reinforcement Learning with Explanation
por: Cheng, Zelei, et al.
Publicado: (2024) -
Soft-Label Integration for Robust Toxicity Classification
por: Cheng, Zelei, et al.
Publicado: (2024) -
UC-MOA: Utility-Conditioned Multi-Objective Alignment for Distributional Pareto-Optimality
por: Cheng, Zelei, et al.
Publicado: (2025)