PGPO: Enhancing Agent Reasoning via Pseudocode-style Planning Guided Preference Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cao, Zouying, Wang, Runze, Yang, Yifei, Ma, Xinbei, Zhu, Xiaoyong, Zheng, Bo, Zhao, Hai |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LaCo: Large Language Model Pruning via Layer Collapse
par: Yang, Yifei, et autres
Publié: (2024)
par: Yang, Yifei, et autres
Publié: (2024)
Head-wise Shareable Attention for Large Language Models
par: Cao, Zouying, et autres
Publié: (2024)
par: Cao, Zouying, et autres
Publié: (2024)
LESA: Learnable LLM Layer Scaling-Up
par: Yang, Yifei, et autres
Publié: (2025)
par: Yang, Yifei, et autres
Publié: (2025)
Plan-over-Graph: Towards Parallelable LLM Agent Schedule
par: Zhang, Shiqi, et autres
Publié: (2025)
par: Zhang, Shiqi, et autres
Publié: (2025)
Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents
par: Li, Xinze, et autres
Publié: (2026)
par: Li, Xinze, et autres
Publié: (2026)
AutoHall: Automated Factuality Hallucination Dataset Generation for Large Language Models
par: Cao, Zouying, et autres
Publié: (2023)
par: Cao, Zouying, et autres
Publié: (2023)
CoCo-Agent: A Comprehensive Cognitive MLLM Agent for Smartphone GUI Automation
par: Ma, Xinbei, et autres
Publié: (2024)
par: Ma, Xinbei, et autres
Publié: (2024)
SCANS: Mitigating the Exaggerated Safety for LLMs via Safety-Conscious Activation Steering
par: Cao, Zouying, et autres
Publié: (2024)
par: Cao, Zouying, et autres
Publié: (2024)
KVSharer: Efficient Inference via Layer-Wise Dissimilar KV Cache Sharing
par: Yang, Yifei, et autres
Publié: (2024)
par: Yang, Yifei, et autres
Publié: (2024)
How Deep is Love in LLMs' Hearts? Exploring Semantic Size in Human-like Cognition
par: Yao, Yao, et autres
Publié: (2025)
par: Yao, Yao, et autres
Publié: (2025)
Textual-to-Visual Iterative Self-Verification for Slide Generation
par: Xu, Yunqing, et autres
Publié: (2025)
par: Xu, Yunqing, et autres
Publié: (2025)
ParaCook: On Time-Efficient Planning for Multi-Agent Systems
par: Zhang, Shiqi, et autres
Publié: (2025)
par: Zhang, Shiqi, et autres
Publié: (2025)
Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent Evolution
par: Cao, Zouying, et autres
Publié: (2025)
par: Cao, Zouying, et autres
Publié: (2025)
Wide-Horizon Thinking and Simulation-Based Evaluation for Real-World LLM Planning with Multifaceted Constraints
par: Yang, Dongjie, et autres
Publié: (2025)
par: Yang, Dongjie, et autres
Publié: (2025)
Enabling Agents to Communicate Entirely in Latent Space
par: Du, Zhuoyun, et autres
Publié: (2025)
par: Du, Zhuoyun, et autres
Publié: (2025)
Learning to Evolve: A Self-Improving Framework for Multi-Agent Systems via Textual Parameter Graph Optimization
par: He, Shan, et autres
Publié: (2026)
par: He, Shan, et autres
Publié: (2026)
Caution for the Environment: Multimodal LLM Agents are Susceptible to Environmental Distractions
par: Ma, Xinbei, et autres
Publié: (2024)
par: Ma, Xinbei, et autres
Publié: (2024)
REVISION:Reflective Intent Mining and Online Reasoning Auxiliary for E-commerce Visual Search System Optimization
par: Tang, Yiwen, et autres
Publié: (2025)
par: Tang, Yiwen, et autres
Publié: (2025)
PROM: A Phrase-level Copying Mechanism with Pre-training for Abstractive Summarization
par: Ma, Xinbei, et autres
Publié: (2023)
par: Ma, Xinbei, et autres
Publié: (2023)
MEGen: Generative Backdoor into Large Language Models via Model Editing
par: Qiu, Jiyang, et autres
Publié: (2024)
par: Qiu, Jiyang, et autres
Publié: (2024)
Language Models as Compilers: Simulating Pseudocode Execution Improves Algorithmic Reasoning in Language Models
par: Chae, Hyungjoo, et autres
Publié: (2024)
par: Chae, Hyungjoo, et autres
Publié: (2024)
Agent-Dice: Disentangling Knowledge Updates via Geometric Consensus for Agent Continual Learning
par: Wu, Zheng, et autres
Publié: (2026)
par: Wu, Zheng, et autres
Publié: (2026)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
par: Wang, Weiyun, et autres
Publié: (2024)
par: Wang, Weiyun, et autres
Publié: (2024)
Pseudocode-Injection Magic: Enabling LLMs to Tackle Graph Computational Tasks
par: Gong, Chang, et autres
Publié: (2025)
par: Gong, Chang, et autres
Publié: (2025)
DiffCoT: Diffusion-styled Chain-of-Thought Reasoning in LLMs
par: Cao, Shidong, et autres
Publié: (2026)
par: Cao, Shidong, et autres
Publié: (2026)
Probability-Consistent Preference Optimization for Enhanced LLM Reasoning
par: Yang, Yunqiao, et autres
Publié: (2025)
par: Yang, Yunqiao, et autres
Publié: (2025)
Online-PVLM: Advancing Personalized VLMs with Online Concept Learning
par: Bai, Huiyu, et autres
Publié: (2025)
par: Bai, Huiyu, et autres
Publié: (2025)
Enhancing LLM Reasoning via Non-Human-Like Reasoning Path Preference Optimization
par: Lu, Junjie, et autres
Publié: (2025)
par: Lu, Junjie, et autres
Publié: (2025)
DEPO: Dual-Efficiency Preference Optimization for LLM Agents
par: Chen, Sirui, et autres
Publié: (2025)
par: Chen, Sirui, et autres
Publié: (2025)
Enhancing LLM Safety via Constrained Direct Preference Optimization
par: Liu, Zixuan, et autres
Publié: (2024)
par: Liu, Zixuan, et autres
Publié: (2024)
On the Robustness of Editing Large Language Models
par: Ma, Xinbei, et autres
Publié: (2024)
par: Ma, Xinbei, et autres
Publié: (2024)
DiffPO: Diffusion-styled Preference Optimization for Efficient Inference-Time Alignment of Large Language Models
par: Chen, Ruizhe, et autres
Publié: (2025)
par: Chen, Ruizhe, et autres
Publié: (2025)
Preference-Guided Reflective Sampling for Aligning Language Models
par: Ye, Hai, et autres
Publié: (2024)
par: Ye, Hai, et autres
Publié: (2024)
DecoupledESC: Enhancing Emotional Support Generation via Strategy-Response Decoupled Preference Optimization
par: Zhang, Chao, et autres
Publié: (2025)
par: Zhang, Chao, et autres
Publié: (2025)
Beyond Overlap Metrics: Rewarding Reasoning and Preferences for Faithful Multi-Role Dialogue Summarization
par: Mei, Xiaoyong, et autres
Publié: (2026)
par: Mei, Xiaoyong, et autres
Publié: (2026)
TL-GRPO: Turn-Level RL for Reasoning-Guided Iterative Optimization
par: Li, Peiji, et autres
Publié: (2026)
par: Li, Peiji, et autres
Publié: (2026)
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
par: Xia, Yinan, et autres
Publié: (2025)
par: Xia, Yinan, et autres
Publié: (2025)
PILOT: Planning via Internalized Latent Optimization Trajectories for Large Language Models
par: Zheng, Haoyu, et autres
Publié: (2026)
par: Zheng, Haoyu, et autres
Publié: (2026)
DuET: Dual Execution for Test Output Prediction with Generated Code and Pseudocode
par: Han, Hojae, et autres
Publié: (2026)
par: Han, Hojae, et autres
Publié: (2026)
Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM Game
par: Cheng, Pengyu, et autres
Publié: (2023)
par: Cheng, Pengyu, et autres
Publié: (2023)
Documents similaires
-
LaCo: Large Language Model Pruning via Layer Collapse
par: Yang, Yifei, et autres
Publié: (2024) -
Head-wise Shareable Attention for Large Language Models
par: Cao, Zouying, et autres
Publié: (2024) -
LESA: Learnable LLM Layer Scaling-Up
par: Yang, Yifei, et autres
Publié: (2025) -
Plan-over-Graph: Towards Parallelable LLM Agent Schedule
par: Zhang, Shiqi, et autres
Publié: (2025) -
Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents
par: Li, Xinze, et autres
Publié: (2026)