P^2O: Joint Policy and Prompt Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Lu, Xinyu, Zhang, Kaiqi, Yang, Jinglin, Cao, Boxi, Lu, Yaojie, Lin, Hongyu, He, Min, Han, Xianpei, Sun, Le |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
por: Ma, Zhengzhao, et al.
Publicado: (2026)
por: Ma, Zhengzhao, et al.
Publicado: (2026)
Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models
por: Yan, Xinru, et al.
Publicado: (2026)
por: Yan, Xinru, et al.
Publicado: (2026)
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
por: Zheng, Jiasheng, et al.
Publicado: (2024)
por: Zheng, Jiasheng, et al.
Publicado: (2024)
Search, Verify and Feedback: Towards Next Generation Post-training Paradigm of Foundation Models via Verifier Engineering
por: Guan, Xinyan, et al.
Publicado: (2024)
por: Guan, Xinyan, et al.
Publicado: (2024)
When Models Outthink Their Safety: Unveiling and Mitigating Self-Jailbreak in Large Reasoning Models
por: Mao, Yingzhi, et al.
Publicado: (2025)
por: Mao, Yingzhi, et al.
Publicado: (2025)
Memorizing is Not Enough: Deep Knowledge Injection Through Reasoning
por: Xu, Ruoxi, et al.
Publicado: (2025)
por: Xu, Ruoxi, et al.
Publicado: (2025)
Executing Natural Language-Described Algorithms with Large Language Models: An Investigation
por: Zheng, Xin, et al.
Publicado: (2024)
por: Zheng, Xin, et al.
Publicado: (2024)
Meta-Cognitive Analysis: Evaluating Declarative and Procedural Knowledge in Datasets and Large Language Models
por: Li, Zhuoqun, et al.
Publicado: (2024)
por: Li, Zhuoqun, et al.
Publicado: (2024)
LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents
por: Peng, Xiaoxuan, et al.
Publicado: (2026)
por: Peng, Xiaoxuan, et al.
Publicado: (2026)
URL: Universal Referential Knowledge Linking via Task-instructed Representation Compression
por: Li, Zhuoqun, et al.
Publicado: (2024)
por: Li, Zhuoqun, et al.
Publicado: (2024)
Towards Scalable Automated Alignment of LLMs: A Survey
por: Cao, Boxi, et al.
Publicado: (2024)
por: Cao, Boxi, et al.
Publicado: (2024)
DOMAINEVAL: An Auto-Constructed Benchmark for Multi-Domain Code Generation
por: Zhu, Qiming, et al.
Publicado: (2024)
por: Zhu, Qiming, et al.
Publicado: (2024)
Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation
por: Yuan, Qianhao, et al.
Publicado: (2026)
por: Yuan, Qianhao, et al.
Publicado: (2026)
CRUXEval-X: A Benchmark for Multilingual Code Reasoning, Understanding and Execution
por: Xu, Ruiyang, et al.
Publicado: (2024)
por: Xu, Ruiyang, et al.
Publicado: (2024)
Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation
por: Liu, Yanjiang, et al.
Publicado: (2026)
por: Liu, Yanjiang, et al.
Publicado: (2026)
Rethinking Reward Model Evaluation: Are We Barking up the Wrong Tree?
por: Wen, Xueru, et al.
Publicado: (2024)
por: Wen, Xueru, et al.
Publicado: (2024)
StructEval: Deepen and Broaden Large Language Model Assessment via Structured Evaluation
por: Cao, Boxi, et al.
Publicado: (2024)
por: Cao, Boxi, et al.
Publicado: (2024)
Coupled Variational Reinforcement Learning for Language Model General Reasoning
por: Wen, Xueru, et al.
Publicado: (2025)
por: Wen, Xueru, et al.
Publicado: (2025)
Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models
por: Liu, Yanjiang, et al.
Publicado: (2025)
por: Liu, Yanjiang, et al.
Publicado: (2025)
DeepSolution: Boosting Complex Engineering Solution Design via Tree-based Exploration and Bi-point Thinking
por: Li, Zhuoqun, et al.
Publicado: (2025)
por: Li, Zhuoqun, et al.
Publicado: (2025)
MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning
por: Yuan, Qianhao, et al.
Publicado: (2025)
por: Yuan, Qianhao, et al.
Publicado: (2025)
Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards
por: Ren, Mengjie, et al.
Publicado: (2026)
por: Ren, Mengjie, et al.
Publicado: (2026)
PPTAgent: Generating and Evaluating Presentations Beyond Text-to-Slides
por: Zheng, Hao, et al.
Publicado: (2025)
por: Zheng, Hao, et al.
Publicado: (2025)
LiveMCPBench: Can Agents Navigate an Ocean of MCP Tools?
por: Mo, Guozhao, et al.
Publicado: (2025)
por: Mo, Guozhao, et al.
Publicado: (2025)
DeepPresenter: Environment-Grounded Reflection for Agentic Presentation Generation
por: Zheng, Hao, et al.
Publicado: (2026)
por: Zheng, Hao, et al.
Publicado: (2026)
Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces
por: Chen, Jiawei, et al.
Publicado: (2026)
por: Chen, Jiawei, et al.
Publicado: (2026)
Retentive or Forgetful? Diving into the Knowledge Memorizing Mechanism of Language Models
por: Cao, Boxi, et al.
Publicado: (2023)
por: Cao, Boxi, et al.
Publicado: (2023)
DeepRAG: Thinking to Retrieve Step by Step for Large Language Models
por: Guan, Xinyan, et al.
Publicado: (2025)
por: Guan, Xinyan, et al.
Publicado: (2025)
Multi-Facet Counterfactual Learning for Content Quality Evaluation
por: Zheng, Jiasheng, et al.
Publicado: (2024)
por: Zheng, Jiasheng, et al.
Publicado: (2024)
StructRAG: Boosting Knowledge Intensive Reasoning of LLMs via Inference-time Hybrid Information Structurization
por: Li, Zhuoqun, et al.
Publicado: (2024)
por: Li, Zhuoqun, et al.
Publicado: (2024)
Combinatorial Synthesis: Scaling Code RLVR via Atomic Decomposition and Recombination
por: Zheng, Jiasheng, et al.
Publicado: (2026)
por: Zheng, Jiasheng, et al.
Publicado: (2026)
EmbedAgent: Benchmarking Large Language Models in Embedded System Development
por: Xu, Ruiyang, et al.
Publicado: (2025)
por: Xu, Ruiyang, et al.
Publicado: (2025)
The Life Cycle of Knowledge in Big Language Models: A Survey
por: Cao, Boxi, et al.
Publicado: (2023)
por: Cao, Boxi, et al.
Publicado: (2023)
Cheems: A Practical Guidance for Building and Evaluating Chinese Reward Models from Scratch
por: Wen, Xueru, et al.
Publicado: (2025)
por: Wen, Xueru, et al.
Publicado: (2025)
The Devil Is in the Details: Tackling Unimodal Spurious Correlations for Generalizable Multimodal Reward Models
por: Li, Zichao, et al.
Publicado: (2025)
por: Li, Zichao, et al.
Publicado: (2025)
LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation
por: Xu, Dong, et al.
Publicado: (2026)
por: Xu, Dong, et al.
Publicado: (2026)
Self-Retrieval: End-to-End Information Retrieval with One Large Language Model
por: Tang, Qiaoyu, et al.
Publicado: (2024)
por: Tang, Qiaoyu, et al.
Publicado: (2024)
ARise: Towards Knowledge-Augmented Reasoning via Risk-Adaptive Search
por: Zhang, Yize, et al.
Publicado: (2025)
por: Zhang, Yize, et al.
Publicado: (2025)
Rule or Story, Which is a Better Commonsense Expression for Talking with Large Language Models?
por: Bian, Ning, et al.
Publicado: (2024)
por: Bian, Ning, et al.
Publicado: (2024)
REInstruct: Building Instruction Data from Unlabeled Corpus
por: Chen, Shu, et al.
Publicado: (2024)
por: Chen, Shu, et al.
Publicado: (2024)
Ejemplares similares
-
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
por: Ma, Zhengzhao, et al.
Publicado: (2026) -
Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models
por: Yan, Xinru, et al.
Publicado: (2026) -
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
por: Zheng, Jiasheng, et al.
Publicado: (2024) -
Search, Verify and Feedback: Towards Next Generation Post-training Paradigm of Foundation Models via Verifier Engineering
por: Guan, Xinyan, et al.
Publicado: (2024) -
When Models Outthink Their Safety: Unveiling and Mitigating Self-Jailbreak in Large Reasoning Models
por: Mao, Yingzhi, et al.
Publicado: (2025)