BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Shiyu, Yin, Yongjing, Yan, Jianhao, Tang, Yunbo, Zhang, Qinggang, Li, Bei, Chen, Xin, Wang, Jingang, Cai, Xunliang, Su, Jinsong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Causal Autoregressive Diffusion Language Model
di: Ruan, Junhao, et al.
Pubblicazione: (2026)
di: Ruan, Junhao, et al.
Pubblicazione: (2026)
MemGraphRAG: Memory-based Multi-Agent System for Graph Retrieval-Augmented Generation
di: Wu, Chuanjie, et al.
Pubblicazione: (2026)
di: Wu, Chuanjie, et al.
Pubblicazione: (2026)
MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks
di: Ruan, Junhao, et al.
Pubblicazione: (2026)
di: Ruan, Junhao, et al.
Pubblicazione: (2026)
Augmenting Intra-Modal Understanding in MLLMs for Robust Multimodal Keyphrase Generation
di: Cao, Jiajun, et al.
Pubblicazione: (2025)
di: Cao, Jiajun, et al.
Pubblicazione: (2025)
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
di: Bai, Yang, et al.
Pubblicazione: (2026)
di: Bai, Yang, et al.
Pubblicazione: (2026)
Earlier Tokens Contribute More: Learning Direct Preference Optimization From Temporal Decay Perspective
di: Shao, Ruichen, et al.
Pubblicazione: (2025)
di: Shao, Ruichen, et al.
Pubblicazione: (2025)
What Have We Achieved on Non-autoregressive Translation?
di: Li, Yafu, et al.
Pubblicazione: (2024)
di: Li, Yafu, et al.
Pubblicazione: (2024)
Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism
di: Liu, Jiahao, et al.
Pubblicazione: (2024)
di: Liu, Jiahao, et al.
Pubblicazione: (2024)
ReMamba: Equip Mamba with Effective Long-Sequence Modeling
di: Yuan, Danlong, et al.
Pubblicazione: (2024)
di: Yuan, Danlong, et al.
Pubblicazione: (2024)
Dynamic Fisher-weighted Model Merging via Bayesian Optimization
di: Lee, Sanwoo, et al.
Pubblicazione: (2025)
di: Lee, Sanwoo, et al.
Pubblicazione: (2025)
Enhancing Large Language Models with Reliable Knowledge Graphs
di: Zhang, Qinggang
Pubblicazione: (2025)
di: Zhang, Qinggang
Pubblicazione: (2025)
LegalGraphRAG: Multi-Agent Graph Retrieval-Augmented Generation for Reliable Legal Reasoning
di: Chen, Zerui, et al.
Pubblicazione: (2026)
di: Chen, Zerui, et al.
Pubblicazione: (2026)
What Makes Quantization for Large Language Models Hard? An Empirical Study from the Lens of Perturbation
di: Gong, Zhuocheng, et al.
Pubblicazione: (2024)
di: Gong, Zhuocheng, et al.
Pubblicazione: (2024)
BAPO: Base-Anchored Preference Optimization for Overcoming Forgetting in Large Language Models Personalization
di: Lee, Gihun, et al.
Pubblicazione: (2024)
di: Lee, Gihun, et al.
Pubblicazione: (2024)
Libra: Assessing and Improving Reward Model by Learning to Think
di: Zhou, Meng, et al.
Pubblicazione: (2025)
di: Zhou, Meng, et al.
Pubblicazione: (2025)
SEAS: Self-Evolving Adversarial Safety Optimization for Large Language Models
di: Diao, Muxi, et al.
Pubblicazione: (2024)
di: Diao, Muxi, et al.
Pubblicazione: (2024)
A Preliminary Study on the Promises and Challenges of Native Top-$k$ Sparse Attention
di: Xiu, Di, et al.
Pubblicazione: (2025)
di: Xiu, Di, et al.
Pubblicazione: (2025)
Ltri-LLM: Streaming Long Context Inference for LLMs with Training-Free Dynamic Triangular Attention Pattern
di: Tang, Hongyin, et al.
Pubblicazione: (2024)
di: Tang, Hongyin, et al.
Pubblicazione: (2024)
Length Desensitization in Direct Preference Optimization
di: Liu, Wei, et al.
Pubblicazione: (2024)
di: Liu, Wei, et al.
Pubblicazione: (2024)
SpanNorm: Reconciling Training Stability and Performance in Deep Transformers
di: Wang, Chao, et al.
Pubblicazione: (2026)
di: Wang, Chao, et al.
Pubblicazione: (2026)
Reasoning about Reasoning: BAPO Bounds on Chain-of-Thought Token Complexity in LLMs
di: Tomlinson, Kiran, et al.
Pubblicazione: (2026)
di: Tomlinson, Kiran, et al.
Pubblicazione: (2026)
LinkQA: Synthesizing Diverse QA from Multiple Seeds Strongly Linked by Knowledge Points
di: Zhang, Xuemiao, et al.
Pubblicazione: (2025)
di: Zhang, Xuemiao, et al.
Pubblicazione: (2025)
Large-Scale Diverse Synthesis for Mid-Training
di: Zhang, Xuemiao, et al.
Pubblicazione: (2025)
di: Zhang, Xuemiao, et al.
Pubblicazione: (2025)
Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic Search
di: Chen, Yiqun, et al.
Pubblicazione: (2026)
di: Chen, Yiqun, et al.
Pubblicazione: (2026)
A2RAG: Adaptive Agentic Graph Retrieval for Cost-Aware and Reliable Reasoning
di: Liu, Jiate, et al.
Pubblicazione: (2026)
di: Liu, Jiate, et al.
Pubblicazione: (2026)
AT$^2$PO: Agentic Turn-based Policy Optimization via Tree Search
di: Zong, Zefang, et al.
Pubblicazione: (2026)
di: Zong, Zefang, et al.
Pubblicazione: (2026)
DSPO: Stable and Efficient Policy Optimization for Agentic Search and Reasoning
di: Gu, Chenyang, et al.
Pubblicazione: (2025)
di: Gu, Chenyang, et al.
Pubblicazione: (2025)
Graph-Structured Speculative Decoding
di: Gong, Zhuocheng, et al.
Pubblicazione: (2024)
di: Gong, Zhuocheng, et al.
Pubblicazione: (2024)
BARREL: Boundary-Aware Reasoning for Factual and Reliable LRMs
di: Yang, Junxiao, et al.
Pubblicazione: (2025)
di: Yang, Junxiao, et al.
Pubblicazione: (2025)
Too Consistent to Detect: A Study of Self-Consistent Errors in LLMs
di: Tan, Hexiang, et al.
Pubblicazione: (2025)
di: Tan, Hexiang, et al.
Pubblicazione: (2025)
When to use Graphs in RAG: A Comprehensive Analysis for Graph Retrieval-Augmented Generation
di: Xiang, Zhishang, et al.
Pubblicazione: (2025)
di: Xiang, Zhishang, et al.
Pubblicazione: (2025)
LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance
di: Fan, Yuchun, et al.
Pubblicazione: (2026)
di: Fan, Yuchun, et al.
Pubblicazione: (2026)
Agentic Reinforced Policy Optimization
di: Dong, Guanting, et al.
Pubblicazione: (2025)
di: Dong, Guanting, et al.
Pubblicazione: (2025)
RefuteBench 2.0 -- Agentic Benchmark for Dynamic Evaluation of LLM Responses to Refutation Instruction
di: Yan, Jianhao, et al.
Pubblicazione: (2025)
di: Yan, Jianhao, et al.
Pubblicazione: (2025)
NeedleInATable: Exploring Long-Context Capability of Large Language Models towards Long-Structured Tables
di: Wang, Lanrui, et al.
Pubblicazione: (2025)
di: Wang, Lanrui, et al.
Pubblicazione: (2025)
FAPO: Flawed-Aware Policy Optimization for Efficient and Reliable Reasoning
di: Ding, Yuyang, et al.
Pubblicazione: (2025)
di: Ding, Yuyang, et al.
Pubblicazione: (2025)
Enhancing Agentic RL with Progressive Reward Shaping and Value-based Sampling Policy Optimization
di: Su, Jianghao, et al.
Pubblicazione: (2025)
di: Su, Jianghao, et al.
Pubblicazione: (2025)
Expanding Reasoning Potential in Foundation Model by Learning Diverse Chains of Thought Patterns
di: Zhang, Xuemiao, et al.
Pubblicazione: (2025)
di: Zhang, Xuemiao, et al.
Pubblicazione: (2025)
Forgetting Curve: A Reliable Method for Evaluating Memorization Capability for Long-context Models
di: Liu, Xinyu, et al.
Pubblicazione: (2024)
di: Liu, Xinyu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Causal Autoregressive Diffusion Language Model
di: Ruan, Junhao, et al.
Pubblicazione: (2026) -
MemGraphRAG: Memory-based Multi-Agent System for Graph Retrieval-Augmented Generation
di: Wu, Chuanjie, et al.
Pubblicazione: (2026) -
MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks
di: Ruan, Junhao, et al.
Pubblicazione: (2026) -
Augmenting Intra-Modal Understanding in MLLMs for Robust Multimodal Keyphrase Generation
di: Cao, Jiajun, et al.
Pubblicazione: (2025) -
BAPO: Stabilizing Off-Policy Reinforcement Learning for LLMs via Balanced Policy Optimization with Adaptive Clipping
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)