Towards Agentic Self-Learning LLMs in Search Environment
Fuente:
arXiv
Saved in:
| Main Authors: | Sun, Wangtao, Cheng, Xiang, Fan, Jialin, Xu, Yao, Yu, Xing, He, Shizhu, Zhao, Jun, Liu, Kang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
From Chain to Tree: Refining Chain-like Rules into Tree-like Rules on Knowledge Graphs
by: Sun, Wangtao, et al.
Published: (2024)
by: Sun, Wangtao, et al.
Published: (2024)
ExpNote: Black-box Large Language Models are Better Task Solvers with Experience Notebook
by: Sun, Wangtao, et al.
Published: (2023)
by: Sun, Wangtao, et al.
Published: (2023)
ItD: Large Language Models Can Teach Themselves Induction through Deduction
by: Sun, Wangtao, et al.
Published: (2024)
by: Sun, Wangtao, et al.
Published: (2024)
Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN
by: Xu, Yao, et al.
Published: (2025)
by: Xu, Yao, et al.
Published: (2025)
Improve Rule Retrieval and Reasoning with Self-Induction and Relevance ReEstimate
by: Huang, Ziyang, et al.
Published: (2025)
by: Huang, Ziyang, et al.
Published: (2025)
Beyond Instruction Following: Evaluating Inferential Rule Following of Large Language Models
by: Sun, Wangtao, et al.
Published: (2024)
by: Sun, Wangtao, et al.
Published: (2024)
Query2Triple: Unified Query Encoding for Answering Diverse Complex Queries over Knowledge Graphs
by: Xu, Yao, et al.
Published: (2023)
by: Xu, Yao, et al.
Published: (2023)
The Zero-Step Thinking: An Empirical Study of Mode Selection as Harder Early Exit in Reasoning Models
by: Tan, Yuqiao, et al.
Published: (2025)
by: Tan, Yuqiao, et al.
Published: (2025)
Neural Incompatibility: The Unbridgeable Gap of Cross-Scale Parametric Knowledge Transfer in Large Language Models
by: Tan, Yuqiao, et al.
Published: (2025)
by: Tan, Yuqiao, et al.
Published: (2025)
Efficient Data Learning for Open Information Extraction with Pre-trained Language Models
by: Fan, Zhiyuan, et al.
Published: (2023)
by: Fan, Zhiyuan, et al.
Published: (2023)
DATA: Decomposed Attention-based Task Adaptation for Rehearsal-Free Continual Learning
by: Liao, Huanxuan, et al.
Published: (2025)
by: Liao, Huanxuan, et al.
Published: (2025)
Find Parent then Label Children: A Two-stage Taxonomy Completion Method with Pre-trained Language Model
by: Xia, Fei, et al.
Published: (2024)
by: Xia, Fei, et al.
Published: (2024)
Dynamic Parametric Retrieval Augmented Generation for Test-time Knowledge Enhancement
by: Tan, Yuqiao, et al.
Published: (2025)
by: Tan, Yuqiao, et al.
Published: (2025)
Probabilistic Uncertain Reward Model
by: Sun, Wangtao, et al.
Published: (2025)
by: Sun, Wangtao, et al.
Published: (2025)
LLaSA: Large Language and Structured Data Assistant
by: Xu, Yao, et al.
Published: (2024)
by: Xu, Yao, et al.
Published: (2024)
Generate-on-Graph: Treat LLM as both Agent and KG in Incomplete Knowledge Graph Question Answering
by: Xu, Yao, et al.
Published: (2024)
by: Xu, Yao, et al.
Published: (2024)
Socratic-PRMBench: Benchmarking Process Reward Models with Systematic Reasoning Patterns
by: Li, Xiang, et al.
Published: (2025)
by: Li, Xiang, et al.
Published: (2025)
Computer Environments Elicit General Agentic Intelligence in LLMs
by: Cheng, Daixuan, et al.
Published: (2026)
by: Cheng, Daixuan, et al.
Published: (2026)
Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning
by: Wang, Zhaoyang, et al.
Published: (2026)
by: Wang, Zhaoyang, et al.
Published: (2026)
LingYi: Medical Conversational Question Answering System based on Multi-modal Knowledge Graphs
by: Xia, Fei, et al.
Published: (2022)
by: Xia, Fei, et al.
Published: (2022)
From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space
by: Tan, Yuqiao, et al.
Published: (2026)
by: Tan, Yuqiao, et al.
Published: (2026)
DeepEyesV2: Toward Agentic Multimodal Model
by: Hong, Jack, et al.
Published: (2025)
by: Hong, Jack, et al.
Published: (2025)
ONSEP: A Novel Online Neural-Symbolic Framework for Event Prediction Based on Large Language Model
by: Yu, Xuanqing, et al.
Published: (2024)
by: Yu, Xuanqing, et al.
Published: (2024)
APTBench: Benchmarking Agentic Potential of Base LLMs During Pre-Training
by: Qin, Jiarui, et al.
Published: (2025)
by: Qin, Jiarui, et al.
Published: (2025)
AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models
by: Wang, Yixu, et al.
Published: (2025)
by: Wang, Yixu, et al.
Published: (2025)
Can LLMs Time Travel? Enhancing Temporal Consistency in Legal Agentic Search through Reinforcement Learning
by: Fan, Wei, et al.
Published: (2026)
by: Fan, Wei, et al.
Published: (2026)
CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG
by: Shen, Jianghan, et al.
Published: (2026)
by: Shen, Jianghan, et al.
Published: (2026)
AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning
by: Sun, Jingbo, et al.
Published: (2026)
by: Sun, Jingbo, et al.
Published: (2026)
Towards Long-horizon Agentic Multimodal Search
by: Du, Yifan, et al.
Published: (2026)
by: Du, Yifan, et al.
Published: (2026)
A Comprehensive Survey on Reinforcement Learning-based Agentic Search: Foundations, Roles, Optimizations, Evaluations, and Applications
by: Lin, Minhua, et al.
Published: (2025)
by: Lin, Minhua, et al.
Published: (2025)
Compiler-R1: Towards Agentic Compiler Auto-tuning with Reinforcement Learning
by: Pan, Haolin, et al.
Published: (2025)
by: Pan, Haolin, et al.
Published: (2025)
Position: Agentic Evolution is the Path to Evolving LLMs
by: Lin, Minhua, et al.
Published: (2026)
by: Lin, Minhua, et al.
Published: (2026)
Human Cognition Inspired RAG with Knowledge Graph for Complex Problem Solving
by: Cheng, Yao, et al.
Published: (2025)
by: Cheng, Yao, et al.
Published: (2025)
ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning
by: Chen, Mingyang, et al.
Published: (2025)
by: Chen, Mingyang, et al.
Published: (2025)
RAVine: Reality-Aligned Evaluation for Agentic Search
by: Xu, Yilong, et al.
Published: (2025)
by: Xu, Yilong, et al.
Published: (2025)
AtelierEval: Agentic Evaluation of Humans & LLMs as Text-to-Image Prompters
by: Luo, Hanjun, et al.
Published: (2026)
by: Luo, Hanjun, et al.
Published: (2026)
Self-Distilled Agentic Reinforcement Learning
by: Lu, Zhengxi, et al.
Published: (2026)
by: Lu, Zhengxi, et al.
Published: (2026)
EvoTest: Evolutionary Test-Time Learning for Self-Improving Agentic Systems
by: He, Yufei, et al.
Published: (2025)
by: He, Yufei, et al.
Published: (2025)
SparK: Query-Aware Unstructured Sparsity with Recoverable KV Cache Channel Pruning
by: Liao, Huanxuan, et al.
Published: (2025)
by: Liao, Huanxuan, et al.
Published: (2025)
WideSeek: Advancing Wide Research via Multi-Agent Scaling
by: Huang, Ziyang, et al.
Published: (2026)
by: Huang, Ziyang, et al.
Published: (2026)
Similar Items
-
From Chain to Tree: Refining Chain-like Rules into Tree-like Rules on Knowledge Graphs
by: Sun, Wangtao, et al.
Published: (2024) -
ExpNote: Black-box Large Language Models are Better Task Solvers with Experience Notebook
by: Sun, Wangtao, et al.
Published: (2023) -
ItD: Large Language Models Can Teach Themselves Induction through Deduction
by: Sun, Wangtao, et al.
Published: (2024) -
Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN
by: Xu, Yao, et al.
Published: (2025) -
Improve Rule Retrieval and Reasoning with Self-Induction and Relevance ReEstimate
by: Huang, Ziyang, et al.
Published: (2025)