Guided Self-Evolving LLMs with Minimal Human Supervision
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Wenhao, Liang, Zhenwen, Huang, Chengsong, Panaganti, Kishan, Fang, Tianqing, Mi, Haitao, Yu, Dong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Group Distributionally Robust Optimization-Driven Reinforcement Learning for LLM Reasoning
par: Panaganti, Kishan, et autres
Publié: (2026)
par: Panaganti, Kishan, et autres
Publié: (2026)
Can LLMs Guide Their Own Exploration? Gradient-Guided Reinforcement Learning for LLM Reasoning
par: Liang, Zhenwen, et autres
Publié: (2025)
par: Liang, Zhenwen, et autres
Publié: (2025)
Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis
par: Shi, Yucheng, et autres
Publié: (2026)
par: Shi, Yucheng, et autres
Publié: (2026)
R-Zero: Self-Evolving Reasoning LLM from Zero Data
par: Huang, Chengsong, et autres
Publié: (2025)
par: Huang, Chengsong, et autres
Publié: (2025)
Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation
par: Zhou, Yujun, et autres
Publié: (2025)
par: Zhou, Yujun, et autres
Publié: (2025)
Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
Every Question Has Its Own Value: Reinforcement Learning with Explicit Human Values
par: Yu, Dian, et autres
Publié: (2025)
par: Yu, Dian, et autres
Publié: (2025)
TTCS: Test-Time Curriculum Synthesis for Self-Evolving
par: Yang, Chengyi, et autres
Publié: (2026)
par: Yang, Chengyi, et autres
Publié: (2026)
DOTS: Learning to Reason Dynamically in LLMs via Optimal Reasoning Trajectories Search
par: Yue, Murong, et autres
Publié: (2024)
par: Yue, Murong, et autres
Publié: (2024)
CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
par: Dai, Runpeng, et autres
Publié: (2025)
par: Dai, Runpeng, et autres
Publié: (2025)
VisPlay: Self-Evolving Vision-Language Models from Images
par: He, Yicheng, et autres
Publié: (2025)
par: He, Yicheng, et autres
Publié: (2025)
Stable and Efficient Single-Rollout RL for Multimodal Reasoning
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
Efficient Test-Time Scaling via Self-Calibration
par: Huang, Chengsong, et autres
Publié: (2025)
par: Huang, Chengsong, et autres
Publié: (2025)
Divide, Reweight, and Conquer: A Logit Arithmetic Approach for In-Context Learning
par: Huang, Chengsong, et autres
Publié: (2024)
par: Huang, Chengsong, et autres
Publié: (2024)
WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms
par: Zhang, Zhisong, et autres
Publié: (2025)
par: Zhang, Zhisong, et autres
Publié: (2025)
Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding
par: Wang, Wenkai, et autres
Publié: (2026)
par: Wang, Wenkai, et autres
Publié: (2026)
Self-Evolving Critique Abilities in Large Language Models
par: Tang, Zhengyang, et autres
Publié: (2025)
par: Tang, Zhengyang, et autres
Publié: (2025)
Minimal and Mechanistic Conditions for Behavioral Self-Awareness in LLMs
par: Bozoukov, Matthew, et autres
Publié: (2025)
par: Bozoukov, Matthew, et autres
Publié: (2025)
KL-regularization Itself is Differentially Private in Bandits and RLHF
par: Zhang, Yizhou, et autres
Publié: (2025)
par: Zhang, Yizhou, et autres
Publié: (2025)
Self-Supervised Prompt Optimization
par: Xiang, Jinyu, et autres
Publié: (2025)
par: Xiang, Jinyu, et autres
Publié: (2025)
Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
par: Zhang, Yuheng, et autres
Publié: (2025)
par: Zhang, Yuheng, et autres
Publié: (2025)
LiteSearch: Efficacious Tree Search for LLM
par: Wang, Ante, et autres
Publié: (2024)
par: Wang, Ante, et autres
Publié: (2024)
POSS: Position Specialist Generates Better Draft for Speculative Decoding
par: Huang, Langlin, et autres
Publié: (2025)
par: Huang, Langlin, et autres
Publié: (2025)
Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration
par: Deng, Wenhao, et autres
Publié: (2025)
par: Deng, Wenhao, et autres
Publié: (2025)
Query-Guided Self-Supervised Summarization of Nursing Notes
par: Gao, Ya, et autres
Publié: (2024)
par: Gao, Ya, et autres
Publié: (2024)
Efficient Policy Optimization in Robust Constrained MDPs with Iteration Complexity Guarantees
par: Ganguly, Sourav, et autres
Publié: (2025)
par: Ganguly, Sourav, et autres
Publié: (2025)
Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning
par: Liu, Haolin, et autres
Publié: (2026)
par: Liu, Haolin, et autres
Publié: (2026)
MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?
par: Che, Xinyu, et autres
Publié: (2026)
par: Che, Xinyu, et autres
Publié: (2026)
Self-Error-Instruct: Generalizing from Errors for LLMs Mathematical Reasoning
par: Yu, Erxin, et autres
Publié: (2025)
par: Yu, Erxin, et autres
Publié: (2025)
LLMs as Scalable, General-Purpose Simulators For Evolving Digital Agent Training
par: Wang, Yiming, et autres
Publié: (2025)
par: Wang, Yiming, et autres
Publié: (2025)
G-Zero: Self-Play for Open-Ended Generation from Zero Data
par: Huang, Chengsong, et autres
Publié: (2026)
par: Huang, Chengsong, et autres
Publié: (2026)
RelayLLM: Efficient Reasoning via Collaborative Decoding
par: Huang, Chengsong, et autres
Publié: (2026)
par: Huang, Chengsong, et autres
Publié: (2026)
Nonsense Helps: Prompt Space Perturbation Broadens Reasoning Exploration
par: Huang, Langlin, et autres
Publié: (2026)
par: Huang, Langlin, et autres
Publié: (2026)
Nudging: Inference-time Alignment of LLMs via Guided Decoding
par: Fei, Yu, et autres
Publié: (2024)
par: Fei, Yu, et autres
Publié: (2024)
MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents
par: Zhang, Haozhen, et autres
Publié: (2026)
par: Zhang, Haozhen, et autres
Publié: (2026)
AgentEvolver: Towards Efficient Self-Evolving Agent System
par: Zhai, Yunpeng, et autres
Publié: (2025)
par: Zhai, Yunpeng, et autres
Publié: (2025)
Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning
par: Zhang, Yuheng, et autres
Publié: (2024)
par: Zhang, Yuheng, et autres
Publié: (2024)
Robust LLM Alignment via Distributionally Robust Direct Preference Optimization
par: Xu, Zaiyan, et autres
Publié: (2025)
par: Xu, Zaiyan, et autres
Publié: (2025)
Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences
par: Karlekar, Sweta, et autres
Publié: (2026)
par: Karlekar, Sweta, et autres
Publié: (2026)
EvoMemBench: Benchmarking Agent Memory from a Self-Evolving Perspective
par: Wang, Yuyao, et autres
Publié: (2026)
par: Wang, Yuyao, et autres
Publié: (2026)
Documents similaires
-
Group Distributionally Robust Optimization-Driven Reinforcement Learning for LLM Reasoning
par: Panaganti, Kishan, et autres
Publié: (2026) -
Can LLMs Guide Their Own Exploration? Gradient-Guided Reinforcement Learning for LLM Reasoning
par: Liang, Zhenwen, et autres
Publié: (2025) -
Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis
par: Shi, Yucheng, et autres
Publié: (2026) -
R-Zero: Self-Evolving Reasoning LLM from Zero Data
par: Huang, Chengsong, et autres
Publié: (2025) -
Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation
par: Zhou, Yujun, et autres
Publié: (2025)