Can Large Language Models Invent Algorithms to Improve Themselves?: Algorithm Discovery for Recursive Self-Improvement through Reinforcement Learning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ishibashi, Yoichi, Yano, Taro, Oyamada, Masafumi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Effective Harness Engineering for Algorithm Discovery with Coding Agents
par: Ishibashi, Yoichi, et autres
Publié: (2026)
par: Ishibashi, Yoichi, et autres
Publié: (2026)
LaMDAgent: An Autonomous Framework for Post-Training Pipeline Optimization via LLM Agents
par: Yano, Taro, et autres
Publié: (2025)
par: Yano, Taro, et autres
Publié: (2025)
Mining Hidden Thoughts from Texts: Evaluating Continual Pretraining with Synthetic Data for LLM Reasoning
par: Ishibashi, Yoichi, et autres
Publié: (2025)
par: Ishibashi, Yoichi, et autres
Publié: (2025)
Can a Crow Hatch a Falcon? Lineage Matters in Predicting Large Language Model Performance
par: Tamura, Takuya, et autres
Publié: (2025)
par: Tamura, Takuya, et autres
Publié: (2025)
An Empirical Study of LLM-as-a-Judge: How Design Choices Impact Evaluation Reliability
par: Yamauchi, Yusuke, et autres
Publié: (2025)
par: Yamauchi, Yusuke, et autres
Publié: (2025)
Knowledge Sanitization of Large Language Models
par: Ishibashi, Yoichi, et autres
Publié: (2023)
par: Ishibashi, Yoichi, et autres
Publié: (2023)
$M^3$ Scaling Law: Optimizing Multi-Epoch, Multi-Lingual, and Multi-Stage Training for Low-Resource Language Models
par: Akimoto, Kosuke, et autres
Publié: (2024)
par: Akimoto, Kosuke, et autres
Publié: (2024)
Jellyfish: A Large Language Model for Data Preprocessing
par: Zhang, Haochen, et autres
Publié: (2023)
par: Zhang, Haochen, et autres
Publié: (2023)
ItD: Large Language Models Can Teach Themselves Induction through Deduction
par: Sun, Wangtao, et autres
Publié: (2024)
par: Sun, Wangtao, et autres
Publié: (2024)
Reward Models Can Improve Themselves: Reward-Guided Adversarial Failure Mode Discovery for Robust Reward Modeling
par: Pathmanathan, Pankayaraj, et autres
Publié: (2025)
par: Pathmanathan, Pankayaraj, et autres
Publié: (2025)
Revisiting Observation Reduction for Web Agents: Comprehensive Evaluation with a Lightweight Framework
par: Enomoto, Masafumi, et autres
Publié: (2026)
par: Enomoto, Masafumi, et autres
Publié: (2026)
Read More, Think More: Revisiting Observation Reduction for Web Agents
par: Enomoto, Masafumi, et autres
Publié: (2026)
par: Enomoto, Masafumi, et autres
Publié: (2026)
Context Quality Matters in Training Fusion-in-Decoder for Extractive Open-Domain Question Answering
par: Akimoto, Kosuke, et autres
Publié: (2024)
par: Akimoto, Kosuke, et autres
Publié: (2024)
Self-Organized Agents: A LLM Multi-Agent Framework toward Ultra Large-Scale Code Generation and Optimization
par: Ishibashi, Yoichi, et autres
Publié: (2024)
par: Ishibashi, Yoichi, et autres
Publié: (2024)
Can Large Language Models Still Explain Themselves? Investigating the Impact of Quantization on Self-Explanations
par: Wang, Qianli, et autres
Publié: (2026)
par: Wang, Qianli, et autres
Publié: (2026)
Looking Inward: Language Models Can Learn About Themselves by Introspection
par: Binder, Felix J, et autres
Publié: (2024)
par: Binder, Felix J, et autres
Publié: (2024)
LightPAL: Lightweight Passage Retrieval for Open Domain Multi-Document Summarization
par: Enomoto, Masafumi, et autres
Publié: (2024)
par: Enomoto, Masafumi, et autres
Publié: (2024)
Large Language Models are Demonstration Pre-Selectors for Themselves
par: Jin, Jiarui, et autres
Publié: (2025)
par: Jin, Jiarui, et autres
Publié: (2025)
Can Language Models Critique Themselves? Investigating Self-Feedback for Retrieval Augmented Generation at BioASQ 2025
par: Ateia, Samy, et autres
Publié: (2025)
par: Ateia, Samy, et autres
Publié: (2025)
Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training
par: Yong, Zheng-Xin, et autres
Publié: (2025)
par: Yong, Zheng-Xin, et autres
Publié: (2025)
Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs
par: Tie, Guiyao, et autres
Publié: (2025)
par: Tie, Guiyao, et autres
Publié: (2025)
Can LLMs Explain Themselves Counterfactually?
par: Dehghanighobadi, Zahra, et autres
Publié: (2025)
par: Dehghanighobadi, Zahra, et autres
Publié: (2025)
DeLTa: A Decoding Strategy based on Logit Trajectory Prediction Improves Factuality and Reasoning Ability
par: He, Yunzhen, et autres
Publié: (2025)
par: He, Yunzhen, et autres
Publié: (2025)
Latent Principle Discovery for Language Model Self-Improvement
par: Ramji, Keshav, et autres
Publié: (2025)
par: Ramji, Keshav, et autres
Publié: (2025)
AlphaResearch: Accelerating New Algorithm Discovery with Language Models
par: Yu, Zhaojian, et autres
Publié: (2025)
par: Yu, Zhaojian, et autres
Publié: (2025)
Large Language Models are Algorithmically Blind
par: Venkatesh, Sohan, et autres
Publié: (2026)
par: Venkatesh, Sohan, et autres
Publié: (2026)
Large Language Models Can Self-Improve in Long-context Reasoning
par: Li, Siheng, et autres
Publié: (2024)
par: Li, Siheng, et autres
Publié: (2024)
Importance Weighting Can Help Large Language Models Self-Improve
par: Jiang, Chunyang, et autres
Publié: (2024)
par: Jiang, Chunyang, et autres
Publié: (2024)
Self-Improvement in Multimodal Large Language Models: A Survey
par: Deng, Shijian, et autres
Publié: (2025)
par: Deng, Shijian, et autres
Publié: (2025)
Enabling Language Models to Implicitly Learn Self-Improvement
par: Wang, Ziqi, et autres
Publié: (2023)
par: Wang, Ziqi, et autres
Publié: (2023)
Test-time Recursive Thinking: Self-Improvement without External Feedback
par: Zhuang, Yufan, et autres
Publié: (2026)
par: Zhuang, Yufan, et autres
Publié: (2026)
Helping Large Language Models Protect Themselves: An Enhanced Filtering and Summarization System
par: Muhaimin, Sheikh Samit, et autres
Publié: (2025)
par: Muhaimin, Sheikh Samit, et autres
Publié: (2025)
Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking
par: Zelikman, Eric, et autres
Publié: (2024)
par: Zelikman, Eric, et autres
Publié: (2024)
Structural Perturbation in Large Language Model Representations through Recursive Symbolic Regeneration
par: Eaglewood, Kathlyn, et autres
Publié: (2025)
par: Eaglewood, Kathlyn, et autres
Publié: (2025)
LLMs Can Teach Themselves to Better Predict the Future
par: Turtel, Benjamin, et autres
Publié: (2025)
par: Turtel, Benjamin, et autres
Publié: (2025)
PRIME: Policy-Reinforced Iterative Multi-agent Execution for Algorithmic Reasoning in Large Language Models
par: Xu, Jiawei, et autres
Publié: (2026)
par: Xu, Jiawei, et autres
Publié: (2026)
Advancing Large Language Model Attribution through Self-Improving
par: Huang, Lei, et autres
Publié: (2024)
par: Huang, Lei, et autres
Publié: (2024)
Intrinsically Correct Algorithms and Recursive Coalgebras
par: Alexandru, Cass, et autres
Publié: (2025)
par: Alexandru, Cass, et autres
Publié: (2025)
Recursive Introspection: Teaching Language Model Agents How to Self-Improve
par: Qu, Yuxiao, et autres
Publié: (2024)
par: Qu, Yuxiao, et autres
Publié: (2024)
Large Language Models Can Self-Improve At Web Agent Tasks
par: Patel, Ajay, et autres
Publié: (2024)
par: Patel, Ajay, et autres
Publié: (2024)
Documents similaires
-
Effective Harness Engineering for Algorithm Discovery with Coding Agents
par: Ishibashi, Yoichi, et autres
Publié: (2026) -
LaMDAgent: An Autonomous Framework for Post-Training Pipeline Optimization via LLM Agents
par: Yano, Taro, et autres
Publié: (2025) -
Mining Hidden Thoughts from Texts: Evaluating Continual Pretraining with Synthetic Data for LLM Reasoning
par: Ishibashi, Yoichi, et autres
Publié: (2025) -
Can a Crow Hatch a Falcon? Lineage Matters in Predicting Large Language Model Performance
par: Tamura, Takuya, et autres
Publié: (2025) -
An Empirical Study of LLM-as-a-Judge: How Design Choices Impact Evaluation Reliability
par: Yamauchi, Yusuke, et autres
Publié: (2025)