Can Large Language Models Invent Algorithms to Improve Themselves?: Algorithm Discovery for Recursive Self-Improvement through Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Ishibashi, Yoichi, Yano, Taro, Oyamada, Masafumi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Effective Harness Engineering for Algorithm Discovery with Coding Agents
di: Ishibashi, Yoichi, et al.
Pubblicazione: (2026)
di: Ishibashi, Yoichi, et al.
Pubblicazione: (2026)
LaMDAgent: An Autonomous Framework for Post-Training Pipeline Optimization via LLM Agents
di: Yano, Taro, et al.
Pubblicazione: (2025)
di: Yano, Taro, et al.
Pubblicazione: (2025)
Mining Hidden Thoughts from Texts: Evaluating Continual Pretraining with Synthetic Data for LLM Reasoning
di: Ishibashi, Yoichi, et al.
Pubblicazione: (2025)
di: Ishibashi, Yoichi, et al.
Pubblicazione: (2025)
Can a Crow Hatch a Falcon? Lineage Matters in Predicting Large Language Model Performance
di: Tamura, Takuya, et al.
Pubblicazione: (2025)
di: Tamura, Takuya, et al.
Pubblicazione: (2025)
An Empirical Study of LLM-as-a-Judge: How Design Choices Impact Evaluation Reliability
di: Yamauchi, Yusuke, et al.
Pubblicazione: (2025)
di: Yamauchi, Yusuke, et al.
Pubblicazione: (2025)
Knowledge Sanitization of Large Language Models
di: Ishibashi, Yoichi, et al.
Pubblicazione: (2023)
di: Ishibashi, Yoichi, et al.
Pubblicazione: (2023)
$M^3$ Scaling Law: Optimizing Multi-Epoch, Multi-Lingual, and Multi-Stage Training for Low-Resource Language Models
di: Akimoto, Kosuke, et al.
Pubblicazione: (2024)
di: Akimoto, Kosuke, et al.
Pubblicazione: (2024)
Jellyfish: A Large Language Model for Data Preprocessing
di: Zhang, Haochen, et al.
Pubblicazione: (2023)
di: Zhang, Haochen, et al.
Pubblicazione: (2023)
ItD: Large Language Models Can Teach Themselves Induction through Deduction
di: Sun, Wangtao, et al.
Pubblicazione: (2024)
di: Sun, Wangtao, et al.
Pubblicazione: (2024)
Reward Models Can Improve Themselves: Reward-Guided Adversarial Failure Mode Discovery for Robust Reward Modeling
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2025)
di: Pathmanathan, Pankayaraj, et al.
Pubblicazione: (2025)
Revisiting Observation Reduction for Web Agents: Comprehensive Evaluation with a Lightweight Framework
di: Enomoto, Masafumi, et al.
Pubblicazione: (2026)
di: Enomoto, Masafumi, et al.
Pubblicazione: (2026)
Read More, Think More: Revisiting Observation Reduction for Web Agents
di: Enomoto, Masafumi, et al.
Pubblicazione: (2026)
di: Enomoto, Masafumi, et al.
Pubblicazione: (2026)
Context Quality Matters in Training Fusion-in-Decoder for Extractive Open-Domain Question Answering
di: Akimoto, Kosuke, et al.
Pubblicazione: (2024)
di: Akimoto, Kosuke, et al.
Pubblicazione: (2024)
Self-Organized Agents: A LLM Multi-Agent Framework toward Ultra Large-Scale Code Generation and Optimization
di: Ishibashi, Yoichi, et al.
Pubblicazione: (2024)
di: Ishibashi, Yoichi, et al.
Pubblicazione: (2024)
Can Large Language Models Still Explain Themselves? Investigating the Impact of Quantization on Self-Explanations
di: Wang, Qianli, et al.
Pubblicazione: (2026)
di: Wang, Qianli, et al.
Pubblicazione: (2026)
Looking Inward: Language Models Can Learn About Themselves by Introspection
di: Binder, Felix J, et al.
Pubblicazione: (2024)
di: Binder, Felix J, et al.
Pubblicazione: (2024)
LightPAL: Lightweight Passage Retrieval for Open Domain Multi-Document Summarization
di: Enomoto, Masafumi, et al.
Pubblicazione: (2024)
di: Enomoto, Masafumi, et al.
Pubblicazione: (2024)
Large Language Models are Demonstration Pre-Selectors for Themselves
di: Jin, Jiarui, et al.
Pubblicazione: (2025)
di: Jin, Jiarui, et al.
Pubblicazione: (2025)
Can Language Models Critique Themselves? Investigating Self-Feedback for Retrieval Augmented Generation at BioASQ 2025
di: Ateia, Samy, et al.
Pubblicazione: (2025)
di: Ateia, Samy, et al.
Pubblicazione: (2025)
Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2025)
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2025)
Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs
di: Tie, Guiyao, et al.
Pubblicazione: (2025)
di: Tie, Guiyao, et al.
Pubblicazione: (2025)
Can LLMs Explain Themselves Counterfactually?
di: Dehghanighobadi, Zahra, et al.
Pubblicazione: (2025)
di: Dehghanighobadi, Zahra, et al.
Pubblicazione: (2025)
DeLTa: A Decoding Strategy based on Logit Trajectory Prediction Improves Factuality and Reasoning Ability
di: He, Yunzhen, et al.
Pubblicazione: (2025)
di: He, Yunzhen, et al.
Pubblicazione: (2025)
Latent Principle Discovery for Language Model Self-Improvement
di: Ramji, Keshav, et al.
Pubblicazione: (2025)
di: Ramji, Keshav, et al.
Pubblicazione: (2025)
AlphaResearch: Accelerating New Algorithm Discovery with Language Models
di: Yu, Zhaojian, et al.
Pubblicazione: (2025)
di: Yu, Zhaojian, et al.
Pubblicazione: (2025)
Large Language Models are Algorithmically Blind
di: Venkatesh, Sohan, et al.
Pubblicazione: (2026)
di: Venkatesh, Sohan, et al.
Pubblicazione: (2026)
Large Language Models Can Self-Improve in Long-context Reasoning
di: Li, Siheng, et al.
Pubblicazione: (2024)
di: Li, Siheng, et al.
Pubblicazione: (2024)
Importance Weighting Can Help Large Language Models Self-Improve
di: Jiang, Chunyang, et al.
Pubblicazione: (2024)
di: Jiang, Chunyang, et al.
Pubblicazione: (2024)
Self-Improvement in Multimodal Large Language Models: A Survey
di: Deng, Shijian, et al.
Pubblicazione: (2025)
di: Deng, Shijian, et al.
Pubblicazione: (2025)
Enabling Language Models to Implicitly Learn Self-Improvement
di: Wang, Ziqi, et al.
Pubblicazione: (2023)
di: Wang, Ziqi, et al.
Pubblicazione: (2023)
Test-time Recursive Thinking: Self-Improvement without External Feedback
di: Zhuang, Yufan, et al.
Pubblicazione: (2026)
di: Zhuang, Yufan, et al.
Pubblicazione: (2026)
Helping Large Language Models Protect Themselves: An Enhanced Filtering and Summarization System
di: Muhaimin, Sheikh Samit, et al.
Pubblicazione: (2025)
di: Muhaimin, Sheikh Samit, et al.
Pubblicazione: (2025)
Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking
di: Zelikman, Eric, et al.
Pubblicazione: (2024)
di: Zelikman, Eric, et al.
Pubblicazione: (2024)
Structural Perturbation in Large Language Model Representations through Recursive Symbolic Regeneration
di: Eaglewood, Kathlyn, et al.
Pubblicazione: (2025)
di: Eaglewood, Kathlyn, et al.
Pubblicazione: (2025)
LLMs Can Teach Themselves to Better Predict the Future
di: Turtel, Benjamin, et al.
Pubblicazione: (2025)
di: Turtel, Benjamin, et al.
Pubblicazione: (2025)
PRIME: Policy-Reinforced Iterative Multi-agent Execution for Algorithmic Reasoning in Large Language Models
di: Xu, Jiawei, et al.
Pubblicazione: (2026)
di: Xu, Jiawei, et al.
Pubblicazione: (2026)
Advancing Large Language Model Attribution through Self-Improving
di: Huang, Lei, et al.
Pubblicazione: (2024)
di: Huang, Lei, et al.
Pubblicazione: (2024)
Intrinsically Correct Algorithms and Recursive Coalgebras
di: Alexandru, Cass, et al.
Pubblicazione: (2025)
di: Alexandru, Cass, et al.
Pubblicazione: (2025)
Recursive Introspection: Teaching Language Model Agents How to Self-Improve
di: Qu, Yuxiao, et al.
Pubblicazione: (2024)
di: Qu, Yuxiao, et al.
Pubblicazione: (2024)
Large Language Models Can Self-Improve At Web Agent Tasks
di: Patel, Ajay, et al.
Pubblicazione: (2024)
di: Patel, Ajay, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Effective Harness Engineering for Algorithm Discovery with Coding Agents
di: Ishibashi, Yoichi, et al.
Pubblicazione: (2026) -
LaMDAgent: An Autonomous Framework for Post-Training Pipeline Optimization via LLM Agents
di: Yano, Taro, et al.
Pubblicazione: (2025) -
Mining Hidden Thoughts from Texts: Evaluating Continual Pretraining with Synthetic Data for LLM Reasoning
di: Ishibashi, Yoichi, et al.
Pubblicazione: (2025) -
Can a Crow Hatch a Falcon? Lineage Matters in Predicting Large Language Model Performance
di: Tamura, Takuya, et al.
Pubblicazione: (2025) -
An Empirical Study of LLM-as-a-Judge: How Design Choices Impact Evaluation Reliability
di: Yamauchi, Yusuke, et al.
Pubblicazione: (2025)