Recursive Introspection: Teaching Language Model Agents How to Self-Improve
Fuente:
arXiv
Salvato in:
| Autori principali: | Qu, Yuxiao, Zhang, Tianjun, Garg, Naman, Kumar, Aviral |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CaRT: Teaching LLM Agents to Know When They Know Enough
di: Liu, Grace, et al.
Pubblicazione: (2025)
di: Liu, Grace, et al.
Pubblicazione: (2025)
Recursive Agent Optimization
di: Gandhi, Apurva, et al.
Pubblicazione: (2026)
di: Gandhi, Apurva, et al.
Pubblicazione: (2026)
QED-Nano: Teaching a Tiny Model to Prove Hard Theorems
di: LM-Provers, et al.
Pubblicazione: (2026)
di: LM-Provers, et al.
Pubblicazione: (2026)
POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration
di: Qu, Yuxiao, et al.
Pubblicazione: (2026)
di: Qu, Yuxiao, et al.
Pubblicazione: (2026)
RIV: Recursive Introspection Mask Diffusion Vision Language Model
di: Li, YuQian, et al.
Pubblicazione: (2025)
di: Li, YuQian, et al.
Pubblicazione: (2025)
Unfamiliar Finetuning Examples Control How Language Models Hallucinate
di: Kang, Katie, et al.
Pubblicazione: (2024)
di: Kang, Katie, et al.
Pubblicazione: (2024)
IntroLM: Introspective Language Models via Prefilling-Time Self-Evaluation
di: Kasnavieh, Hossein Hosseini, et al.
Pubblicazione: (2026)
di: Kasnavieh, Hossein Hosseini, et al.
Pubblicazione: (2026)
ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL
di: Zhou, Yifei, et al.
Pubblicazione: (2024)
di: Zhou, Yifei, et al.
Pubblicazione: (2024)
RLAD: Training LLMs to Discover Abstractions for Solving Reasoning Problems
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
Soft Self-Consistency Improves Language Model Agents
di: Wang, Han, et al.
Pubblicazione: (2024)
di: Wang, Han, et al.
Pubblicazione: (2024)
Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences
di: Rosset, Corby, et al.
Pubblicazione: (2024)
di: Rosset, Corby, et al.
Pubblicazione: (2024)
Self-Taught Optimizer (STOP): Recursively Self-Improving Code Generation
di: Zelikman, Eric, et al.
Pubblicazione: (2023)
di: Zelikman, Eric, et al.
Pubblicazione: (2023)
Combee: Scaling Prompt Learning for Self-Improving Language Model Agents
di: Li, Hanchen, et al.
Pubblicazione: (2026)
di: Li, Hanchen, et al.
Pubblicazione: (2026)
Extensive Self-Contrast Enables Feedback-Free Language Model Alignment
di: Liu, Xiao, et al.
Pubblicazione: (2024)
di: Liu, Xiao, et al.
Pubblicazione: (2024)
SPaR: Self-Play with Tree-Search Refinement to Improve Instruction-Following in Large Language Models
di: Cheng, Jiale, et al.
Pubblicazione: (2024)
di: Cheng, Jiale, et al.
Pubblicazione: (2024)
Large Language Models Can Self-Improve At Web Agent Tasks
di: Patel, Ajay, et al.
Pubblicazione: (2024)
di: Patel, Ajay, et al.
Pubblicazione: (2024)
Recursive Multi-Agent Systems
di: Yang, Xiyuan, et al.
Pubblicazione: (2026)
di: Yang, Xiyuan, et al.
Pubblicazione: (2026)
Analytic Subspace Routing: How Recursive Least Squares Works in Continual Learning of Large Language Model
di: Tong, Kai, et al.
Pubblicazione: (2025)
di: Tong, Kai, et al.
Pubblicazione: (2025)
Introspective Planning: Aligning Robots' Uncertainty with Inherent Task Ambiguity
di: Liang, Kaiqu, et al.
Pubblicazione: (2024)
di: Liang, Kaiqu, et al.
Pubblicazione: (2024)
Beyond Introspection: Reinforcing Thinking via Externalist Behavioral Feedback
di: Yang, Diji, et al.
Pubblicazione: (2024)
di: Yang, Diji, et al.
Pubblicazione: (2024)
On The Truthfulness of 'Surprisingly Likely' Responses of Large Language Models
di: Goel, Naman
Pubblicazione: (2023)
di: Goel, Naman
Pubblicazione: (2023)
Zero-Overhead Introspection for Adaptive Test-Time Compute
di: Manvi, Rohin, et al.
Pubblicazione: (2025)
di: Manvi, Rohin, et al.
Pubblicazione: (2025)
ORION: Teaching Language Models to Reason Efficiently in the Language of Thought
di: Tanmay, Kumar, et al.
Pubblicazione: (2025)
di: Tanmay, Kumar, et al.
Pubblicazione: (2025)
Recursive Language Models Meet Uncertainty: The Surprising Effectiveness of Self-Reflective Program Search for Long Context
di: Alizadeh, Keivan, et al.
Pubblicazione: (2026)
di: Alizadeh, Keivan, et al.
Pubblicazione: (2026)
A comprehensive study of on-device NLP applications -- VQA, automated Form filling, Smart Replies for Linguistic Codeswitching
di: Goyal, Naman
Pubblicazione: (2024)
di: Goyal, Naman
Pubblicazione: (2024)
InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning
di: Yang, Matthew Y. R., et al.
Pubblicazione: (2026)
di: Yang, Matthew Y. R., et al.
Pubblicazione: (2026)
CodeIt: Self-Improving Language Models with Prioritized Hindsight Replay
di: Butt, Natasha, et al.
Pubblicazione: (2024)
di: Butt, Natasha, et al.
Pubblicazione: (2024)
RLAC: Reinforcement Learning with Adversarial Critic for Free-Form Generation Tasks
di: Wu, Mian, et al.
Pubblicazione: (2025)
di: Wu, Mian, et al.
Pubblicazione: (2025)
Scalable Oversight for Superhuman AI via Recursive Self-Critiquing
di: Wen, Xueru, et al.
Pubblicazione: (2025)
di: Wen, Xueru, et al.
Pubblicazione: (2025)
Recursive Concept Evolution for Compositional Reasoning in Large Language Models
di: Chaudhry, Sarim
Pubblicazione: (2026)
di: Chaudhry, Sarim
Pubblicazione: (2026)
CARE: Decoding Time Safety Alignment via Rollback and Introspection Intervention
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
RL on Incorrect Synthetic Data Scales the Efficiency of LLM Math Reasoning by Eight-Fold
di: Setlur, Amrith, et al.
Pubblicazione: (2024)
di: Setlur, Amrith, et al.
Pubblicazione: (2024)
AgentBench: Evaluating LLMs as Agents
di: Liu, Xiao, et al.
Pubblicazione: (2023)
di: Liu, Xiao, et al.
Pubblicazione: (2023)
Self-Improving LLM Agents at Test-Time
di: Acikgoz, Emre Can, et al.
Pubblicazione: (2025)
di: Acikgoz, Emre Can, et al.
Pubblicazione: (2025)
Understanding Emergent Abilities of Language Models from the Loss Perspective
di: Du, Zhengxiao, et al.
Pubblicazione: (2024)
di: Du, Zhengxiao, et al.
Pubblicazione: (2024)
Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models
di: Zhang, Qizheng, et al.
Pubblicazione: (2025)
di: Zhang, Qizheng, et al.
Pubblicazione: (2025)
Inference-Aware Fine-Tuning for Best-of-N Sampling in Large Language Models
di: Chow, Yinlam, et al.
Pubblicazione: (2024)
di: Chow, Yinlam, et al.
Pubblicazione: (2024)
SLED: Self Logits Evolution Decoding for Improving Factuality in Large Language Models
di: Zhang, Jianyi, et al.
Pubblicazione: (2024)
di: Zhang, Jianyi, et al.
Pubblicazione: (2024)
Debate Helps Weak Judges Reward Stronger Models
di: Elasky, Ethan, et al.
Pubblicazione: (2026)
di: Elasky, Ethan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
CaRT: Teaching LLM Agents to Know When They Know Enough
di: Liu, Grace, et al.
Pubblicazione: (2025) -
Recursive Agent Optimization
di: Gandhi, Apurva, et al.
Pubblicazione: (2026) -
QED-Nano: Teaching a Tiny Model to Prove Hard Theorems
di: LM-Provers, et al.
Pubblicazione: (2026) -
POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration
di: Qu, Yuxiao, et al.
Pubblicazione: (2026) -
RIV: Recursive Introspection Mask Diffusion Vision Language Model
di: Li, YuQian, et al.
Pubblicazione: (2025)