Language Models can Self-Improve at State-Value Estimation for Better Search
Fuente:
arXiv
Salvato in:
| Autori principali: | Mendes, Ethan, Ritter, Alan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Anticipatory Evaluation of Language Models
di: Park, Jungsoo, et al.
Pubblicazione: (2025)
di: Park, Jungsoo, et al.
Pubblicazione: (2025)
Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression
di: Park, Jungsoo, et al.
Pubblicazione: (2026)
di: Park, Jungsoo, et al.
Pubblicazione: (2026)
Large Language Models can be Strong Self-Detoxifiers
di: Ko, Ching-Yun, et al.
Pubblicazione: (2024)
di: Ko, Ching-Yun, et al.
Pubblicazione: (2024)
Having Beer after Prayer? Measuring Cultural Bias in Large Language Models
di: Naous, Tarek, et al.
Pubblicazione: (2023)
di: Naous, Tarek, et al.
Pubblicazione: (2023)
Better Estimation of the Kullback--Leibler Divergence Between Language Models
di: Amini, Afra, et al.
Pubblicazione: (2025)
di: Amini, Afra, et al.
Pubblicazione: (2025)
Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training
di: Feng, Xidong, et al.
Pubblicazione: (2023)
di: Feng, Xidong, et al.
Pubblicazione: (2023)
SPaR: Self-Play with Tree-Search Refinement to Improve Instruction-Following in Large Language Models
di: Cheng, Jiale, et al.
Pubblicazione: (2024)
di: Cheng, Jiale, et al.
Pubblicazione: (2024)
Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States
di: Choi, Yunho, et al.
Pubblicazione: (2026)
di: Choi, Yunho, et al.
Pubblicazione: (2026)
Neural Parameter Search for Slimmer Fine-Tuned Models and Better Transfer
di: Du, Guodong, et al.
Pubblicazione: (2025)
di: Du, Guodong, et al.
Pubblicazione: (2025)
Soft Self-Consistency Improves Language Model Agents
di: Wang, Han, et al.
Pubblicazione: (2024)
di: Wang, Han, et al.
Pubblicazione: (2024)
Didactic to Constructive: Turning Expert Solutions into Learnable Reasoning
di: Mendes, Ethan, et al.
Pubblicazione: (2026)
di: Mendes, Ethan, et al.
Pubblicazione: (2026)
CodeIt: Self-Improving Language Models with Prioritized Hindsight Replay
di: Butt, Natasha, et al.
Pubblicazione: (2024)
di: Butt, Natasha, et al.
Pubblicazione: (2024)
Improving Large Models with Small models: Lower Costs and Better Performance
di: Chen, Dong, et al.
Pubblicazione: (2024)
di: Chen, Dong, et al.
Pubblicazione: (2024)
Instruction-tuned Language Models are Better Knowledge Learners
di: Jiang, Zhengbao, et al.
Pubblicazione: (2024)
di: Jiang, Zhengbao, et al.
Pubblicazione: (2024)
First is Not Really Better Than Last: Evaluating Layer Choice and Aggregation Strategies in Language Model Data Influence Estimation
di: Vitel, Dmytro, et al.
Pubblicazione: (2025)
di: Vitel, Dmytro, et al.
Pubblicazione: (2025)
Can LLMs Help Uncover Insights about LLMs? A Large-Scale, Evolving Literature Analysis of Frontier LLMs
di: Park, Jungsoo, et al.
Pubblicazione: (2025)
di: Park, Jungsoo, et al.
Pubblicazione: (2025)
Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models
di: Zhang, Qizheng, et al.
Pubblicazione: (2025)
di: Zhang, Qizheng, et al.
Pubblicazione: (2025)
Combee: Scaling Prompt Learning for Self-Improving Language Model Agents
di: Li, Hanchen, et al.
Pubblicazione: (2026)
di: Li, Hanchen, et al.
Pubblicazione: (2026)
Large Language Models Can Self-Improve At Web Agent Tasks
di: Patel, Ajay, et al.
Pubblicazione: (2024)
di: Patel, Ajay, et al.
Pubblicazione: (2024)
Recursive Introspection: Teaching Language Model Agents How to Self-Improve
di: Qu, Yuxiao, et al.
Pubblicazione: (2024)
di: Qu, Yuxiao, et al.
Pubblicazione: (2024)
SAIL: Self-Improving Efficient Online Alignment of Large Language Models
di: Ding, Mucong, et al.
Pubblicazione: (2024)
di: Ding, Mucong, et al.
Pubblicazione: (2024)
Improving Instruction Following in Language Models through Proxy-Based Uncertainty Estimation
di: Lee, JoonHo, et al.
Pubblicazione: (2024)
di: Lee, JoonHo, et al.
Pubblicazione: (2024)
Planning In Natural Language Improves LLM Search For Code Generation
di: Wang, Evan, et al.
Pubblicazione: (2024)
di: Wang, Evan, et al.
Pubblicazione: (2024)
Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences
di: Rosset, Corby, et al.
Pubblicazione: (2024)
di: Rosset, Corby, et al.
Pubblicazione: (2024)
SLED: Self Logits Evolution Decoding for Improving Factuality in Large Language Models
di: Zhang, Jianyi, et al.
Pubblicazione: (2024)
di: Zhang, Jianyi, et al.
Pubblicazione: (2024)
Repeat After Me: Transformers are Better than State Space Models at Copying
di: Jelassi, Samy, et al.
Pubblicazione: (2024)
di: Jelassi, Samy, et al.
Pubblicazione: (2024)
Foundational Autoraters: Taming Large Language Models for Better Automatic Evaluation
di: Vu, Tu, et al.
Pubblicazione: (2024)
di: Vu, Tu, et al.
Pubblicazione: (2024)
Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language Models
di: Dong, Guanting, et al.
Pubblicazione: (2024)
di: Dong, Guanting, et al.
Pubblicazione: (2024)
Weak-to-Strong Search: Align Large Language Models via Searching over Small Language Models
di: Zhou, Zhanhui, et al.
Pubblicazione: (2024)
di: Zhou, Zhanhui, et al.
Pubblicazione: (2024)
Recursive Language Models Meet Uncertainty: The Surprising Effectiveness of Self-Reflective Program Search for Long Context
di: Alizadeh, Keivan, et al.
Pubblicazione: (2026)
di: Alizadeh, Keivan, et al.
Pubblicazione: (2026)
Large Language Models can impersonate politicians and other public figures
di: Herbold, Steffen, et al.
Pubblicazione: (2024)
di: Herbold, Steffen, et al.
Pubblicazione: (2024)
Tree Search for Language Model Agents
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
Rephrase and Respond: Let Large Language Models Ask Better Questions for Themselves
di: Deng, Yihe, et al.
Pubblicazione: (2023)
di: Deng, Yihe, et al.
Pubblicazione: (2023)
MYTE: Morphology-Driven Byte Encoding for Better and Fairer Multilingual Language Modeling
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2024)
di: Limisiewicz, Tomasz, et al.
Pubblicazione: (2024)
Relative Value Biases in Large Language Models
di: Hayes, William M., et al.
Pubblicazione: (2024)
di: Hayes, William M., et al.
Pubblicazione: (2024)
Learning to Reason Over Time: Timeline Self-Reflection for Improved Temporal Reasoning in Language Models
di: Bazaga, Adrián, et al.
Pubblicazione: (2025)
di: Bazaga, Adrián, et al.
Pubblicazione: (2025)
Selective Self-Rehearsal: A Fine-Tuning Approach to Improve Generalization in Large Language Models
di: Gupta, Sonam, et al.
Pubblicazione: (2024)
di: Gupta, Sonam, et al.
Pubblicazione: (2024)
PlaSma: Making Small Language Models Better Procedural Knowledge Models for (Counterfactual) Planning
di: Brahman, Faeze, et al.
Pubblicazione: (2023)
di: Brahman, Faeze, et al.
Pubblicazione: (2023)
Internal Value Alignment in Large Language Models through Controlled Value Vector Activation
di: Jin, Haoran, et al.
Pubblicazione: (2025)
di: Jin, Haoran, et al.
Pubblicazione: (2025)
Value-Guided Search for Efficient Chain-of-Thought Reasoning
di: Wang, Kaiwen, et al.
Pubblicazione: (2025)
di: Wang, Kaiwen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Anticipatory Evaluation of Language Models
di: Park, Jungsoo, et al.
Pubblicazione: (2025) -
Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression
di: Park, Jungsoo, et al.
Pubblicazione: (2026) -
Large Language Models can be Strong Self-Detoxifiers
di: Ko, Ching-Yun, et al.
Pubblicazione: (2024) -
Having Beer after Prayer? Measuring Cultural Bias in Large Language Models
di: Naous, Tarek, et al.
Pubblicazione: (2023) -
Better Estimation of the Kullback--Leibler Divergence Between Language Models
di: Amini, Afra, et al.
Pubblicazione: (2025)