Mind the Gap: Examining the Self-Improvement Capabilities of Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Song, Yuda, Zhang, Hanlin, Eisenach, Carson, Kakade, Sham, Foster, Dean, Ghai, Udaya |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Neural Coordination and Capacity Control for Inventory Management
di: Eisenach, Carson, et al.
Pubblicazione: (2024)
di: Eisenach, Carson, et al.
Pubblicazione: (2024)
Outbound Modeling for Inventory Management
di: Savorgnan, Riccardo, et al.
Pubblicazione: (2025)
di: Savorgnan, Riccardo, et al.
Pubblicazione: (2025)
Prescriptive Scaling Reveals the Evolution of Language Model Capabilities
di: Zhang, Hanlin, et al.
Pubblicazione: (2026)
di: Zhang, Hanlin, et al.
Pubblicazione: (2026)
Discovering Hierarchical Latent Capabilities of Language Models via Causal Representation Learning
di: Jin, Jikai, et al.
Pubblicazione: (2025)
di: Jin, Jikai, et al.
Pubblicazione: (2025)
The Bicameral Model: Bidirectional Hidden-State Coupling Between Parallel Language Models
di: Flamant, Cedric, et al.
Pubblicazione: (2026)
di: Flamant, Cedric, et al.
Pubblicazione: (2026)
How Does Critical Batch Size Scale in Pre-training?
di: Zhang, Hanlin, et al.
Pubblicazione: (2024)
di: Zhang, Hanlin, et al.
Pubblicazione: (2024)
BRIDGE: Building Representations In Domain Guided Program Synthesis
di: George, Robert Joseph, et al.
Pubblicazione: (2025)
di: George, Robert Joseph, et al.
Pubblicazione: (2025)
CoLoR-Filter: Conditional Loss Reduction Filtering for Targeted Language Model Pre-training
di: Brandfonbrener, David, et al.
Pubblicazione: (2024)
di: Brandfonbrener, David, et al.
Pubblicazione: (2024)
Learning an Inventory Control Policy with General Inventory Arrival Dynamics
di: Andaz, Sohrab, et al.
Pubblicazione: (2023)
di: Andaz, Sohrab, et al.
Pubblicazione: (2023)
A Study on the Calibration of In-context Learning
di: Zhang, Hanlin, et al.
Pubblicazione: (2023)
di: Zhang, Hanlin, et al.
Pubblicazione: (2023)
Follow My Instruction and Spill the Beans: Scalable Data Extraction from Retrieval-Augmented Generation Systems
di: Qi, Zhenting, et al.
Pubblicazione: (2024)
di: Qi, Zhenting, et al.
Pubblicazione: (2024)
Eliminating Position Bias of Language Models: A Mechanistic Approach
di: Wang, Ziqi, et al.
Pubblicazione: (2024)
di: Wang, Ziqi, et al.
Pubblicazione: (2024)
EvoLM: In Search of Lost Language Model Training Dynamics
di: Qi, Zhenting, et al.
Pubblicazione: (2025)
di: Qi, Zhenting, et al.
Pubblicazione: (2025)
Peer-Predictive Self-Training for Language Model Reasoning
di: Feng, Shi, et al.
Pubblicazione: (2026)
di: Feng, Shi, et al.
Pubblicazione: (2026)
Self-Improvement in Language Models: The Sharpening Mechanism
di: Huang, Audrey, et al.
Pubblicazione: (2024)
di: Huang, Audrey, et al.
Pubblicazione: (2024)
Repeat After Me: Transformers are Better than State Space Models at Copying
di: Jelassi, Samy, et al.
Pubblicazione: (2024)
di: Jelassi, Samy, et al.
Pubblicazione: (2024)
In Good GRACEs: Principled Teacher Selection for Knowledge Distillation
di: Panigrahi, Abhishek, et al.
Pubblicazione: (2025)
di: Panigrahi, Abhishek, et al.
Pubblicazione: (2025)
LoRA Soups: Merging LoRAs for Practical Skill Composition Tasks
di: Prabhakar, Akshara, et al.
Pubblicazione: (2024)
di: Prabhakar, Akshara, et al.
Pubblicazione: (2024)
On the Thinking-Language Modeling Gap in Large Language Models
di: Liu, Chenxi, et al.
Pubblicazione: (2025)
di: Liu, Chenxi, et al.
Pubblicazione: (2025)
Loss-to-Loss Prediction: Scaling Laws for All Datasets
di: Brandfonbrener, David, et al.
Pubblicazione: (2024)
di: Brandfonbrener, David, et al.
Pubblicazione: (2024)
Ready from Day 1: Population-Aware Coordination for Large-Scale Constrained Multi-Agent Systems
di: Wang, Angel, et al.
Pubblicazione: (2026)
di: Wang, Angel, et al.
Pubblicazione: (2026)
The Role of Sparsity for Length Generalization in Transformers
di: Golowich, Noah, et al.
Pubblicazione: (2025)
di: Golowich, Noah, et al.
Pubblicazione: (2025)
A Careful Examination of Large Language Model Performance on Grade School Arithmetic
di: Zhang, Hugh, et al.
Pubblicazione: (2024)
di: Zhang, Hugh, et al.
Pubblicazione: (2024)
Investigating Symbolic Capabilities of Large Language Models
di: Dave, Neisarg, et al.
Pubblicazione: (2024)
di: Dave, Neisarg, et al.
Pubblicazione: (2024)
Crosslingual Capabilities and Knowledge Barriers in Multilingual Large Language Models
di: Chua, Lynn, et al.
Pubblicazione: (2024)
di: Chua, Lynn, et al.
Pubblicazione: (2024)
Sample-Optimal Agnostic Boosting with Unlabeled Data
di: Ghai, Udaya, et al.
Pubblicazione: (2025)
di: Ghai, Udaya, et al.
Pubblicazione: (2025)
Accelerating Unbiased LLM Evaluation via Synthetic Feedback
di: Zhou, Zhaoyi, et al.
Pubblicazione: (2025)
di: Zhou, Zhaoyi, et al.
Pubblicazione: (2025)
Outcome-based Exploration for LLM Reasoning
di: Song, Yuda, et al.
Pubblicazione: (2025)
di: Song, Yuda, et al.
Pubblicazione: (2025)
Scaling Laws for Discriminative Classification in Large Language Models
di: Wyatte, Dean, et al.
Pubblicazione: (2024)
di: Wyatte, Dean, et al.
Pubblicazione: (2024)
Connections between Schedule-Free Optimizers, AdEMAMix, and Accelerated SGD Variants
di: Morwani, Depen, et al.
Pubblicazione: (2025)
di: Morwani, Depen, et al.
Pubblicazione: (2025)
Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language Models
di: Dong, Guanting, et al.
Pubblicazione: (2024)
di: Dong, Guanting, et al.
Pubblicazione: (2024)
LLMCheckup: Conversational Examination of Large Language Models via Interpretability Tools and Self-Explanations
di: Wang, Qianli, et al.
Pubblicazione: (2024)
di: Wang, Qianli, et al.
Pubblicazione: (2024)
CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models
di: Tu, Ruibo, et al.
Pubblicazione: (2024)
di: Tu, Ruibo, et al.
Pubblicazione: (2024)
Latent Principle Discovery for Language Model Self-Improvement
di: Ramji, Keshav, et al.
Pubblicazione: (2025)
di: Ramji, Keshav, et al.
Pubblicazione: (2025)
Sample-Efficient Agnostic Boosting
di: Ghai, Udaya, et al.
Pubblicazione: (2024)
di: Ghai, Udaya, et al.
Pubblicazione: (2024)
An Examination on the Effectiveness of Divide-and-Conquer Prompting in Large Language Models
di: Zhang, Yizhou, et al.
Pubblicazione: (2024)
di: Zhang, Yizhou, et al.
Pubblicazione: (2024)
Benchmarking Generation and Evaluation Capabilities of Large Language Models for Instruction Controllable Summarization
di: Liu, Yixin, et al.
Pubblicazione: (2023)
di: Liu, Yixin, et al.
Pubblicazione: (2023)
TritonBench: Benchmarking Large Language Model Capabilities for Generating Triton Operators
di: Li, Jianling, et al.
Pubblicazione: (2025)
di: Li, Jianling, et al.
Pubblicazione: (2025)
Evaluation and Improvement of Fault Detection for Large Language Models
di: Hu, Qiang, et al.
Pubblicazione: (2024)
di: Hu, Qiang, et al.
Pubblicazione: (2024)
On the Convergence of Moral Self-Correction in Large Language Models
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Neural Coordination and Capacity Control for Inventory Management
di: Eisenach, Carson, et al.
Pubblicazione: (2024) -
Outbound Modeling for Inventory Management
di: Savorgnan, Riccardo, et al.
Pubblicazione: (2025) -
Prescriptive Scaling Reveals the Evolution of Language Model Capabilities
di: Zhang, Hanlin, et al.
Pubblicazione: (2026) -
Discovering Hierarchical Latent Capabilities of Language Models via Causal Representation Learning
di: Jin, Jikai, et al.
Pubblicazione: (2025) -
The Bicameral Model: Bidirectional Hidden-State Coupling Between Parallel Language Models
di: Flamant, Cedric, et al.
Pubblicazione: (2026)