Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Pengyi, Skripkin, Matvey, Zubrey, Alexander, Kuznetsov, Andrey, Oseledets, Ivan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Back to Basics: Revisiting Exploration in Reinforcement Learning for LLM Reasoning via Generative Probabilities
di: Li, Pengyi, et al.
Pubblicazione: (2026)
di: Li, Pengyi, et al.
Pubblicazione: (2026)
Simple Vision-Language Math Reasoning via Rendered Text
di: Skripkin, Matvey, et al.
Pubblicazione: (2025)
di: Skripkin, Matvey, et al.
Pubblicazione: (2025)
The Shape of Learning: Anisotropy and Intrinsic Dimensions in Transformer-Based Models
di: Razzhigaev, Anton, et al.
Pubblicazione: (2023)
di: Razzhigaev, Anton, et al.
Pubblicazione: (2023)
Your Transformer is Secretly Linear
di: Razzhigaev, Anton, et al.
Pubblicazione: (2024)
di: Razzhigaev, Anton, et al.
Pubblicazione: (2024)
MaxInfo: A Training-Free Key-Frame Selection Method Using Maximum Volume for Enhanced Video Understanding
di: Li, Pengyi, et al.
Pubblicazione: (2025)
di: Li, Pengyi, et al.
Pubblicazione: (2025)
Listener-Rewarded Thinking in VLMs for Image Preferences
di: Gambashidze, Alexander, et al.
Pubblicazione: (2025)
di: Gambashidze, Alexander, et al.
Pubblicazione: (2025)
Attention Is All You Need But You Don't Need All Of It For Inference of Large Language Models
di: Tyukin, Georgy, et al.
Pubblicazione: (2024)
di: Tyukin, Georgy, et al.
Pubblicazione: (2024)
Logit-KL Flow Matching: Non-Autoregressive Text Generation via Sampling-Hybrid Inference
di: Sevriugov, Egor, et al.
Pubblicazione: (2024)
di: Sevriugov, Egor, et al.
Pubblicazione: (2024)
An Extra RMSNorm is All You Need for Fine Tuning to 1.58 Bits
di: Steinmetz, Cody, et al.
Pubblicazione: (2025)
di: Steinmetz, Cody, et al.
Pubblicazione: (2025)
SynthDST: Synthetic Data is All You Need for Few-Shot Dialog State Tracking
di: Kulkarni, Atharva, et al.
Pubblicazione: (2024)
di: Kulkarni, Atharva, et al.
Pubblicazione: (2024)
Synthetic Data RL: Task Definition Is All You Need
di: Guo, Yiduo, et al.
Pubblicazione: (2025)
di: Guo, Yiduo, et al.
Pubblicazione: (2025)
OmniFusion Technical Report
di: Goncharova, Elizaveta, et al.
Pubblicazione: (2024)
di: Goncharova, Elizaveta, et al.
Pubblicazione: (2024)
Reflect-RL: Two-Player Online RL Fine-Tuning for LMs
di: Zhou, Runlong, et al.
Pubblicazione: (2024)
di: Zhou, Runlong, et al.
Pubblicazione: (2024)
Latent Feature Mining for Predictive Model Enhancement with Large Language Models
di: Li, Bingxuan, et al.
Pubblicazione: (2024)
di: Li, Bingxuan, et al.
Pubblicazione: (2024)
More Agents Is All You Need
di: Li, Junyou, et al.
Pubblicazione: (2024)
di: Li, Junyou, et al.
Pubblicazione: (2024)
All You Need is One: Capsule Prompt Tuning with a Single Vector
di: Liu, Yiyang, et al.
Pubblicazione: (2025)
di: Liu, Yiyang, et al.
Pubblicazione: (2025)
Predicting Intermittent Job Failure Categories for Diagnosis Using Few-Shot Fine-Tuned Language Models
di: Aïdasso, Henri, et al.
Pubblicazione: (2026)
di: Aïdasso, Henri, et al.
Pubblicazione: (2026)
Attention Is Not All You Need: The Importance of Feedforward Networks in Transformer Models
di: Gerber, Isaac
Pubblicazione: (2025)
di: Gerber, Isaac
Pubblicazione: (2025)
Few-Shot Recalibration of Language Models
di: Li, Xiang Lisa, et al.
Pubblicazione: (2024)
di: Li, Xiang Lisa, et al.
Pubblicazione: (2024)
Guidance is All You Need: Temperature-Guided Reasoning in Large Language Models
di: Gomaa, Eyad, et al.
Pubblicazione: (2024)
di: Gomaa, Eyad, et al.
Pubblicazione: (2024)
Quantization of Large Language Models with an Overdetermined Basis
di: Merkulov, Daniil, et al.
Pubblicazione: (2024)
di: Merkulov, Daniil, et al.
Pubblicazione: (2024)
Block Rotation is All You Need for MXFP4 Quantization
di: Shao, Yuantian, et al.
Pubblicazione: (2025)
di: Shao, Yuantian, et al.
Pubblicazione: (2025)
Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2025)
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2025)
On the Utility of Domain-Adjacent Fine-Tuned Model Ensembles for Few-shot Problems
di: Alam, Md Ibrahim Ibne, et al.
Pubblicazione: (2024)
di: Alam, Md Ibrahim Ibne, et al.
Pubblicazione: (2024)
ToolRL: Reward is All Tool Learning Needs
di: Qian, Cheng, et al.
Pubblicazione: (2025)
di: Qian, Cheng, et al.
Pubblicazione: (2025)
Generative Model for Small Molecules with Latent Space RL Fine-Tuning to Protein Targets
di: Sob, Ulrich A. Mbou, et al.
Pubblicazione: (2024)
di: Sob, Ulrich A. Mbou, et al.
Pubblicazione: (2024)
Tensor Product Attention Is All You Need
di: Zhang, Yifan, et al.
Pubblicazione: (2025)
di: Zhang, Yifan, et al.
Pubblicazione: (2025)
Attention Smoothing Is All You Need For Unlearning
di: Zade, Saleh Zare, et al.
Pubblicazione: (2026)
di: Zade, Saleh Zare, et al.
Pubblicazione: (2026)
Evidence Is All You Need: Ordering Imaging Studies via Language Model Alignment with the ACR Appropriateness Criteria
di: Yao, Michael S., et al.
Pubblicazione: (2024)
di: Yao, Michael S., et al.
Pubblicazione: (2024)
Are Retrials All You Need? Enhancing Large Language Model Reasoning Without Verbalized Feedback
di: Potamitis, Nearchos, et al.
Pubblicazione: (2025)
di: Potamitis, Nearchos, et al.
Pubblicazione: (2025)
Scaling Sparse Fine-Tuning to Large Language Models
di: Ansell, Alan, et al.
Pubblicazione: (2024)
di: Ansell, Alan, et al.
Pubblicazione: (2024)
On the Spatial Structure of Mixture-of-Experts in Transformers
di: Bershatsky, Daniel, et al.
Pubblicazione: (2025)
di: Bershatsky, Daniel, et al.
Pubblicazione: (2025)
Exploring the Hidden Capacity of LLMs for One-Step Text Generation
di: Mezentsev, Gleb, et al.
Pubblicazione: (2025)
di: Mezentsev, Gleb, et al.
Pubblicazione: (2025)
One Model is All You Need: ByT5-Sanskrit, a Unified Model for Sanskrit NLP Tasks
di: Nehrdich, Sebastian, et al.
Pubblicazione: (2024)
di: Nehrdich, Sebastian, et al.
Pubblicazione: (2024)
Memory Is All You Need: Testing How Model Memory Affects LLM Performance in Annotation Tasks
di: Timoneda, Joan C., et al.
Pubblicazione: (2025)
di: Timoneda, Joan C., et al.
Pubblicazione: (2025)
Confidence over Time: Confidence Calibration with Temporal Logic for Large Language Model Reasoning
di: Mao, Zhenjiang, et al.
Pubblicazione: (2026)
di: Mao, Zhenjiang, et al.
Pubblicazione: (2026)
Geometry is All You Need: A Unified Taxonomy of Matrix and Tensor Factorization for Compression of Generative Language Models
di: Xu, Mingxue, et al.
Pubblicazione: (2024)
di: Xu, Mingxue, et al.
Pubblicazione: (2024)
Fine-Tuning Language Models with Just Forward Passes
di: Malladi, Sadhika, et al.
Pubblicazione: (2023)
di: Malladi, Sadhika, et al.
Pubblicazione: (2023)
Dissecting Fine-Tuning Unlearning in Large Language Models
di: Hong, Yihuai, et al.
Pubblicazione: (2024)
di: Hong, Yihuai, et al.
Pubblicazione: (2024)
Ignore the KL Penalty! Boosting Exploration on Critical Tokens to Enhance RL Fine-Tuning
di: Vassoyan, Jean, et al.
Pubblicazione: (2025)
di: Vassoyan, Jean, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Back to Basics: Revisiting Exploration in Reinforcement Learning for LLM Reasoning via Generative Probabilities
di: Li, Pengyi, et al.
Pubblicazione: (2026) -
Simple Vision-Language Math Reasoning via Rendered Text
di: Skripkin, Matvey, et al.
Pubblicazione: (2025) -
The Shape of Learning: Anisotropy and Intrinsic Dimensions in Transformer-Based Models
di: Razzhigaev, Anton, et al.
Pubblicazione: (2023) -
Your Transformer is Secretly Linear
di: Razzhigaev, Anton, et al.
Pubblicazione: (2024) -
MaxInfo: A Training-Free Key-Frame Selection Method Using Maximum Volume for Enhanced Video Understanding
di: Li, Pengyi, et al.
Pubblicazione: (2025)