Efficiently Learning at Test-Time: Active Fine-Tuning of LLMs
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Hübotter, Jonas, Bongni, Sascha, Hakimi, Ido, Krause, Andreas |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging
von: Bertolissi, Ryo, et al.
Veröffentlicht: (2025)
von: Bertolissi, Ryo, et al.
Veröffentlicht: (2025)
Learning on the Job: Test-Time Curricula for Targeted Reinforcement Learning
von: Hübotter, Jonas, et al.
Veröffentlicht: (2025)
von: Hübotter, Jonas, et al.
Veröffentlicht: (2025)
Active Few-Shot Fine-Tuning
von: Hübotter, Jonas, et al.
Veröffentlicht: (2024)
von: Hübotter, Jonas, et al.
Veröffentlicht: (2024)
Maximizing Prefix-Confidence at Test-Time Efficiently Improves Mathematical Reasoning
von: Otth, Matthias, et al.
Veröffentlicht: (2025)
von: Otth, Matthias, et al.
Veröffentlicht: (2025)
Probabilistic Artificial Intelligence
von: Krause, Andreas, et al.
Veröffentlicht: (2025)
von: Krause, Andreas, et al.
Veröffentlicht: (2025)
Transductive Active Learning: Theory and Applications
von: Hübotter, Jonas, et al.
Veröffentlicht: (2024)
von: Hübotter, Jonas, et al.
Veröffentlicht: (2024)
ActiveUltraFeedback: Efficient Preference Data Generation using Active Learning
von: Melikidze, Davit, et al.
Veröffentlicht: (2026)
von: Melikidze, Davit, et al.
Veröffentlicht: (2026)
Specialization after Generalization: Towards Understanding Test-Time Training in Foundation Models
von: Hübotter, Jonas, et al.
Veröffentlicht: (2025)
von: Hübotter, Jonas, et al.
Veröffentlicht: (2025)
Active Fine-Tuning of Multi-Task Policies
von: Bagatella, Marco, et al.
Veröffentlicht: (2024)
von: Bagatella, Marco, et al.
Veröffentlicht: (2024)
Reinforcement Learning via Self-Distillation
von: Hübotter, Jonas, et al.
Veröffentlicht: (2026)
von: Hübotter, Jonas, et al.
Veröffentlicht: (2026)
DISCOVER: Automated Curricula for Sparse-Reward Reinforcement Learning
von: Diaz-Bone, Leander, et al.
Veröffentlicht: (2025)
von: Diaz-Bone, Leander, et al.
Veröffentlicht: (2025)
Majority Voting for Code Generation
von: Launer, Tim, et al.
Veröffentlicht: (2026)
von: Launer, Tim, et al.
Veröffentlicht: (2026)
Thompson Sampling via Fine-Tuning of LLMs
von: Menet, Nicolas, et al.
Veröffentlicht: (2025)
von: Menet, Nicolas, et al.
Veröffentlicht: (2025)
Aligning Language Models from User Interactions
von: Buening, Thomas Kleine, et al.
Veröffentlicht: (2026)
von: Buening, Thomas Kleine, et al.
Veröffentlicht: (2026)
Test-Time Tuned Language Models Enable End-to-end De Novo Molecular Structure Generation from MS/MS Spectra
von: Mismetti, Laura, et al.
Veröffentlicht: (2025)
von: Mismetti, Laura, et al.
Veröffentlicht: (2025)
RewardUQ: A Unified Framework for Uncertainty-Aware Reward Models
von: Yang, Daniel, et al.
Veröffentlicht: (2026)
von: Yang, Daniel, et al.
Veröffentlicht: (2026)
Simulation Priors for Data-Efficient Deep Learning
von: Treven, Lenart, et al.
Veröffentlicht: (2025)
von: Treven, Lenart, et al.
Veröffentlicht: (2025)
From LLMs to Edge: Parameter-Efficient Fine-Tuning on Edge Devices
von: Slamanig, Georg, et al.
Veröffentlicht: (2025)
von: Slamanig, Georg, et al.
Veröffentlicht: (2025)
Test-time Offline Reinforcement Learning on Goal-related Experience
von: Bagatella, Marco, et al.
Veröffentlicht: (2025)
von: Bagatella, Marco, et al.
Veröffentlicht: (2025)
Efficient Differentially Private Fine-Tuning of LLMs via Reinforcement Learning
von: Khadangi, Afshin, et al.
Veröffentlicht: (2025)
von: Khadangi, Afshin, et al.
Veröffentlicht: (2025)
ESSAM: A Novel Competitive Evolution Strategies Approach to Reinforcement Learning for Memory Efficient LLMs Fine-Tuning
von: Sun, Zhishen, et al.
Veröffentlicht: (2026)
von: Sun, Zhishen, et al.
Veröffentlicht: (2026)
LITE: Efficiently Estimating Gaussian Probability of Maximality
von: Menet, Nicolas, et al.
Veröffentlicht: (2025)
von: Menet, Nicolas, et al.
Veröffentlicht: (2025)
Understanding and Preserving Safety in Fine-Tuned LLMs
von: Zhang, Jiawen, et al.
Veröffentlicht: (2026)
von: Zhang, Jiawen, et al.
Veröffentlicht: (2026)
Efficiency vs. Alignment: Investigating Safety and Fairness Risks in Parameter-Efficient Fine-Tuning of LLMs
von: Taraghi, Mina, et al.
Veröffentlicht: (2025)
von: Taraghi, Mina, et al.
Veröffentlicht: (2025)
On-the-Fly Adaptation to Quantization: Configuration-Aware LoRA for Efficient Fine-Tuning of Quantized LLMs
von: Ye, Rongguang, et al.
Veröffentlicht: (2025)
von: Ye, Rongguang, et al.
Veröffentlicht: (2025)
DONOD: Efficient and Generalizable Instruction Fine-Tuning for LLMs via Model-Intrinsic Dataset Pruning
von: Hu, Jucheng, et al.
Veröffentlicht: (2025)
von: Hu, Jucheng, et al.
Veröffentlicht: (2025)
Teaching LLMs How to Learn with Contextual Fine-Tuning
von: Choi, Younwoo, et al.
Veröffentlicht: (2025)
von: Choi, Younwoo, et al.
Veröffentlicht: (2025)
Zeroth-Order Fine-Tuning of LLMs in Random Subspaces
von: Yu, Ziming, et al.
Veröffentlicht: (2024)
von: Yu, Ziming, et al.
Veröffentlicht: (2024)
Zeroth-Order Fine-Tuning of LLMs with Extreme Sparsity
von: Guo, Wentao, et al.
Veröffentlicht: (2024)
von: Guo, Wentao, et al.
Veröffentlicht: (2024)
Hallucination Detection in LLMs: Fast and Memory-Efficient Fine-Tuned Models
von: Arteaga, Gabriel Y., et al.
Veröffentlicht: (2024)
von: Arteaga, Gabriel Y., et al.
Veröffentlicht: (2024)
Reinforcement Learning Fine-Tuning Enhances Activation Intensity and Diversity in the Internal Circuitry of LLMs
von: Zhang, Honglin, et al.
Veröffentlicht: (2025)
von: Zhang, Honglin, et al.
Veröffentlicht: (2025)
RevFFN: Memory-Efficient Full-Parameter Fine-Tuning of Mixture-of-Experts LLMs with Reversible Blocks
von: Liu, Ningyuan, et al.
Veröffentlicht: (2025)
von: Liu, Ningyuan, et al.
Veröffentlicht: (2025)
Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning
von: Qu, Yuxiao, et al.
Veröffentlicht: (2025)
von: Qu, Yuxiao, et al.
Veröffentlicht: (2025)
Rethinking Fine-Tuning when Scaling Test-Time Compute: Limiting Confidence Improves Mathematical Reasoning
von: Chen, Feng, et al.
Veröffentlicht: (2025)
von: Chen, Feng, et al.
Veröffentlicht: (2025)
Fine-Tuned In-Context Learners for Efficient Adaptation
von: Bornschein, Jorg, et al.
Veröffentlicht: (2025)
von: Bornschein, Jorg, et al.
Veröffentlicht: (2025)
Aligning LLMs with Biomedical Knowledge using Balanced Fine-Tuning
von: Tang, Zhenchao, et al.
Veröffentlicht: (2025)
von: Tang, Zhenchao, et al.
Veröffentlicht: (2025)
Federated Fine-Tuning of LLMs: Framework Comparison and Research Directions
von: Yan, Na, et al.
Veröffentlicht: (2025)
von: Yan, Na, et al.
Veröffentlicht: (2025)
A Survey on Parameter-Efficient Fine-Tuning for Foundation Models in Federated Learning
von: Bian, Jieming, et al.
Veröffentlicht: (2025)
von: Bian, Jieming, et al.
Veröffentlicht: (2025)
Learning Safety Constraints for Large Language Models
von: Chen, Xin, et al.
Veröffentlicht: (2025)
von: Chen, Xin, et al.
Veröffentlicht: (2025)
POETS: Uncertainty-Aware LLM Optimization via Compute-Efficient Policy Ensembles
von: Menet, Nicolas, et al.
Veröffentlicht: (2026)
von: Menet, Nicolas, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging
von: Bertolissi, Ryo, et al.
Veröffentlicht: (2025) -
Learning on the Job: Test-Time Curricula for Targeted Reinforcement Learning
von: Hübotter, Jonas, et al.
Veröffentlicht: (2025) -
Active Few-Shot Fine-Tuning
von: Hübotter, Jonas, et al.
Veröffentlicht: (2024) -
Maximizing Prefix-Confidence at Test-Time Efficiently Improves Mathematical Reasoning
von: Otth, Matthias, et al.
Veröffentlicht: (2025) -
Probabilistic Artificial Intelligence
von: Krause, Andreas, et al.
Veröffentlicht: (2025)