Guardado en:
| Autor principal: | Mineiro, Paul |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2406.04516 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Flow-DPO: Improving LLM Mathematical Reasoning through Online Multi-Agent Learning
por: Deng, Yihe, et al.
Publicado: (2024)
por: Deng, Yihe, et al.
Publicado: (2024)
ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning
por: Zhang, Tonghe, et al.
Publicado: (2025)
por: Zhang, Tonghe, et al.
Publicado: (2025)
Active, anytime-valid risk controlling prediction sets
por: Xu, Ziyu, et al.
Publicado: (2024)
por: Xu, Ziyu, et al.
Publicado: (2024)
Memento: Fine-tuning LLM Agents without Fine-tuning LLMs
por: Zhou, Huichi, et al.
Publicado: (2025)
por: Zhou, Huichi, et al.
Publicado: (2025)
$π_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models
por: Chen, Kang, et al.
Publicado: (2025)
por: Chen, Kang, et al.
Publicado: (2025)
Efficient Contextual Bandits with Uninformed Feedback Graphs
por: Zhang, Mengxiao, et al.
Publicado: (2024)
por: Zhang, Mengxiao, et al.
Publicado: (2024)
Provably Efficient Interactive-Grounded Learning with Personalized Reward
por: Zhang, Mengxiao, et al.
Publicado: (2024)
por: Zhang, Mengxiao, et al.
Publicado: (2024)
Interaction-Grounded Learning for Contextual Markov Decision Processes with Personalized Feedback
por: Zhang, Mengxiao, et al.
Publicado: (2026)
por: Zhang, Mengxiao, et al.
Publicado: (2026)
Aligning LLM Agents by Learning Latent Preference from User Edits
por: Gao, Ge, et al.
Publicado: (2024)
por: Gao, Ge, et al.
Publicado: (2024)
TuneComp: Joint Fine-tuning and Compression for Large Foundation Models
por: Chen, Xiangyu, et al.
Publicado: (2025)
por: Chen, Xiangyu, et al.
Publicado: (2025)
Fine-tuning Flow Matching Generative Models with Intermediate Feedback
por: Fan, Jiajun, et al.
Publicado: (2025)
por: Fan, Jiajun, et al.
Publicado: (2025)
The Importance of Online Data: Understanding Preference Fine-tuning via Coverage
por: Song, Yuda, et al.
Publicado: (2024)
por: Song, Yuda, et al.
Publicado: (2024)
Utility-Diversity Aware Online Batch Selection for LLM Supervised Fine-tuning
por: Zou, Heming, et al.
Publicado: (2025)
por: Zou, Heming, et al.
Publicado: (2025)
Bayesian Fine-tuning in Projected Subspaces
por: Dubovik, Viktar, et al.
Publicado: (2026)
por: Dubovik, Viktar, et al.
Publicado: (2026)
HOFT: Householder Orthogonal Fine-tuning
por: Arcas, Alejandro Moreno, et al.
Publicado: (2025)
por: Arcas, Alejandro Moreno, et al.
Publicado: (2025)
Anytime-valid off-policy inference for contextual bandits
por: Waudby-Smith, Ian, et al.
Publicado: (2022)
por: Waudby-Smith, Ian, et al.
Publicado: (2022)
Fine-tuning Behavioral Cloning Policies with Preference-Based Reinforcement Learning
por: Macuglia, Maël, et al.
Publicado: (2025)
por: Macuglia, Maël, et al.
Publicado: (2025)
Enhancing Multi-modal Models with Heterogeneous MoE Adapters for Fine-tuning
por: Zhou, Sashuai, et al.
Publicado: (2025)
por: Zhou, Sashuai, et al.
Publicado: (2025)
MOTO: Offline Pre-training to Online Fine-tuning for Model-based Robot Learning
por: Rafailov, Rafael, et al.
Publicado: (2024)
por: Rafailov, Rafael, et al.
Publicado: (2024)
LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities
por: Schmied, Thomas, et al.
Publicado: (2025)
por: Schmied, Thomas, et al.
Publicado: (2025)
Human Implicit Preference-Based Policy Fine-tuning for Multi-Agent Reinforcement Learning in USV Swarm
por: Kim, Hyeonjun, et al.
Publicado: (2025)
por: Kim, Hyeonjun, et al.
Publicado: (2025)
An Efficient Rehearsal Scheme for Catastrophic Forgetting Mitigation during Multi-stage Fine-tuning
por: Bai, Andrew, et al.
Publicado: (2024)
por: Bai, Andrew, et al.
Publicado: (2024)
Open-Vocabulary Calibration for Fine-tuned CLIP
por: Wang, Shuoyuan, et al.
Publicado: (2024)
por: Wang, Shuoyuan, et al.
Publicado: (2024)
Probe-based Fine-tuning for Reducing Toxicity
por: Wehner, Jan, et al.
Publicado: (2025)
por: Wehner, Jan, et al.
Publicado: (2025)
Analyzing the Effect of Noise in LLM Fine-tuning
por: Li, Lingfang, et al.
Publicado: (2026)
por: Li, Lingfang, et al.
Publicado: (2026)
Adjoint Matching: Fine-tuning Flow and Diffusion Generative Models with Memoryless Stochastic Optimal Control
por: Domingo-Enrich, Carles, et al.
Publicado: (2024)
por: Domingo-Enrich, Carles, et al.
Publicado: (2024)
Improving Sampling Methods for Fine-tuning SentenceBERT in Text Streams
por: Garcia, Cristiano Mesquita, et al.
Publicado: (2024)
por: Garcia, Cristiano Mesquita, et al.
Publicado: (2024)
Can Muon Fine-tune Adam-Pretrained Models?
por: Qu, Xingyu, et al.
Publicado: (2026)
por: Qu, Xingyu, et al.
Publicado: (2026)
Efficient Adjoint Matching for Fine-tuning Diffusion Models
por: Shin, Jeongwoo, et al.
Publicado: (2026)
por: Shin, Jeongwoo, et al.
Publicado: (2026)
Grow, Don't Overwrite: Fine-tuning Without Forgetting
por: Adila, Dyah, et al.
Publicado: (2026)
por: Adila, Dyah, et al.
Publicado: (2026)
Fine-tuning Multi-hop Question Answering with Hierarchical Graph Network
por: Xiong, Guanming
Publicado: (2020)
por: Xiong, Guanming
Publicado: (2020)
Joint Fine-tuning and Conversion of Pretrained Speech and Language Models towards Linear Complexity
por: He, Mutian, et al.
Publicado: (2024)
por: He, Mutian, et al.
Publicado: (2024)
ReFine: Boosting Time Series Prediction of Extreme Events by Reweighting and Fine-tuning
por: Shi, Jimeng, et al.
Publicado: (2024)
por: Shi, Jimeng, et al.
Publicado: (2024)
Selective Pre-training for Private Fine-tuning
por: Yu, Da, et al.
Publicado: (2023)
por: Yu, Da, et al.
Publicado: (2023)
SMART Fine-tuning Factor Augmented Neural Lasso
por: Chai, Jinhang, et al.
Publicado: (2026)
por: Chai, Jinhang, et al.
Publicado: (2026)
FDPP: Fine-tune Diffusion Policy with Human Preference
por: Chen, Yuxin, et al.
Publicado: (2025)
por: Chen, Yuxin, et al.
Publicado: (2025)
A Study of Optimizations for Fine-tuning Large Language Models
por: Singh, Arjun, et al.
Publicado: (2024)
por: Singh, Arjun, et al.
Publicado: (2024)
Understanding Fine-tuning in Approximate Unlearning: A Theoretical Perspective
por: Ding, Meng, et al.
Publicado: (2024)
por: Ding, Meng, et al.
Publicado: (2024)
Model Balancing Helps Low-data Training and Fine-tuning
por: Liu, Zihang, et al.
Publicado: (2024)
por: Liu, Zihang, et al.
Publicado: (2024)
Functional-level Uncertainty Quantification for Calibrated Fine-tuning on LLMs
por: Niu, Ruijia, et al.
Publicado: (2024)
por: Niu, Ruijia, et al.
Publicado: (2024)
Ejemplares similares
-
Flow-DPO: Improving LLM Mathematical Reasoning through Online Multi-Agent Learning
por: Deng, Yihe, et al.
Publicado: (2024) -
ReinFlow: Fine-tuning Flow Matching Policy with Online Reinforcement Learning
por: Zhang, Tonghe, et al.
Publicado: (2025) -
Active, anytime-valid risk controlling prediction sets
por: Xu, Ziyu, et al.
Publicado: (2024) -
Memento: Fine-tuning LLM Agents without Fine-tuning LLMs
por: Zhou, Huichi, et al.
Publicado: (2025) -
$π_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models
por: Chen, Kang, et al.
Publicado: (2025)