Portable Reward Tuning: Towards Reusable Fine-Tuning across Different Pretrained Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Chijiwa, Daiki, Hasegawa, Taku, Nishida, Kyosuke, Saito, Kuniko, Takeuchi, Susumu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Lossless Vocabulary Reduction for Auto-Regressive Language Models
por: Chijiwa, Daiki, et al.
Publicado: (2025)
por: Chijiwa, Daiki, et al.
Publicado: (2025)
Parallel In-context Learning for Large Vision Language Models
por: Yamaguchi, Shin'ya, et al.
Publicado: (2026)
por: Yamaguchi, Shin'ya, et al.
Publicado: (2026)
The Strong Lottery Ticket Hypothesis for Multi-Head Attention Mechanisms
por: Otsuka, Hikari, et al.
Publicado: (2025)
por: Otsuka, Hikari, et al.
Publicado: (2025)
Toward Data Efficient Model Merging between Different Datasets without Performance Degradation
por: Yamada, Masanori, et al.
Publicado: (2023)
por: Yamada, Masanori, et al.
Publicado: (2023)
Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought
por: Yamaguchi, Shin'ya, et al.
Publicado: (2025)
por: Yamaguchi, Shin'ya, et al.
Publicado: (2025)
Zero-shot Concept Bottleneck Models
por: Yamaguchi, Shin'ya, et al.
Publicado: (2025)
por: Yamaguchi, Shin'ya, et al.
Publicado: (2025)
Reward Sharpness-Aware Fine-Tuning for Diffusion Models
por: Kim, Kwanyoung, et al.
Publicado: (2026)
por: Kim, Kwanyoung, et al.
Publicado: (2026)
VDocRAG: Retrieval-Augmented Generation over Visually-Rich Documents
por: Tanaka, Ryota, et al.
Publicado: (2025)
por: Tanaka, Ryota, et al.
Publicado: (2025)
Fine-Tuning Language Models with Reward Learning on Policy
por: Lang, Hao, et al.
Publicado: (2024)
por: Lang, Hao, et al.
Publicado: (2024)
Partially Frozen Random Networks Contain Compact Strong Lottery Tickets
por: Otsuka, Hikari, et al.
Publicado: (2024)
por: Otsuka, Hikari, et al.
Publicado: (2024)
Adaptive Random Feature Regularization on Fine-tuning Deep Neural Networks
por: Yamaguchi, Shin'ya, et al.
Publicado: (2024)
por: Yamaguchi, Shin'ya, et al.
Publicado: (2024)
Representation Without Reward: A JEPA Audit for LLM Fine-Tuning
por: Sengupta, Biswa
Publicado: (2026)
por: Sengupta, Biswa
Publicado: (2026)
RIFT: Repurposing Negative Samples via Reward-Informed Fine-Tuning
por: Liu, Zehua, et al.
Publicado: (2026)
por: Liu, Zehua, et al.
Publicado: (2026)
Transfer Learning with Pre-trained Conditional Generative Models
por: Yamaguchi, Shin'ya, et al.
Publicado: (2022)
por: Yamaguchi, Shin'ya, et al.
Publicado: (2022)
Fine-Tuning Discrete Diffusion Models via Reward Optimization with Applications to DNA and Protein Design
por: Wang, Chenyu, et al.
Publicado: (2024)
por: Wang, Chenyu, et al.
Publicado: (2024)
Wavelet-based Positional Representation for Long Context
por: Oka, Yui, et al.
Publicado: (2025)
por: Oka, Yui, et al.
Publicado: (2025)
PREFINE: Preference-Based Implicit Reward and Cost Fine-Tuning for Safety Alignment
por: Verma, Richa, et al.
Publicado: (2026)
por: Verma, Richa, et al.
Publicado: (2026)
Iterative Distillation for Reward-Guided Fine-Tuning of Diffusion Models in Biomolecular Design
por: Su, Xingyu, et al.
Publicado: (2025)
por: Su, Xingyu, et al.
Publicado: (2025)
FedNano: Toward Lightweight Federated Tuning for Pretrained Multimodal Large Language Models
por: Zhang, Yao, et al.
Publicado: (2025)
por: Zhang, Yao, et al.
Publicado: (2025)
H2Tune: Federated Foundation Model Fine-Tuning with Hybrid Heterogeneity
por: Guo, Wei, et al.
Publicado: (2025)
por: Guo, Wei, et al.
Publicado: (2025)
Fight Fire with Fire: Defending Against Malicious RL Fine-Tuning via Reward Neutralization
por: Cao, Wenjun
Publicado: (2025)
por: Cao, Wenjun
Publicado: (2025)
GFT: From Imitation to Reward Fine-Tuning with Unbiased Group Advantages and Dynamic Coefficient Rectification
por: Gan, Wangjie, et al.
Publicado: (2026)
por: Gan, Wangjie, et al.
Publicado: (2026)
TabTune: A Unified Library for Inference and Fine-Tuning Tabular Foundation Models
por: Tanna, Aditya, et al.
Publicado: (2025)
por: Tanna, Aditya, et al.
Publicado: (2025)
FT-Dojo: Towards Autonomous LLM Fine-Tuning with Language Agents
por: Li, Qizheng, et al.
Publicado: (2026)
por: Li, Qizheng, et al.
Publicado: (2026)
BiSSL: Enhancing the Alignment Between Self-Supervised Pretraining and Downstream Fine-Tuning via Bilevel Optimization
por: Zakarias, Gustav Wagner, et al.
Publicado: (2024)
por: Zakarias, Gustav Wagner, et al.
Publicado: (2024)
BIPEFT: Budget-Guided Iterative Search for Parameter Efficient Fine-Tuning of Large Pretrained Language Models
por: Chang, Aofei, et al.
Publicado: (2024)
por: Chang, Aofei, et al.
Publicado: (2024)
Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction
por: Smirnov, Alexander
Publicado: (2026)
por: Smirnov, Alexander
Publicado: (2026)
Linearization Explains Fine-Tuning in Large Language Models
por: Afzal, Zahra Rahimi, et al.
Publicado: (2026)
por: Afzal, Zahra Rahimi, et al.
Publicado: (2026)
PIRF: Physics-Informed Reward Fine-Tuning for Diffusion Models
por: Yuan, Mingze, et al.
Publicado: (2025)
por: Yuan, Mingze, et al.
Publicado: (2025)
FLAME: Towards Federated Fine-Tuning Large Language Models Through Adaptive SMoE
por: Le, Khiem, et al.
Publicado: (2025)
por: Le, Khiem, et al.
Publicado: (2025)
Fine-Tuning without Performance Degradation
por: Wang, Han, et al.
Publicado: (2025)
por: Wang, Han, et al.
Publicado: (2025)
Alignment Dynamics in LLM Fine-Tuning
por: Huang, Yuhan, et al.
Publicado: (2026)
por: Huang, Yuhan, et al.
Publicado: (2026)
Active Few-Shot Fine-Tuning
por: Hübotter, Jonas, et al.
Publicado: (2024)
por: Hübotter, Jonas, et al.
Publicado: (2024)
Rotation-Preserving Supervised Fine-Tuning
por: Jin, Hangzhan, et al.
Publicado: (2026)
por: Jin, Hangzhan, et al.
Publicado: (2026)
Model Editing by Standard Fine-Tuning
por: Gangadhar, Govind, et al.
Publicado: (2024)
por: Gangadhar, Govind, et al.
Publicado: (2024)
Diversity as a Reward: Fine-Tuning LLMs on a Mixture of Domain-Undetermined Data
por: Ling, Zhenqing, et al.
Publicado: (2025)
por: Ling, Zhenqing, et al.
Publicado: (2025)
Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents
por: Huang, Jiawei, et al.
Publicado: (2026)
por: Huang, Jiawei, et al.
Publicado: (2026)
Fine-Tuning Diffusion Models via Intermediate Distribution Shaping
por: Anil, Gautham Govind, et al.
Publicado: (2025)
por: Anil, Gautham Govind, et al.
Publicado: (2025)
Preserving Diversity in Supervised Fine-Tuning of Large Language Models
por: Li, Ziniu, et al.
Publicado: (2024)
por: Li, Ziniu, et al.
Publicado: (2024)
On the Entropy Dynamics in Reinforcement Fine-Tuning of Large Language Models
por: Wang, Shumin, et al.
Publicado: (2026)
por: Wang, Shumin, et al.
Publicado: (2026)
Ejemplares similares
-
Lossless Vocabulary Reduction for Auto-Regressive Language Models
por: Chijiwa, Daiki, et al.
Publicado: (2025) -
Parallel In-context Learning for Large Vision Language Models
por: Yamaguchi, Shin'ya, et al.
Publicado: (2026) -
The Strong Lottery Ticket Hypothesis for Multi-Head Attention Mechanisms
por: Otsuka, Hikari, et al.
Publicado: (2025) -
Toward Data Efficient Model Merging between Different Datasets without Performance Degradation
por: Yamada, Masanori, et al.
Publicado: (2023) -
Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought
por: Yamaguchi, Shin'ya, et al.
Publicado: (2025)