Salvato in:
| Autori principali: | Khan, Rana Muhammad Shahroz, Liu, Zijie, Tan, Zhen, Fleming, Charles, Chen, Tianlong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2602.03073 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
$\textit{Agents Under Siege}$: Breaking Pragmatic Multi-Agent LLM Systems with Optimized Prompt Attacks
di: Khan, Rana Muhammad Shahroz, et al.
Pubblicazione: (2025)
di: Khan, Rana Muhammad Shahroz, et al.
Pubblicazione: (2025)
The Quest for Efficient Reasoning: A Data-Centric Benchmark to CoT Distillation
di: Zhang, Ruichen, et al.
Pubblicazione: (2025)
di: Zhang, Ruichen, et al.
Pubblicazione: (2025)
ORAL: Prompting Your Large-Scale LoRAs via Conditional Recurrent Diffusion
di: Khan, Rana Muhammad Shahroz, et al.
Pubblicazione: (2025)
di: Khan, Rana Muhammad Shahroz, et al.
Pubblicazione: (2025)
PortLLM: Personalizing Evolving Large Language Models with Training-Free and Portable Model Patches
di: Khan, Rana Muhammad Shahroz, et al.
Pubblicazione: (2024)
di: Khan, Rana Muhammad Shahroz, et al.
Pubblicazione: (2024)
EQA-RM: A Generative Embodied Reward Model with Test-time Scaling
di: Chen, Yuhang, et al.
Pubblicazione: (2025)
di: Chen, Yuhang, et al.
Pubblicazione: (2025)
Can GRPO Help LLMs Transcend Their Pretraining Origin?
di: Ni, Kangqi, et al.
Pubblicazione: (2025)
di: Ni, Kangqi, et al.
Pubblicazione: (2025)
Linear Optimal Partial Transport Embedding
di: Bai, Yikun, et al.
Pubblicazione: (2023)
di: Bai, Yikun, et al.
Pubblicazione: (2023)
Generative VS non-Generative Models in Engineering Shape Optimization
di: Usama, Muhammad, et al.
Pubblicazione: (2024)
di: Usama, Muhammad, et al.
Pubblicazione: (2024)
SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning
di: Limozin, Alexis, et al.
Pubblicazione: (2026)
di: Limozin, Alexis, et al.
Pubblicazione: (2026)
Patch the Distribution Mismatch: RL Rewriting Agent for Stable Off-Policy SFT
di: Wang, Jiacheng, et al.
Pubblicazione: (2026)
di: Wang, Jiacheng, et al.
Pubblicazione: (2026)
GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs
di: Deng, Jianing, et al.
Pubblicazione: (2026)
di: Deng, Jianing, et al.
Pubblicazione: (2026)
On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification
di: Wu, Yongliang, et al.
Pubblicazione: (2025)
di: Wu, Yongliang, et al.
Pubblicazione: (2025)
Physics-Informed Geometric Operators to Support Surrogate, Dimension Reduction and Generative Models for Engineering Design
di: Khan, Shahroz, et al.
Pubblicazione: (2024)
di: Khan, Shahroz, et al.
Pubblicazione: (2024)
Trajectory-Oriented Policy Optimization with Sparse Rewards
di: Wang, Guojian, et al.
Pubblicazione: (2024)
di: Wang, Guojian, et al.
Pubblicazione: (2024)
Continual SFT Matches Multimodal RLHF with Negative Supervision
di: Zhu, Ke, et al.
Pubblicazione: (2024)
di: Zhu, Ke, et al.
Pubblicazione: (2024)
RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment
di: Du, Yuhao, et al.
Pubblicazione: (2025)
di: Du, Yuhao, et al.
Pubblicazione: (2025)
What Do Agents Learn from Trajectory-SFT: Semantics or Interfaces?
di: Gu, Weizheng, et al.
Pubblicazione: (2026)
di: Gu, Weizheng, et al.
Pubblicazione: (2026)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
di: Bai, Yang, et al.
Pubblicazione: (2026)
di: Bai, Yang, et al.
Pubblicazione: (2026)
Beyond Redundancy: Diverse and Specialized Multi-Expert Sparse Autoencoder
di: Xu, Zhen, et al.
Pubblicazione: (2025)
di: Xu, Zhen, et al.
Pubblicazione: (2025)
Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning
di: Zhu, Taojie, et al.
Pubblicazione: (2026)
di: Zhu, Taojie, et al.
Pubblicazione: (2026)
Crafting Reversible SFT Behaviors in Large Language Models
di: Lin, Yuping, et al.
Pubblicazione: (2026)
di: Lin, Yuping, et al.
Pubblicazione: (2026)
GAC: Noise-Aware Adaptive Mixing for Hybrid SFT-RL Post-Training
di: Hu, Yuelin, et al.
Pubblicazione: (2026)
di: Hu, Yuelin, et al.
Pubblicazione: (2026)
Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections
di: Wang, Bo, et al.
Pubblicazione: (2025)
di: Wang, Bo, et al.
Pubblicazione: (2025)
Modular Diffusion Policy Training: Decoupling and Recombining Guidance and Diffusion for Offline RL
di: Chen, Zhaoyang, et al.
Pubblicazione: (2025)
di: Chen, Zhaoyang, et al.
Pubblicazione: (2025)
Robust Post-Training for Generative Recommenders: Why Exponential Reward-Weighted SFT Outperforms RLHF
di: Chidambaram, Keertana, et al.
Pubblicazione: (2026)
di: Chidambaram, Keertana, et al.
Pubblicazione: (2026)
GraphRCG: Self-Conditioned Graph Generation
di: Wang, Song, et al.
Pubblicazione: (2024)
di: Wang, Song, et al.
Pubblicazione: (2024)
SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models
di: Kim, Gyuhak, et al.
Pubblicazione: (2025)
di: Kim, Gyuhak, et al.
Pubblicazione: (2025)
Procedural-skill SFT across capacity tiers: A W-Shaped pre-SFT Trajectory and Regime-Asymmetric Mechanism on 0.8B-4B Qwen3.5 Models
di: Strozzi, Igor
Pubblicazione: (2026)
di: Strozzi, Igor
Pubblicazione: (2026)
QuantMoE-Bench: Examining Post-Training Quantization for Mixture-of-Experts
di: Li, Pingzhi, et al.
Pubblicazione: (2024)
di: Li, Pingzhi, et al.
Pubblicazione: (2024)
Value-Free Policy Optimization via Reward Partitioning
di: Faye, Bilal, et al.
Pubblicazione: (2025)
di: Faye, Bilal, et al.
Pubblicazione: (2025)
mSFT: Addressing Dataset Mixtures Overfitting Heterogeneously in Multi-task SFT
di: Koh, Woosung, et al.
Pubblicazione: (2026)
di: Koh, Woosung, et al.
Pubblicazione: (2026)
Probing to Refine: Reinforcement Distillation of LLMs via Explanatory Inversion
di: Tan, Zhen, et al.
Pubblicazione: (2026)
di: Tan, Zhen, et al.
Pubblicazione: (2026)
DOGe: Defensive Output Generation for LLM Protection Against Knowledge Distillation
di: Li, Pingzhi, et al.
Pubblicazione: (2025)
di: Li, Pingzhi, et al.
Pubblicazione: (2025)
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
di: Hong, Joey, et al.
Pubblicazione: (2024)
di: Hong, Joey, et al.
Pubblicazione: (2024)
Supervised Reward Inference
di: Schwarzer, Will, et al.
Pubblicazione: (2025)
di: Schwarzer, Will, et al.
Pubblicazione: (2025)
Self-Supervised On-Policy Distillation for Reasoning Language Models
di: Tan, Zhiquan, et al.
Pubblicazione: (2026)
di: Tan, Zhiquan, et al.
Pubblicazione: (2026)
FisherSFT: Data-Efficient Supervised Fine-Tuning of Language Models Using Information Gain
di: Deb, Rohan, et al.
Pubblicazione: (2025)
di: Deb, Rohan, et al.
Pubblicazione: (2025)
HopCast: Calibration of Autoregressive Dynamics Models
di: Shahid, Muhammad Bilal, et al.
Pubblicazione: (2025)
di: Shahid, Muhammad Bilal, et al.
Pubblicazione: (2025)
Reward-SQL: Boosting Text-to-SQL via Stepwise Reasoning and Process-Supervised Rewards
di: Zhang, Yuxin, et al.
Pubblicazione: (2025)
di: Zhang, Yuxin, et al.
Pubblicazione: (2025)
Flow-Based Single-Step Completion for Efficient and Expressive Policy Learning
di: Koirala, Prajwal, et al.
Pubblicazione: (2025)
di: Koirala, Prajwal, et al.
Pubblicazione: (2025)
Documenti analoghi
-
$\textit{Agents Under Siege}$: Breaking Pragmatic Multi-Agent LLM Systems with Optimized Prompt Attacks
di: Khan, Rana Muhammad Shahroz, et al.
Pubblicazione: (2025) -
The Quest for Efficient Reasoning: A Data-Centric Benchmark to CoT Distillation
di: Zhang, Ruichen, et al.
Pubblicazione: (2025) -
ORAL: Prompting Your Large-Scale LoRAs via Conditional Recurrent Diffusion
di: Khan, Rana Muhammad Shahroz, et al.
Pubblicazione: (2025) -
PortLLM: Personalizing Evolving Large Language Models with Training-Free and Portable Model Patches
di: Khan, Rana Muhammad Shahroz, et al.
Pubblicazione: (2024) -
EQA-RM: A Generative Embodied Reward Model with Test-time Scaling
di: Chen, Yuhang, et al.
Pubblicazione: (2025)