Guardado en:
| Autores principales: | Ming, Rui, Wu, Haoyuan, Hu, Shoubo, He, Zhuolun, Yu, Bei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2509.26313 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ToTRL: Unlock LLM Tree-of-Thoughts Reasoning Potential through Puzzles Solving
por: Wu, Haoyuan, et al.
Publicado: (2025)
por: Wu, Haoyuan, et al.
Publicado: (2025)
Divergent Thoughts toward One Goal: LLM-based Multi-Agent Collaboration System for Electronic Design Automation
por: Wu, Haoyuan, et al.
Publicado: (2025)
por: Wu, Haoyuan, et al.
Publicado: (2025)
Efficient OpAmp Adaptation for Zoom Attention to Golden Contexts
por: Wu, Haoyuan, et al.
Publicado: (2025)
por: Wu, Haoyuan, et al.
Publicado: (2025)
Architect of the Bits World: Masked Autoregressive Modeling for Circuit Generation Guided by Truth Table
por: Wu, Haoyuan, et al.
Publicado: (2025)
por: Wu, Haoyuan, et al.
Publicado: (2025)
On-Policy Optimization with Group Equivalent Preference for Multi-Programming Language Understanding
por: Wu, Haoyuan, et al.
Publicado: (2025)
por: Wu, Haoyuan, et al.
Publicado: (2025)
Customized Retrieval Augmented Generation and Benchmarking for EDA Tool Documentation QA
por: Pu, Yuan, et al.
Publicado: (2024)
por: Pu, Yuan, et al.
Publicado: (2024)
Parameter-Efficient Sparsity Crafting from Dense to Mixture-of-Experts for Instruction Tuning on General Tasks
por: Wu, Haoyuan, et al.
Publicado: (2024)
por: Wu, Haoyuan, et al.
Publicado: (2024)
Supervised Fine-Tuning Needs to Unlock the Potential of Token Priority
por: Shen, Zhanming, et al.
Publicado: (2026)
por: Shen, Zhanming, et al.
Publicado: (2026)
Rethinking Data Selection for Supervised Fine-Tuning
por: Shen, Ming
Publicado: (2024)
por: Shen, Ming
Publicado: (2024)
Diversity or Precision? A Deep Dive into Next Token Prediction
por: Wu, Haoyuan, et al.
Publicado: (2025)
por: Wu, Haoyuan, et al.
Publicado: (2025)
Token Cleaning: Fine-Grained Data Selection for LLM Supervised Fine-Tuning
por: Pang, Jinlong, et al.
Publicado: (2025)
por: Pang, Jinlong, et al.
Publicado: (2025)
Semantic Loss Guided Data Efficient Supervised Fine Tuning for Safe Responses in LLMs
por: Lu, Yuxiao, et al.
Publicado: (2024)
por: Lu, Yuxiao, et al.
Publicado: (2024)
Beyond Negative Rollouts: Positive-Only Policy Optimization with Implicit Negative Gradients
por: Xu, Mingwei, et al.
Publicado: (2026)
por: Xu, Mingwei, et al.
Publicado: (2026)
Towards Pedagogical LLMs with Supervised Fine Tuning for Computing Education
por: Vassar, Alexandra, et al.
Publicado: (2024)
por: Vassar, Alexandra, et al.
Publicado: (2024)
GradPruner: Gradient-Guided Layer Pruning Enabling Efficient Fine-Tuning and Inference for LLMs
por: Huang, Wei, et al.
Publicado: (2026)
por: Huang, Wei, et al.
Publicado: (2026)
Anchored Supervised Fine-Tuning
por: Zhu, He, et al.
Publicado: (2025)
por: Zhu, He, et al.
Publicado: (2025)
Proximal Supervised Fine-Tuning
por: Zhu, Wenhong, et al.
Publicado: (2025)
por: Zhu, Wenhong, et al.
Publicado: (2025)
Supervised Fine-Tuning LLMs to Behave as Pedagogical Agents in Programming Education
por: Ross, Emily, et al.
Publicado: (2025)
por: Ross, Emily, et al.
Publicado: (2025)
Are Full Rollouts Necessary for On-Policy Distillation?
por: Zhang, Yaocheng, et al.
Publicado: (2026)
por: Zhang, Yaocheng, et al.
Publicado: (2026)
Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
por: Heuillet, Maxime, et al.
Publicado: (2025)
por: Heuillet, Maxime, et al.
Publicado: (2025)
Mitigating Forgetting in LLM Fine-Tuning via Low-Perplexity Token Learning
por: Wu, Chao-Chung, et al.
Publicado: (2025)
por: Wu, Chao-Chung, et al.
Publicado: (2025)
Fine-Tuning Discrete Diffusion Models with Policy Gradient Methods
por: Zekri, Oussama, et al.
Publicado: (2025)
por: Zekri, Oussama, et al.
Publicado: (2025)
Analyzing the Effects of Supervised Fine-Tuning on Model Knowledge from Token and Parameter Levels
por: Ye, Junjie, et al.
Publicado: (2025)
por: Ye, Junjie, et al.
Publicado: (2025)
Rethinking Supervised Fine-Tuning: Emphasizing Key Answer Tokens for Improved LLM Accuracy
por: Shi, Xiaofeng, et al.
Publicado: (2025)
por: Shi, Xiaofeng, et al.
Publicado: (2025)
Unleashing the Reasoning Potential of Pre-trained LLMs by Critique Fine-Tuning on One Problem
por: Wang, Yubo, et al.
Publicado: (2025)
por: Wang, Yubo, et al.
Publicado: (2025)
Supervised Fine-Tuning or In-Context Learning? Evaluating LLMs for Clinical NER
por: Baroian, Andrei
Publicado: (2025)
por: Baroian, Andrei
Publicado: (2025)
Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning
por: Feng, Weitao, et al.
Publicado: (2025)
por: Feng, Weitao, et al.
Publicado: (2025)
FineMedLM-o1: Enhancing Medical Knowledge Reasoning Ability of LLM from Supervised Fine-Tuning to Test-Time Training
por: Yu, Hongzhou, et al.
Publicado: (2025)
por: Yu, Hongzhou, et al.
Publicado: (2025)
Mind the Gap: Data Rewriting for Stable Off-Policy Supervised Fine-Tuning
por: Zhao, Shiwan, et al.
Publicado: (2025)
por: Zhao, Shiwan, et al.
Publicado: (2025)
From Instance Selection to Fixed-Pool Data Recipe Search for Supervised Fine-Tuning
por: Wu, Haodong, et al.
Publicado: (2026)
por: Wu, Haodong, et al.
Publicado: (2026)
Fine-Tuning LLMs for Report Summarization: Analysis on Supervised and Unsupervised Data
por: Rallapalli, Swati, et al.
Publicado: (2025)
por: Rallapalli, Swati, et al.
Publicado: (2025)
Reassessing the Role of Supervised Fine-Tuning: An Empirical Study in VLM Reasoning
por: Yu, Yongcan, et al.
Publicado: (2025)
por: Yu, Yongcan, et al.
Publicado: (2025)
Winning the Pruning Gamble: A Unified Approach to Joint Sample and Token Pruning for Efficient Supervised Fine-Tuning
por: Wang, Shaobo, et al.
Publicado: (2025)
por: Wang, Shaobo, et al.
Publicado: (2025)
FocuSFT: Bilevel Optimization for Dilution-Aware Long-Context Fine-Tuning
por: Pei, Zehua, et al.
Publicado: (2026)
por: Pei, Zehua, et al.
Publicado: (2026)
Gradient Surgery for Safe LLM Fine-Tuning
por: Yi, Biao, et al.
Publicado: (2025)
por: Yi, Biao, et al.
Publicado: (2025)
Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning
por: Ruan, Zhiwen, et al.
Publicado: (2025)
por: Ruan, Zhiwen, et al.
Publicado: (2025)
SFT-TA: Supervised Fine-Tuned Agents in Multi-Agent LLMs for Automated Inductive Thematic Analysis
por: Yi, Seungjun, et al.
Publicado: (2025)
por: Yi, Seungjun, et al.
Publicado: (2025)
Exploring Multi-Temperature Strategies for Token- and Rollout-Level Control in RLVR
por: Zhuang, Haomin, et al.
Publicado: (2025)
por: Zhuang, Haomin, et al.
Publicado: (2025)
Parameter Importance is Not Static: Evolving Parameter Isolation for Supervised Fine-Tuning
por: Lin, Zekai, et al.
Publicado: (2026)
por: Lin, Zekai, et al.
Publicado: (2026)
Supervised In-Context Fine-Tuning for Generative Sequence Labeling
por: Dukić, David, et al.
Publicado: (2025)
por: Dukić, David, et al.
Publicado: (2025)
Ejemplares similares
-
ToTRL: Unlock LLM Tree-of-Thoughts Reasoning Potential through Puzzles Solving
por: Wu, Haoyuan, et al.
Publicado: (2025) -
Divergent Thoughts toward One Goal: LLM-based Multi-Agent Collaboration System for Electronic Design Automation
por: Wu, Haoyuan, et al.
Publicado: (2025) -
Efficient OpAmp Adaptation for Zoom Attention to Golden Contexts
por: Wu, Haoyuan, et al.
Publicado: (2025) -
Architect of the Bits World: Masked Autoregressive Modeling for Circuit Generation Guided by Truth Table
por: Wu, Haoyuan, et al.
Publicado: (2025) -
On-Policy Optimization with Group Equivalent Preference for Multi-Programming Language Understanding
por: Wu, Haoyuan, et al.
Publicado: (2025)