Direct Behavior Optimization: Unlocking the Potential of Lightweight LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Hongming, Lin, Shi, Shao, Jun, Lin, Changting, Zhu, Donghai, Han, Meng, Kong, Qinglei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
por: Lin, Shi, et al.
Publicado: (2024)
por: Lin, Shi, et al.
Publicado: (2024)
NeuRel-Attack: Neuron Relearning for Safety Disalignment in Large Language Models
por: Zhou, Yi, et al.
Publicado: (2025)
por: Zhou, Yi, et al.
Publicado: (2025)
Knapsack RL: Unlocking Exploration of LLMs via Optimizing Budget Allocation
por: Li, Ziniu, et al.
Publicado: (2025)
por: Li, Ziniu, et al.
Publicado: (2025)
StepFun-Formalizer: Unlocking the Autoformalization Potential of LLMs through Knowledge-Reasoning Fusion
por: Wu, Yutong, et al.
Publicado: (2025)
por: Wu, Yutong, et al.
Publicado: (2025)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
por: Wang, Haoxiang, et al.
Publicado: (2024)
por: Wang, Haoxiang, et al.
Publicado: (2024)
RLHF Can Speak Many Languages: Unlocking Multilingual Preference Optimization for LLMs
por: Dang, John, et al.
Publicado: (2024)
por: Dang, John, et al.
Publicado: (2024)
MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining
por: Xiaomi, LLM-Core, et al.
Publicado: (2025)
por: Xiaomi, LLM-Core, et al.
Publicado: (2025)
Orthogonal Finetuning for Direct Preference Optimization
por: Yang, Chenxu, et al.
Publicado: (2024)
por: Yang, Chenxu, et al.
Publicado: (2024)
MEUV: Achieving Fine-Grained Capability Activation in Large Language Models via Mutually Exclusive Unlock Vectors
por: Tong, Xin, et al.
Publicado: (2025)
por: Tong, Xin, et al.
Publicado: (2025)
Unlocking Multimodal Mathematical Reasoning via Process Reward Model
por: Luo, Ruilin, et al.
Publicado: (2025)
por: Luo, Ruilin, et al.
Publicado: (2025)
Supervised Fine-Tuning Needs to Unlock the Potential of Token Priority
por: Shen, Zhanming, et al.
Publicado: (2026)
por: Shen, Zhanming, et al.
Publicado: (2026)
Scaling Up RL: Unlocking Diverse Reasoning in LLMs via Prolonged Training
por: Liu, Mingjie, et al.
Publicado: (2025)
por: Liu, Mingjie, et al.
Publicado: (2025)
Unlocking Reasoning Capabilities in LLMs via Reinforcement Learning Exploration
por: Deng, Wenhao, et al.
Publicado: (2025)
por: Deng, Wenhao, et al.
Publicado: (2025)
Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning
por: Fei, Wu, et al.
Publicado: (2025)
por: Fei, Wu, et al.
Publicado: (2025)
Enhancing Multi-Step Reasoning Abilities of Language Models through Direct Q-Function Optimization
por: Ji, Kaixuan, et al.
Publicado: (2024)
por: Ji, Kaixuan, et al.
Publicado: (2024)
PowerFlow: Unlocking the Dual Nature of LLMs via Principled Distribution Matching
por: Chen, Ruishuo, et al.
Publicado: (2026)
por: Chen, Ruishuo, et al.
Publicado: (2026)
Stabilizing Reinforcement Learning with LLMs: Formulation and Practices
por: Zheng, Chujie, et al.
Publicado: (2025)
por: Zheng, Chujie, et al.
Publicado: (2025)
A Lightweight LLM Framework for Disaster Humanitarian Information Classification
por: Jinzhen, Han, et al.
Publicado: (2026)
por: Jinzhen, Han, et al.
Publicado: (2026)
EnvGen: Generating and Adapting Environments via LLMs for Training Embodied Agents
por: Zala, Abhay, et al.
Publicado: (2024)
por: Zala, Abhay, et al.
Publicado: (2024)
Agile-Quant: Activation-Guided Quantization for Faster Inference of LLMs on the Edge
por: Shen, Xuan, et al.
Publicado: (2023)
por: Shen, Xuan, et al.
Publicado: (2023)
Unlocking the Potential of Continual Model Merging: An ODE Perspective
por: Lin, Lihong, et al.
Publicado: (2026)
por: Lin, Lihong, et al.
Publicado: (2026)
Aligning Frozen LLMs by Reinforcement Learning: An Iterative Reweight-then-Optimize Approach
por: Zhang, Xinnan, et al.
Publicado: (2025)
por: Zhang, Xinnan, et al.
Publicado: (2025)
Revisiting Entropy Regularization: Adaptive Coefficient Unlocks Its Potential for LLM Reinforcement Learning
por: Zhang, Xiaoyun, et al.
Publicado: (2025)
por: Zhang, Xiaoyun, et al.
Publicado: (2025)
Revealing Behavioral Plasticity in Large Language Models: A Token-Conditional Perspective
por: Mao, Liyuan, et al.
Publicado: (2026)
por: Mao, Liyuan, et al.
Publicado: (2026)
Unlocking Public Catalogues: Instruction-Tuning LLMs for ICD Coding of German Tumor Diagnoses
por: Lenz, Stefan, et al.
Publicado: (2025)
por: Lenz, Stefan, et al.
Publicado: (2025)
Stability as a Liability:Systematic Breakdown of Linguistic Structure in LLMs
por: Meng, Xianzhe, et al.
Publicado: (2026)
por: Meng, Xianzhe, et al.
Publicado: (2026)
Clover: Regressive Lightweight Speculative Decoding with Sequential Knowledge
por: Xiao, Bin, et al.
Publicado: (2024)
por: Xiao, Bin, et al.
Publicado: (2024)
A Framework to Implement 1+N Multi-task Fine-tuning Pattern in LLMs Using the CGC-LORA Algorithm
por: Song, Chao, et al.
Publicado: (2024)
por: Song, Chao, et al.
Publicado: (2024)
Shared Lexical Task Representations Explain Behavioral Variability In LLMs
por: Yang, Zhuonan, et al.
Publicado: (2026)
por: Yang, Zhuonan, et al.
Publicado: (2026)
Aligning CodeLLMs with Direct Preference Optimization
por: Miao, Yibo, et al.
Publicado: (2024)
por: Miao, Yibo, et al.
Publicado: (2024)
MANATEE: Inference-Time Lightweight Diffusion Based Safety Defense for LLMs
por: Kan, Chun Yan Ryan, et al.
Publicado: (2026)
por: Kan, Chun Yan Ryan, et al.
Publicado: (2026)
A Case Study of Selected PTQ Baselines for Reasoning LLMs on Ascend NPU
por: Luo, Yuchen, et al.
Publicado: (2026)
por: Luo, Yuchen, et al.
Publicado: (2026)
CriticBench: Benchmarking LLMs for Critique-Correct Reasoning
por: Lin, Zicheng, et al.
Publicado: (2024)
por: Lin, Zicheng, et al.
Publicado: (2024)
GEM: A Gym for Agentic LLMs
por: Liu, Zichen, et al.
Publicado: (2025)
por: Liu, Zichen, et al.
Publicado: (2025)
TIPS: Turn-Level Information-Potential Reward Shaping for Search-Augmented LLMs
por: Xie, Yutao, et al.
Publicado: (2026)
por: Xie, Yutao, et al.
Publicado: (2026)
Linear Model Merging Unlocks Simple and Scalable Multimodal Data Mixture Optimization
por: Berasi, Davide, et al.
Publicado: (2026)
por: Berasi, Davide, et al.
Publicado: (2026)
PRISM: A Geometric Risk Bound that Decomposes Drift into Scale, Shape, and Head
por: Lin, Chieh-Yen, et al.
Publicado: (2026)
por: Lin, Chieh-Yen, et al.
Publicado: (2026)
MPPO: Multi Pair-wise Preference Optimization for LLMs with Arbitrary Negative Samples
por: Xie, Shuo, et al.
Publicado: (2024)
por: Xie, Shuo, et al.
Publicado: (2024)
Filtered Direct Preference Optimization
por: Morimura, Tetsuro, et al.
Publicado: (2024)
por: Morimura, Tetsuro, et al.
Publicado: (2024)
Direct Preference Optimization with an Offset
por: Amini, Afra, et al.
Publicado: (2024)
por: Amini, Afra, et al.
Publicado: (2024)
Ejemplares similares
-
LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models
por: Lin, Shi, et al.
Publicado: (2024) -
NeuRel-Attack: Neuron Relearning for Safety Disalignment in Large Language Models
por: Zhou, Yi, et al.
Publicado: (2025) -
Knapsack RL: Unlocking Exploration of LLMs via Optimizing Budget Allocation
por: Li, Ziniu, et al.
Publicado: (2025) -
StepFun-Formalizer: Unlocking the Autoformalization Potential of LLMs through Knowledge-Reasoning Fusion
por: Wu, Yutong, et al.
Publicado: (2025) -
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
por: Wang, Haoxiang, et al.
Publicado: (2024)