FuseChat-3.0: Preference Optimization Meets Heterogeneous Model Fusion
Fuente:
arXiv
Saved in:
| Main Authors: | Yang, Ziyi, Wan, Fanqi, Zhong, Longguang, Huang, Canbin, Liang, Guosheng, Quan, Xiaojun |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
FuseChat: Knowledge Fusion of Chat Models
by: Wan, Fanqi, et al.
Published: (2024)
by: Wan, Fanqi, et al.
Published: (2024)
FuseRL: Dense Preference Optimization for Heterogeneous Model Fusion
by: Zhong, Longguang, et al.
Published: (2025)
by: Zhong, Longguang, et al.
Published: (2025)
Weighted-Reward Preference Optimization for Implicit Model Fusion
by: Yang, Ziyi, et al.
Published: (2024)
by: Yang, Ziyi, et al.
Published: (2024)
Knowledge Fusion of Chat LLMs: A Preliminary Technical Report
by: Wan, Fanqi, et al.
Published: (2024)
by: Wan, Fanqi, et al.
Published: (2024)
ThinkSwitcher: When to Think Hard, When to Think Fast
by: Liang, Guosheng, et al.
Published: (2025)
by: Liang, Guosheng, et al.
Published: (2025)
BlockPruner: Fine-grained Pruning for Large Language Models
by: Zhong, Longguang, et al.
Published: (2024)
by: Zhong, Longguang, et al.
Published: (2024)
Mutual-Taught for Co-adapting Policy and Reward Models
by: Shi, Tianyuan, et al.
Published: (2025)
by: Shi, Tianyuan, et al.
Published: (2025)
ProFuser: Progressive Fusion of Large Language Models
by: Shi, Tianyuan, et al.
Published: (2024)
by: Shi, Tianyuan, et al.
Published: (2024)
Advantage-Guided Distillation for Preference Alignment in Small Language Models
by: Gao, Shiping, et al.
Published: (2025)
by: Gao, Shiping, et al.
Published: (2025)
Knowledge Fusion of Large Language Models
by: Wan, Fanqi, et al.
Published: (2024)
by: Wan, Fanqi, et al.
Published: (2024)
Self-Evolution Fine-Tuning for Policy Optimization
by: Chen, Ruijun, et al.
Published: (2024)
by: Chen, Ruijun, et al.
Published: (2024)
Lookahead Routing for Large Language Models
by: Huang, Canbin, et al.
Published: (2025)
by: Huang, Canbin, et al.
Published: (2025)
SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models
by: Yang, Ziyi, et al.
Published: (2025)
by: Yang, Ziyi, et al.
Published: (2025)
Cool-Fusion: Fuse Large Language Models without Training
by: Liu, Cong, et al.
Published: (2024)
by: Liu, Cong, et al.
Published: (2024)
ProactiveEval: A Unified Evaluation Framework for Proactive Dialogue Agents
by: Liu, Tianjian, et al.
Published: (2025)
by: Liu, Tianjian, et al.
Published: (2025)
Knowledge Verification to Nip Hallucination in the Bud
by: Wan, Fanqi, et al.
Published: (2024)
by: Wan, Fanqi, et al.
Published: (2024)
ContraSolver: Self-Alignment of Language Models by Resolving Internal Preference Contradictions
by: Zhang, Xu, et al.
Published: (2024)
by: Zhang, Xu, et al.
Published: (2024)
SoLoPO: Unlocking Long-Context Capabilities in LLMs via Short-to-Long Preference Optimization
by: Sun, Huashan, et al.
Published: (2025)
by: Sun, Huashan, et al.
Published: (2025)
Think-on-Graph 3.0: Efficient and Adaptive LLM Reasoning on Heterogeneous Graphs via Multi-Agent Dual-Evolving Context Retrieval
by: Wu, Xiaojun, et al.
Published: (2025)
by: Wu, Xiaojun, et al.
Published: (2025)
QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning
by: Wan, Fanqi, et al.
Published: (2025)
by: Wan, Fanqi, et al.
Published: (2025)
InfiFPO: Implicit Model Fusion via Preference Optimization in Large Language Models
by: Gu, Yanggan, et al.
Published: (2025)
by: Gu, Yanggan, et al.
Published: (2025)
Alirector: Alignment-Enhanced Chinese Grammatical Error Corrector
by: Yang, Haihui, et al.
Published: (2024)
by: Yang, Haihui, et al.
Published: (2024)
Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization
by: Gao, Shiping, et al.
Published: (2026)
by: Gao, Shiping, et al.
Published: (2026)
Discriminative Policy Optimization for Token-Level Reward Models
by: Chen, Hongzhan, et al.
Published: (2025)
by: Chen, Hongzhan, et al.
Published: (2025)
WaterPool: A Watermark Mitigating Trade-offs among Imperceptibility, Efficacy and Robustness
by: Huang, Baizhou, et al.
Published: (2024)
by: Huang, Baizhou, et al.
Published: (2024)
Evaluating, Understanding, and Improving Constrained Text Generation for Large Language Models
by: Chen, Xiang, et al.
Published: (2023)
by: Chen, Xiang, et al.
Published: (2023)
Data Proportion Detection for Optimized Data Management for Large Language Models
by: Liang, Hao, et al.
Published: (2024)
by: Liang, Hao, et al.
Published: (2024)
Probabilistic Token Alignment for Large Language Model Fusion
by: Zeng, Runjia, et al.
Published: (2025)
by: Zeng, Runjia, et al.
Published: (2025)
Multi-Reference Preference Optimization for Large Language Models
by: Le, Hung, et al.
Published: (2024)
by: Le, Hung, et al.
Published: (2024)
RPO: Retrieval Preference Optimization for Robust Retrieval-Augmented Generation
by: Yan, Shi-Qi, et al.
Published: (2025)
by: Yan, Shi-Qi, et al.
Published: (2025)
MetFuse: Figurative Fusion between Metonymy and Metaphor
by: Ghosh, Saptarshi, et al.
Published: (2026)
by: Ghosh, Saptarshi, et al.
Published: (2026)
Transitivity Meets Cyclicity: Explicit Preference Decomposition for Dynamic Large Language Model Alignment
by: Huang, Yucong, et al.
Published: (2026)
by: Huang, Yucong, et al.
Published: (2026)
QuantileMark: A Message-Symmetric Multi-bit Watermark for LLMs
by: Zhu, Junlin, et al.
Published: (2026)
by: Zhu, Junlin, et al.
Published: (2026)
$B^4$: A Black-Box Scrubbing Attack on LLM Watermarks
by: Huang, Baizhou, et al.
Published: (2024)
by: Huang, Baizhou, et al.
Published: (2024)
Multiplayer Nash Preference Optimization
by: Wu, Fang, et al.
Published: (2025)
by: Wu, Fang, et al.
Published: (2025)
CFunModel: A "Funny" Language Model Capable of Chinese Humor Generation and Processing
by: Yu, Zhenghan, et al.
Published: (2025)
by: Yu, Zhenghan, et al.
Published: (2025)
Gradable ChatGPT Translation Evaluation
by: Jiao, Hui, et al.
Published: (2024)
by: Jiao, Hui, et al.
Published: (2024)
FuseGen: PLM Fusion for Data-generation based Zero-shot Learning
by: Zou, Tianyuan, et al.
Published: (2024)
by: Zou, Tianyuan, et al.
Published: (2024)
PANDA: Prompt Transfer Meets Knowledge Distillation for Efficient Model Adaptation
by: Zhong, Qihuang, et al.
Published: (2022)
by: Zhong, Qihuang, et al.
Published: (2022)
BPO: Revisiting Preference Modeling in Direct Preference Optimization
by: Sun, Lin, et al.
Published: (2025)
by: Sun, Lin, et al.
Published: (2025)
Similar Items
-
FuseChat: Knowledge Fusion of Chat Models
by: Wan, Fanqi, et al.
Published: (2024) -
FuseRL: Dense Preference Optimization for Heterogeneous Model Fusion
by: Zhong, Longguang, et al.
Published: (2025) -
Weighted-Reward Preference Optimization for Implicit Model Fusion
by: Yang, Ziyi, et al.
Published: (2024) -
Knowledge Fusion of Chat LLMs: A Preliminary Technical Report
by: Wan, Fanqi, et al.
Published: (2024) -
ThinkSwitcher: When to Think Hard, When to Think Fast
by: Liang, Guosheng, et al.
Published: (2025)