SoLoPO: Unlocking Long-Context Capabilities in LLMs via Short-to-Long Preference Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Sun, Huashan, Liao, Shengyi, Han, Yansen, Bai, Yu, Gao, Yang, Fu, Cheng, Shen, Weizhou, Wan, Fanqi, Yan, Ming, Zhang, Ji, Huang, Fei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning
por: Wan, Fanqi, et al.
Publicado: (2025)
por: Wan, Fanqi, et al.
Publicado: (2025)
QwenLong-CPRS: Towards $\infty$-LLMs with Dynamic Context Optimization
por: Shen, Weizhou, et al.
Publicado: (2025)
por: Shen, Weizhou, et al.
Publicado: (2025)
SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models
por: Yang, Ziyi, et al.
Publicado: (2025)
por: Yang, Ziyi, et al.
Publicado: (2025)
QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management
por: Shen, Weizhou, et al.
Publicado: (2025)
por: Shen, Weizhou, et al.
Publicado: (2025)
LongPO: Long Context Self-Evolution of Large Language Models through Short-to-Long Preference Optimization
por: Chen, Guanzheng, et al.
Publicado: (2025)
por: Chen, Guanzheng, et al.
Publicado: (2025)
LongLLaDA: Unlocking Long Context Capabilities in Diffusion LLMs
por: Liu, Xiaoran, et al.
Publicado: (2025)
por: Liu, Xiaoran, et al.
Publicado: (2025)
Incentivizing In-depth Reasoning over Long Contexts with Process Advantage Shaping
por: Peng, Miao, et al.
Publicado: (2026)
por: Peng, Miao, et al.
Publicado: (2026)
Long-Short Alignment for Effective Long-Context Modeling in LLMs
por: Du, Tianqi, et al.
Publicado: (2025)
por: Du, Tianqi, et al.
Publicado: (2025)
Leave No Document Behind: Benchmarking Long-Context LLMs with Extended Multi-Doc QA
por: Wang, Minzheng, et al.
Publicado: (2024)
por: Wang, Minzheng, et al.
Publicado: (2024)
Long-CLIP: Unlocking the Long-Text Capability of CLIP
por: Zhang, Beichen, et al.
Publicado: (2024)
por: Zhang, Beichen, et al.
Publicado: (2024)
UIO-LLMs: Unbiased Incremental Optimization for Long-Context LLMs
por: Li, Wenhao, et al.
Publicado: (2024)
por: Li, Wenhao, et al.
Publicado: (2024)
PRISM: Efficient Long-Range Reasoning With Short-Context LLMs
por: Jayalath, Dulhan, et al.
Publicado: (2024)
por: Jayalath, Dulhan, et al.
Publicado: (2024)
LoCoNet: Long-Short Context Network for Active Speaker Detection
por: Wang, Xizi, et al.
Publicado: (2023)
por: Wang, Xizi, et al.
Publicado: (2023)
Unlocking Efficient Long-to-Short LLM Reasoning with Model Merging
por: Wu, Han, et al.
Publicado: (2025)
por: Wu, Han, et al.
Publicado: (2025)
LongGenBench: Benchmarking Long-Form Generation in Long Context LLMs
por: Wu, Yuhao, et al.
Publicado: (2024)
por: Wu, Yuhao, et al.
Publicado: (2024)
ETT: Expanding the Long Context Understanding Capability of LLMs at Test-Time
por: Zahirnia, Kiarash, et al.
Publicado: (2025)
por: Zahirnia, Kiarash, et al.
Publicado: (2025)
Training Long-Context LLMs Efficiently via Chunk-wise Optimization
por: Li, Wenhao, et al.
Publicado: (2025)
por: Li, Wenhao, et al.
Publicado: (2025)
Weighted-Reward Preference Optimization for Implicit Model Fusion
por: Yang, Ziyi, et al.
Publicado: (2024)
por: Yang, Ziyi, et al.
Publicado: (2024)
Mutual-Taught for Co-adapting Policy and Reward Models
por: Shi, Tianyuan, et al.
Publicado: (2025)
por: Shi, Tianyuan, et al.
Publicado: (2025)
LongRM: Revealing and Unlocking the Context Boundary of Reward Modeling
por: Tang, Zecheng, et al.
Publicado: (2025)
por: Tang, Zecheng, et al.
Publicado: (2025)
Generalizing From Short to Long: Effective Data Synthesis for Long-Context Instruction Tuning
por: Zhu, Wenhao, et al.
Publicado: (2025)
por: Zhu, Wenhao, et al.
Publicado: (2025)
Long Context Alignment with Short Instructions and Synthesized Positions
por: Wu, Wenhao, et al.
Publicado: (2024)
por: Wu, Wenhao, et al.
Publicado: (2024)
GPT-5 vs Other LLMs in Long Short-Context Performance
por: Esmi, Nima, et al.
Publicado: (2026)
por: Esmi, Nima, et al.
Publicado: (2026)
Shifting Long-Context LLMs Research from Input to Output
por: Wu, Yuhao, et al.
Publicado: (2025)
por: Wu, Yuhao, et al.
Publicado: (2025)
SinkLoRA: Enhanced Efficiency and Chat Capabilities for Long-Context Large Language Models
por: Zhang, Hengyu
Publicado: (2024)
por: Zhang, Hengyu
Publicado: (2024)
Temporal User Profiling with LLMs: Balancing Short-Term and Long-Term Preferences for Recommendations
por: Sabouri, Milad, et al.
Publicado: (2025)
por: Sabouri, Milad, et al.
Publicado: (2025)
Reasoning BO: Enhancing Bayesian Optimization with Long-Context Reasoning Power of LLMs
por: Yang, Zhuo, et al.
Publicado: (2025)
por: Yang, Zhuo, et al.
Publicado: (2025)
HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs
por: Kachroo, Darsh, et al.
Publicado: (2026)
por: Kachroo, Darsh, et al.
Publicado: (2026)
ViPO: Visual Preference Optimization at Scale
por: Li, Ming, et al.
Publicado: (2026)
por: Li, Ming, et al.
Publicado: (2026)
Small LLMs Are Weak Tool Learners: A Multi-LLM Agent
por: Shen, Weizhou, et al.
Publicado: (2024)
por: Shen, Weizhou, et al.
Publicado: (2024)
MemPO: Self-Memory Policy Optimization for Long-Horizon Agents
por: Li, Ruoran, et al.
Publicado: (2026)
por: Li, Ruoran, et al.
Publicado: (2026)
RLPO: Residual Listwise Preference Optimization for Long-Context Review Ranking
por: Jiang, Hao, et al.
Publicado: (2026)
por: Jiang, Hao, et al.
Publicado: (2026)
Across Time and (Product) Space: A Capability-Centric Model of Relatedness and Economic Complexity
por: Huang, Ziang, et al.
Publicado: (2025)
por: Huang, Ziang, et al.
Publicado: (2025)
ChatQA 2: Bridging the Gap to Proprietary LLMs in Long Context and RAG Capabilities
por: Xu, Peng, et al.
Publicado: (2024)
por: Xu, Peng, et al.
Publicado: (2024)
FuseRL: Dense Preference Optimization for Heterogeneous Model Fusion
por: Zhong, Longguang, et al.
Publicado: (2025)
por: Zhong, Longguang, et al.
Publicado: (2025)
Joint Enhancement of Relational Reasoning for Long-Context LLMs
por: Chen, Zhirui, et al.
Publicado: (2025)
por: Chen, Zhirui, et al.
Publicado: (2025)
BitDecoding: Unlocking Tensor Cores for Long-Context LLMs with Low-Bit KV Cache
por: Du, Dayou, et al.
Publicado: (2025)
por: Du, Dayou, et al.
Publicado: (2025)
Document Reconstruction Unlocks Scalable Long-Context RLVR
por: Xiao, Yao, et al.
Publicado: (2026)
por: Xiao, Yao, et al.
Publicado: (2026)
LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs
por: Wang, Xiaodong, et al.
Publicado: (2025)
por: Wang, Xiaodong, et al.
Publicado: (2025)
LongMamba: Enhancing Mamba's Long Context Capabilities via Training-Free Receptive Field Enlargement
por: Ye, Zhifan, et al.
Publicado: (2025)
por: Ye, Zhifan, et al.
Publicado: (2025)
Ejemplares similares
-
QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning
por: Wan, Fanqi, et al.
Publicado: (2025) -
QwenLong-CPRS: Towards $\infty$-LLMs with Dynamic Context Optimization
por: Shen, Weizhou, et al.
Publicado: (2025) -
SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models
por: Yang, Ziyi, et al.
Publicado: (2025) -
QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management
por: Shen, Weizhou, et al.
Publicado: (2025) -
LongPO: Long Context Self-Evolution of Large Language Models through Short-to-Long Preference Optimization
por: Chen, Guanzheng, et al.
Publicado: (2025)