Not All Preferences Are Created Equal: Stability-Aware and Gradient-Efficient Alignment for Reasoning Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Hui, Cai, Hengyi, Zhao, Jinman, Chen, Xinran, Li, Ziheng, Zhao, Zhejun, Wang, Shuaiqiang, Li, Yuchen, Yin, Dawei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Efficient Thought Space Exploration Through Strategic Intervention
por: Li, Ziheng, et al.
Publicado: (2025)
por: Li, Ziheng, et al.
Publicado: (2025)
Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding
por: Li, Ziheng, et al.
Publicado: (2025)
por: Li, Ziheng, et al.
Publicado: (2025)
PA-RAG: RAG Alignment via Multi-Perspective Preference Optimization
por: Wu, Jiayi, et al.
Publicado: (2024)
por: Wu, Jiayi, et al.
Publicado: (2024)
CurES: From Gradient Analysis to Efficient Curriculum Learning for Reasoning LLMs
por: Zeng, Yongcheng, et al.
Publicado: (2025)
por: Zeng, Yongcheng, et al.
Publicado: (2025)
AdaSwitch: Balancing Exploration and Guidance in Knowledge Distillation via Adaptive Switching
por: Peng, Jingyu, et al.
Publicado: (2025)
por: Peng, Jingyu, et al.
Publicado: (2025)
Not All Preference Pairs Are Created Equal: A Recipe for Annotation-Efficient Iterative Preference Learning
por: Yang, Sen, et al.
Publicado: (2024)
por: Yang, Sen, et al.
Publicado: (2024)
EndPrompt: Efficient Long-Context Extension via Terminal Anchoring
por: Tian, Han, et al.
Publicado: (2026)
por: Tian, Han, et al.
Publicado: (2026)
MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching
por: Qu, Changle, et al.
Publicado: (2026)
por: Qu, Changle, et al.
Publicado: (2026)
Solving the Granularity Mismatch: Hierarchical Preference Learning for Long-Horizon LLM Agents
por: Gao, Heyang, et al.
Publicado: (2025)
por: Gao, Heyang, et al.
Publicado: (2025)
Not All LLM Reasoners Are Created Equal
por: Hosseini, Arian, et al.
Publicado: (2024)
por: Hosseini, Arian, et al.
Publicado: (2024)
AdaFuse: Accelerating Dynamic Adapter Inference via Token-Level Pre-Gating and Fused Kernel Optimization
por: Li, Qiyang, et al.
Publicado: (2026)
por: Li, Qiyang, et al.
Publicado: (2026)
XL$^2$Bench: A Benchmark for Extremely Long Context Understanding with Long-range Dependencies
por: Ni, Xuanfan, et al.
Publicado: (2024)
por: Ni, Xuanfan, et al.
Publicado: (2024)
Grounding Long-Context Reasoning with Contextual Normalization for Retrieval-Augmented Generation
por: Chen, Jiamin, et al.
Publicado: (2025)
por: Chen, Jiamin, et al.
Publicado: (2025)
Cross-model Control: Improving Multiple Large Language Models in One-time Training
por: Wu, Jiayi, et al.
Publicado: (2024)
por: Wu, Jiayi, et al.
Publicado: (2024)
Reasoning-to-Defend: Safety-Aware Reasoning Can Defend Large Language Models from Jailbreaking
por: Zhu, Junda, et al.
Publicado: (2025)
por: Zhu, Junda, et al.
Publicado: (2025)
Not All Tokens Are Created Equal: Query-Efficient Jailbreak Fuzzing for LLMs
por: Chen, Wenyu, et al.
Publicado: (2026)
por: Chen, Wenyu, et al.
Publicado: (2026)
Not All Errors Are Created Equal: ASCoT Addresses Late-Stage Fragility in Efficient LLM Reasoning
por: Zhang, Dongxu, et al.
Publicado: (2025)
por: Zhang, Dongxu, et al.
Publicado: (2025)
MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering
por: Wu, Hui, et al.
Publicado: (2026)
por: Wu, Hui, et al.
Publicado: (2026)
FlexSpec: Frozen Drafts Meet Evolving Targets in Edge-Cloud Collaborative LLM Speculative Decoding
por: Li, Yuchen, et al.
Publicado: (2026)
por: Li, Yuchen, et al.
Publicado: (2026)
Not All Features Are Created Equal: A Mechanistic Study of Vision-Language-Action Models
por: Grant, Bryce, et al.
Publicado: (2026)
por: Grant, Bryce, et al.
Publicado: (2026)
From Prompting to Alignment: A Generative Framework for Query Recommendation
por: Min, Erxue, et al.
Publicado: (2025)
por: Min, Erxue, et al.
Publicado: (2025)
Adversarial Yet Cooperative: Multi-Perspective Reasoning in Retrieved-Augmented Language Models
por: Xu, Can, et al.
Publicado: (2026)
por: Xu, Can, et al.
Publicado: (2026)
Exploring the Limitations of Large Language Models in Compositional Relation Reasoning
por: Zhao, Jinman, et al.
Publicado: (2024)
por: Zhao, Jinman, et al.
Publicado: (2024)
Not All RAGs Are Created Equal: A Component-Wise Empirical Study for Software Engineering Tasks
por: Ke, Qiang, et al.
Publicado: (2026)
por: Ke, Qiang, et al.
Publicado: (2026)
Not All Candidates are Created Equal: A Heterogeneity-Aware Approach to Pre-ranking in Recommender Systems
por: Tong, Pengfei, et al.
Publicado: (2026)
por: Tong, Pengfei, et al.
Publicado: (2026)
Tool Learning with Large Language Models: A Survey
por: Qu, Changle, et al.
Publicado: (2024)
por: Qu, Changle, et al.
Publicado: (2024)
Towards Completeness-Oriented Tool Retrieval for Large Language Models
por: Qu, Changle, et al.
Publicado: (2024)
por: Qu, Changle, et al.
Publicado: (2024)
Measuring Maximum Activations in Open Large Language Models
por: Chen, Luxuan, et al.
Publicado: (2026)
por: Chen, Luxuan, et al.
Publicado: (2026)
Pretraining on the Test Set Is No Longer All You Need: A Debate-Driven Approach to QA Benchmarks
por: Cao, Linbo, et al.
Publicado: (2025)
por: Cao, Linbo, et al.
Publicado: (2025)
Towards Verifiable Text Generation with Evolving Memory and Self-Reflection
por: Sun, Hao, et al.
Publicado: (2023)
por: Sun, Hao, et al.
Publicado: (2023)
Selective Matching Losses -- Not All Scores Are Created Equal
por: Shamir, Gil I., et al.
Publicado: (2025)
por: Shamir, Gil I., et al.
Publicado: (2025)
AdaSwitch: Adaptive Switching between Small and Large Agents for Effective Cloud-Local Collaborative Learning
por: Sun, Hao, et al.
Publicado: (2024)
por: Sun, Hao, et al.
Publicado: (2024)
Improving the Robustness of Large Language Models via Consistency Alignment
por: Zhao, Yukun, et al.
Publicado: (2024)
por: Zhao, Yukun, et al.
Publicado: (2024)
From Exploration to Mastery: Enabling LLMs to Master Tools via Self-Driven Interactions
por: Qu, Changle, et al.
Publicado: (2024)
por: Qu, Changle, et al.
Publicado: (2024)
Generative Pre-trained Ranking Model with Over-parameterization at Web-Scale (Extended Abstract)
por: Li, Yuchen, et al.
Publicado: (2024)
por: Li, Yuchen, et al.
Publicado: (2024)
Not All Frequencies Are Created Equal:Towards a Dynamic Fusion of Frequencies in Time-Series Forecasting
por: Zhang, Xingyu, et al.
Publicado: (2024)
por: Zhang, Xingyu, et al.
Publicado: (2024)
Unsupervised Large Language Model Alignment for Information Retrieval via Contrastive Feedback
por: Dong, Qian, et al.
Publicado: (2023)
por: Dong, Qian, et al.
Publicado: (2023)
When Search Engine Services meet Large Language Models: Visions and Challenges
por: Xiong, Haoyi, et al.
Publicado: (2024)
por: Xiong, Haoyi, et al.
Publicado: (2024)
Mitigating Hallucinations in Large Vision-Language Models via Entity-Centric Multimodal Preference Optimization
por: Wu, Jiulong, et al.
Publicado: (2025)
por: Wu, Jiulong, et al.
Publicado: (2025)
MILL: Mutual Verification with Large Language Models for Zero-Shot Query Expansion
por: Jia, Pengyue, et al.
Publicado: (2023)
por: Jia, Pengyue, et al.
Publicado: (2023)
Ejemplares similares
-
Efficient Thought Space Exploration Through Strategic Intervention
por: Li, Ziheng, et al.
Publicado: (2025) -
Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding
por: Li, Ziheng, et al.
Publicado: (2025) -
PA-RAG: RAG Alignment via Multi-Perspective Preference Optimization
por: Wu, Jiayi, et al.
Publicado: (2024) -
CurES: From Gradient Analysis to Efficient Curriculum Learning for Reasoning LLMs
por: Zeng, Yongcheng, et al.
Publicado: (2025) -
AdaSwitch: Balancing Exploration and Guidance in Knowledge Distillation via Adaptive Switching
por: Peng, Jingyu, et al.
Publicado: (2025)