Guardado en:
| Autores principales: | Zhao, Ziqi, Ma, Xinyu, Yang, Liu, Feng, Yujie, Shi, Daiting, He, Jingzhou, Xin, Xin, Ren, Zhaochun, Wu, Xiao-Ming |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2605.28014 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Reinforced Efficient Reasoning via Semantically Diverse Exploration
por: Zhao, Ziqi, et al.
Publicado: (2026)
por: Zhao, Ziqi, et al.
Publicado: (2026)
Curriculum Approximate Unlearning for Session-based Recommendation
por: Yang, Liu, et al.
Publicado: (2025)
por: Yang, Liu, et al.
Publicado: (2025)
Cold-Starts in Generative Recommendation: A Reproducibility Study
por: Zhang, Zhen, et al.
Publicado: (2026)
por: Zhang, Zhen, et al.
Publicado: (2026)
Offline Trajectory Optimization for Offline Reinforcement Learning
por: Zhao, Ziqi, et al.
Publicado: (2024)
por: Zhao, Ziqi, et al.
Publicado: (2024)
Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
por: Zhao, Siyan, et al.
Publicado: (2026)
por: Zhao, Siyan, et al.
Publicado: (2026)
OISD: On-Policy Internal Self-Distillation of Language Models
por: Liu, Xinyu, et al.
Publicado: (2026)
por: Liu, Xinyu, et al.
Publicado: (2026)
Training with Harnesses: On-Policy Harness Self-Distillation for Complex Reasoning
por: Zhao, Zhengyang, et al.
Publicado: (2026)
por: Zhao, Zhengyang, et al.
Publicado: (2026)
Continual Dialogue State Tracking via Reason-of-Select Distillation
por: Feng, Yujie, et al.
Publicado: (2024)
por: Feng, Yujie, et al.
Publicado: (2024)
Model Editing for New Document Integration in Generative Information Retrieval
por: Zhang, Zhen, et al.
Publicado: (2026)
por: Zhang, Zhen, et al.
Publicado: (2026)
Improving Sequential Recommenders through Counterfactual Augmentation of System Exposure
por: Zhao, Ziqi, et al.
Publicado: (2025)
por: Zhao, Ziqi, et al.
Publicado: (2025)
Crosslingual On-Policy Self-Distillation for Multilingual Reasoning
por: Liu, Yihong, et al.
Publicado: (2026)
por: Liu, Yihong, et al.
Publicado: (2026)
Self-Supervised On-Policy Distillation for Reasoning Language Models
por: Tan, Zhiquan, et al.
Publicado: (2026)
por: Tan, Zhiquan, et al.
Publicado: (2026)
When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
por: Liu, Xiaogeng, et al.
Publicado: (2026)
por: Liu, Xiaogeng, et al.
Publicado: (2026)
Direct Retrieval-augmented Optimization: Synergizing Knowledge Selection and Language Models
por: Shi, Zhengliang, et al.
Publicado: (2025)
por: Shi, Zhengliang, et al.
Publicado: (2025)
Towards Reason-Informed Video Editing in Unified Models with Self-Reflective Learning
por: Liu, Xinyu, et al.
Publicado: (2025)
por: Liu, Xinyu, et al.
Publicado: (2025)
Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning
por: Ke, Junlong, et al.
Publicado: (2026)
por: Ke, Junlong, et al.
Publicado: (2026)
Self-Adaptive Cognitive Debiasing for Large Language Models in Decision-Making
por: Lyu, Yougang, et al.
Publicado: (2025)
por: Lyu, Yougang, et al.
Publicado: (2025)
ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework
por: Qin, Kai, et al.
Publicado: (2026)
por: Qin, Kai, et al.
Publicado: (2026)
Self-Supervised Position Debiasing for Large Language Models
por: Liu, Zhongkun, et al.
Publicado: (2024)
por: Liu, Zhongkun, et al.
Publicado: (2024)
Iterative Self-Incentivization Empowers Large Language Models as Agentic Searchers
por: Shi, Zhengliang, et al.
Publicado: (2025)
por: Shi, Zhengliang, et al.
Publicado: (2025)
Is ChatGPT Good at Search? Investigating Large Language Models as Re-Ranking Agents
por: Sun, Weiwei, et al.
Publicado: (2023)
por: Sun, Weiwei, et al.
Publicado: (2023)
CRISP: Compressed Reasoning via Iterative Self-Policy Distillation
por: Sang, Hejian, et al.
Publicado: (2026)
por: Sang, Hejian, et al.
Publicado: (2026)
R^3AG: First Workshop on Refined and Reliable Retrieval Augmented Generation
por: Wang, Zihan, et al.
Publicado: (2024)
por: Wang, Zihan, et al.
Publicado: (2024)
DiffuGR: Generative Document Retrieval with Diffusion Language Models
por: Zhao, Xinpeng, et al.
Publicado: (2025)
por: Zhao, Xinpeng, et al.
Publicado: (2025)
CORD: Bridging the Audio-Text Reasoning Gap via Weighted On-policy Cross-modal Distillation
por: Hu, Jing, et al.
Publicado: (2026)
por: Hu, Jing, et al.
Publicado: (2026)
DreamPolish: Domain Score Distillation With Progressive Geometry Generation
por: Cheng, Yean, et al.
Publicado: (2024)
por: Cheng, Yean, et al.
Publicado: (2024)
Reasoning Compression with Mixed-Policy Distillation
por: Yang, Han, et al.
Publicado: (2026)
por: Yang, Han, et al.
Publicado: (2026)
A Token is Worth over 1,000 Tokens: Efficient Knowledge Distillation through Low-Rank Clone
por: Hao, Jitai, et al.
Publicado: (2025)
por: Hao, Jitai, et al.
Publicado: (2025)
Agentic-R: Learning to Retrieve for Agentic Search
por: Liu, Wenhan, et al.
Publicado: (2026)
por: Liu, Wenhan, et al.
Publicado: (2026)
Tailoring High‐Temperature Low‐Loss Properties in Polyimide Films for Energy Storage Through Multiamino Crosslinking
por: Di Wu, et al.
Publicado: (2026)
por: Di Wu, et al.
Publicado: (2026)
A Cooperative Multi-Agent Framework for Zero-Shot Named Entity Recognition
por: Wang, Zihan, et al.
Publicado: (2025)
por: Wang, Zihan, et al.
Publicado: (2025)
Constrained Auto-Regressive Decoding Constrains Generative Retrieval
por: Wu, Shiguang, et al.
Publicado: (2025)
por: Wu, Shiguang, et al.
Publicado: (2025)
Mirror: A Multiple-perspective Self-Reflection Method for Knowledge-rich Reasoning
por: Yan, Hanqi, et al.
Publicado: (2024)
por: Yan, Hanqi, et al.
Publicado: (2024)
Uncovering Selective State Space Model's Capabilities in Lifelong Sequential Recommendation
por: Yang, Jiyuan, et al.
Publicado: (2024)
por: Yang, Jiyuan, et al.
Publicado: (2024)
ReleaseEval: A Benchmark for Evaluating Language Models in Automated Release Note Generation
por: Meng, Qianru, et al.
Publicado: (2025)
por: Meng, Qianru, et al.
Publicado: (2025)
Unlocking General Long Chain-of-Thought Reasoning Capabilities of Large Language Models via Representation Engineering
por: Tang, Xinyu, et al.
Publicado: (2025)
por: Tang, Xinyu, et al.
Publicado: (2025)
TourRank: Utilizing Large Language Models for Documents Ranking with a Tournament-Inspired Strategy
por: Chen, Yiqun, et al.
Publicado: (2024)
por: Chen, Yiqun, et al.
Publicado: (2024)
MEFT: Memory-Efficient Fine-Tuning through Sparse Adapter
por: Hao, Jitai, et al.
Publicado: (2024)
por: Hao, Jitai, et al.
Publicado: (2024)
What are the limits of cross-lingual dense passage retrieval for low-resource languages?
por: Wu, Jie, et al.
Publicado: (2024)
por: Wu, Jie, et al.
Publicado: (2024)
Skill-Conditioned Gated Self-Distillation for LLM Reasoning
por: Huang, Jiazhen, et al.
Publicado: (2026)
por: Huang, Jiazhen, et al.
Publicado: (2026)
Ejemplares similares
-
Reinforced Efficient Reasoning via Semantically Diverse Exploration
por: Zhao, Ziqi, et al.
Publicado: (2026) -
Curriculum Approximate Unlearning for Session-based Recommendation
por: Yang, Liu, et al.
Publicado: (2025) -
Cold-Starts in Generative Recommendation: A Reproducibility Study
por: Zhang, Zhen, et al.
Publicado: (2026) -
Offline Trajectory Optimization for Offline Reinforcement Learning
por: Zhao, Ziqi, et al.
Publicado: (2024) -
Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
por: Zhao, Siyan, et al.
Publicado: (2026)