Salvato in:
| Autori principali: | Zhao, Ziqi, Ma, Xinyu, Yang, Liu, Feng, Yujie, Shi, Daiting, He, Jingzhou, Xin, Xin, Ren, Zhaochun, Wu, Xiao-Ming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2605.28014 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reinforced Efficient Reasoning via Semantically Diverse Exploration
di: Zhao, Ziqi, et al.
Pubblicazione: (2026)
di: Zhao, Ziqi, et al.
Pubblicazione: (2026)
Curriculum Approximate Unlearning for Session-based Recommendation
di: Yang, Liu, et al.
Pubblicazione: (2025)
di: Yang, Liu, et al.
Pubblicazione: (2025)
Cold-Starts in Generative Recommendation: A Reproducibility Study
di: Zhang, Zhen, et al.
Pubblicazione: (2026)
di: Zhang, Zhen, et al.
Pubblicazione: (2026)
Offline Trajectory Optimization for Offline Reinforcement Learning
di: Zhao, Ziqi, et al.
Pubblicazione: (2024)
di: Zhao, Ziqi, et al.
Pubblicazione: (2024)
Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
di: Zhao, Siyan, et al.
Pubblicazione: (2026)
di: Zhao, Siyan, et al.
Pubblicazione: (2026)
OISD: On-Policy Internal Self-Distillation of Language Models
di: Liu, Xinyu, et al.
Pubblicazione: (2026)
di: Liu, Xinyu, et al.
Pubblicazione: (2026)
Training with Harnesses: On-Policy Harness Self-Distillation for Complex Reasoning
di: Zhao, Zhengyang, et al.
Pubblicazione: (2026)
di: Zhao, Zhengyang, et al.
Pubblicazione: (2026)
Continual Dialogue State Tracking via Reason-of-Select Distillation
di: Feng, Yujie, et al.
Pubblicazione: (2024)
di: Feng, Yujie, et al.
Pubblicazione: (2024)
Model Editing for New Document Integration in Generative Information Retrieval
di: Zhang, Zhen, et al.
Pubblicazione: (2026)
di: Zhang, Zhen, et al.
Pubblicazione: (2026)
Improving Sequential Recommenders through Counterfactual Augmentation of System Exposure
di: Zhao, Ziqi, et al.
Pubblicazione: (2025)
di: Zhao, Ziqi, et al.
Pubblicazione: (2025)
Crosslingual On-Policy Self-Distillation for Multilingual Reasoning
di: Liu, Yihong, et al.
Pubblicazione: (2026)
di: Liu, Yihong, et al.
Pubblicazione: (2026)
Self-Supervised On-Policy Distillation for Reasoning Language Models
di: Tan, Zhiquan, et al.
Pubblicazione: (2026)
di: Tan, Zhiquan, et al.
Pubblicazione: (2026)
When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
di: Liu, Xiaogeng, et al.
Pubblicazione: (2026)
di: Liu, Xiaogeng, et al.
Pubblicazione: (2026)
Direct Retrieval-augmented Optimization: Synergizing Knowledge Selection and Language Models
di: Shi, Zhengliang, et al.
Pubblicazione: (2025)
di: Shi, Zhengliang, et al.
Pubblicazione: (2025)
Towards Reason-Informed Video Editing in Unified Models with Self-Reflective Learning
di: Liu, Xinyu, et al.
Pubblicazione: (2025)
di: Liu, Xinyu, et al.
Pubblicazione: (2025)
Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning
di: Ke, Junlong, et al.
Pubblicazione: (2026)
di: Ke, Junlong, et al.
Pubblicazione: (2026)
Self-Adaptive Cognitive Debiasing for Large Language Models in Decision-Making
di: Lyu, Yougang, et al.
Pubblicazione: (2025)
di: Lyu, Yougang, et al.
Pubblicazione: (2025)
ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework
di: Qin, Kai, et al.
Pubblicazione: (2026)
di: Qin, Kai, et al.
Pubblicazione: (2026)
Self-Supervised Position Debiasing for Large Language Models
di: Liu, Zhongkun, et al.
Pubblicazione: (2024)
di: Liu, Zhongkun, et al.
Pubblicazione: (2024)
Iterative Self-Incentivization Empowers Large Language Models as Agentic Searchers
di: Shi, Zhengliang, et al.
Pubblicazione: (2025)
di: Shi, Zhengliang, et al.
Pubblicazione: (2025)
Is ChatGPT Good at Search? Investigating Large Language Models as Re-Ranking Agents
di: Sun, Weiwei, et al.
Pubblicazione: (2023)
di: Sun, Weiwei, et al.
Pubblicazione: (2023)
CRISP: Compressed Reasoning via Iterative Self-Policy Distillation
di: Sang, Hejian, et al.
Pubblicazione: (2026)
di: Sang, Hejian, et al.
Pubblicazione: (2026)
R^3AG: First Workshop on Refined and Reliable Retrieval Augmented Generation
di: Wang, Zihan, et al.
Pubblicazione: (2024)
di: Wang, Zihan, et al.
Pubblicazione: (2024)
DiffuGR: Generative Document Retrieval with Diffusion Language Models
di: Zhao, Xinpeng, et al.
Pubblicazione: (2025)
di: Zhao, Xinpeng, et al.
Pubblicazione: (2025)
CORD: Bridging the Audio-Text Reasoning Gap via Weighted On-policy Cross-modal Distillation
di: Hu, Jing, et al.
Pubblicazione: (2026)
di: Hu, Jing, et al.
Pubblicazione: (2026)
DreamPolish: Domain Score Distillation With Progressive Geometry Generation
di: Cheng, Yean, et al.
Pubblicazione: (2024)
di: Cheng, Yean, et al.
Pubblicazione: (2024)
Reasoning Compression with Mixed-Policy Distillation
di: Yang, Han, et al.
Pubblicazione: (2026)
di: Yang, Han, et al.
Pubblicazione: (2026)
A Token is Worth over 1,000 Tokens: Efficient Knowledge Distillation through Low-Rank Clone
di: Hao, Jitai, et al.
Pubblicazione: (2025)
di: Hao, Jitai, et al.
Pubblicazione: (2025)
Agentic-R: Learning to Retrieve for Agentic Search
di: Liu, Wenhan, et al.
Pubblicazione: (2026)
di: Liu, Wenhan, et al.
Pubblicazione: (2026)
Tailoring High‐Temperature Low‐Loss Properties in Polyimide Films for Energy Storage Through Multiamino Crosslinking
di: Di Wu, et al.
Pubblicazione: (2026)
di: Di Wu, et al.
Pubblicazione: (2026)
A Cooperative Multi-Agent Framework for Zero-Shot Named Entity Recognition
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
Constrained Auto-Regressive Decoding Constrains Generative Retrieval
di: Wu, Shiguang, et al.
Pubblicazione: (2025)
di: Wu, Shiguang, et al.
Pubblicazione: (2025)
Mirror: A Multiple-perspective Self-Reflection Method for Knowledge-rich Reasoning
di: Yan, Hanqi, et al.
Pubblicazione: (2024)
di: Yan, Hanqi, et al.
Pubblicazione: (2024)
Uncovering Selective State Space Model's Capabilities in Lifelong Sequential Recommendation
di: Yang, Jiyuan, et al.
Pubblicazione: (2024)
di: Yang, Jiyuan, et al.
Pubblicazione: (2024)
ReleaseEval: A Benchmark for Evaluating Language Models in Automated Release Note Generation
di: Meng, Qianru, et al.
Pubblicazione: (2025)
di: Meng, Qianru, et al.
Pubblicazione: (2025)
Unlocking General Long Chain-of-Thought Reasoning Capabilities of Large Language Models via Representation Engineering
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
di: Tang, Xinyu, et al.
Pubblicazione: (2025)
TourRank: Utilizing Large Language Models for Documents Ranking with a Tournament-Inspired Strategy
di: Chen, Yiqun, et al.
Pubblicazione: (2024)
di: Chen, Yiqun, et al.
Pubblicazione: (2024)
MEFT: Memory-Efficient Fine-Tuning through Sparse Adapter
di: Hao, Jitai, et al.
Pubblicazione: (2024)
di: Hao, Jitai, et al.
Pubblicazione: (2024)
What are the limits of cross-lingual dense passage retrieval for low-resource languages?
di: Wu, Jie, et al.
Pubblicazione: (2024)
di: Wu, Jie, et al.
Pubblicazione: (2024)
Skill-Conditioned Gated Self-Distillation for LLM Reasoning
di: Huang, Jiazhen, et al.
Pubblicazione: (2026)
di: Huang, Jiazhen, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Reinforced Efficient Reasoning via Semantically Diverse Exploration
di: Zhao, Ziqi, et al.
Pubblicazione: (2026) -
Curriculum Approximate Unlearning for Session-based Recommendation
di: Yang, Liu, et al.
Pubblicazione: (2025) -
Cold-Starts in Generative Recommendation: A Reproducibility Study
di: Zhang, Zhen, et al.
Pubblicazione: (2026) -
Offline Trajectory Optimization for Offline Reinforcement Learning
di: Zhao, Ziqi, et al.
Pubblicazione: (2024) -
Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
di: Zhao, Siyan, et al.
Pubblicazione: (2026)