Distill Not Only Data but Also Rewards: Can Smaller Language Models Surpass Larger Ones?
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Yudi, Wang, Lu, Fang, Meng, Du, Yali, Huang, Chenghua, Wang, Jun, Lin, Qingwei, Pechenizkiy, Mykola, Zhang, Dongmei, Rajmohan, Saravan, Zhang, Qi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RuAG: Learned-rule-augmented Generation for Large Language Models
di: Zhang, Yudi, et al.
Pubblicazione: (2024)
di: Zhang, Yudi, et al.
Pubblicazione: (2024)
From Reasoning to Answer: Empirical, Attention-Based and Mechanistic Insights into Distilled DeepSeek R1 Models
di: Zhang, Jue, et al.
Pubblicazione: (2025)
di: Zhang, Jue, et al.
Pubblicazione: (2025)
PillagerBench: Benchmarking LLM-Based Agents in Competitive Minecraft Team Environments
di: Schipper, Olivier, et al.
Pubblicazione: (2025)
di: Schipper, Olivier, et al.
Pubblicazione: (2025)
Pretrain Value, Not Reward: Decoupled Value Policy Optimization
di: Huang, Chenghua, et al.
Pubblicazione: (2025)
di: Huang, Chenghua, et al.
Pubblicazione: (2025)
Self-Evolved Reward Learning for LLMs
di: Huang, Chenghua, et al.
Pubblicazione: (2024)
di: Huang, Chenghua, et al.
Pubblicazione: (2024)
The Vision of Autonomic Computing: Can LLMs Make It a Reality?
di: Zhang, Zhiyang, et al.
Pubblicazione: (2024)
di: Zhang, Zhiyang, et al.
Pubblicazione: (2024)
Contrastive Attribution in the Wild: An Interpretability Analysis of LLM Failures on Realistic Benchmarks
di: Tan, Rongyuan, et al.
Pubblicazione: (2026)
di: Tan, Rongyuan, et al.
Pubblicazione: (2026)
Large Language Models Are Neurosymbolic Reasoners
di: Fang, Meng, et al.
Pubblicazione: (2024)
di: Fang, Meng, et al.
Pubblicazione: (2024)
LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals
di: Sun, Lihao, et al.
Pubblicazione: (2026)
di: Sun, Lihao, et al.
Pubblicazione: (2026)
Larger or Smaller Reward Margins to Select Preferences for Alignment?
di: Huang, Kexin, et al.
Pubblicazione: (2025)
di: Huang, Kexin, et al.
Pubblicazione: (2025)
MEETING DELEGATE: Benchmarking LLMs on Attending Meetings on Our Behalf
di: Hu, Lingxiang, et al.
Pubblicazione: (2025)
di: Hu, Lingxiang, et al.
Pubblicazione: (2025)
AXIS: Efficient Human-Agent-Computer Interaction with API-First LLM-Based Agents
di: Lu, Junting, et al.
Pubblicazione: (2024)
di: Lu, Junting, et al.
Pubblicazione: (2024)
Text2Grad: Reinforcement Learning from Natural Language Feedback
di: Wang, Hanyang, et al.
Pubblicazione: (2025)
di: Wang, Hanyang, et al.
Pubblicazione: (2025)
DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems
di: Ma, Ming, et al.
Pubblicazione: (2025)
di: Ma, Ming, et al.
Pubblicazione: (2025)
Benchmarking Foundation Models with Retrieval-Augmented Generation in Olympic-Level Physics Problem Solving
di: Zheng, Shunfeng, et al.
Pubblicazione: (2025)
di: Zheng, Shunfeng, et al.
Pubblicazione: (2025)
Privacy in Action: Towards Realistic Privacy Mitigation and Evaluation for LLM-Powered Agents
di: Wang, Shouju, et al.
Pubblicazione: (2025)
di: Wang, Shouju, et al.
Pubblicazione: (2025)
Agent Based Simulators for Epidemic Modelling: Simulating Larger Models Using Smaller Ones
di: Mittal, Daksh, et al.
Pubblicazione: (2022)
di: Mittal, Daksh, et al.
Pubblicazione: (2022)
Navigating the Unknown: A Chat-Based Collaborative Interface for Personalized Exploratory Tasks
di: Peng, Yingzhe, et al.
Pubblicazione: (2024)
di: Peng, Yingzhe, et al.
Pubblicazione: (2024)
Contrastive Learning with Negative Sampling Correction
di: Wang, Lu, et al.
Pubblicazione: (2024)
di: Wang, Lu, et al.
Pubblicazione: (2024)
AutoRAG-HP: Automatic Online Hyper-Parameter Tuning for Retrieval-Augmented Generation
di: Fu, Jia, et al.
Pubblicazione: (2024)
di: Fu, Jia, et al.
Pubblicazione: (2024)
VEM: Environment-Free Exploration for Training GUI Agent with Value Environment Model
di: Zheng, Jiani, et al.
Pubblicazione: (2025)
di: Zheng, Jiani, et al.
Pubblicazione: (2025)
HASARD: A Benchmark for Vision-Based Safe Reinforcement Learning in Embodied Agents
di: Tomilin, Tristan, et al.
Pubblicazione: (2025)
di: Tomilin, Tristan, et al.
Pubblicazione: (2025)
CI-Work: Benchmarking Contextual Integrity in Enterprise LLM Agents
di: Fu, Wenjie, et al.
Pubblicazione: (2026)
di: Fu, Wenjie, et al.
Pubblicazione: (2026)
API Agents vs. GUI Agents: Divergence and Convergence
di: Zhang, Chaoyun, et al.
Pubblicazione: (2025)
di: Zhang, Chaoyun, et al.
Pubblicazione: (2025)
Large Language Models can Deliver Accurate and Interpretable Time Series Anomaly Detection
di: Liu, Jun, et al.
Pubblicazione: (2024)
di: Liu, Jun, et al.
Pubblicazione: (2024)
Zipage: Maintain High Request Concurrency for LLM Reasoning through Compressed PagedAttention
di: Liao, Mengqi, et al.
Pubblicazione: (2026)
di: Liao, Mengqi, et al.
Pubblicazione: (2026)
MACCA: Offline Multi-agent Reinforcement Learning with Causal Credit Assignment
di: Wang, Ziyan, et al.
Pubblicazione: (2023)
di: Wang, Ziyan, et al.
Pubblicazione: (2023)
Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs
di: Wang, Qibin, et al.
Pubblicazione: (2025)
di: Wang, Qibin, et al.
Pubblicazione: (2025)
Sharingan: Extract User Action Sequence from Desktop Recordings
di: Chen, Yanting, et al.
Pubblicazione: (2024)
di: Chen, Yanting, et al.
Pubblicazione: (2024)
EfficientRAG: Efficient Retriever for Multi-Hop Question Answering
di: Zhuang, Ziyuan, et al.
Pubblicazione: (2024)
di: Zhuang, Ziyuan, et al.
Pubblicazione: (2024)
Everything of Thoughts: Defying the Law of Penrose Triangle for Thought Generation
di: Ding, Ruomeng, et al.
Pubblicazione: (2023)
di: Ding, Ruomeng, et al.
Pubblicazione: (2023)
Efficient Exploration in Average-Reward Constrained Reinforcement Learning: Achieving Near-Optimal Regret With Posterior Sampling
di: Provodin, Danil, et al.
Pubblicazione: (2024)
di: Provodin, Danil, et al.
Pubblicazione: (2024)
Enabling Autonomic Microservice Management through Self-Learning Agents
di: Yu, Fenglin, et al.
Pubblicazione: (2025)
di: Yu, Fenglin, et al.
Pubblicazione: (2025)
AI Delegates with a Dual Focus: Ensuring Privacy and Strategic Self-Disclosure
di: Zhang, Zhiyang, et al.
Pubblicazione: (2024)
di: Zhang, Zhiyang, et al.
Pubblicazione: (2024)
Reason-before-Retrieve: One-Stage Reflective Chain-of-Thoughts for Training-Free Zero-Shot Composed Image Retrieval
di: Tang, Yuanmin, et al.
Pubblicazione: (2024)
di: Tang, Yuanmin, et al.
Pubblicazione: (2024)
WarriorCoder: Learning from Expert Battles to Augment Code Large Language Models
di: Feng, Huawen, et al.
Pubblicazione: (2024)
di: Feng, Huawen, et al.
Pubblicazione: (2024)
G-KV: Decoding-Time KV Cache Eviction with Global Attention
di: Liao, Mengqi, et al.
Pubblicazione: (2025)
di: Liao, Mengqi, et al.
Pubblicazione: (2025)
Not Only Rewards But Also Constraints: Applications on Legged Robot Locomotion
di: Kim, Yunho, et al.
Pubblicazione: (2023)
di: Kim, Yunho, et al.
Pubblicazione: (2023)
ExeCoder: Empowering Large Language Models with Executability Representation for Code Translation
di: He, Minghua, et al.
Pubblicazione: (2025)
di: He, Minghua, et al.
Pubblicazione: (2025)
MEAL: A Benchmark for Continual Multi-Agent Reinforcement Learning
di: Tomilin, Tristan, et al.
Pubblicazione: (2025)
di: Tomilin, Tristan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
RuAG: Learned-rule-augmented Generation for Large Language Models
di: Zhang, Yudi, et al.
Pubblicazione: (2024) -
From Reasoning to Answer: Empirical, Attention-Based and Mechanistic Insights into Distilled DeepSeek R1 Models
di: Zhang, Jue, et al.
Pubblicazione: (2025) -
PillagerBench: Benchmarking LLM-Based Agents in Competitive Minecraft Team Environments
di: Schipper, Olivier, et al.
Pubblicazione: (2025) -
Pretrain Value, Not Reward: Decoupled Value Policy Optimization
di: Huang, Chenghua, et al.
Pubblicazione: (2025) -
Self-Evolved Reward Learning for LLMs
di: Huang, Chenghua, et al.
Pubblicazione: (2024)