TED: Training-Free Experience Distillation for Multimodal Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yuan, Shuozhi, Wang, Jinqing, Liu, Zihao, Yuan, Miaomiao, Peng, Haoran, Zhao, Jin, Wang, Bingwen, Wang, Haoyi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MCTS-SQL: Light-Weight LLMs can Master the Text-to-SQL through Monte Carlo Tree Search
par: Yuan, Shuozhi, et autres
Publié: (2025)
par: Yuan, Shuozhi, et autres
Publié: (2025)
Topology-Aware Revival for Efficient Sparse Training
par: Jin, Meiling, et autres
Publié: (2026)
par: Jin, Meiling, et autres
Publié: (2026)
Validity-Calibrated Reasoning Distillation
par: Saadi, Khouloud, et autres
Publié: (2026)
par: Saadi, Khouloud, et autres
Publié: (2026)
Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models
par: Yang, Shidong, et autres
Publié: (2026)
par: Yang, Shidong, et autres
Publié: (2026)
Distilled Protein Backbone Generation
par: Xie, Liyang, et autres
Publié: (2025)
par: Xie, Liyang, et autres
Publié: (2025)
HEAL: Hindsight Entropy-Assisted Learning for Reasoning Distillation
par: Zhang, Wenjing, et autres
Publié: (2026)
par: Zhang, Wenjing, et autres
Publié: (2026)
Automated Fusion of Multimodal Electronic Health Records for Better Medical Predictions
par: Cui, Suhan, et autres
Publié: (2024)
par: Cui, Suhan, et autres
Publié: (2024)
Native Reasoning Models: Training Language Models to Reason on Unverifiable Data
par: Wang, Yuanfu, et autres
Publié: (2026)
par: Wang, Yuanfu, et autres
Publié: (2026)
Beyond Scaling Law: A Data-Efficient Distillation Framework for Reasoning
par: Wu, Xiaojun, et autres
Publié: (2025)
par: Wu, Xiaojun, et autres
Publié: (2025)
Annealing Self-Distillation Rectification Improves Adversarial Training
par: Wu, Yu-Yu, et autres
Publié: (2023)
par: Wu, Yu-Yu, et autres
Publié: (2023)
When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
par: Liu, Xiaogeng, et autres
Publié: (2026)
par: Liu, Xiaogeng, et autres
Publié: (2026)
Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning
par: Yang, Zhicheng, et autres
Publié: (2026)
par: Yang, Zhicheng, et autres
Publié: (2026)
LLM and GNN are Complementary: Distilling LLM for Multimodal Graph Learning
par: Xu, Junjie, et autres
Publié: (2024)
par: Xu, Junjie, et autres
Publié: (2024)
Training Free Guided Flow Matching with Optimal Control
par: Wang, Luran, et autres
Publié: (2024)
par: Wang, Luran, et autres
Publié: (2024)
Logit Distillation on Manifolds: Mapping by Learning
par: Yang, Yiru, et autres
Publié: (2026)
par: Yang, Yiru, et autres
Publié: (2026)
FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion
par: Wang, Zehan, et autres
Publié: (2024)
par: Wang, Zehan, et autres
Publié: (2024)
Training Multimodal Large Reasoning Models Needs Better Thoughts: A Three-Stage Framework for Long Chain-of-Thought Synthesis and Selection
par: Wang, Yizhi, et autres
Publié: (2025)
par: Wang, Yizhi, et autres
Publié: (2025)
A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning
par: Li, Mengqi, et autres
Publié: (2025)
par: Li, Mengqi, et autres
Publié: (2025)
OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning
par: Yang, Yuxiao, et autres
Publié: (2026)
par: Yang, Yuxiao, et autres
Publié: (2026)
MemCast: Memory-Driven Time Series Forecasting with Experience-Conditioned Reasoning
par: Tao, Xiaoyu, et autres
Publié: (2026)
par: Tao, Xiaoyu, et autres
Publié: (2026)
Mid-Think: Training-Free Intermediate-Budget Reasoning via Token-Level Triggers
par: Yang, Wang, et autres
Publié: (2026)
par: Yang, Wang, et autres
Publié: (2026)
Beyond the Proxy: Trajectory-Distilled Guidance for Offline GFlowNet Training
par: Chen, Ruishuo, et autres
Publié: (2025)
par: Chen, Ruishuo, et autres
Publié: (2025)
PSNE: Efficient Spectral Sparsification Algorithms for Scaling Network Embedding
par: Lin, Longlong, et autres
Publié: (2024)
par: Lin, Longlong, et autres
Publié: (2024)
When and Why Adversarial Training Improves PINNs: A Neural Tangent Kernel Perspective
par: Cao, Yuan-dong, et autres
Publié: (2026)
par: Cao, Yuan-dong, et autres
Publié: (2026)
Medical Multimodal Foundation Models in Clinical Diagnosis and Treatment: Applications, Challenges, and Future Directions
par: Sun, Kai, et autres
Publié: (2024)
par: Sun, Kai, et autres
Publié: (2024)
Can Past Experience Accelerate LLM Reasoning?
par: Pan, Bo, et autres
Publié: (2025)
par: Pan, Bo, et autres
Publié: (2025)
KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning
par: Xu, Hongling, et autres
Publié: (2025)
par: Xu, Hongling, et autres
Publié: (2025)
R$^2$PO: Decoupling Training Trajectories from Inference Responses for LLM Reasoning
par: Wang, Jingchu, et autres
Publié: (2026)
par: Wang, Jingchu, et autres
Publié: (2026)
Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation
par: Wu, Yecheng, et autres
Publié: (2026)
par: Wu, Yecheng, et autres
Publié: (2026)
Hindsight Hint Distillation: Scaffolded Reasoning for SWE Agents from CoT-free Answers
par: Wang, Shengjie, et autres
Publié: (2026)
par: Wang, Shengjie, et autres
Publié: (2026)
No Free Lunch: Rethinking Internal Feedback for LLM Reasoning
par: Zhang, Yanzhi, et autres
Publié: (2025)
par: Zhang, Yanzhi, et autres
Publié: (2025)
Training-Free ANN-to-SNN Conversion for High-Performance Spiking Transformer
par: Wang, Jingya, et autres
Publié: (2025)
par: Wang, Jingya, et autres
Publié: (2025)
Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO
par: Yu, Bowen, et autres
Publié: (2026)
par: Yu, Bowen, et autres
Publié: (2026)
The Quest for Efficient Reasoning: A Data-Centric Benchmark to CoT Distillation
par: Zhang, Ruichen, et autres
Publié: (2025)
par: Zhang, Ruichen, et autres
Publié: (2025)
Learning to Reason as Action Abstractions with Scalable Mid-Training RL
par: Zhang, Shenao, et autres
Publié: (2025)
par: Zhang, Shenao, et autres
Publié: (2025)
TED: Turn Emphasis with Dialogue Feature Attention for Emotion Recognition in Conversation
par: Ono, Junya, et autres
Publié: (2025)
par: Ono, Junya, et autres
Publié: (2025)
SLEA-RL: Step-Level Experience Augmented Reinforcement Learning for Multi-Turn Agentic Training
par: Wang, Prince Zizhuang, et autres
Publié: (2026)
par: Wang, Prince Zizhuang, et autres
Publié: (2026)
DeepVision-103K: A Visually Diverse, Broad-Coverage, and Verifiable Mathematical Dataset for Multimodal Reasoning
par: Sun, Haoxiang, et autres
Publié: (2026)
par: Sun, Haoxiang, et autres
Publié: (2026)
Data-Free Continual Learning of Server Models in Model-Heterogeneous Cloud-Device Collaboration
par: Zhang, Xiao, et autres
Publié: (2025)
par: Zhang, Xiao, et autres
Publié: (2025)
Train at Moving Edge: Online-Verified Prompt Selection for Efficient RL Training of Large Reasoning Model
par: Wu, Jiahao, et autres
Publié: (2026)
par: Wu, Jiahao, et autres
Publié: (2026)
Documents similaires
-
MCTS-SQL: Light-Weight LLMs can Master the Text-to-SQL through Monte Carlo Tree Search
par: Yuan, Shuozhi, et autres
Publié: (2025) -
Topology-Aware Revival for Efficient Sparse Training
par: Jin, Meiling, et autres
Publié: (2026) -
Validity-Calibrated Reasoning Distillation
par: Saadi, Khouloud, et autres
Publié: (2026) -
Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models
par: Yang, Shidong, et autres
Publié: (2026) -
Distilled Protein Backbone Generation
par: Xie, Liyang, et autres
Publié: (2025)