SAGE-32B: Agentic Reasoning via Iterative Distillation
Fuente:
arXiv
Guardado en:
| Autores principales: | Jha, Basab, Paudel, Firoj, Puri, Ujjwal, Henkel, Ethan, Yuting, Zhang, Kowalczyk, Mateusz, Huang, Mei, Donghyuk, Choi, Junhao, Wang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Thinking About Thinking: SAGE-nano's Inverse Reasoning for Self-Aware Language Models
por: Jha, Basab, et al.
Publicado: (2025)
por: Jha, Basab, et al.
Publicado: (2025)
SAGE Celer 2.6 Technical Card
por: SAGEA Research Team, et al.
Publicado: (2026)
por: SAGEA Research Team, et al.
Publicado: (2026)
Fragile Mastery: Are Domain-Specific Trade-Offs Undermining On-Device Language Models?
por: Jha, Basab, et al.
Publicado: (2025)
por: Jha, Basab, et al.
Publicado: (2025)
The Rosetta Paradox: Domain-Specific Performance Inversions in Large Language Models
por: Jha, Basab, et al.
Publicado: (2024)
por: Jha, Basab, et al.
Publicado: (2024)
Analyzing Error Propagation in Korean Spoken QA with ASR-LLM Cascades
por: Jung, Donghyuk, et al.
Publicado: (2026)
por: Jung, Donghyuk, et al.
Publicado: (2026)
SAGE: An Agentic Explainer Framework for Interpreting SAE Features in Language Models
por: Han, Jiaojiao, et al.
Publicado: (2025)
por: Han, Jiaojiao, et al.
Publicado: (2025)
SAGE: A Novelty Gate for Efficient Memory Evolution in Agentic LLMs
por: Wang, Sijia, et al.
Publicado: (2026)
por: Wang, Sijia, et al.
Publicado: (2026)
Accurate Legal Reasoning at Scale: Neuro-Symbolic Offloading and Structural Auditability for Robust Legal Adjudication
por: Sójka, Stanisław, et al.
Publicado: (2026)
por: Sójka, Stanisław, et al.
Publicado: (2026)
Agentic-R1: Distilled Dual-Strategy Reasoning
por: Du, Weihua, et al.
Publicado: (2025)
por: Du, Weihua, et al.
Publicado: (2025)
CANDLE: Iterative Conceptualization and Instantiation Distillation from Large Language Models for Commonsense Reasoning
por: Wang, Weiqi, et al.
Publicado: (2024)
por: Wang, Weiqi, et al.
Publicado: (2024)
SAGE-LD: Towards Scalable and Generalizable End-to-End Language Diarization via Simulated Data Augmentation
por: Lee, Sangmin, et al.
Publicado: (2025)
por: Lee, Sangmin, et al.
Publicado: (2025)
ARTIS: Agentic Risk-Aware Test-Time Scaling via Iterative Simulation
por: Zeng, Xingshan, et al.
Publicado: (2026)
por: Zeng, Xingshan, et al.
Publicado: (2026)
Detecting Distillation Data from Reasoning Models
por: Zhang, Hengxiang, et al.
Publicado: (2025)
por: Zhang, Hengxiang, et al.
Publicado: (2025)
Distilling the Essence: Efficient Reasoning Distillation via Sequence Truncation
por: Chen, Wei-Rui, et al.
Publicado: (2025)
por: Chen, Wei-Rui, et al.
Publicado: (2025)
Is Modularity Transferable? A Case Study through the Lens of Knowledge Distillation
por: Klimaszewski, Mateusz, et al.
Publicado: (2024)
por: Klimaszewski, Mateusz, et al.
Publicado: (2024)
IndicEval-XL: Bridging Linguistic Diversity in Code Generation Across Indic Languages
por: Singh, Ujjwal, et al.
Publicado: (2025)
por: Singh, Ujjwal, et al.
Publicado: (2025)
RLKD: Distilling LLMs' Reasoning via Reinforcement Learning
por: Xu, Shicheng, et al.
Publicado: (2025)
por: Xu, Shicheng, et al.
Publicado: (2025)
Evaluating Subword Tokenization Techniques for Bengali: A Benchmark Study with BengaliBPE
por: Patwary, Firoj Ahmmed, et al.
Publicado: (2025)
por: Patwary, Firoj Ahmmed, et al.
Publicado: (2025)
Can GPT-4 Identify Propaganda? Annotation and Detection of Propaganda Spans in News Articles
por: Hasanain, Maram, et al.
Publicado: (2024)
por: Hasanain, Maram, et al.
Publicado: (2024)
Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning
por: Wu, Tong, et al.
Publicado: (2025)
por: Wu, Tong, et al.
Publicado: (2025)
AgenticMath: Enhancing LLM Reasoning via Agentic-based Math Data Generation
por: Liu, Xianyang, et al.
Publicado: (2025)
por: Liu, Xianyang, et al.
Publicado: (2025)
Iterative Self-Incentivization Empowers Large Language Models as Agentic Searchers
por: Shi, Zhengliang, et al.
Publicado: (2025)
por: Shi, Zhengliang, et al.
Publicado: (2025)
Long-Chain Reasoning Distillation via Adaptive Prefix Alignment
por: Liu, Zhenghao, et al.
Publicado: (2026)
por: Liu, Zhenghao, et al.
Publicado: (2026)
Continual Dialogue State Tracking via Reason-of-Select Distillation
por: Feng, Yujie, et al.
Publicado: (2024)
por: Feng, Yujie, et al.
Publicado: (2024)
Self-Distilled Agentic Reinforcement Learning
por: Lu, Zhengxi, et al.
Publicado: (2026)
por: Lu, Zhengxi, et al.
Publicado: (2026)
Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools
por: Wu, Junde, et al.
Publicado: (2025)
por: Wu, Junde, et al.
Publicado: (2025)
Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning
por: Shen, Junhao, et al.
Publicado: (2026)
por: Shen, Junhao, et al.
Publicado: (2026)
Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
por: Zhao, Siyan, et al.
Publicado: (2026)
por: Zhao, Siyan, et al.
Publicado: (2026)
Learning to Reason via Self-Iterative Process Feedback for Small Language Models
por: Chen, Kaiyuan, et al.
Publicado: (2024)
por: Chen, Kaiyuan, et al.
Publicado: (2024)
DyFlow: Dynamic Workflow Framework for Agentic Reasoning
por: Wang, Yanbo, et al.
Publicado: (2025)
por: Wang, Yanbo, et al.
Publicado: (2025)
Scaling Reasoning Efficiently via Relaxed On-Policy Distillation
por: Ko, Jongwoo, et al.
Publicado: (2026)
por: Ko, Jongwoo, et al.
Publicado: (2026)
Critique-Guided Distillation for Robust Reasoning via Refinement
por: Kapusuzoglu, Berkcan, et al.
Publicado: (2025)
por: Kapusuzoglu, Berkcan, et al.
Publicado: (2025)
Agentic Conversational Search with Contextualized Reasoning via Reinforcement Learning
por: Mo, Fengran, et al.
Publicado: (2026)
por: Mo, Fengran, et al.
Publicado: (2026)
MARSAD: A Multi-Functional Tool for Real-Time Social Media Analysis
por: Biswas, Md. Rafiul, et al.
Publicado: (2025)
por: Biswas, Md. Rafiul, et al.
Publicado: (2025)
Reasoning Gets Harder for LLMs Inside A Dialogue
por: Kartáč, Ivan, et al.
Publicado: (2026)
por: Kartáč, Ivan, et al.
Publicado: (2026)
Iterative Reasoning Preference Optimization
por: Pang, Richard Yuanzhe, et al.
Publicado: (2024)
por: Pang, Richard Yuanzhe, et al.
Publicado: (2024)
Demystifying Reinforcement Learning in Agentic Reasoning
por: Yu, Zhaochen, et al.
Publicado: (2025)
por: Yu, Zhaochen, et al.
Publicado: (2025)
IIET: Efficient Numerical Transformer via Implicit Iterative Euler Method
por: Liu, Xinyu, et al.
Publicado: (2025)
por: Liu, Xinyu, et al.
Publicado: (2025)
Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
por: Shen, Guobin, et al.
Publicado: (2026)
por: Shen, Guobin, et al.
Publicado: (2026)
Thinking with DistilQwen: A Tale of Four Distilled Reasoning and Reward Model Series
por: Cai, Wenrui, et al.
Publicado: (2025)
por: Cai, Wenrui, et al.
Publicado: (2025)
Ejemplares similares
-
Thinking About Thinking: SAGE-nano's Inverse Reasoning for Self-Aware Language Models
por: Jha, Basab, et al.
Publicado: (2025) -
SAGE Celer 2.6 Technical Card
por: SAGEA Research Team, et al.
Publicado: (2026) -
Fragile Mastery: Are Domain-Specific Trade-Offs Undermining On-Device Language Models?
por: Jha, Basab, et al.
Publicado: (2025) -
The Rosetta Paradox: Domain-Specific Performance Inversions in Large Language Models
por: Jha, Basab, et al.
Publicado: (2024) -
Analyzing Error Propagation in Korean Spoken QA with ASR-LLM Cascades
por: Jung, Donghyuk, et al.
Publicado: (2026)