Recall with Reasoning: Chain-of-Thought Distillation for Mamba's Long-Context Memory and Extrapolation
Fuente:
arXiv
Guardado en:
| Autores principales: | Ma, Junyu, Fang, Tianqing, Zhang, Zhisong, Zhang, Hongming, Mi, Haitao, Yu, Dong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
WebCoT: Enhancing Web Agent Reasoning by Reconstructing Chain-of-Thought in Reflection, Branching, and Rollback
por: Hu, Minda, et al.
Publicado: (2025)
por: Hu, Minda, et al.
Publicado: (2025)
WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model
por: Fang, Tianqing, et al.
Publicado: (2025)
por: Fang, Tianqing, et al.
Publicado: (2025)
UniGist: Towards General and Hardware-aligned Sequence-level Long Context Compression
por: Deng, Chenlong, et al.
Publicado: (2025)
por: Deng, Chenlong, et al.
Publicado: (2025)
WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms
por: Zhang, Zhisong, et al.
Publicado: (2025)
por: Zhang, Zhisong, et al.
Publicado: (2025)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
por: Zhang, Ce, et al.
Publicado: (2025)
por: Zhang, Ce, et al.
Publicado: (2025)
Understanding and Enhancing Mamba-Transformer Hybrids for Memory Recall and Language Modeling
por: Lee, Hyunji, et al.
Publicado: (2025)
por: Lee, Hyunji, et al.
Publicado: (2025)
InComeS: Integrating Compression and Selection Mechanisms into LLMs for Efficient Model Editing
por: Li, Shuaiyi, et al.
Publicado: (2025)
por: Li, Shuaiyi, et al.
Publicado: (2025)
WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models
por: Wang, Rui, et al.
Publicado: (2025)
por: Wang, Rui, et al.
Publicado: (2025)
Attention Entropy is a Key Factor: An Analysis of Parallel Context Encoding with Full-attention-based Pre-trained Language Models
por: Zhang, Zhisong, et al.
Publicado: (2024)
por: Zhang, Zhisong, et al.
Publicado: (2024)
Abstraction-of-Thought Makes Language Models Better Reasoners
por: Hong, Ruixin, et al.
Publicado: (2024)
por: Hong, Ruixin, et al.
Publicado: (2024)
Unveiling the Key Factors for Distilling Chain-of-Thought Reasoning
por: Chen, Xinghao, et al.
Publicado: (2025)
por: Chen, Xinghao, et al.
Publicado: (2025)
Facilitating Long Context Understanding via Supervised Chain-of-Thought Reasoning
por: Lin, Jingyang, et al.
Publicado: (2025)
por: Lin, Jingyang, et al.
Publicado: (2025)
CoT-Evo: Evolutionary Distillation of Chain-of-Thought for Scientific Reasoning
por: Feng, Kehua, et al.
Publicado: (2025)
por: Feng, Kehua, et al.
Publicado: (2025)
Chain-of-Thought Matters: Improving Long-Context Language Models with Reasoning Path Supervision
por: Zhu, Dawei, et al.
Publicado: (2025)
por: Zhu, Dawei, et al.
Publicado: (2025)
Low-Bit Quantization Favors Undertrained LLMs: Scaling Laws for Quantized LLMs with 100T Training Tokens
por: Ouyang, Xu, et al.
Publicado: (2024)
por: Ouyang, Xu, et al.
Publicado: (2024)
BOLT: Bootstrap Long Chain-of-Thought in Language Models without Distillation
por: Pang, Bo, et al.
Publicado: (2025)
por: Pang, Bo, et al.
Publicado: (2025)
Entropy Guided Extrapolative Decoding to Improve Factuality in Large Language Models
por: Das, Souvik, et al.
Publicado: (2024)
por: Das, Souvik, et al.
Publicado: (2024)
InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory
por: Xiao, Chaojun, et al.
Publicado: (2024)
por: Xiao, Chaojun, et al.
Publicado: (2024)
Slow Tuning and Low-Entropy Masking for Safe Chain-of-Thought Distillation
por: Ma, Ziyang, et al.
Publicado: (2025)
por: Ma, Ziyang, et al.
Publicado: (2025)
The Molecular Structure of Thought: Mapping the Topology of Long Chain-of-Thought Reasoning
por: Chen, Qiguang, et al.
Publicado: (2026)
por: Chen, Qiguang, et al.
Publicado: (2026)
Beyond Fine-Tuning: In-Context Learning and Chain-of-Thought for Reasoned Distractor Generation
por: Alhazmi, Elaf, et al.
Publicado: (2026)
por: Alhazmi, Elaf, et al.
Publicado: (2026)
Long-Context Reasoning Through Proxy-Based Chain-of-Thought Tuning
por: Li, Miao, et al.
Publicado: (2026)
por: Li, Miao, et al.
Publicado: (2026)
Getting Sick After Seeing a Doctor? Diagnosing and Mitigating Knowledge Conflicts in Event Temporal Reasoning
por: Fang, Tianqing, et al.
Publicado: (2023)
por: Fang, Tianqing, et al.
Publicado: (2023)
Resource-Limited Joint Multimodal Sentiment Reasoning and Classification via Chain-of-Thought Enhancement and Distillation
por: Shangguan, Haonan, et al.
Publicado: (2025)
por: Shangguan, Haonan, et al.
Publicado: (2025)
Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning?
por: He, Yancheng, et al.
Publicado: (2025)
por: He, Yancheng, et al.
Publicado: (2025)
Chain of Thought with Explicit Evidence Reasoning for Few-shot Relation Extraction
por: Ma, Xilai, et al.
Publicado: (2023)
por: Ma, Xilai, et al.
Publicado: (2023)
Long-Chain Reasoning Distillation via Adaptive Prefix Alignment
por: Liu, Zhenghao, et al.
Publicado: (2026)
por: Liu, Zhenghao, et al.
Publicado: (2026)
Demystifying Long Chain-of-Thought Reasoning in LLMs
por: Yeo, Edward, et al.
Publicado: (2025)
por: Yeo, Edward, et al.
Publicado: (2025)
Chain-of-Thought Driven Adversarial Scenario Extrapolation for Robust Language Models
por: Rashid, Md Rafi Ur, et al.
Publicado: (2025)
por: Rashid, Md Rafi Ur, et al.
Publicado: (2025)
Cognitive Kernel-Pro: A Framework for Deep Research Agents and Agent Foundation Models Training
por: Fang, Tianqing, et al.
Publicado: (2025)
por: Fang, Tianqing, et al.
Publicado: (2025)
DeepCompress: A Dual Reward Strategy for Dynamically Exploring and Compressing Reasoning Chains
por: Liang, Tian, et al.
Publicado: (2025)
por: Liang, Tian, et al.
Publicado: (2025)
Keypoint-based Progressive Chain-of-Thought Distillation for LLMs
por: Feng, Kaituo, et al.
Publicado: (2024)
por: Feng, Kaituo, et al.
Publicado: (2024)
OpenWebVoyager: Building Multimodal Web Agents via Iterative Real-World Exploration, Feedback and Optimization
por: He, Hongliang, et al.
Publicado: (2024)
por: He, Hongliang, et al.
Publicado: (2024)
Effectiveness of Chain-of-Thought in Distilling Reasoning Capability from Large Language Models
por: Do, Cong-Thanh, et al.
Publicado: (2025)
por: Do, Cong-Thanh, et al.
Publicado: (2025)
Guided Self-Evolving LLMs with Minimal Human Supervision
por: Yu, Wenhao, et al.
Publicado: (2025)
por: Yu, Wenhao, et al.
Publicado: (2025)
Locas: Your Models are Principled Initializers of Locally-Supported Parametric Memories
por: Lu, Sidi, et al.
Publicado: (2026)
por: Lu, Sidi, et al.
Publicado: (2026)
Verified Critical Step Optimization for LLM Agents
por: Li, Mukai, et al.
Publicado: (2026)
por: Li, Mukai, et al.
Publicado: (2026)
Understanding Before Reasoning: Enhancing Chain-of-Thought with Iterative Summarization Pre-Prompting
por: Zhu, Dong-Hai, et al.
Publicado: (2025)
por: Zhu, Dong-Hai, et al.
Publicado: (2025)
Draft-Thinking: Learning Efficient Reasoning in Long Chain-of-Thought LLMs
por: Cao, Jie, et al.
Publicado: (2026)
por: Cao, Jie, et al.
Publicado: (2026)
Leopard: A Vision Language Model For Text-Rich Multi-Image Tasks
por: Jia, Mengzhao, et al.
Publicado: (2024)
por: Jia, Mengzhao, et al.
Publicado: (2024)
Ejemplares similares
-
WebCoT: Enhancing Web Agent Reasoning by Reconstructing Chain-of-Thought in Reflection, Branching, and Rollback
por: Hu, Minda, et al.
Publicado: (2025) -
WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model
por: Fang, Tianqing, et al.
Publicado: (2025) -
UniGist: Towards General and Hardware-aligned Sequence-level Long Context Compression
por: Deng, Chenlong, et al.
Publicado: (2025) -
WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms
por: Zhang, Zhisong, et al.
Publicado: (2025) -
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
por: Zhang, Ce, et al.
Publicado: (2025)