Inner Thinking Transformer: Leveraging Dynamic Depth Scaling to Foster Adaptive Internal Thinking
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Yilong, Shang, Junyuan, Zhang, Zhenyu, Xie, Yanxi, Sheng, Jiawei, Liu, Tingwen, Wang, Shuohuan, Sun, Yu, Wu, Hua, Wang, Haifeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mixture of Universal Experts: Scaling Virtual Width via Depth-Width Transformation
di: Chen, Yilong, et al.
Pubblicazione: (2026)
di: Chen, Yilong, et al.
Pubblicazione: (2026)
Mixture of Hidden-Dimensions Transformer
di: Chen, Yilong, et al.
Pubblicazione: (2024)
di: Chen, Yilong, et al.
Pubblicazione: (2024)
DHA: Learning Decoupled-Head Attention from Transformer Checkpoints via Adaptive Heads Fusion
di: Chen, Yilong, et al.
Pubblicazione: (2024)
di: Chen, Yilong, et al.
Pubblicazione: (2024)
Sparse Growing Transformer: Training-Time Sparse Depth Allocation via Progressive Attention Looping
di: Chen, Yao, et al.
Pubblicazione: (2026)
di: Chen, Yao, et al.
Pubblicazione: (2026)
NACL: A General and Effective KV Cache Eviction Framework for LLMs at Inference Time
di: Chen, Yilong, et al.
Pubblicazione: (2024)
di: Chen, Yilong, et al.
Pubblicazione: (2024)
VideoAR: Autoregressive Video Generation via Next-Frame & Scale Prediction
di: Ji, Longbin, et al.
Pubblicazione: (2026)
di: Ji, Longbin, et al.
Pubblicazione: (2026)
MoR: Mixture of Ranks for Low-Rank Adaptation Tuning
di: Tang, Chuanyu, et al.
Pubblicazione: (2024)
di: Tang, Chuanyu, et al.
Pubblicazione: (2024)
Advantageous Parameter Expansion Training Makes Better Large Language Models
di: Gu, Naibin, et al.
Pubblicazione: (2025)
di: Gu, Naibin, et al.
Pubblicazione: (2025)
Curiosity-Driven Reinforcement Learning from Human Feedback
di: Sun, Haoran, et al.
Pubblicazione: (2025)
di: Sun, Haoran, et al.
Pubblicazione: (2025)
Elastic MoE: Unlocking the Inference-Time Scalability of Mixture-of-Experts
di: Gu, Naibin, et al.
Pubblicazione: (2025)
di: Gu, Naibin, et al.
Pubblicazione: (2025)
V-ITI: Mitigating Hallucinations in Multimodal Large Language Models via Visual Inference-Time Intervention
di: Sun, Nan, et al.
Pubblicazione: (2025)
di: Sun, Nan, et al.
Pubblicazione: (2025)
Loop, Think, & Generalize: Implicit Reasoning in Recurrent-Depth Transformers
di: Kohli, Harsh, et al.
Pubblicazione: (2026)
di: Kohli, Harsh, et al.
Pubblicazione: (2026)
AdapThink: Adaptive Thinking Preferences for Reasoning Language Model
di: Wan, Xu, et al.
Pubblicazione: (2025)
di: Wan, Xu, et al.
Pubblicazione: (2025)
MatryoshkaThinking: Recursive Test-Time Scaling Enables Efficient Reasoning
di: Chen, Hongwei, et al.
Pubblicazione: (2025)
di: Chen, Hongwei, et al.
Pubblicazione: (2025)
Upcycling Instruction Tuning from Dense to Mixture-of-Experts via Parameter Merging
di: Hui, Tingfeng, et al.
Pubblicazione: (2024)
di: Hui, Tingfeng, et al.
Pubblicazione: (2024)
HFT: Half Fine-Tuning for Large Language Models
di: Hui, Tingfeng, et al.
Pubblicazione: (2024)
di: Hui, Tingfeng, et al.
Pubblicazione: (2024)
Systems Thinking and the Inner Development Goals
di: Rian Satterwhite, et al.
Pubblicazione: (2025)
di: Rian Satterwhite, et al.
Pubblicazione: (2025)
HeavySkill: Heavy Thinking as the Inner Skill in Agentic Harness
di: Wang, Jianing, et al.
Pubblicazione: (2026)
di: Wang, Jianing, et al.
Pubblicazione: (2026)
Deep Think with Confidence
di: Fu, Yichao, et al.
Pubblicazione: (2025)
di: Fu, Yichao, et al.
Pubblicazione: (2025)
Integrating Arts with STEM to Foster Systems Thinking
di: Grace, Elizabeth, et al.
Pubblicazione: (2021)
di: Grace, Elizabeth, et al.
Pubblicazione: (2021)
BeamLoRA: Beam-Constraint Low-Rank Adaptation
di: Gu, Naibin, et al.
Pubblicazione: (2025)
di: Gu, Naibin, et al.
Pubblicazione: (2025)
LoginMEA: Local-to-Global Interaction Network for Multi-modal Entity Alignment
di: Su, Taoyu, et al.
Pubblicazione: (2024)
di: Su, Taoyu, et al.
Pubblicazione: (2024)
Don't Think Longer, Think Wisely: Optimizing Thinking Dynamics for Large Reasoning Models
di: An, Sohyun, et al.
Pubblicazione: (2025)
di: An, Sohyun, et al.
Pubblicazione: (2025)
Exploring the System 1 Thinking Capability of Large Reasoning Models
di: Zhang, Wenyuan, et al.
Pubblicazione: (2025)
di: Zhang, Wenyuan, et al.
Pubblicazione: (2025)
Thinking Deeper, Not Longer: Depth-Recurrent Transformers for Compositional Generalization
di: Chen, Hung-Hsuan
Pubblicazione: (2026)
di: Chen, Hung-Hsuan
Pubblicazione: (2026)
The Pedagogy of AI Mistakes: Fostering Higher-Order Thinking
di: Hosseini, Hadi
Pubblicazione: (2026)
di: Hosseini, Hadi
Pubblicazione: (2026)
Beyond Passive Critical Thinking: Fostering Proactive Questioning to Enhance Human-AI Collaboration
di: Wang, Ante, et al.
Pubblicazione: (2025)
di: Wang, Ante, et al.
Pubblicazione: (2025)
AdaThinkDrive: Adaptive Thinking via Reinforcement Learning for Autonomous Driving
di: Luo, Yuechen, et al.
Pubblicazione: (2025)
di: Luo, Yuechen, et al.
Pubblicazione: (2025)
AdaThink-Med: Medical Adaptive Thinking with Uncertainty-Guided Length Calibration
di: Rui, Shaohao, et al.
Pubblicazione: (2025)
di: Rui, Shaohao, et al.
Pubblicazione: (2025)
Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance
di: Yu, Jiachen, et al.
Pubblicazione: (2026)
di: Yu, Jiachen, et al.
Pubblicazione: (2026)
Geo-Code: A Code Framework for Reverse Code Generation from Geometric Images Based on Two-Stage Multi-Agent Evolution
di: Wu, Zhenyu, et al.
Pubblicazione: (2026)
di: Wu, Zhenyu, et al.
Pubblicazione: (2026)
Think3D: Thinking with Space for Spatial Reasoning
di: Zhang, Zaibin, et al.
Pubblicazione: (2026)
di: Zhang, Zaibin, et al.
Pubblicazione: (2026)
Mitigating Gender Bias via Fostering Exploratory Thinking in LLMs
di: Wei, Kangda, et al.
Pubblicazione: (2025)
di: Wei, Kangda, et al.
Pubblicazione: (2025)
Significant Process of Change for Elementary Teachers to Foster Functional Thinking
di: Nasim Asghary
Pubblicazione: (2013)
di: Nasim Asghary
Pubblicazione: (2013)
Demystifying Hybrid Thinking: Can LLMs Truly Switch Between Think and No-Think?
di: Wang, Shouren, et al.
Pubblicazione: (2025)
di: Wang, Shouren, et al.
Pubblicazione: (2025)
Think Deep, Think Fast: Investigating Efficiency of Verifier-free Inference-time-scaling Methods
di: Wang, Junlin, et al.
Pubblicazione: (2025)
di: Wang, Junlin, et al.
Pubblicazione: (2025)
Foster Adaptivity and Balance in Learning with Noisy Labels
di: Sheng, Mengmeng, et al.
Pubblicazione: (2024)
di: Sheng, Mengmeng, et al.
Pubblicazione: (2024)
Do Agents Think Deeper? A Mechanistic Investigation of Layer-Wise Dynamics in Sequential Planning
di: Cui, Zhenyu, et al.
Pubblicazione: (2026)
di: Cui, Zhenyu, et al.
Pubblicazione: (2026)
MA-RLHF: Reinforcement Learning from Human Feedback with Macro Actions
di: Chai, Yekun, et al.
Pubblicazione: (2024)
di: Chai, Yekun, et al.
Pubblicazione: (2024)
ThinkingViT: Matryoshka Thinking Vision Transformer for Elastic Inference
di: Hojjat, Ali, et al.
Pubblicazione: (2025)
di: Hojjat, Ali, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Mixture of Universal Experts: Scaling Virtual Width via Depth-Width Transformation
di: Chen, Yilong, et al.
Pubblicazione: (2026) -
Mixture of Hidden-Dimensions Transformer
di: Chen, Yilong, et al.
Pubblicazione: (2024) -
DHA: Learning Decoupled-Head Attention from Transformer Checkpoints via Adaptive Heads Fusion
di: Chen, Yilong, et al.
Pubblicazione: (2024) -
Sparse Growing Transformer: Training-Time Sparse Depth Allocation via Progressive Attention Looping
di: Chen, Yao, et al.
Pubblicazione: (2026) -
NACL: A General and Effective KV Cache Eviction Framework for LLMs at Inference Time
di: Chen, Yilong, et al.
Pubblicazione: (2024)