Post Reasoning: Improving the Performance of Non-Thinking Models at No Cost
Fuente:
arXiv
Guardado en:
| Autores principales: | Xuan, Richmond Sin Jing, Bhardwaj, Rishabh, Poria, Soujanya |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Language Models are Homer Simpson! Safety Re-Alignment of Fine-tuned Language Models through Task Arithmetic
por: Bhardwaj, Rishabh, et al.
Publicado: (2024)
por: Bhardwaj, Rishabh, et al.
Publicado: (2024)
OffTopicEval: When Large Language Models Enter the Wrong Chat, Almost Always!
por: Lei, Jingdi, et al.
Publicado: (2025)
por: Lei, Jingdi, et al.
Publicado: (2025)
Towards Robust Instruction Tuning on Multimodal Large Language Models
por: Han, Wei, et al.
Publicado: (2024)
por: Han, Wei, et al.
Publicado: (2024)
The Jumping Reasoning Curve? Tracking the Evolution of Reasoning Performance in GPT-[n] and o-[n] Models on Multimodal Puzzles
por: Toh, Vernon Y. H., et al.
Publicado: (2025)
por: Toh, Vernon Y. H., et al.
Publicado: (2025)
Uncovering Cross-Linguistic Disparities in LLMs using Sparse Autoencoders
por: Xuan, Richmond Sin Jing, et al.
Publicado: (2025)
por: Xuan, Richmond Sin Jing, et al.
Publicado: (2025)
DELLA-Merging: Reducing Interference in Model Merging through Magnitude-Based Sampling
por: Deep, Pala Tej, et al.
Publicado: (2024)
por: Deep, Pala Tej, et al.
Publicado: (2024)
Ruby Teaming: Improving Quality Diversity Search with Memory for Automated Red Teaming
por: Han, Vernon Toh Yan, et al.
Publicado: (2024)
por: Han, Vernon Toh Yan, et al.
Publicado: (2024)
Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision
por: Pala, Tej Deep, et al.
Publicado: (2025)
por: Pala, Tej Deep, et al.
Publicado: (2025)
Video2Music: Suitable Music Generation from Videos using an Affective Multimodal Transformer model
por: Kang, Jaeyong, et al.
Publicado: (2023)
por: Kang, Jaeyong, et al.
Publicado: (2023)
Are Language Models Puzzle Prodigies? Algorithmic Puzzles Unveil Serious Challenges in Multimodal Reasoning
por: Ghosal, Deepanway, et al.
Publicado: (2024)
por: Ghosal, Deepanway, et al.
Publicado: (2024)
Stacked from One: Multi-Scale Self-Injection for Context Window Extension
por: Han, Wei, et al.
Publicado: (2026)
por: Han, Wei, et al.
Publicado: (2026)
Training Vision-Language Process Reward Models for Test-Time Scaling in Multimodal Reasoning: Key Insights and Lessons Learned
por: Ong, Brandon, et al.
Publicado: (2025)
por: Ong, Brandon, et al.
Publicado: (2025)
WalledEval: A Comprehensive Safety Evaluation Toolkit for Large Language Models
por: Gupta, Prannaya, et al.
Publicado: (2024)
por: Gupta, Prannaya, et al.
Publicado: (2024)
Two are better than one: Context window extension with multi-grained self-injection
por: Han, Wei, et al.
Publicado: (2024)
por: Han, Wei, et al.
Publicado: (2024)
Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning
por: Sun, Qi, et al.
Publicado: (2024)
por: Sun, Qi, et al.
Publicado: (2024)
Reasoning Paths Optimization: Learning to Reason and Explore From Diverse Paths
por: Chia, Yew Ken, et al.
Publicado: (2024)
por: Chia, Yew Ken, et al.
Publicado: (2024)
Self-Adaptive Sampling for Efficient Video Question-Answering on Image--Text Models
por: Han, Wei, et al.
Publicado: (2023)
por: Han, Wei, et al.
Publicado: (2023)
Can-Do! A Dataset and Neuro-Symbolic Grounded Framework for Embodied Planning with Large Multimodal Models
por: Chia, Yew Ken, et al.
Publicado: (2024)
por: Chia, Yew Ken, et al.
Publicado: (2024)
Large Language Models for Automated Open-domain Scientific Hypotheses Discovery
por: Yang, Zonglin, et al.
Publicado: (2023)
por: Yang, Zonglin, et al.
Publicado: (2023)
Toward Robust Multimodal Learning using Multimodal Foundational Models
por: Zhao, Xianbing, et al.
Publicado: (2024)
por: Zhao, Xianbing, et al.
Publicado: (2024)
Thinking About Thinking: Evaluating Reasoning in Post-Trained Language Models
por: Singla, Pratham, et al.
Publicado: (2025)
por: Singla, Pratham, et al.
Publicado: (2025)
Beyond What to Select: A Plug-and-play Oscillatory Data-Volume Scheduling for Efficient Model Training
por: Yang, Suorong, et al.
Publicado: (2026)
por: Yang, Suorong, et al.
Publicado: (2026)
Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning
por: Gan, Siyuan, et al.
Publicado: (2026)
por: Gan, Siyuan, et al.
Publicado: (2026)
Thinking Sparks!: Emergent Attention Heads in Reasoning Models During Post Training
por: Park, Yein, et al.
Publicado: (2025)
por: Park, Yein, et al.
Publicado: (2025)
NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks
por: Hung, Chia-Yu, et al.
Publicado: (2025)
por: Hung, Chia-Yu, et al.
Publicado: (2025)
HyperTTS: Parameter Efficient Adaptation in Text to Speech using Hypernetworks
por: Li, Yingting, et al.
Publicado: (2024)
por: Li, Yingting, et al.
Publicado: (2024)
Computational Irreducibility as the Foundation of Agency: A Formal Model Connecting Undecidability to Autonomous Behavior in Complex Systems
por: Azadi, Poria
Publicado: (2025)
por: Azadi, Poria
Publicado: (2025)
DialogXpert: Driving Intelligent and Emotion-Aware Conversations through Online Value-Based Reinforcement Learning with LLM Priors
por: Rakib, Tazeek Bin Abdur, et al.
Publicado: (2025)
por: Rakib, Tazeek Bin Abdur, et al.
Publicado: (2025)
Lightweight Spatial Modeling for Combinatorial Information Extraction From Documents
por: Dong, Yanfei, et al.
Publicado: (2024)
por: Dong, Yanfei, et al.
Publicado: (2024)
$δ$-mem: Efficient Online Memory for Large Language Models
por: Lei, Jingdi, et al.
Publicado: (2026)
por: Lei, Jingdi, et al.
Publicado: (2026)
NORA-1.5: A Vision-Language-Action Model Trained using World Model- and Action-based Preference Rewards
por: Hung, Chia-Yu, et al.
Publicado: (2025)
por: Hung, Chia-Yu, et al.
Publicado: (2025)
Don't Think Longer, Think Wisely: Optimizing Thinking Dynamics for Large Reasoning Models
por: An, Sohyun, et al.
Publicado: (2025)
por: An, Sohyun, et al.
Publicado: (2025)
Ferret: Faster and Effective Automated Red Teaming with Reward-Based Scoring Technique
por: Pala, Tej Deep, et al.
Publicado: (2024)
por: Pala, Tej Deep, et al.
Publicado: (2024)
JAM: A Tiny Flow-based Song Generator with Fine-grained Controllability and Aesthetic Alignment
por: Liu, Renhang, et al.
Publicado: (2025)
por: Liu, Renhang, et al.
Publicado: (2025)
10 Open Challenges Steering the Future of Vision-Language-Action Models
por: Poria, Soujanya, et al.
Publicado: (2025)
por: Poria, Soujanya, et al.
Publicado: (2025)
MOOSE-Chem: Large Language Models for Rediscovering Unseen Chemistry Scientific Hypotheses
por: Yang, Zonglin, et al.
Publicado: (2024)
por: Yang, Zonglin, et al.
Publicado: (2024)
PivotRL: High Accuracy Agentic Post-Training at Low Compute Cost
por: Yi, Junkeun, et al.
Publicado: (2026)
por: Yi, Junkeun, et al.
Publicado: (2026)
LLMs Can't Handle Peer Pressure: Crumbling under Multi-Agent Social Interactions
por: Song, Maojia, et al.
Publicado: (2025)
por: Song, Maojia, et al.
Publicado: (2025)
Efficient Reasoning with Hidden Thinking
por: Shen, Xuan, et al.
Publicado: (2025)
por: Shen, Xuan, et al.
Publicado: (2025)
Think First, Diffuse Fast: Improving Diffusion Language Model Reasoning via Autoregressive Plan Conditioning
por: Sauver, Earl J St
Publicado: (2026)
por: Sauver, Earl J St
Publicado: (2026)
Ejemplares similares
-
Language Models are Homer Simpson! Safety Re-Alignment of Fine-tuned Language Models through Task Arithmetic
por: Bhardwaj, Rishabh, et al.
Publicado: (2024) -
OffTopicEval: When Large Language Models Enter the Wrong Chat, Almost Always!
por: Lei, Jingdi, et al.
Publicado: (2025) -
Towards Robust Instruction Tuning on Multimodal Large Language Models
por: Han, Wei, et al.
Publicado: (2024) -
The Jumping Reasoning Curve? Tracking the Evolution of Reasoning Performance in GPT-[n] and o-[n] Models on Multimodal Puzzles
por: Toh, Vernon Y. H., et al.
Publicado: (2025) -
Uncovering Cross-Linguistic Disparities in LLMs using Sparse Autoencoders
por: Xuan, Richmond Sin Jing, et al.
Publicado: (2025)