Superficial Self-Improved Reasoners Benefit from Model Merging
Fuente:
arXiv
Guardado en:
| Autores principales: | Yuan, Xiangchi, Zhang, Chunhui, Liu, Zheyuan, Shi, Dachuan, Pan, Leyan, Vosoughi, Soroush, Lee, Wenke |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Behavior Knowledge Merge in Reinforced Agentic Models
por: Yuan, Xiangchi, et al.
Publicado: (2026)
por: Yuan, Xiangchi, et al.
Publicado: (2026)
SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs
por: Shi, Dachuan, et al.
Publicado: (2025)
por: Shi, Dachuan, et al.
Publicado: (2025)
Growing Through Experience: Scaling Episodic Grounding in Language Models
por: Zhang, Chunhui, et al.
Publicado: (2025)
por: Zhang, Chunhui, et al.
Publicado: (2025)
Mitigating Forgetting Between Supervised and Reinforcement Learning Yields Stronger Reasoners
por: Yuan, Xiangchi, et al.
Publicado: (2025)
por: Yuan, Xiangchi, et al.
Publicado: (2025)
CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning
por: Shi, Dachuan, et al.
Publicado: (2026)
por: Shi, Dachuan, et al.
Publicado: (2026)
MetaState: Persistent Working Memory Enhances Reasoning in Discrete Diffusion Language Models
por: Xia, Kejing, et al.
Publicado: (2026)
por: Xia, Kejing, et al.
Publicado: (2026)
Modality-Aware Neuron Pruning for Unlearning in Multimodal Large Language Models
por: Liu, Zheyuan, et al.
Publicado: (2025)
por: Liu, Zheyuan, et al.
Publicado: (2025)
Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization
por: Diao, Xingjian, et al.
Publicado: (2026)
por: Diao, Xingjian, et al.
Publicado: (2026)
Is It Navajo? Accurate Language Detection in Endangered Athabaskan Languages
por: Yang, Ivory, et al.
Publicado: (2025)
por: Yang, Ivory, et al.
Publicado: (2025)
Serial Position Effects of Large Language Models
por: Guo, Xiaobo, et al.
Publicado: (2024)
por: Guo, Xiaobo, et al.
Publicado: (2024)
Overcoming Multi-step Complexity in Multimodal Theory-of-Mind Reasoning: A Scalable Bayesian Planner
por: Zhang, Chunhui, et al.
Publicado: (2025)
por: Zhang, Chunhui, et al.
Publicado: (2025)
Disordered-DABS: A Benchmark for Dynamic Aspect-Based Summarization in Disordered Texts
por: Guo, Xiaobo, et al.
Publicado: (2024)
por: Guo, Xiaobo, et al.
Publicado: (2024)
MODABS: Multi-Objective Learning for Dynamic Aspect-Based Summarization
por: Guo, Xiaobo, et al.
Publicado: (2024)
por: Guo, Xiaobo, et al.
Publicado: (2024)
SoundMind: RL-Incentivized Logic Reasoning for Audio-Language Models
por: Diao, Xingjian, et al.
Publicado: (2025)
por: Diao, Xingjian, et al.
Publicado: (2025)
Steering Multimodal Large Language Models Decoding for Context-Aware Safety
por: Liu, Zheyuan, et al.
Publicado: (2025)
por: Liu, Zheyuan, et al.
Publicado: (2025)
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
por: Liu, Zheyuan, et al.
Publicado: (2026)
por: Liu, Zheyuan, et al.
Publicado: (2026)
What Makes a Good Curriculum? Disentangling the Effects of Data Ordering on LLM Mathematical Reasoning
por: Jia, Yaning, et al.
Publicado: (2025)
por: Jia, Yaning, et al.
Publicado: (2025)
NushuRescue: Revitalization of the Endangered Nushu Language with AI
por: Yang, Ivory, et al.
Publicado: (2024)
por: Yang, Ivory, et al.
Publicado: (2024)
MentalManip: A Dataset For Fine-grained Analysis of Mental Manipulation in Conversations
por: Wang, Yuxin, et al.
Publicado: (2024)
por: Wang, Yuxin, et al.
Publicado: (2024)
Enhanced Detection of Conversational Mental Manipulation Through Advanced Prompting Techniques
por: Yang, Ivory, et al.
Publicado: (2024)
por: Yang, Ivory, et al.
Publicado: (2024)
Pretrained Image-Text Models are Secretly Video Captioners
por: Zhang, Chunhui, et al.
Publicado: (2025)
por: Zhang, Chunhui, et al.
Publicado: (2025)
LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models
por: Shi, Dachuan, et al.
Publicado: (2025)
por: Shi, Dachuan, et al.
Publicado: (2025)
The Computational Anatomy of Humility: Modeling Intellectual Humility in Online Public Discourse
por: Guo, Xiaobo, et al.
Publicado: (2024)
por: Guo, Xiaobo, et al.
Publicado: (2024)
Improving Retrieval Augmented Language Model with Self-Reasoning
por: Xia, Yuan, et al.
Publicado: (2024)
por: Xia, Yuan, et al.
Publicado: (2024)
Cluster-R1: Large Reasoning Models Are Instruction-following Clustering Agents
por: Qing, Peijun, et al.
Publicado: (2026)
por: Qing, Peijun, et al.
Publicado: (2026)
ImpScore: A Learnable Metric For Quantifying The Implicitness Level of Sentence
por: Wang, Yuxin, et al.
Publicado: (2024)
por: Wang, Yuxin, et al.
Publicado: (2024)
Unconstrained Model Merging for Enhanced LLM Reasoning
por: Zhang, Yiming, et al.
Publicado: (2024)
por: Zhang, Yiming, et al.
Publicado: (2024)
Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge
por: Shi, Lin, et al.
Publicado: (2024)
por: Shi, Lin, et al.
Publicado: (2024)
The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering
por: Zhou, Yefan, et al.
Publicado: (2026)
por: Zhou, Yefan, et al.
Publicado: (2026)
Unlocking Efficient Long-to-Short LLM Reasoning with Model Merging
por: Wu, Han, et al.
Publicado: (2025)
por: Wu, Han, et al.
Publicado: (2025)
Can Transformers Reason Logically? A Study in SAT Solving
por: Pan, Leyan, et al.
Publicado: (2024)
por: Pan, Leyan, et al.
Publicado: (2024)
Bring Reason to Vision: Understanding Perception and Reasoning through Model Merging
por: Chen, Shiqi, et al.
Publicado: (2025)
por: Chen, Shiqi, et al.
Publicado: (2025)
Probing Association Biases in LLM Moderation Over-Sensitivity
por: Wang, Yuxin, et al.
Publicado: (2025)
por: Wang, Yuxin, et al.
Publicado: (2025)
AlphaLoRA: Assigning LoRA Experts Based on Layer Training Quality
por: Qing, Peijun, et al.
Publicado: (2024)
por: Qing, Peijun, et al.
Publicado: (2024)
SE-Merging: A Self-Enhanced Approach for Dynamic Model Merging
por: Chen, Zijun, et al.
Publicado: (2025)
por: Chen, Zijun, et al.
Publicado: (2025)
1bit-Merging: Dynamic Quantized Merging for Large Language Models
por: Liu, Shuqi, et al.
Publicado: (2025)
por: Liu, Shuqi, et al.
Publicado: (2025)
Diffusion Language Models Know the Answer Before Decoding
por: Li, Pengxiang, et al.
Publicado: (2025)
por: Li, Pengxiang, et al.
Publicado: (2025)
Reasoning Pattern Alignment Merging for Adaptive Reasoning
por: Zhong, Zhaofeng, et al.
Publicado: (2026)
por: Zhong, Zhaofeng, et al.
Publicado: (2026)
DECASTE: Unveiling Caste Stereotypes in Large Language Models through Multi-Dimensional Bias Analysis
por: Vijayaraghavan, Prashanth, et al.
Publicado: (2025)
por: Vijayaraghavan, Prashanth, et al.
Publicado: (2025)
Merging Improves Self-Critique Against Jailbreak Attacks
por: Gallego, Victor
Publicado: (2024)
por: Gallego, Victor
Publicado: (2024)
Ejemplares similares
-
Behavior Knowledge Merge in Reinforced Agentic Models
por: Yuan, Xiangchi, et al.
Publicado: (2026) -
SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs
por: Shi, Dachuan, et al.
Publicado: (2025) -
Growing Through Experience: Scaling Episodic Grounding in Language Models
por: Zhang, Chunhui, et al.
Publicado: (2025) -
Mitigating Forgetting Between Supervised and Reinforcement Learning Yields Stronger Reasoners
por: Yuan, Xiangchi, et al.
Publicado: (2025) -
CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning
por: Shi, Dachuan, et al.
Publicado: (2026)