Do Instruction-Tuned Models Always Perform Better Than Base Models? Evidence from Math and Domain-Shifted Benchmarks
Fuente:
arXiv
Saved in:
| Main Authors: | Munjal, Prateek, Christophe, Clement, Rajan, Ronnie, Kanithi, Praveenkumar |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Overalignment in Frontier LLMs: An Empirical Study of Sycophantic Behaviour in Healthcare
by: Christophe, Clément, et al.
Published: (2026)
by: Christophe, Clément, et al.
Published: (2026)
MEDIC: Comprehensive Evaluation of Leading Indicators for LLM Safety and Utility in Clinical Applications
by: Kanithi, Praveenkumar, et al.
Published: (2024)
by: Kanithi, Praveenkumar, et al.
Published: (2024)
Beyond Metrics: A Critical Analysis of the Variability in Large Language Model Evaluation Frameworks
by: Pimentel, Marco AF, et al.
Published: (2024)
by: Pimentel, Marco AF, et al.
Published: (2024)
Cross-Examination Framework: A Task-Agnostic Diagnostic for Information Fidelity in Text-to-Text Generation
by: Raha, Tathagata, et al.
Published: (2026)
by: Raha, Tathagata, et al.
Published: (2026)
Do Transformer World Models Give Better Policy Gradients?
by: Ma, Michel, et al.
Published: (2024)
by: Ma, Michel, et al.
Published: (2024)
Benchmarking GNN Models on Molecular Regression Tasks with CKA-Based Representation Analysis
by: Rajan, et al.
Published: (2026)
by: Rajan, et al.
Published: (2026)
Bigger is not Always Better: Scaling Properties of Latent Diffusion Models
by: Mei, Kangfu, et al.
Published: (2024)
by: Mei, Kangfu, et al.
Published: (2024)
MathScale: Scaling Instruction Tuning for Mathematical Reasoning
by: Tang, Zhengyang, et al.
Published: (2024)
by: Tang, Zhengyang, et al.
Published: (2024)
OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset
by: Toshniwal, Shubham, et al.
Published: (2024)
by: Toshniwal, Shubham, et al.
Published: (2024)
From Language Modeling to Instruction Following: Understanding the Behavior Shift in LLMs after Instruction Tuning
by: Wu, Xuansheng, et al.
Published: (2023)
by: Wu, Xuansheng, et al.
Published: (2023)
Benchmarking Large Language Models for Math Reasoning Tasks
by: Seßler, Kathrin, et al.
Published: (2024)
by: Seßler, Kathrin, et al.
Published: (2024)
Limitations of Public Chest Radiography Datasets for Artificial Intelligence: Label Quality, Domain Shift, Bias and Evaluation Challenges
by: Rafferty, Amy, et al.
Published: (2025)
by: Rafferty, Amy, et al.
Published: (2025)
Triplets Better Than Pairs: Towards Stable and Effective Self-Play Fine-Tuning for LLMs
by: Wang, Yibo, et al.
Published: (2026)
by: Wang, Yibo, et al.
Published: (2026)
What Makes Looped Transformers Perform Better Than Non-Recursive Ones
by: Gong, Zixuan, et al.
Published: (2025)
by: Gong, Zixuan, et al.
Published: (2025)
A Unified Graph Language Model for Multi-Domain Multi-Task Graph Alignment Instruction Tuning
by: Chen, Haibo, et al.
Published: (2026)
by: Chen, Haibo, et al.
Published: (2026)
Is Bigger Edit Batch Size Always Better? -- An Empirical Study on Model Editing with Llama-3
by: Yoon, Junsang, et al.
Published: (2024)
by: Yoon, Junsang, et al.
Published: (2024)
Tabular Data Generation Models: An In-Depth Survey and Performance Benchmarks with Extensive Tuning
by: Kindji, G. Charbel N., et al.
Published: (2024)
by: Kindji, G. Charbel N., et al.
Published: (2024)
Do Better Volatility Forecasts Lead to Better Portfolios? Evidence from Graph Neural Networks
by: Wade, Rylan
Published: (2026)
by: Wade, Rylan
Published: (2026)
Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment
by: Zhang, Jiazheng, et al.
Published: (2025)
by: Zhang, Jiazheng, et al.
Published: (2025)
Bridging Language Barriers in Healthcare: A Study on Arabic LLMs
by: Saadi, Nada, et al.
Published: (2025)
by: Saadi, Nada, et al.
Published: (2025)
Mortgage Language Model: Domain-Adaptive Pretraining with Residual Instruction, Alignment Tuning, and Task-Specific Routing
by: Jain, Manish, et al.
Published: (2025)
by: Jain, Manish, et al.
Published: (2025)
Instruction-tuned Language Models are Better Knowledge Learners
by: Jiang, Zhengbao, et al.
Published: (2024)
by: Jiang, Zhengbao, et al.
Published: (2024)
Are Greedy Task Orderings Better Than Random in Continual Linear Regression?
by: Tsipory, Matan, et al.
Published: (2025)
by: Tsipory, Matan, et al.
Published: (2025)
Graph Neural Networks Do Not Always Oversmooth
by: Epping, Bastian, et al.
Published: (2024)
by: Epping, Bastian, et al.
Published: (2024)
WirelessMathBench: A Mathematical Modeling Benchmark for LLMs in Wireless Communications
by: Li, Xin, et al.
Published: (2025)
by: Li, Xin, et al.
Published: (2025)
Instruction Tuning Chronologically Consistent Language Models
by: He, Songrun, et al.
Published: (2025)
by: He, Songrun, et al.
Published: (2025)
Better World Models Can Lead to Better Post-Training Performance
by: Gupta, Prakhar, et al.
Published: (2025)
by: Gupta, Prakhar, et al.
Published: (2025)
TuneShift-KD: Knowledge Distillation and Transfer for Fine-tuned Models
by: Guan, Yushi, et al.
Published: (2026)
by: Guan, Yushi, et al.
Published: (2026)
Attackers Can Do Better: Over- and Understated Factors of Model Stealing Attacks
by: Oliynyk, Daryna, et al.
Published: (2025)
by: Oliynyk, Daryna, et al.
Published: (2025)
Is More Context Always Better? Examining LLM Reasoning Capability for Time Interval Prediction
by: Cao, Yanan, et al.
Published: (2026)
by: Cao, Yanan, et al.
Published: (2026)
Masked Diffusion Models are Secretly Learned-Order Autoregressive Models
by: Garg, Prateek, et al.
Published: (2025)
by: Garg, Prateek, et al.
Published: (2025)
The Vulnerability of Language Model Benchmarks: Do They Accurately Reflect True LLM Performance?
by: Banerjee, Sourav, et al.
Published: (2024)
by: Banerjee, Sourav, et al.
Published: (2024)
Should We Always Train Models on Fine-Grained Classes?
by: Pirovano, Davide, et al.
Published: (2025)
by: Pirovano, Davide, et al.
Published: (2025)
Benchmarks Saturate When The Model Gets Smarter Than The Judge
by: Ballon, Marthe, et al.
Published: (2026)
by: Ballon, Marthe, et al.
Published: (2026)
Solving for X and Beyond: Can Large Language Models Solve Complex Math Problems with More-Than-Two Unknowns?
by: Kao, Kuei-Chun, et al.
Published: (2024)
by: Kao, Kuei-Chun, et al.
Published: (2024)
Silent Commitment Failure in Instruction-Tuned Language Models: Evidence of Governability Divergence Across Architectures
by: Ruddell, Gregory M.
Published: (2026)
by: Ruddell, Gregory M.
Published: (2026)
Towards Understanding Why FixMatch Generalizes Better Than Supervised Learning
by: Li, Jingyang, et al.
Published: (2024)
by: Li, Jingyang, et al.
Published: (2024)
Clustering-Based Validation Splits for Model Selection under Domain Shift
by: Napoli, Andrea, et al.
Published: (2024)
by: Napoli, Andrea, et al.
Published: (2024)
Empowering Domain-Specific Language Models with Graph-Oriented Databases: A Paradigm Shift in Performance and Model Maintenance
by: Di Pasquale, Ricardo, et al.
Published: (2024)
by: Di Pasquale, Ricardo, et al.
Published: (2024)
GCAL: Adapting Graph Models to Evolving Domain Shifts
by: Qiao, Ziyue, et al.
Published: (2025)
by: Qiao, Ziyue, et al.
Published: (2025)
Similar Items
-
Overalignment in Frontier LLMs: An Empirical Study of Sycophantic Behaviour in Healthcare
by: Christophe, Clément, et al.
Published: (2026) -
MEDIC: Comprehensive Evaluation of Leading Indicators for LLM Safety and Utility in Clinical Applications
by: Kanithi, Praveenkumar, et al.
Published: (2024) -
Beyond Metrics: A Critical Analysis of the Variability in Large Language Model Evaluation Frameworks
by: Pimentel, Marco AF, et al.
Published: (2024) -
Cross-Examination Framework: A Task-Agnostic Diagnostic for Information Fidelity in Text-to-Text Generation
by: Raha, Tathagata, et al.
Published: (2026) -
Do Transformer World Models Give Better Policy Gradients?
by: Ma, Michel, et al.
Published: (2024)