EasyMath: A 0-shot Math Benchmark for SLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Karki, Drishya, Kamphuis, Michiel, Frey, Angelecia |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models
por: Fadli, Samih
Publicado: (2025)
por: Fadli, Samih
Publicado: (2025)
Cognitive Load Limits in Large Language Models: Benchmarking Multi-Hop Reasoning
por: Adapala, Sai Teja Reddy
Publicado: (2025)
por: Adapala, Sai Teja Reddy
Publicado: (2025)
Diagnosing and Addressing Pitfalls in KG-RAG Datasets: Toward More Reliable Benchmarking
por: Zhang, Liangliang, et al.
Publicado: (2025)
por: Zhang, Liangliang, et al.
Publicado: (2025)
Control Reinforcement Learning: Interpretable Token-Level Steering of LLMs via Sparse Autoencoder Features
por: Cho, Seonglae, et al.
Publicado: (2026)
por: Cho, Seonglae, et al.
Publicado: (2026)
In-Context Fixation: When Demonstrated Labels Override Semantics in Few-Shot Classification
por: Liu, Ming
Publicado: (2026)
por: Liu, Ming
Publicado: (2026)
No Free Swap: Protocol-Dependent Layer Redundancy in Transformers
por: Garcia, Gabriel
Publicado: (2026)
por: Garcia, Gabriel
Publicado: (2026)
Beyond Pass@k: Breadth-Depth Metrics for Reasoning Boundaries
por: Dragoi, Marius, et al.
Publicado: (2025)
por: Dragoi, Marius, et al.
Publicado: (2025)
Revisiting Intermediate-Layer Matching in Knowledge Distillation: Layer-Selection Strategy Doesn't Matter (Much)
por: Yu, Zony, et al.
Publicado: (2025)
por: Yu, Zony, et al.
Publicado: (2025)
Painless Activation Steering: An Automated, Lightweight Approach for Post-Training Large Language Models
por: Cui, Sasha, et al.
Publicado: (2025)
por: Cui, Sasha, et al.
Publicado: (2025)
The Last Word Often Wins: A Format Confound in Chain-of-Thought Corruption Studies
por: Garcia, Gabriel
Publicado: (2026)
por: Garcia, Gabriel
Publicado: (2026)
Counterfactual Likelihood Tests for Indirect Influence in Private Reasoning Channels
por: Lorup, Alexander Boesgaard
Publicado: (2026)
por: Lorup, Alexander Boesgaard
Publicado: (2026)
TIAR: Trajectory-Informed Advantage Reweighting for LLM Abstention Learning
por: Pan, Muyu, et al.
Publicado: (2026)
por: Pan, Muyu, et al.
Publicado: (2026)
Pressure-Testing Deception Probes in LLMs: Scaling, Robustness, and the Geometry of Deceptive Representations
por: Kumar, Sachin
Publicado: (2026)
por: Kumar, Sachin
Publicado: (2026)
Structured Prompt Optimization Meets Reinforcement Learning for Global and Local Interpretability over Complex Text
por: Zhou, Tianyang, et al.
Publicado: (2026)
por: Zhou, Tianyang, et al.
Publicado: (2026)
AMEL: Accumulated Message Effects on LLM Judgments
por: Temkit, Sid-Ali
Publicado: (2026)
por: Temkit, Sid-Ali
Publicado: (2026)
Prototype Transformer: Towards Language Model Architectures Interpretable by Design
por: Yordanov, Yordan, et al.
Publicado: (2026)
por: Yordanov, Yordan, et al.
Publicado: (2026)
Forget Attention: Importance-Aware Attention Is All You Need
por: Shin, Soohyeong, et al.
Publicado: (2026)
por: Shin, Soohyeong, et al.
Publicado: (2026)
Enhancing Burmese News Classification with Kolmogorov-Arnold Network Head Fine-tuning
por: Aung, Thura, et al.
Publicado: (2025)
por: Aung, Thura, et al.
Publicado: (2025)
MaPPO: Maximum a Posteriori Preference Optimization with Prior Knowledge
por: Lan, Guangchen, et al.
Publicado: (2025)
por: Lan, Guangchen, et al.
Publicado: (2025)
Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models
por: Zhang, Gongbo, et al.
Publicado: (2026)
por: Zhang, Gongbo, et al.
Publicado: (2026)
Dodo: Dynamic Contextual Compression for Decoder-only LMs
por: Qin, Guanghui, et al.
Publicado: (2023)
por: Qin, Guanghui, et al.
Publicado: (2023)
Model Collapse as Cultural Evolution
por: Guo, Dongxin, et al.
Publicado: (2026)
por: Guo, Dongxin, et al.
Publicado: (2026)
CorrSteer: Generation-Time LLM Steering via Correlated Sparse Autoencoder Features
por: Cho, Seonglae, et al.
Publicado: (2025)
por: Cho, Seonglae, et al.
Publicado: (2025)
Adapting While Learning: Grounding LLMs for Scientific Problems with Intelligent Tool Usage Adaptation
por: Lyu, Bohan, et al.
Publicado: (2024)
por: Lyu, Bohan, et al.
Publicado: (2024)
Harnessing Negative Signals: Reinforcement Distillation from Teacher Data for LLM Reasoning
por: Xu, Shuyao, et al.
Publicado: (2025)
por: Xu, Shuyao, et al.
Publicado: (2025)
DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory
por: Zhou, Wenxuan, et al.
Publicado: (2025)
por: Zhou, Wenxuan, et al.
Publicado: (2025)
Contextual Integrity in LLMs via Reasoning and Reinforcement Learning
por: Lan, Guangchen, et al.
Publicado: (2025)
por: Lan, Guangchen, et al.
Publicado: (2025)
Generalizing Numerical Reasoning in Table Data through Operation Sketches and Self-Supervised Learning
por: Cho, Hanjun, et al.
Publicado: (2026)
por: Cho, Hanjun, et al.
Publicado: (2026)
Beyond Hallucinations: A Composite Score for Measuring Reliability in Open-Source Large Language Models
por: Salla, Rohit Kumar, et al.
Publicado: (2025)
por: Salla, Rohit Kumar, et al.
Publicado: (2025)
The Instability of Safety: How Random Seeds and Temperature Expose Inconsistent LLM Refusal Behavior
por: Larsen, Erik
Publicado: (2025)
por: Larsen, Erik
Publicado: (2025)
Language as a Wave Phenomenon: Semantic Phase Locking and Interference in Neural Networks
por: Yıldırım, Alper, et al.
Publicado: (2025)
por: Yıldırım, Alper, et al.
Publicado: (2025)
Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy
por: Lan, Guangchen, et al.
Publicado: (2026)
por: Lan, Guangchen, et al.
Publicado: (2026)
Graph Memory Transformer (GMT)
por: Zanarini, Nicola, et al.
Publicado: (2026)
por: Zanarini, Nicola, et al.
Publicado: (2026)
Domain-Specific Pretraining of Language Models: A Comparative Study in the Medical Field
por: Kerner, Tobias
Publicado: (2024)
por: Kerner, Tobias
Publicado: (2024)
The Deterministic Horizon: When Extended Reasoning Fails and Tool Delegation Becomes Necessary
por: Guo, Dongxin, et al.
Publicado: (2026)
por: Guo, Dongxin, et al.
Publicado: (2026)
Self-Training Doesn't Flatten Language -- It Restructures It: Surface Markers Amplify While Deep Syntax Dies
por: Liu, Ming
Publicado: (2026)
por: Liu, Ming
Publicado: (2026)
The Readout Shortcut: Positional Number Copying Dominates Arithmetic CoT Readout in Small Language Models
por: Liu, Ming
Publicado: (2026)
por: Liu, Ming
Publicado: (2026)
Synthius-Mem: Brain-Inspired Hallucination-Resistant Persona Memory Achieving 94.4% Memory Accuracy and 99.6% Adversarial Robustness on LoCoMo
por: Gadzhiev, Artem, et al.
Publicado: (2026)
por: Gadzhiev, Artem, et al.
Publicado: (2026)
Weakly Supervised Distillation of Hallucination Signals into Transformer Representations
por: Salehmohamed, Shoaib Sadiq, et al.
Publicado: (2026)
por: Salehmohamed, Shoaib Sadiq, et al.
Publicado: (2026)
RMGAP: Benchmarking the Generalization of Reward Models across Diverse Preferences
por: Zhou, Yangyang, et al.
Publicado: (2026)
por: Zhou, Yangyang, et al.
Publicado: (2026)
Ejemplares similares
-
Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models
por: Fadli, Samih
Publicado: (2025) -
Cognitive Load Limits in Large Language Models: Benchmarking Multi-Hop Reasoning
por: Adapala, Sai Teja Reddy
Publicado: (2025) -
Diagnosing and Addressing Pitfalls in KG-RAG Datasets: Toward More Reliable Benchmarking
por: Zhang, Liangliang, et al.
Publicado: (2025) -
Control Reinforcement Learning: Interpretable Token-Level Steering of LLMs via Sparse Autoencoder Features
por: Cho, Seonglae, et al.
Publicado: (2026) -
In-Context Fixation: When Demonstrated Labels Override Semantics in Few-Shot Classification
por: Liu, Ming
Publicado: (2026)