Pre-Calc: Learning to Use the Calculator Improves Numeracy in Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Veerendranath, Vishruth, Shah, Vishwa, Ghate, Kshitish |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ECCO: Can We Improve Model-Generated Code Efficiency Without Sacrificing Functional Correctness?
por: Waghjale, Siddhant, et al.
Publicado: (2024)
por: Waghjale, Siddhant, et al.
Publicado: (2024)
Personal Information Parroting in Language Models
por: Subramani, Nishant, et al.
Publicado: (2026)
por: Subramani, Nishant, et al.
Publicado: (2026)
MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models
por: Mao, Kangkun, et al.
Publicado: (2025)
por: Mao, Kangkun, et al.
Publicado: (2025)
MedCalc-Bench: Evaluating Large Language Models for Medical Calculations
por: Khandekar, Nikhil, et al.
Publicado: (2024)
por: Khandekar, Nikhil, et al.
Publicado: (2024)
Beyond Cooperative Simulators: Generating Realistic User Personas for Robust Evaluation of LLM Agents
por: Chopra, Harshita, et al.
Publicado: (2026)
por: Chopra, Harshita, et al.
Publicado: (2026)
REALM: A Dataset of Real-World LLM Use Cases
por: Cheng, Jingwen, et al.
Publicado: (2025)
por: Cheng, Jingwen, et al.
Publicado: (2025)
Generative Value Conflicts Reveal LLM Priorities
por: Liu, Andy, et al.
Publicado: (2025)
por: Liu, Andy, et al.
Publicado: (2025)
Deep Reasoning in General Purpose Agents via Structured Meta-Cognition
por: Light, Dean, et al.
Publicado: (2026)
por: Light, Dean, et al.
Publicado: (2026)
Revealing the Numeracy Gap: An Empirical Investigation of Text Embedding Models
por: Deng, Ningyuan, et al.
Publicado: (2025)
por: Deng, Ningyuan, et al.
Publicado: (2025)
Exposing Numeracy Gaps: A Benchmark to Evaluate Fundamental Numerical Abilities in Large Language Models
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
Biases Propagate in Encoder-based Vision-Language Models: A Systematic Analysis From Intrinsic Measures to Zero-shot Retrieval Outcomes
por: Ghate, Kshitish, et al.
Publicado: (2025)
por: Ghate, Kshitish, et al.
Publicado: (2025)
TaxCalcBench: Evaluating Frontier Models on the Tax Calculation Task
por: Bock, Michael R., et al.
Publicado: (2025)
por: Bock, Michael R., et al.
Publicado: (2025)
Meta-Reasoning Improves Tool Use in Large Language Models
por: Alazraki, Lisa, et al.
Publicado: (2024)
por: Alazraki, Lisa, et al.
Publicado: (2024)
Spontaneous Giving and Calculated Greed in Language Models
por: Li, Yuxuan, et al.
Publicado: (2025)
por: Li, Yuxuan, et al.
Publicado: (2025)
"According to ...": Prompting Language Models Improves Quoting from Pre-Training Data
por: Weller, Orion, et al.
Publicado: (2023)
por: Weller, Orion, et al.
Publicado: (2023)
B-cos LM: Efficiently Transforming Pre-trained Language Models for Improved Explainability
por: Wang, Yifan, et al.
Publicado: (2025)
por: Wang, Yifan, et al.
Publicado: (2025)
Intrinsic Bias is Predicted by Pretraining Data and Correlates with Downstream Performance in Vision-Language Encoders
por: Ghate, Kshitish, et al.
Publicado: (2025)
por: Ghate, Kshitish, et al.
Publicado: (2025)
Language Models Struggle to Use Representations Learned In-Context
por: Lepori, Michael A., et al.
Publicado: (2026)
por: Lepori, Michael A., et al.
Publicado: (2026)
Calibrating Pre-trained Language Classifiers on LLM-generated Noisy Labels via Iterative Refinement
por: Ye, Liqin, et al.
Publicado: (2025)
por: Ye, Liqin, et al.
Publicado: (2025)
Contextual Evaluation of Large Language Models for Classifying Tropical and Infectious Diseases
por: Asiedu, Mercy, et al.
Publicado: (2024)
por: Asiedu, Mercy, et al.
Publicado: (2024)
Efficient Data Learning for Open Information Extraction with Pre-trained Language Models
por: Fan, Zhiyuan, et al.
Publicado: (2023)
por: Fan, Zhiyuan, et al.
Publicado: (2023)
MERLIN: A Testbed for Multilingual Multimodal Entity Recognition and Linking
por: Ramamoorthy, Sathyanarayanan, et al.
Publicado: (2025)
por: Ramamoorthy, Sathyanarayanan, et al.
Publicado: (2025)
Improving Language Model Reasoning with Self-motivated Learning
por: Feng, Yunlong, et al.
Publicado: (2024)
por: Feng, Yunlong, et al.
Publicado: (2024)
Evolution of Concepts in Language Model Pre-Training
por: Ge, Xuyang, et al.
Publicado: (2025)
por: Ge, Xuyang, et al.
Publicado: (2025)
Improving the Language Understanding Capabilities of Large Language Models Using Reinforcement Learning
por: Hu, Bokai, et al.
Publicado: (2024)
por: Hu, Bokai, et al.
Publicado: (2024)
PreCog: Exploring the Relation between Memorization and Performance in Pre-trained Language Models
por: Ranaldi, Leonardo, et al.
Publicado: (2023)
por: Ranaldi, Leonardo, et al.
Publicado: (2023)
Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model
por: Yin, Yueqin, et al.
Publicado: (2025)
por: Yin, Yueqin, et al.
Publicado: (2025)
Probing Language Models for Pre-training Data Detection
por: Liu, Zhenhua, et al.
Publicado: (2024)
por: Liu, Zhenhua, et al.
Publicado: (2024)
Revealing the Inherent Instructability of Pre-Trained Language Models
por: An, Seokhyun, et al.
Publicado: (2024)
por: An, Seokhyun, et al.
Publicado: (2024)
Topic Segmentation Using Generative Language Models
por: Mackenzie, Pierre, et al.
Publicado: (2025)
por: Mackenzie, Pierre, et al.
Publicado: (2025)
Concept-aware Data Construction Improves In-context Learning of Language Models
por: Štefánik, Michal, et al.
Publicado: (2024)
por: Štefánik, Michal, et al.
Publicado: (2024)
Pre-training LLMs using human-like development data corpus
por: Bhardwaj, Khushi, et al.
Publicado: (2023)
por: Bhardwaj, Khushi, et al.
Publicado: (2023)
Pre-trained Language Models Improve the Few-shot Prompt Ability of Decision Transformer
por: Yang, Yu, et al.
Publicado: (2024)
por: Yang, Yu, et al.
Publicado: (2024)
Code-driven Number Sequence Calculation: Enhancing the inductive Reasoning Abilities of Large Language Models
por: Chen, Kedi, et al.
Publicado: (2025)
por: Chen, Kedi, et al.
Publicado: (2025)
Can Pre-trained Language Models Understand Chinese Humor?
por: Chen, Yuyan, et al.
Publicado: (2024)
por: Chen, Yuyan, et al.
Publicado: (2024)
Pre-trained Large Language Models for Financial Sentiment Analysis
por: Luo, Wei, et al.
Publicado: (2024)
por: Luo, Wei, et al.
Publicado: (2024)
Pre-Trained Language Models for Keyphrase Prediction: A Review
por: Umair, Muhammad, et al.
Publicado: (2024)
por: Umair, Muhammad, et al.
Publicado: (2024)
Spike No More: Stabilizing the Pre-training of Large Language Models
por: Takase, Sho, et al.
Publicado: (2023)
por: Takase, Sho, et al.
Publicado: (2023)
Pre-Training Curriculum for Multi-Token Prediction in Language Models
por: Aynetdinov, Ansar, et al.
Publicado: (2025)
por: Aynetdinov, Ansar, et al.
Publicado: (2025)
From Scores to Steps: Diagnosing and Improving LLM Performance in Evidence-Based Medical Calculations
por: Wang, Benlu, et al.
Publicado: (2025)
por: Wang, Benlu, et al.
Publicado: (2025)
Ejemplares similares
-
ECCO: Can We Improve Model-Generated Code Efficiency Without Sacrificing Functional Correctness?
por: Waghjale, Siddhant, et al.
Publicado: (2024) -
Personal Information Parroting in Language Models
por: Subramani, Nishant, et al.
Publicado: (2026) -
MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models
por: Mao, Kangkun, et al.
Publicado: (2025) -
MedCalc-Bench: Evaluating Large Language Models for Medical Calculations
por: Khandekar, Nikhil, et al.
Publicado: (2024) -
Beyond Cooperative Simulators: Generating Realistic User Personas for Robust Evaluation of LLM Agents
por: Chopra, Harshita, et al.
Publicado: (2026)