Teaching Smaller Language Models To Generalise To Unseen Compositional Questions (Full Thesis)
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Hartill, Tim |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multi-Step Deductive Reasoning Over Natural Language: An Empirical Study on Out-of-Distribution Generalisation
par: Bao, Qiming, et autres
Publié: (2022)
par: Bao, Qiming, et autres
Publié: (2022)
Fine-tuning Smaller Language Models for Question Answering over Financial Documents
par: Phogat, Karmvir Singh, et autres
Publié: (2024)
par: Phogat, Karmvir Singh, et autres
Publié: (2024)
Mixed Distillation Helps Smaller Language Model Better Reasoning
par: Li, Chenglin, et autres
Publié: (2023)
par: Li, Chenglin, et autres
Publié: (2023)
Benchmarking LLMs' Mathematical Reasoning with Unseen Random Variables Questions
par: Hong, Zijin, et autres
Publié: (2025)
par: Hong, Zijin, et autres
Publié: (2025)
STaR-GATE: Teaching Language Models to Ask Clarifying Questions
par: Andukuri, Chinmaya, et autres
Publié: (2024)
par: Andukuri, Chinmaya, et autres
Publié: (2024)
The Impact of Model Scaling on Seen and Unseen Language Performance
par: Pokharel, Rhitabrat, et autres
Publié: (2025)
par: Pokharel, Rhitabrat, et autres
Publié: (2025)
Distill Not Only Data but Also Rewards: Can Smaller Language Models Surpass Larger Ones?
par: Zhang, Yudi, et autres
Publié: (2025)
par: Zhang, Yudi, et autres
Publié: (2025)
How do you know that? Teaching Generative Language Models to Reference Answers to Biomedical Questions
par: Bašaragin, Bojana, et autres
Publié: (2024)
par: Bašaragin, Bojana, et autres
Publié: (2024)
RepLiQA: A Question-Answering Dataset for Benchmarking LLMs on Unseen Reference Content
par: Monteiro, Joao, et autres
Publié: (2024)
par: Monteiro, Joao, et autres
Publié: (2024)
MELABenchv1: Benchmarking Large Language Models against Smaller Fine-Tuned Models for Low-Resource Maltese NLP
par: Micallef, Kurt, et autres
Publié: (2025)
par: Micallef, Kurt, et autres
Publié: (2025)
Chain-of-Tools: Utilizing Massive Unseen Tools in the CoT Reasoning of Frozen Language Models
par: Wu, Mengsong, et autres
Publié: (2025)
par: Wu, Mengsong, et autres
Publié: (2025)
Harnessing Linguistic Dissimilarity for Language Generalization on Unseen Low-Resource Varieties
par: Kim, Jinju, et autres
Publié: (2026)
par: Kim, Jinju, et autres
Publié: (2026)
Enhancing Generalization in Chain of Thought Reasoning for Smaller Models
par: Yin, Maxwell J., et autres
Publié: (2025)
par: Yin, Maxwell J., et autres
Publié: (2025)
Unleashing the Unseen: Harnessing Benign Datasets for Jailbreaking Large Language Models
par: Zhao, Wei, et autres
Publié: (2024)
par: Zhao, Wei, et autres
Publié: (2024)
Language Diffusion Models are Associative Memories Capable of Retrieving Unseen Data
par: Pham, Bao, et autres
Publié: (2026)
par: Pham, Bao, et autres
Publié: (2026)
Blar-SQL: Faster, Stronger, Smaller NL2SQL
par: Domínguez, José Manuel, et autres
Publié: (2024)
par: Domínguez, José Manuel, et autres
Publié: (2024)
Empowering Smaller Models: Tuning LLaMA and Gemma with Chain-of-Thought for Ukrainian Exam Tasks
par: Syromiatnikov, Mykyta, et autres
Publié: (2025)
par: Syromiatnikov, Mykyta, et autres
Publié: (2025)
Teaching Language Models to Reason with Tools
par: Li, Chengpeng, et autres
Publié: (2025)
par: Li, Chengpeng, et autres
Publié: (2025)
Tuning LLMs with Contrastive Alignment Instructions for Machine Translation in Unseen, Low-resource Languages
par: Mao, Zhuoyuan, et autres
Publié: (2024)
par: Mao, Zhuoyuan, et autres
Publié: (2024)
Ask Good Questions for Large Language Models
par: Wu, Qi, et autres
Publié: (2025)
par: Wu, Qi, et autres
Publié: (2025)
MOOSE-Chem: Large Language Models for Rediscovering Unseen Chemistry Scientific Hypotheses
par: Yang, Zonglin, et autres
Publié: (2024)
par: Yang, Zonglin, et autres
Publié: (2024)
Integrating Arithmetic Learning Improves Mathematical Reasoning in Smaller Models
par: Gangwar, Neeraj, et autres
Publié: (2025)
par: Gangwar, Neeraj, et autres
Publié: (2025)
CoT-Driven Framework for Short Text Classification: Enhancing and Transferring Capabilities from Large to Smaller Model
par: Wu, Hui, et autres
Publié: (2024)
par: Wu, Hui, et autres
Publié: (2024)
Teaching Language Models To Gather Information Proactively
par: Huang, Tenghao, et autres
Publié: (2025)
par: Huang, Tenghao, et autres
Publié: (2025)
Chronological Thinking in Full-Duplex Spoken Dialogue Language Models
par: Wu, Donghang, et autres
Publié: (2025)
par: Wu, Donghang, et autres
Publié: (2025)
LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?
par: Wang, Jingyuan, et autres
Publié: (2025)
par: Wang, Jingyuan, et autres
Publié: (2025)
FLANS at SemEval-2026 Task 7: RAG with Open-Sourced Smaller LLMs for Everyday Knowledge Across Diverse Languages and Cultures
par: Bogdanova, Liliia, et autres
Publié: (2026)
par: Bogdanova, Liliia, et autres
Publié: (2026)
An Empirical Evaluation of Large Language Models on Consumer Health Questions
par: Abrar, Moaiz, et autres
Publié: (2024)
par: Abrar, Moaiz, et autres
Publié: (2024)
Mitigating Knowledge Conflicts in Language Model-Driven Question Answering
par: Cao, Han, et autres
Publié: (2024)
par: Cao, Han, et autres
Publié: (2024)
Are Large Language Models Consistent over Value-laden Questions?
par: Moore, Jared, et autres
Publié: (2024)
par: Moore, Jared, et autres
Publié: (2024)
Uncertainty Estimation of Large Language Models in Medical Question Answering
par: Wu, Jiaxin, et autres
Publié: (2024)
par: Wu, Jiaxin, et autres
Publié: (2024)
Multilingual Medical Reasoning for Question Answering with Large Language Models
par: Ferrazzi, Pietro, et autres
Publié: (2025)
par: Ferrazzi, Pietro, et autres
Publié: (2025)
Smaller, Weaker, Yet Better: Training LLM Reasoners via Compute-Optimal Sampling
par: Bansal, Hritik, et autres
Publié: (2024)
par: Bansal, Hritik, et autres
Publié: (2024)
Does Pre-trained Language Model Actually Infer Unseen Links in Knowledge Graph Completion?
par: Sakai, Yusuke, et autres
Publié: (2023)
par: Sakai, Yusuke, et autres
Publié: (2023)
Recursive Language Models
par: Zhang, Alex L., et autres
Publié: (2025)
par: Zhang, Alex L., et autres
Publié: (2025)
Can Language Models Analyze Data? Evaluating Large Language Models for Question Answering over Datasets
par: Xenofontos, Andreas, et autres
Publié: (2026)
par: Xenofontos, Andreas, et autres
Publié: (2026)
ASTRO: Teaching Language Models to Reason by Reflecting and Backtracking In-Context
par: Kim, Joongwon, et autres
Publié: (2025)
par: Kim, Joongwon, et autres
Publié: (2025)
Bayesian Teaching Enables Probabilistic Reasoning in Large Language Models
par: Qiu, Linlu, et autres
Publié: (2025)
par: Qiu, Linlu, et autres
Publié: (2025)
KnowRL: Teaching Language Models to Know What They Know
par: Kale, Sahil, et autres
Publié: (2025)
par: Kale, Sahil, et autres
Publié: (2025)
Fine-Tuned Machine Translation Metrics Struggle in Unseen Domains
par: Zouhar, Vilém, et autres
Publié: (2024)
par: Zouhar, Vilém, et autres
Publié: (2024)
Documents similaires
-
Multi-Step Deductive Reasoning Over Natural Language: An Empirical Study on Out-of-Distribution Generalisation
par: Bao, Qiming, et autres
Publié: (2022) -
Fine-tuning Smaller Language Models for Question Answering over Financial Documents
par: Phogat, Karmvir Singh, et autres
Publié: (2024) -
Mixed Distillation Helps Smaller Language Model Better Reasoning
par: Li, Chenglin, et autres
Publié: (2023) -
Benchmarking LLMs' Mathematical Reasoning with Unseen Random Variables Questions
par: Hong, Zijin, et autres
Publié: (2025) -
STaR-GATE: Teaching Language Models to Ask Clarifying Questions
par: Andukuri, Chinmaya, et autres
Publié: (2024)