Tiny language models
Fuente:
arXiv
Salvato in:
| Autori principali: | Gross, Ronit D., Tzach, Yarden, Halevi, Tal, Koresh, Ella, Kanter, Ido |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Low-latency vision transformers via large-scale multi-head attention
di: Gross, Ronit D., et al.
Pubblicazione: (2025)
di: Gross, Ronit D., et al.
Pubblicazione: (2025)
Learning Mechanism Underlying NLP Pre-Training and Fine-Tuning
di: Tzach, Yarden, et al.
Pubblicazione: (2025)
di: Tzach, Yarden, et al.
Pubblicazione: (2025)
Unified CNNs and transformers underlying learning mechanism reveals multi-head attention modus vivendi
di: Koresh, Ella, et al.
Pubblicazione: (2025)
di: Koresh, Ella, et al.
Pubblicazione: (2025)
Self-attention vector output similarities reveal how machines pay attention
di: Halevi, Tal, et al.
Pubblicazione: (2025)
di: Halevi, Tal, et al.
Pubblicazione: (2025)
Advanced deep architecture pruning using single filter performance
di: Tzach, Yarden, et al.
Pubblicazione: (2025)
di: Tzach, Yarden, et al.
Pubblicazione: (2025)
Single-Nodal Spontaneous Symmetry Breaking in NLP Models
di: Rosner, Shalom, et al.
Pubblicazione: (2026)
di: Rosner, Shalom, et al.
Pubblicazione: (2026)
Translation Entropy: A Statistical Framework for Evaluating Translation Systems
di: Gross, Ronit D., et al.
Pubblicazione: (2025)
di: Gross, Ronit D., et al.
Pubblicazione: (2025)
Towards a universal mechanism for successful deep learning
di: Meir, Yuval, et al.
Pubblicazione: (2023)
di: Meir, Yuval, et al.
Pubblicazione: (2023)
Role of Delay in Brain Dynamics
di: Meir, Yuval, et al.
Pubblicazione: (2024)
di: Meir, Yuval, et al.
Pubblicazione: (2024)
Manipulating language models' training data to study syntactic constraint learning: the case of English passivization
di: Leong, Cara Su-Yi, et al.
Pubblicazione: (2024)
di: Leong, Cara Su-Yi, et al.
Pubblicazione: (2024)
Why are language models less surprised than humans? Testing the Parse Multiplicity Mismatch Hypothesis
di: Timkey, William, et al.
Pubblicazione: (2026)
di: Timkey, William, et al.
Pubblicazione: (2026)
TeenyTinyLlama: open-source tiny language models trained in Brazilian Portuguese
di: Corrêa, Nicholas Kluge, et al.
Pubblicazione: (2024)
di: Corrêa, Nicholas Kluge, et al.
Pubblicazione: (2024)
Attribute First, then Generate: Locally-attributable Grounded Text Generation
di: Slobodkin, Aviv, et al.
Pubblicazione: (2024)
di: Slobodkin, Aviv, et al.
Pubblicazione: (2024)
Institutional-Level Monitoring of Immune Checkpoint Inhibitor IrAEs Using a Novel Natural Language Processing Algorithmic Pipeline
di: Shapiro, Michael, et al.
Pubblicazione: (2024)
di: Shapiro, Michael, et al.
Pubblicazione: (2024)
That's Optional: A Contemporary Exploration of "that" Omission in English Subordinate Clauses
di: Rabinovich, Ella
Pubblicazione: (2024)
di: Rabinovich, Ella
Pubblicazione: (2024)
Large language models have learned to use language
di: Lupyan, Gary
Pubblicazione: (2025)
di: Lupyan, Gary
Pubblicazione: (2025)
Tiny Aya: Bridging Scale and Multilingual Depth
di: Salamanca, Alejandro R., et al.
Pubblicazione: (2026)
di: Salamanca, Alejandro R., et al.
Pubblicazione: (2026)
Tiny Reward Models
di: Pan, Sarah
Pubblicazione: (2025)
di: Pan, Sarah
Pubblicazione: (2025)
Deconstructing sentence disambiguation by joint latent modeling of reading paradigms: LLM surprisal is not enough
di: Paape, Dario, et al.
Pubblicazione: (2026)
di: Paape, Dario, et al.
Pubblicazione: (2026)
Studies with impossible languages falsify LMs as models of human language
di: Bowers, Jeffrey S., et al.
Pubblicazione: (2025)
di: Bowers, Jeffrey S., et al.
Pubblicazione: (2025)
Retrieval augmentation of large language models for lay language generation
di: Guo, Yue, et al.
Pubblicazione: (2022)
di: Guo, Yue, et al.
Pubblicazione: (2022)
Do large language models resemble humans in language use?
di: Cai, Zhenguang G., et al.
Pubblicazione: (2023)
di: Cai, Zhenguang G., et al.
Pubblicazione: (2023)
Can we teach language models to gloss endangered languages?
di: Ginn, Michael, et al.
Pubblicazione: (2024)
di: Ginn, Michael, et al.
Pubblicazione: (2024)
Propulsion: Steering LLM with Tiny Fine-Tuning
di: Kowsher, Md, et al.
Pubblicazione: (2024)
di: Kowsher, Md, et al.
Pubblicazione: (2024)
HateTinyLLM : Hate Speech Detection Using Tiny Large Language Models
di: Sen, Tanmay, et al.
Pubblicazione: (2024)
di: Sen, Tanmay, et al.
Pubblicazione: (2024)
Transformers are Multi-State RNNs
di: Oren, Matanel, et al.
Pubblicazione: (2024)
di: Oren, Matanel, et al.
Pubblicazione: (2024)
Universal language model with the intervention of quantum theory
di: Qin, D. -F.
Pubblicazione: (2025)
di: Qin, D. -F.
Pubblicazione: (2025)
Prompting language influences diagnostic reasoning and accuracy of large language models
di: Bazoge, Adrien, et al.
Pubblicazione: (2026)
di: Bazoge, Adrien, et al.
Pubblicazione: (2026)
Why do language models perform worse for morphologically complex languages?
di: Arnett, Catherine, et al.
Pubblicazione: (2024)
di: Arnett, Catherine, et al.
Pubblicazione: (2024)
Large language models are not about natural language
di: Bolhuis, Johan J., et al.
Pubblicazione: (2025)
di: Bolhuis, Johan J., et al.
Pubblicazione: (2025)
Dissociating language and thought in large language models
di: Mahowald, Kyle, et al.
Pubblicazione: (2023)
di: Mahowald, Kyle, et al.
Pubblicazione: (2023)
Dynamic data sampler for cross-language transfer learning in large language models
di: Li, Yudong, et al.
Pubblicazione: (2024)
di: Li, Yudong, et al.
Pubblicazione: (2024)
Multilingual large language models leak human stereotypes across language boundaries
di: Cao, Yang Trista, et al.
Pubblicazione: (2023)
di: Cao, Yang Trista, et al.
Pubblicazione: (2023)
InkubaLM: A small language model for low-resource African languages
di: Tonja, Atnafu Lambebo, et al.
Pubblicazione: (2024)
di: Tonja, Atnafu Lambebo, et al.
Pubblicazione: (2024)
Effective vocabulary expanding of multilingual language models for extremely low-resource languages
di: Zheng, Jianyu
Pubblicazione: (2026)
di: Zheng, Jianyu
Pubblicazione: (2026)
Perpetual Fully-Online Approximate Fairness
di: Kahana, Ido, et al.
Pubblicazione: (2026)
di: Kahana, Ido, et al.
Pubblicazione: (2026)
Demystifying optimized prompts in language models
di: Melamed, Rimon, et al.
Pubblicazione: (2025)
di: Melamed, Rimon, et al.
Pubblicazione: (2025)
TinyHelen's First Curriculum: Training and Evaluating Tiny Language Models in a Simpler Language Environment
di: Yang, Ke, et al.
Pubblicazione: (2024)
di: Yang, Ke, et al.
Pubblicazione: (2024)
Anthropocentric bias in language model evaluation
di: Millière, Raphaël, et al.
Pubblicazione: (2024)
di: Millière, Raphaël, et al.
Pubblicazione: (2024)
Open foundation models for Azerbaijani language
di: Isbarov, Jafar, et al.
Pubblicazione: (2024)
di: Isbarov, Jafar, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Low-latency vision transformers via large-scale multi-head attention
di: Gross, Ronit D., et al.
Pubblicazione: (2025) -
Learning Mechanism Underlying NLP Pre-Training and Fine-Tuning
di: Tzach, Yarden, et al.
Pubblicazione: (2025) -
Unified CNNs and transformers underlying learning mechanism reveals multi-head attention modus vivendi
di: Koresh, Ella, et al.
Pubblicazione: (2025) -
Self-attention vector output similarities reveal how machines pay attention
di: Halevi, Tal, et al.
Pubblicazione: (2025) -
Advanced deep architecture pruning using single filter performance
di: Tzach, Yarden, et al.
Pubblicazione: (2025)