Super Tiny Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hillier, Dylan, Guertler, Leon, Tan, Cheston, Agrawal, Palaash, Ruirui, Chen, Cheng, Bobby |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
STLM Engineering Report: Dropout
par: Hillier, Dylan, et autres
Publié: (2024)
par: Hillier, Dylan, et autres
Publié: (2024)
Social Learning through Interactions with Other Agents: A Survey
par: Hillier, Dylan, et autres
Publié: (2024)
par: Hillier, Dylan, et autres
Publié: (2024)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
par: Peters, Sydney, et autres
Publié: (2025)
par: Peters, Sydney, et autres
Publié: (2025)
Multilingual jailbreaking of LLMs using low-resource languages
par: Marx, Dylan, et autres
Publié: (2026)
par: Marx, Dylan, et autres
Publié: (2026)
Search-R3: Unifying Reasoning and Embedding in Large Language Models
par: Gui, Yuntao, et autres
Publié: (2025)
par: Gui, Yuntao, et autres
Publié: (2025)
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
par: Saji, Alan, et autres
Publié: (2025)
par: Saji, Alan, et autres
Publié: (2025)
Streamlining Redundant Layers to Compress Large Language Models
par: Chen, Xiaodong, et autres
Publié: (2024)
par: Chen, Xiaodong, et autres
Publié: (2024)
Large Language Model (LLM) Bias Index -- LLMBI
par: Oketunji, Abiodun Finbarrs, et autres
Publié: (2023)
par: Oketunji, Abiodun Finbarrs, et autres
Publié: (2023)
Partially Recentralization Softmax Loss for Vision-Language Models Robustness
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
Thought-Like-Pro: Enhancing Reasoning of Large Language Models through Self-Driven Prolog-based Chain-of-Thought
par: Tan, Xiaoyu, et autres
Publié: (2024)
par: Tan, Xiaoyu, et autres
Publié: (2024)
Uncovering Latent Human Wellbeing in Language Model Embeddings
par: Freire, Pedro, et autres
Publié: (2024)
par: Freire, Pedro, et autres
Publié: (2024)
PatentGPT: A Large Language Model for Intellectual Property
par: Bai, Zilong, et autres
Publié: (2024)
par: Bai, Zilong, et autres
Publié: (2024)
Robustness of Large Language Models to Perturbations in Text
par: Singh, Ayush, et autres
Publié: (2024)
par: Singh, Ayush, et autres
Publié: (2024)
Language Models are Crossword Solvers
par: Saha, Soumadeep, et autres
Publié: (2024)
par: Saha, Soumadeep, et autres
Publié: (2024)
Egalitarian Language Representation in Language Models: It All Begins with Tokenizers
par: Velayuthan, Menan, et autres
Publié: (2024)
par: Velayuthan, Menan, et autres
Publié: (2024)
NL2LOGIC: AST-Guided Translation of Natural Language into First-Order Logic with Large Language Models
par: Putra, Rizky Ramadhana, et autres
Publié: (2026)
par: Putra, Rizky Ramadhana, et autres
Publié: (2026)
Adaptive Focus Memory for Language Models
par: Cruz, Christopher
Publié: (2025)
par: Cruz, Christopher
Publié: (2025)
UniHetero: Could Generation Enhance Understanding for Vision-Language-Model at Large Data Scale?
par: Chen, Fengjiao, et autres
Publié: (2025)
par: Chen, Fengjiao, et autres
Publié: (2025)
Evaluating the Efficacy of Hybrid Deep Learning Models in Distinguishing AI-Generated Text
par: Oketunji, Abiodun Finbarrs
Publié: (2023)
par: Oketunji, Abiodun Finbarrs
Publié: (2023)
Integrating Emotional and Linguistic Models for Ethical Compliance in Large Language Models
par: Chang, Edward Y.
Publié: (2024)
par: Chang, Edward Y.
Publié: (2024)
Inference to the Best Explanation in Large Language Models
par: Dalal, Dhairya, et autres
Publié: (2024)
par: Dalal, Dhairya, et autres
Publié: (2024)
Language Model Circuits Are Sparse in the Neuron Basis
par: Arora, Aryaman, et autres
Publié: (2026)
par: Arora, Aryaman, et autres
Publié: (2026)
Bielik 11B v3: Multilingual Large Language Model for European Languages
par: Ociepa, Krzysztof, et autres
Publié: (2025)
par: Ociepa, Krzysztof, et autres
Publié: (2025)
Machine Translation Hallucination Detection for Low and High Resource Languages using Large Language Models
par: Benkirane, Kenza, et autres
Publié: (2024)
par: Benkirane, Kenza, et autres
Publié: (2024)
Future Language Modeling from Temporal Document History
par: Li, Changmao, et autres
Publié: (2024)
par: Li, Changmao, et autres
Publié: (2024)
Exploring Graph Representations of Logical Forms for Language Modeling
par: Sullivan, Michael
Publié: (2025)
par: Sullivan, Michael
Publié: (2025)
A comprehensive taxonomy of hallucinations in Large Language Models
par: Cossio, Manuel
Publié: (2025)
par: Cossio, Manuel
Publié: (2025)
Prompt-Time Symbolic Knowledge Capture with Large Language Models
par: Çöplü, Tolga, et autres
Publié: (2024)
par: Çöplü, Tolga, et autres
Publié: (2024)
Argumentative Large Language Models for Explainable and Contestable Claim Verification
par: Freedman, Gabriel, et autres
Publié: (2024)
par: Freedman, Gabriel, et autres
Publié: (2024)
Reasoning over Uncertain Text by Generative Large Language Models
par: Nafar, Aliakbar, et autres
Publié: (2024)
par: Nafar, Aliakbar, et autres
Publié: (2024)
Multi-Turn Interactions for Text-to-SQL with Large Language Models
par: Xiong, Guanming, et autres
Publié: (2024)
par: Xiong, Guanming, et autres
Publié: (2024)
Artificial Phantasia: Emergent Mental Imagery in Large Language Models
par: McCarty, Morgan, et autres
Publié: (2025)
par: McCarty, Morgan, et autres
Publié: (2025)
Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models
par: Hawkins, John
Publié: (2025)
par: Hawkins, John
Publié: (2025)
Demystifying Instruction Mixing for Fine-tuning Large Language Models
par: Wang, Renxi, et autres
Publié: (2023)
par: Wang, Renxi, et autres
Publié: (2023)
Component-Aware Self-Speculative Decoding in Hybrid Language Models
par: Borobia, Hector, et autres
Publié: (2026)
par: Borobia, Hector, et autres
Publié: (2026)
EQ-Bench: An Emotional Intelligence Benchmark for Large Language Models
par: Paech, Samuel J.
Publié: (2023)
par: Paech, Samuel J.
Publié: (2023)
Predictive Simultaneous Interpretation: Harnessing Large Language Models for Democratizing Real-Time Multilingual Communication
par: Iida, Kurando, et autres
Publié: (2024)
par: Iida, Kurando, et autres
Publié: (2024)
UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning
par: Ovcharov, Volodymyr
Publié: (2026)
par: Ovcharov, Volodymyr
Publié: (2026)
Bielik-Minitron-7B: Compressing Large Language Models via Structured Pruning and Knowledge Distillation for the Polish Language
par: Kinas, Remigiusz, et autres
Publié: (2026)
par: Kinas, Remigiusz, et autres
Publié: (2026)
Can Large Language Models perform Relation-based Argument Mining?
par: Gorur, Deniz, et autres
Publié: (2024)
par: Gorur, Deniz, et autres
Publié: (2024)
Documents similaires
-
STLM Engineering Report: Dropout
par: Hillier, Dylan, et autres
Publié: (2024) -
Social Learning through Interactions with Other Agents: A Survey
par: Hillier, Dylan, et autres
Publié: (2024) -
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
par: Peters, Sydney, et autres
Publié: (2025) -
Multilingual jailbreaking of LLMs using low-resource languages
par: Marx, Dylan, et autres
Publié: (2026) -
Search-R3: Unifying Reasoning and Embedding in Large Language Models
par: Gui, Yuntao, et autres
Publié: (2025)