STLM Engineering Report: Dropout
Fuente:
arXiv
Salvato in:
| Autori principali: | Hillier, Dylan, Guertler, Leon, Cheng, Bobby, Tan, Cheston |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Super Tiny Language Models
di: Hillier, Dylan, et al.
Pubblicazione: (2024)
di: Hillier, Dylan, et al.
Pubblicazione: (2024)
Social Learning through Interactions with Other Agents: A Survey
di: Hillier, Dylan, et al.
Pubblicazione: (2024)
di: Hillier, Dylan, et al.
Pubblicazione: (2024)
CascadeMind at SemEval-2026 Task 4: A Hybrid Neuro-Symbolic Cascade for Narrative Similarity
di: Kawada, Sebastien, et al.
Pubblicazione: (2026)
di: Kawada, Sebastien, et al.
Pubblicazione: (2026)
CRISP: Persistent Concept Unlearning via Sparse Autoencoders
di: Ashuach, Tomer, et al.
Pubblicazione: (2025)
di: Ashuach, Tomer, et al.
Pubblicazione: (2025)
Is Less More? Quality, Quantity and Context in Idiom Processing with Natural Language Models
di: Knietaite, Agne, et al.
Pubblicazione: (2024)
di: Knietaite, Agne, et al.
Pubblicazione: (2024)
Reflective Translation: Improving Low-Resource Machine Translation via Structured Self-Reflection
di: Cheng, Nicholas
Pubblicazione: (2026)
di: Cheng, Nicholas
Pubblicazione: (2026)
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
di: Saji, Alan, et al.
Pubblicazione: (2025)
di: Saji, Alan, et al.
Pubblicazione: (2025)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
di: Peters, Sydney, et al.
Pubblicazione: (2025)
di: Peters, Sydney, et al.
Pubblicazione: (2025)
Engineering A Large Language Model From Scratch
di: Oketunji, Abiodun Finbarrs
Pubblicazione: (2024)
di: Oketunji, Abiodun Finbarrs
Pubblicazione: (2024)
Detección Automática de Patologías en Notas Clínicas en Español Combinando Modelos de Lenguaje y Ontologías Médicos
di: Torre, Léon-Paul Schaub, et al.
Pubblicazione: (2024)
di: Torre, Léon-Paul Schaub, et al.
Pubblicazione: (2024)
Efficient Aspect-Based Summarization of Climate Change Reports with Small Language Models
di: Ghinassi, Iacopo, et al.
Pubblicazione: (2024)
di: Ghinassi, Iacopo, et al.
Pubblicazione: (2024)
Technical Report of TeleChat2, TeleChat2.5 and T1
di: Wang, Zihan, et al.
Pubblicazione: (2025)
di: Wang, Zihan, et al.
Pubblicazione: (2025)
OPOR-Bench: Evaluating Large Language Models on Online Public Opinion Report Generation
di: Yu, Jinzheng, et al.
Pubblicazione: (2025)
di: Yu, Jinzheng, et al.
Pubblicazione: (2025)
Surprise Calibration for Better In-Context Learning
di: Tan, Zhihang, et al.
Pubblicazione: (2025)
di: Tan, Zhihang, et al.
Pubblicazione: (2025)
HACHIMI: Scalable and Controllable Student Persona Generation via Orchestrated Agents
di: Jiang, Yilin, et al.
Pubblicazione: (2026)
di: Jiang, Yilin, et al.
Pubblicazione: (2026)
A Multi-Pass Large Language Model Framework for Precise and Efficient Radiology Report Error Detection
di: Kim, Songsoo, et al.
Pubblicazione: (2025)
di: Kim, Songsoo, et al.
Pubblicazione: (2025)
Multilingual jailbreaking of LLMs using low-resource languages
di: Marx, Dylan, et al.
Pubblicazione: (2026)
di: Marx, Dylan, et al.
Pubblicazione: (2026)
Evaluating Large Language Models for Zero-Shot Disease Labeling in CT Radiology Reports Across Organ Systems
di: Garcia-Alcoser, Michael E., et al.
Pubblicazione: (2025)
di: Garcia-Alcoser, Michael E., et al.
Pubblicazione: (2025)
Towards Fundamental Language Models: Does Linguistic Competence Scale with Model Size?
di: Collado-Montañez, Jaime, et al.
Pubblicazione: (2025)
di: Collado-Montañez, Jaime, et al.
Pubblicazione: (2025)
SeLeRoSa: Sentence-Level Romanian Satire Detection Dataset
di: Smădu, Răzvan-Alexandru, et al.
Pubblicazione: (2025)
di: Smădu, Răzvan-Alexandru, et al.
Pubblicazione: (2025)
Strategy Adaptation in Large Language Model Werewolf Agents
di: Nakamori, Fuya, et al.
Pubblicazione: (2025)
di: Nakamori, Fuya, et al.
Pubblicazione: (2025)
Can LLM Graph Reasoning Generalize beyond Pattern Memorization?
di: Zhang, Yizhuo, et al.
Pubblicazione: (2024)
di: Zhang, Yizhuo, et al.
Pubblicazione: (2024)
LLM Uncertainty Quantification through Directional Entailment Graph and Claim Level Response Augmentation
di: Da, Longchao, et al.
Pubblicazione: (2024)
di: Da, Longchao, et al.
Pubblicazione: (2024)
Towards Massive Multilingual Holistic Bias
di: Tan, Xiaoqing Ellen, et al.
Pubblicazione: (2024)
di: Tan, Xiaoqing Ellen, et al.
Pubblicazione: (2024)
AsyncTLS: Efficient Generative LLM Inference with Asynchronous Two-level Sparse Attention
di: Hu, Yuxuan, et al.
Pubblicazione: (2026)
di: Hu, Yuxuan, et al.
Pubblicazione: (2026)
LUCID: LLM-Generated Utterances for Complex and Interesting Dialogues
di: Stacey, Joe, et al.
Pubblicazione: (2024)
di: Stacey, Joe, et al.
Pubblicazione: (2024)
Graphemic Normalization of the Perso-Arabic Script
di: Doctor, Raiomond, et al.
Pubblicazione: (2022)
di: Doctor, Raiomond, et al.
Pubblicazione: (2022)
Beyond Arabic: Software for Perso-Arabic Script Manipulation
di: Gutkin, Alexander, et al.
Pubblicazione: (2023)
di: Gutkin, Alexander, et al.
Pubblicazione: (2023)
PLM: Efficient Peripheral Language Models Hardware-Co-Designed for Ubiquitous Computing
di: Deng, Cheng, et al.
Pubblicazione: (2025)
di: Deng, Cheng, et al.
Pubblicazione: (2025)
AI Can Learn Scientific Taste
di: Tong, Jingqi, et al.
Pubblicazione: (2026)
di: Tong, Jingqi, et al.
Pubblicazione: (2026)
Low-resource neural machine translation with morphological modeling
di: Nzeyimana, Antoine
Pubblicazione: (2024)
di: Nzeyimana, Antoine
Pubblicazione: (2024)
KinyaColBERT: A Lexically Grounded Retrieval Model for Low-Resource Retrieval-Augmented Generation
di: Nzeyimana, Antoine, et al.
Pubblicazione: (2025)
di: Nzeyimana, Antoine, et al.
Pubblicazione: (2025)
Evaluating the Efficacy of Hybrid Deep Learning Models in Distinguishing AI-Generated Text
di: Oketunji, Abiodun Finbarrs
Pubblicazione: (2023)
di: Oketunji, Abiodun Finbarrs
Pubblicazione: (2023)
TRiMS: Real-Time Tracking of Minimal Sufficient Length for Efficient Reasoning via RL
di: Bian, Tingcheng, et al.
Pubblicazione: (2026)
di: Bian, Tingcheng, et al.
Pubblicazione: (2026)
Can AI Read Between The Lines? Benchmarking LLMs On Financial Nuance
di: Kubica, Dominick, et al.
Pubblicazione: (2025)
di: Kubica, Dominick, et al.
Pubblicazione: (2025)
Omnilingual MT: Machine Translation for 1,600 Languages
di: Omnilingual MT Team, et al.
Pubblicazione: (2026)
di: Omnilingual MT Team, et al.
Pubblicazione: (2026)
Surprisingly Fragile: Assessing and Addressing Prompt Instability in Multimodal Foundation Models
di: Stewart, Ian, et al.
Pubblicazione: (2024)
di: Stewart, Ian, et al.
Pubblicazione: (2024)
Large Language Models for Persian $ \leftrightarrow $ English Idiom Translation
di: Rezaeimanesh, Sara, et al.
Pubblicazione: (2024)
di: Rezaeimanesh, Sara, et al.
Pubblicazione: (2024)
Cross-lingual Human-Preference Alignment for Neural Machine Translation with Direct Quality Optimization
di: Uhlig, Kaden, et al.
Pubblicazione: (2024)
di: Uhlig, Kaden, et al.
Pubblicazione: (2024)
Learning Translations via Matrix Completion
di: Wijaya, Derry, et al.
Pubblicazione: (2024)
di: Wijaya, Derry, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Super Tiny Language Models
di: Hillier, Dylan, et al.
Pubblicazione: (2024) -
Social Learning through Interactions with Other Agents: A Survey
di: Hillier, Dylan, et al.
Pubblicazione: (2024) -
CascadeMind at SemEval-2026 Task 4: A Hybrid Neuro-Symbolic Cascade for Narrative Similarity
di: Kawada, Sebastien, et al.
Pubblicazione: (2026) -
CRISP: Persistent Concept Unlearning via Sparse Autoencoders
di: Ashuach, Tomer, et al.
Pubblicazione: (2025) -
Is Less More? Quality, Quantity and Context in Idiom Processing with Natural Language Models
di: Knietaite, Agne, et al.
Pubblicazione: (2024)