Training Language Models with homotokens Leads to Delayed Overfitting
Fuente:
arXiv
Salvato in:
| Autori principali: | Cosma, Adrian, Ruseti, Stefan, Radoi, Emilian, Dascalu, Mihai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Strawberry Problem: Emergence of Character-level Understanding in Tokenized Language Models
di: Cosma, Adrian, et al.
Pubblicazione: (2025)
di: Cosma, Adrian, et al.
Pubblicazione: (2025)
How Hard is this Test Set? NLI Characterization by Exploiting Training Dynamics
di: Cosma, Adrian, et al.
Pubblicazione: (2024)
di: Cosma, Adrian, et al.
Pubblicazione: (2024)
Value-Aware Numerical Representations for Transformer Language Models
di: Dutulescu, Andreea, et al.
Pubblicazione: (2026)
di: Dutulescu, Andreea, et al.
Pubblicazione: (2026)
What Makes a Good Doctor Response? A Study on Text-Based Telemedicine
di: Cosma, Adrian, et al.
Pubblicazione: (2026)
di: Cosma, Adrian, et al.
Pubblicazione: (2026)
A Retrieval-Based Approach to Medical Procedure Matching in Romanian
di: Niculae, Andrei, et al.
Pubblicazione: (2025)
di: Niculae, Andrei, et al.
Pubblicazione: (2025)
Neural Grammatical Error Correction for Romanian
di: Cotet, Teodor-Mihai, et al.
Pubblicazione: (2026)
di: Cotet, Teodor-Mihai, et al.
Pubblicazione: (2026)
RoMath: A Mathematical Reasoning Benchmark in Romanian
di: Cosma, Adrian, et al.
Pubblicazione: (2024)
di: Cosma, Adrian, et al.
Pubblicazione: (2024)
Dr.Copilot: A Multi-Agent Prompt Optimized Assistant for Improving Patient-Doctor Communication in Romanian
di: Niculae, Andrei, et al.
Pubblicazione: (2025)
di: Niculae, Andrei, et al.
Pubblicazione: (2025)
On Model and Data Scaling for Skeleton-based Self-Supervised Gait Recognition
di: Cosma, Adrian, et al.
Pubblicazione: (2025)
di: Cosma, Adrian, et al.
Pubblicazione: (2025)
The Paradox of Motion: Evidence for Spurious Correlations in Skeleton-based Gait Recognition Models
di: Cătrună, Andy, et al.
Pubblicazione: (2024)
di: Cătrună, Andy, et al.
Pubblicazione: (2024)
Spatial Colour Mixing Illusions as a Perception Stress Test for Vision-Language Models
di: Basoc, Nicoleta-Nina, et al.
Pubblicazione: (2026)
di: Basoc, Nicoleta-Nina, et al.
Pubblicazione: (2026)
MoME: Estimating Psychological Traits from Gait with Multi-Stage Mixture of Movement Experts
di: Cǎtrunǎ, Andy, et al.
Pubblicazione: (2025)
di: Cǎtrunǎ, Andy, et al.
Pubblicazione: (2025)
CrossGaze: A Strong Method for 3D Gaze Estimation in the Wild
di: Cătrună, Andy, et al.
Pubblicazione: (2024)
di: Cătrună, Andy, et al.
Pubblicazione: (2024)
GaitPT: Skeletons Are All You Need For Gait Recognition
di: Catruna, Andy, et al.
Pubblicazione: (2023)
di: Catruna, Andy, et al.
Pubblicazione: (2023)
Database-Agnostic Gait Enrollment using SetTransformers
di: Basoc, Nicoleta, et al.
Pubblicazione: (2025)
di: Basoc, Nicoleta, et al.
Pubblicazione: (2025)
"Înţelegi Româneşte?'' A Recipe for Romanian Vision-Language Models
di: Masala, Mihai, et al.
Pubblicazione: (2026)
di: Masala, Mihai, et al.
Pubblicazione: (2026)
An In-Vitro Study on Cross-Lingual Generalization in Language Models
di: Cosma, Adrian
Pubblicazione: (2026)
di: Cosma, Adrian
Pubblicazione: (2026)
Aligning Actions and Walking to LLM-Generated Textual Descriptions
di: Chivereanu, Radu, et al.
Pubblicazione: (2024)
di: Chivereanu, Radu, et al.
Pubblicazione: (2024)
Gait Recognition from Highly Compressed Videos
di: Niculae, Andrei, et al.
Pubblicazione: (2024)
di: Niculae, Andrei, et al.
Pubblicazione: (2024)
Dual-objective Language Models: Training Efficiency Without Overfitting
di: Samuel, David, et al.
Pubblicazione: (2025)
di: Samuel, David, et al.
Pubblicazione: (2025)
Uncovering Overfitting in Large Language Model Editing
di: Zhang, Mengqi, et al.
Pubblicazione: (2024)
di: Zhang, Mengqi, et al.
Pubblicazione: (2024)
RoCode: A Dataset for Measuring Code Intelligence from Problem Definitions in Romanian
di: Cosma, Adrian, et al.
Pubblicazione: (2024)
di: Cosma, Adrian, et al.
Pubblicazione: (2024)
"Vorbeşti Româneşte?" A Recipe to Train Powerful Romanian LLMs with English Instructions
di: Masala, Mihai, et al.
Pubblicazione: (2024)
di: Masala, Mihai, et al.
Pubblicazione: (2024)
Gumbel Machine: Counterfactual Student Writing Generation via Gumbel Noise Steering
di: McNichols, Hunter, et al.
Pubblicazione: (2026)
di: McNichols, Hunter, et al.
Pubblicazione: (2026)
OpenLLM-Ro -- Technical Report on Open-source Romanian LLMs
di: Masala, Mihai, et al.
Pubblicazione: (2024)
di: Masala, Mihai, et al.
Pubblicazione: (2024)
Dialectal and Low-Resource Machine Translation for Aromanian
di: Jerpelea, Alexandru-Iulius, et al.
Pubblicazione: (2024)
di: Jerpelea, Alexandru-Iulius, et al.
Pubblicazione: (2024)
Post-Training Language Models for Continual Relation Extraction
di: Efeoglu, Sefika, et al.
Pubblicazione: (2025)
di: Efeoglu, Sefika, et al.
Pubblicazione: (2025)
Automatic Prompt Optimization for Dataset-Level Feature Discovery
di: Cosma, Adrian, et al.
Pubblicazione: (2026)
di: Cosma, Adrian, et al.
Pubblicazione: (2026)
TF3-RO-50M: Training Compact Romanian Language Models from Scratch on Synthetic Moral Microfiction
di: Nadas, Mihai Dan, et al.
Pubblicazione: (2026)
di: Nadas, Mihai Dan, et al.
Pubblicazione: (2026)
Evaluating Large Language Models for Diacritic Restoration in Romanian Texts: A Comparative Study
di: Nadas, Mihai, et al.
Pubblicazione: (2025)
di: Nadas, Mihai, et al.
Pubblicazione: (2025)
Synthetic Data Generation Using Large Language Models: Advances in Text and Code
di: Nadas, Mihai, et al.
Pubblicazione: (2025)
di: Nadas, Mihai, et al.
Pubblicazione: (2025)
Mitigating Heterogeneous Token Overfitting in LLM Knowledge Editing
di: Liu, Tianci, et al.
Pubblicazione: (2025)
di: Liu, Tianci, et al.
Pubblicazione: (2025)
Communication Bias in Large Language Models: A Regulatory Perspective
di: Kuenzler, Adrian, et al.
Pubblicazione: (2025)
di: Kuenzler, Adrian, et al.
Pubblicazione: (2025)
Sparse Transformer with Local and Seasonal Adaptation for Multivariate Time Series Forecasting
di: Zhang, Yifan, et al.
Pubblicazione: (2023)
di: Zhang, Yifan, et al.
Pubblicazione: (2023)
Advancing continual lifelong learning in neural information retrieval: definition, dataset, framework, and empirical evaluation
di: Hou, Jingrui, et al.
Pubblicazione: (2023)
di: Hou, Jingrui, et al.
Pubblicazione: (2023)
LLMic: Romanian Foundation Language Model
di: Bădoiu, Vlad-Andrei, et al.
Pubblicazione: (2025)
di: Bădoiu, Vlad-Andrei, et al.
Pubblicazione: (2025)
Data Contamination Quiz: A Tool to Detect and Estimate Contamination in Large Language Models
di: Golchin, Shahriar, et al.
Pubblicazione: (2023)
di: Golchin, Shahriar, et al.
Pubblicazione: (2023)
TF1-EN-3M: Three Million Synthetic Moral Fables for Training Small, Open Language Models
di: Nadas, Mihai, et al.
Pubblicazione: (2025)
di: Nadas, Mihai, et al.
Pubblicazione: (2025)
The Widespread Adoption of Large Language Model-Assisted Writing Across Society
di: Liang, Weixin, et al.
Pubblicazione: (2025)
di: Liang, Weixin, et al.
Pubblicazione: (2025)
UniBERT: Adversarial Training for Language-Universal Representations
di: Avram, Andrei-Marius, et al.
Pubblicazione: (2025)
di: Avram, Andrei-Marius, et al.
Pubblicazione: (2025)
Documenti analoghi
-
The Strawberry Problem: Emergence of Character-level Understanding in Tokenized Language Models
di: Cosma, Adrian, et al.
Pubblicazione: (2025) -
How Hard is this Test Set? NLI Characterization by Exploiting Training Dynamics
di: Cosma, Adrian, et al.
Pubblicazione: (2024) -
Value-Aware Numerical Representations for Transformer Language Models
di: Dutulescu, Andreea, et al.
Pubblicazione: (2026) -
What Makes a Good Doctor Response? A Study on Text-Based Telemedicine
di: Cosma, Adrian, et al.
Pubblicazione: (2026) -
A Retrieval-Based Approach to Medical Procedure Matching in Romanian
di: Niculae, Andrei, et al.
Pubblicazione: (2025)